Что такое «Поиск по архивам» от Яндекса
Сервис «Поиск по архивам» — это бесплатный инструмент, который позволяет находить информацию в оцифрованных исторических документах. В основе лежит технология оптического распознавания текста, обученная на реальных рукописях XVIII–XIX веков. Нейросеть не просто считывает буквы, а учитывает особенности дореформенной орфографии, устаревшие символы (например, «ѣ» — ять, «ѳ» — фита) и индивидуальный почерк писцов.
Пользователь вводит фамилию, название населённого пункта или любое другое слово, и система ищет совпадения в миллионах страниц метрических книг, ревизских сказок, исповедных ведомостей и других архивных материалов. Результат выводится в виде списка документов с подсветкой найденных фрагментов как на скане оригинала, так и в машинной расшифровке.
Сервис доступен всем желающим без регистрации и специальных знаний. Достаточно открыть сайт и ввести запрос — поиск работает аналогично обычному поиску Яндекса.
Как нейросеть учится читать старинные рукописи
Обучение нейросети проходило в несколько этапов. Сначала специалисты Яндекса собрали массив из сотен тысяч реальных рукописных строк из документов XVIII–XIX веков. Эти строки были размечены и расшифрованы экспертами-палеографами, которые знают особенности дореволюционного письма.
Дополнительно было сгенерировано десятки миллионов синтетических примеров — искусственно созданных рукописных текстов, имитирующих разные стили почерка, степень наклона букв, плотность чернил и другие характеристики. Это позволило модели научиться распознавать даже очень неразборчивые записи.
Алгоритм анализирует не отдельные символы, а контекстные группы слов. Если буква написана нечётко, нейросеть «догадывается» о ней по соседним знакам и общему смыслу фразы. Такой подход даёт гораздо более высокую точность, чем классические системы OCR, которые просто сравнивают изображения с шаблонами.
Какие документы доступны для поиска
На момент написания статьи в базе сервиса содержится около 22 миллионов листов архивных документов и примерно 6 миллионов страниц периодических изданий и справочников. Основной массив — это метрические книги (записи о рождениях, браках и смертях), ревизские сказки (результаты переписей населения) и исповедные ведомости (списки прихожан церквей).
Географически документы охватывают несколько регионов: Москву и Московскую область, Оренбургскую, Новгородскую, Иркутскую, Астраханскую области и некоторые другие. Большинство материалов датируется XVIII — началом XX века. Также на сервисе представлены дореволюционные газеты, журналы и справочные издания, которые могут быть полезны для краеведческих и генеалогических исследований.
Полный перечень архивов и фондов можно посмотреть в каталоге на сайте сервиса. Разработчики регулярно добавляют новые документы, поэтому база постоянно растёт.
Как правильно искать: советы и операторы
Поиск по архивам устроен так же, как и обычный поиск Яндекса, но с некоторыми особенностями. Запрос можно вводить как в современной орфографии, так и в дореформенной — система автоматически найдёт оба варианта. Например, по запросу «Тимофей Михеев» будут показаны записи, где встречается «Тимоѳей Михѣевъ».
Для уточнения результатов используйте операторы:
- Восклицательный знак перед словом (!романовых) — поиск только в заданной форме, без учёта падежей и склонений.
- Минус перед словом (романов -михаил) — исключение документов, содержащих это слово.
- Вертикальная черта (романович | романов) — поиск документов, где встречается хотя бы одно из указанных слов.
- Кавычки для прямой цитаты («жить поживать добра наживать») — поиск точной фразы.
- Звёздочка внутри кавычек («жить * наживать») — поиск цитаты с пропущенным словом.
Если результатов слишком много, добавьте дополнительные слова или используйте фильтры по дате, архиву, типу документа. Если слишком мало — попробуйте разные варианты написания фамилии или отчества. Например, в XVIII веке отчества часто заканчивались на «-ов»: «Иванов Иван Максимов» вместо «Иванов Иван Максимович».
Фильтры и настройки для точного поиска
Справа от результатов поиска расположены фильтры, которые помогают сузить область поиска. Для архивных документов доступны следующие параметры:
- Крайние даты дел — можно указать временной промежуток.
- Архив, фонд, опись, дело и диапазон страниц — поля появляются последовательно; если выбрать несколько архивов, последующие фильтры становятся недоступны.
- Тип события (рождения, браки, смерти) и категория участников (например, для рождений — родившийся, родители, восприемники).
- Тип документа (метрические книги, ревизские сказки, исповедные ведомости).
- Область поиска — только в заголовке или во всём тексте.
Дополнительные настройки позволяют:
- убирать из результатов дела, в которых пока нет сканов;
- отображать только документы, добавленные за последний месяц;
- скрывать уже просмотренные документы.
Для периодических изданий и справочников можно фильтровать по дате выхода, названию издания, региону и типу издания. Фильтры можно применять как до ввода запроса, так и для уточнения уже полученных результатов.
Как работать с найденным документом
После того как вы нашли подходящий документ, его можно открыть в режиме чтения. По умолчанию показывается предпросмотр на странице результатов — этого достаточно, чтобы быстро оценить, подходит ли документ. Для полноценного просмотра нажмите «Подробнее».
В режиме чтения доступны:
- изменение масштаба;
- разворот на весь экран;
- подгонка изображения по ширине или целиком;
- скрытие или отображение машинной расшифровки;
- выбор формата расшифровки — блоками или построчно.
Расшифровка и изображение связаны: если нажать на строку в расшифровке, соответствующий фрагмент подсветится на скане, и наоборот. Это очень удобно для проверки — можно сразу увидеть, насколько точно нейросеть распознала текст.
Страницы перелистываются стрелками на клавиатуре или кнопками вверху страницы. Чтобы перейти к определённой странице, введите её номер в поле между стрелок. Также можно добавлять документы в «Избранное» и присваивать им метки для удобной организации.
Карта административно-территориального деления 1897 года
Отдельная полезная функция сервиса — интерактивная карта, на которую нанесены границы губерний и уездов по состоянию на 1897 год. Это помогает понять, к какой административной единице относился тот или иной населённый пункт в дореволюционный период.
На карте зелёными точками отмечены населённые пункты, по которым в базе сервиса есть метрические книги. Приблизив нужный участок, можно увидеть больше точек. Кликнув на точку, вы увидите название населённого пункта, уезда и губернии, а также сможете сразу перейти к поиску по этому приходу или посмотреть список всех доступных метрических книг.
Карта особенно полезна для тех, кто знает только современное название места, но не знает, к какой губернии оно относилось в XIX веке. Поиск по карте можно вести как по историческим, так и по современным названиям.
Ограничения сервиса и важность проверки результатов
Несмотря на впечатляющие возможности, у технологии есть ограничения. Во-первых, в базу нельзя загрузить свои документы — сервис работает только с материалами из государственных архивов, которые прошли процедуру сканирования и публикации. Если вы получили копии из архива самостоятельно, их придётся расшифровывать вручную или обращаться к частным специалистам.
Во-вторых, нейросеть может ошибаться. Особенно часто ошибки возникают при распознавании имён собственных, редких фамилий и нестандартных написаний. Иногда ИИ «галлюцинирует» — выдаёт ложные совпадения или путает однофамильцев из разных губерний. Поэтому всегда сверяйте машинную расшифровку с оригинальным сканом документа.
В-третьих, не все архивы ещё оцифрованы. Если вы не нашли нужного человека, возможно, его документы просто ещё не попали в базу. Разработчики обещают регулярно добавлять новые материалы, поэтому стоит проверять сервис время от времени.
Наконец, важно помнить, что сервис предназначен для поиска в исторических документах, а не для расшифровки личных бумаг пользователей. Если вам нужно прочитать письмо прадеда или старую фотографию с подписью, лучше обратиться к палеографу или использовать другие инструменты.
Практические примеры из жизни пользователей
Многие пользователи уже успели оценить возможности сервиса. Историк-генеалог из Казани рассказала, что раньше на поиск одной записи в метрической книге уходило до трёх месяцев работы в областном архиве. Сейчас она загружает скан в сервис и через минуту видит нужную фамилию, записанную скорописью священника 1895 года.
Другой пользователь из Самары искал информацию о дедушке, пропавшем без вести в 1942 году. Через «Поиск по архивам» он нашёл запись в послевоенной книге учёта перемещённых лиц — оказалось, что дедушка был в Германии. Без нейросети найти этот документ было бы практически невозможно.
Архивист из Ростова-на-Дону отметил, что система хорошо справляется даже с исповедными ведомостями XVIII века, где почерк писца похож на сплошную паутину. Конечно, ошибки в именах встречаются, но в целом это настоящая революция: раньше на обработку одного такого тома уходил год, а теперь это занимает минуты.
Будущее проекта и планы развития
Работа по оцифровке архивов только начинается. Представители Яндекса и Главархива заявляют, что в планах — обработка ещё десятков миллионов страниц, включая особо ценные документы по истории крестьянства, купечества и других сословий. Также развиваются инструменты для анализа ДНК-данных и сопоставления их с архивными находками — это может открыть новые возможности для генеалогических исследований.
Сервис открыт к сотрудничеству с новыми архивами. Участие в проекте бесплатное: Яндекс берёт на себя все расходы, кроме сканирования документов, и не ограничивает право архива распоряжаться документами и их сканами. Особый интерес представляют метрические книги, ревизские сказки, исповедные ведомости, а также старинные книги и газеты, полезные для генеалогии и краеведения.
Если вы представляете архив, музей или библиотеку и хотите присоединиться к проекту, можно заполнить форму обратной связи на сайте сервиса. Для физических лиц возможность загружать свои документы пока не предусмотрена.
Вопросы и ответы
Можно ли загрузить в сервис свои сканы архивных документов?
Нет, сейчас такой возможности нет. Сервис работает только с материалами из государственных архивов, которые прошли официальную процедуру сканирования и публикации. Если вы получили копии документов по запросу в архиве, их придётся расшифровывать вручную или обращаться к частным специалистам.
Почему нейросеть иногда ошибается в расшифровке?
Распознавание рукописного текста — сложная задача даже для современных ИИ. Ошибки чаще всего возникают при чтении имён собственных, редких фамилий и нестандартных написаний. Также возможны «галлюцинации» — ложные совпадения или путаница однофамильцев. Поэтому всегда сверяйте машинную расшифровку с оригинальным сканом документа.
Какие регионы охвачены сервисом на данный момент?
В базе представлены документы из Главархива Москвы, а также архивов Оренбургской, Новгородской, Иркутской, Астраханской областей и некоторых других регионов. Полный список можно посмотреть в каталоге на сайте сервиса. Разработчики регулярно добавляют новые архивы.
Как искать, если я не знаю точного написания фамилии?
Попробуйте разные варианты написания. В дореволюционных документах фамилии часто записывались иначе, чем сейчас. Например, отчества могли заканчиваться на «-ов» (Иванов Иван Максимов вместо Максимович). Также используйте оператор | (например, «Смирнов | Смирновъ»), чтобы найти оба варианта.
Что делать, если нужного архива нет в списке?
Вы можете помочь, отправив обращение в администрацию региона, где находится архив, или в Администрацию Президента (для федеральных архивов). Заинтересованность граждан подчеркнёт важность оцифровки документов и сотрудничества с сервисом.
Как проверить, не ошиблась ли нейросеть в расшифровке?
В режиме чтения документа расшифровка и изображение связаны: нажатие на строку в расшифровке подсвечивает соответствующий фрагмент на скане. Сравните машинный текст с оригиналом. Если заметили ошибку, можно сообщить в службу поддержки — это поможет улучшить алгоритм.
Планируется ли добавление документов XX века?
Основной массив сервиса — документы XVIII — начала XX века. Однако на сервисе уже доступны некоторые периодические издания и справочники середины XX — начала XXI века. Разработчики рассматривают возможность расширения хронологических рамок, но конкретных сроков пока нет.