Нейросети Яндекса для архивов: как ИИ читает рукописи XVIII–XIX веков

Подробный обзор технологии Яндекса по распознаванию дореволюционных рукописей. Как работает сервис «Поиск по архивам», какие документы доступны, как искать предков и на что обращать внимание при проверке результатов.

Что такое «Поиск по архивам» от Яндекса

Сервис «Поиск по архивам» — это бесплатный инструмент, который позволяет находить информацию в оцифрованных исторических документах. В основе лежит технология оптического распознавания текста, обученная на реальных рукописях XVIII–XIX веков. Нейросеть не просто считывает буквы, а учитывает особенности дореформенной орфографии, устаревшие символы (например, «ѣ» — ять, «ѳ» — фита) и индивидуальный почерк писцов.

Пользователь вводит фамилию, название населённого пункта или любое другое слово, и система ищет совпадения в миллионах страниц метрических книг, ревизских сказок, исповедных ведомостей и других архивных материалов. Результат выводится в виде списка документов с подсветкой найденных фрагментов как на скане оригинала, так и в машинной расшифровке.

Сервис доступен всем желающим без регистрации и специальных знаний. Достаточно открыть сайт и ввести запрос — поиск работает аналогично обычному поиску Яндекса.

Как нейросеть учится читать старинные рукописи

Обучение нейросети проходило в несколько этапов. Сначала специалисты Яндекса собрали массив из сотен тысяч реальных рукописных строк из документов XVIII–XIX веков. Эти строки были размечены и расшифрованы экспертами-палеографами, которые знают особенности дореволюционного письма.

Дополнительно было сгенерировано десятки миллионов синтетических примеров — искусственно созданных рукописных текстов, имитирующих разные стили почерка, степень наклона букв, плотность чернил и другие характеристики. Это позволило модели научиться распознавать даже очень неразборчивые записи.

Алгоритм анализирует не отдельные символы, а контекстные группы слов. Если буква написана нечётко, нейросеть «догадывается» о ней по соседним знакам и общему смыслу фразы. Такой подход даёт гораздо более высокую точность, чем классические системы OCR, которые просто сравнивают изображения с шаблонами.

Какие документы доступны для поиска

На момент написания статьи в базе сервиса содержится около 22 миллионов листов архивных документов и примерно 6 миллионов страниц периодических изданий и справочников. Основной массив — это метрические книги (записи о рождениях, браках и смертях), ревизские сказки (результаты переписей населения) и исповедные ведомости (списки прихожан церквей).

Географически документы охватывают несколько регионов: Москву и Московскую область, Оренбургскую, Новгородскую, Иркутскую, Астраханскую области и некоторые другие. Большинство материалов датируется XVIII — началом XX века. Также на сервисе представлены дореволюционные газеты, журналы и справочные издания, которые могут быть полезны для краеведческих и генеалогических исследований.

Полный перечень архивов и фондов можно посмотреть в каталоге на сайте сервиса. Разработчики регулярно добавляют новые документы, поэтому база постоянно растёт.

Как правильно искать: советы и операторы

Поиск по архивам устроен так же, как и обычный поиск Яндекса, но с некоторыми особенностями. Запрос можно вводить как в современной орфографии, так и в дореформенной — система автоматически найдёт оба варианта. Например, по запросу «Тимофей Михеев» будут показаны записи, где встречается «Тимоѳей Михѣевъ».

Для уточнения результатов используйте операторы:

  • Восклицательный знак перед словом (!романовых) — поиск только в заданной форме, без учёта падежей и склонений.
  • Минус перед словом (романов -михаил) — исключение документов, содержащих это слово.
  • Вертикальная черта (романович | романов) — поиск документов, где встречается хотя бы одно из указанных слов.
  • Кавычки для прямой цитаты («жить поживать добра наживать») — поиск точной фразы.
  • Звёздочка внутри кавычек («жить * наживать») — поиск цитаты с пропущенным словом.

Если результатов слишком много, добавьте дополнительные слова или используйте фильтры по дате, архиву, типу документа. Если слишком мало — попробуйте разные варианты написания фамилии или отчества. Например, в XVIII веке отчества часто заканчивались на «-ов»: «Иванов Иван Максимов» вместо «Иванов Иван Максимович».

Фильтры и настройки для точного поиска

Справа от результатов поиска расположены фильтры, которые помогают сузить область поиска. Для архивных документов доступны следующие параметры:

  • Крайние даты дел — можно указать временной промежуток.
  • Архив, фонд, опись, дело и диапазон страниц — поля появляются последовательно; если выбрать несколько архивов, последующие фильтры становятся недоступны.
  • Тип события (рождения, браки, смерти) и категория участников (например, для рождений — родившийся, родители, восприемники).
  • Тип документа (метрические книги, ревизские сказки, исповедные ведомости).
  • Область поиска — только в заголовке или во всём тексте.

Дополнительные настройки позволяют:

  • убирать из результатов дела, в которых пока нет сканов;
  • отображать только документы, добавленные за последний месяц;
  • скрывать уже просмотренные документы.

Для периодических изданий и справочников можно фильтровать по дате выхода, названию издания, региону и типу издания. Фильтры можно применять как до ввода запроса, так и для уточнения уже полученных результатов.

Как работать с найденным документом

После того как вы нашли подходящий документ, его можно открыть в режиме чтения. По умолчанию показывается предпросмотр на странице результатов — этого достаточно, чтобы быстро оценить, подходит ли документ. Для полноценного просмотра нажмите «Подробнее».

В режиме чтения доступны:

  • изменение масштаба;
  • разворот на весь экран;
  • подгонка изображения по ширине или целиком;
  • скрытие или отображение машинной расшифровки;
  • выбор формата расшифровки — блоками или построчно.

Расшифровка и изображение связаны: если нажать на строку в расшифровке, соответствующий фрагмент подсветится на скане, и наоборот. Это очень удобно для проверки — можно сразу увидеть, насколько точно нейросеть распознала текст.

Страницы перелистываются стрелками на клавиатуре или кнопками вверху страницы. Чтобы перейти к определённой странице, введите её номер в поле между стрелок. Также можно добавлять документы в «Избранное» и присваивать им метки для удобной организации.

Карта административно-территориального деления 1897 года

Отдельная полезная функция сервиса — интерактивная карта, на которую нанесены границы губерний и уездов по состоянию на 1897 год. Это помогает понять, к какой административной единице относился тот или иной населённый пункт в дореволюционный период.

На карте зелёными точками отмечены населённые пункты, по которым в базе сервиса есть метрические книги. Приблизив нужный участок, можно увидеть больше точек. Кликнув на точку, вы увидите название населённого пункта, уезда и губернии, а также сможете сразу перейти к поиску по этому приходу или посмотреть список всех доступных метрических книг.

Карта особенно полезна для тех, кто знает только современное название места, но не знает, к какой губернии оно относилось в XIX веке. Поиск по карте можно вести как по историческим, так и по современным названиям.

Ограничения сервиса и важность проверки результатов

Несмотря на впечатляющие возможности, у технологии есть ограничения. Во-первых, в базу нельзя загрузить свои документы — сервис работает только с материалами из государственных архивов, которые прошли процедуру сканирования и публикации. Если вы получили копии из архива самостоятельно, их придётся расшифровывать вручную или обращаться к частным специалистам.

Во-вторых, нейросеть может ошибаться. Особенно часто ошибки возникают при распознавании имён собственных, редких фамилий и нестандартных написаний. Иногда ИИ «галлюцинирует» — выдаёт ложные совпадения или путает однофамильцев из разных губерний. Поэтому всегда сверяйте машинную расшифровку с оригинальным сканом документа.

В-третьих, не все архивы ещё оцифрованы. Если вы не нашли нужного человека, возможно, его документы просто ещё не попали в базу. Разработчики обещают регулярно добавлять новые материалы, поэтому стоит проверять сервис время от времени.

Наконец, важно помнить, что сервис предназначен для поиска в исторических документах, а не для расшифровки личных бумаг пользователей. Если вам нужно прочитать письмо прадеда или старую фотографию с подписью, лучше обратиться к палеографу или использовать другие инструменты.

Практические примеры из жизни пользователей

Многие пользователи уже успели оценить возможности сервиса. Историк-генеалог из Казани рассказала, что раньше на поиск одной записи в метрической книге уходило до трёх месяцев работы в областном архиве. Сейчас она загружает скан в сервис и через минуту видит нужную фамилию, записанную скорописью священника 1895 года.

Другой пользователь из Самары искал информацию о дедушке, пропавшем без вести в 1942 году. Через «Поиск по архивам» он нашёл запись в послевоенной книге учёта перемещённых лиц — оказалось, что дедушка был в Германии. Без нейросети найти этот документ было бы практически невозможно.

Архивист из Ростова-на-Дону отметил, что система хорошо справляется даже с исповедными ведомостями XVIII века, где почерк писца похож на сплошную паутину. Конечно, ошибки в именах встречаются, но в целом это настоящая революция: раньше на обработку одного такого тома уходил год, а теперь это занимает минуты.

Будущее проекта и планы развития

Работа по оцифровке архивов только начинается. Представители Яндекса и Главархива заявляют, что в планах — обработка ещё десятков миллионов страниц, включая особо ценные документы по истории крестьянства, купечества и других сословий. Также развиваются инструменты для анализа ДНК-данных и сопоставления их с архивными находками — это может открыть новые возможности для генеалогических исследований.

Сервис открыт к сотрудничеству с новыми архивами. Участие в проекте бесплатное: Яндекс берёт на себя все расходы, кроме сканирования документов, и не ограничивает право архива распоряжаться документами и их сканами. Особый интерес представляют метрические книги, ревизские сказки, исповедные ведомости, а также старинные книги и газеты, полезные для генеалогии и краеведения.

Если вы представляете архив, музей или библиотеку и хотите присоединиться к проекту, можно заполнить форму обратной связи на сайте сервиса. Для физических лиц возможность загружать свои документы пока не предусмотрена.

Вопросы и ответы

Можно ли загрузить в сервис свои сканы архивных документов?

Нет, сейчас такой возможности нет. Сервис работает только с материалами из государственных архивов, которые прошли официальную процедуру сканирования и публикации. Если вы получили копии документов по запросу в архиве, их придётся расшифровывать вручную или обращаться к частным специалистам.

Почему нейросеть иногда ошибается в расшифровке?

Распознавание рукописного текста — сложная задача даже для современных ИИ. Ошибки чаще всего возникают при чтении имён собственных, редких фамилий и нестандартных написаний. Также возможны «галлюцинации» — ложные совпадения или путаница однофамильцев. Поэтому всегда сверяйте машинную расшифровку с оригинальным сканом документа.

Какие регионы охвачены сервисом на данный момент?

В базе представлены документы из Главархива Москвы, а также архивов Оренбургской, Новгородской, Иркутской, Астраханской областей и некоторых других регионов. Полный список можно посмотреть в каталоге на сайте сервиса. Разработчики регулярно добавляют новые архивы.

Как искать, если я не знаю точного написания фамилии?

Попробуйте разные варианты написания. В дореволюционных документах фамилии часто записывались иначе, чем сейчас. Например, отчества могли заканчиваться на «-ов» (Иванов Иван Максимов вместо Максимович). Также используйте оператор | (например, «Смирнов | Смирновъ»), чтобы найти оба варианта.

Что делать, если нужного архива нет в списке?

Вы можете помочь, отправив обращение в администрацию региона, где находится архив, или в Администрацию Президента (для федеральных архивов). Заинтересованность граждан подчеркнёт важность оцифровки документов и сотрудничества с сервисом.

Как проверить, не ошиблась ли нейросеть в расшифровке?

В режиме чтения документа расшифровка и изображение связаны: нажатие на строку в расшифровке подсвечивает соответствующий фрагмент на скане. Сравните машинный текст с оригиналом. Если заметили ошибку, можно сообщить в службу поддержки — это поможет улучшить алгоритм.

Планируется ли добавление документов XX века?

Основной массив сервиса — документы XVIII — начала XX века. Однако на сервисе уже доступны некоторые периодические издания и справочники середины XX — начала XXI века. Разработчики рассматривают возможность расширения хронологических рамок, но конкретных сроков пока нет.