Примерно в 2015 году трое пакистанских друзей взяли на себя задачу оцифровать большое количество книг на урду, вышедших из печати, многие из которых были литографиями — они называют это Цифровой библиотекой Ibteda. Они делали это из любви к языку, без бюджета и поддержки, но после 576 000 срабатываний затвора на камере D5300, 326 000 на D3300 и 526 000 двусторонних снимков им пришлось остановиться спустя десятилетие. Однако в итоге один из участников разработал тонко настроенный процесс машинного обучения, который в будущем может помочь аналогичным проектам по всему миру. Этот проект определенно контрастирует с нынешней практикой крупных AI-компаний, сканирующих редкие книги и уничтожающих их для обучения AI-чатботов.
У команды не было никакого официального бюджета, и все книги они покупали за свой счет. Работу начали с одной камеры Nikon D5300, нескольких светодиодных ламп и стеклянного листа от копировального аппарата, чтобы прижимать книги. Процесс был ручным во многих смыслах: помимо перелистывания страниц вручную, участники тратили массу времени на постобработку в Photoshop.
Получить архивную цифровую копию страницы не так просто, как сфотографировать лучшей камерой. Требуется выдерживать одинаковые поля, размер текста, ориентацию и использовать коррекцию перспективы для всей книги, а также учитывать множество других тонкостей. Редко можно применить одну и ту же процедуру более чем к нескольким изданиям — даже если две книги идентичны во всем, книга А может быть гораздо толще книги Б, что меняет расстояние между страницами и, возможно, перспективу.
Вдобавок основная часть произведений была написана шрифтом урду, скорее всего Nastaliq. Урду — государственный язык Пакистана, на нем также говорят в некоторых регионах Индии и во многих общинах по всему миру. Его письменная форма изначально представляла собой элегантный вяжущийся шрифт, но с появлением телефонов и интернета люди перешли на латиницу.
Формат письма означает, что макеты почти всегда уникальны, а корпус включает всё — от печатных книг до многовековых литографий и рукописных заметок. К тому же шрифт урду использует много точек, диакритических знаков и мелких символов, поэтому фотошум, грязь и дефекты должны были визуально отличаться от реального текста. Иными словами, каждая книга была отдельным частным случаем, а в старых литографиях особенно много маргиналий.
В итоге это значило, что фотографирование книг было утомительным, но довольно быстрым, а постобработка — точно нет. После 576 000 срабатываний затвора на D5300 и 326 000 на D3300 осталось более 526 000 двусторонних снимков, когда команде пришлось отказаться от проекта в апреле 2026 года. Обрабатывать их вручную было невозможно, поэтому один из исследователей обратил внимание на автоматизацию с помощью OpenCV.
Первые попытки со стандартными методами компьютерного зрения не удались, поскольку набор правил, работавший для одних книг, полностью проваливался для других. Тогда автор понял, что можно использовать собственные обработанные вручную изображения для установления соответствия «источник/цель»: по его словам, «готовые страницы стали метками», что породило идею вычисления гомографии из файлов Photoshop и использования её для обучения нейросети.
Первой задачей было сопоставление границ кадрирования — проще сказать, чем сделать, потому что «плотный шрифт урду повторяет штрихи, слова, границы и рисунки колонок», из-за чего метки с соседних страниц могли сбивать измерения. Далее идентификация видимой области и разделение корешка усложнялись таблицами и глубокими тенями от корешка. Ошибки кадрирования требовали отдельного прохода, как и удаление дефектов.
Что интересно, исследователь заметил, что использование более крупной модели или большего количества обучающих примеров на самом деле снижало точность результатов. Выбор поля кадрирования (впуска) для каждой книги был уникальным и делался на усмотрение редактора. Но поскольку различимой закономерности не было, добавление новых книг ухудшало распознавание шаблонов моделью, а не улучшало.
Финальный процесс всё ещё требует десяти калибровочных кадров для новой книги, но это вполне приемлемый объем ручного труда для полной обработки книги. Готовые книги размещаются в пуле ZFS с манифестами BLAKE3.
Вся история и технические подробности описаны в пространной записи в блоге, а прекрасные урдуские тексты можно посмотреть на странице Цифровой библиотеки Ibteda на Internet Archive. Мои западные глаза ничего не могут прочесть, но переводы стихотворений прекрасны.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Bruno Ferreira




