ABBYY нашла применение старому OCR в конвейере ИИ

Abbyy Ocr Fineparser ии Llm структурирование текста theregister.com

Преобразуйте документы в структурированный текст с помощью FineParser! Инструмент работает на CPU, сохраняет таблицы и структуру перед передачей данных в LLM.

ABBYY представила свой движок оптического распознавания символов (OCR) FineReader в виде самостоятельного инструмента для преобразования документов в структурированный текст, пригодный для использования системами искусственного интеллекта.

Новый продукт компании FineParser работает в контейнере Docker на центральном процессоре (CPU) и не требует графического процессора (GPU). Его цель — сохранение структуры документа при извлечении содержимого.

Программа принимает изображения документов на нескольких языках и преобразует их в структурированный, форматированный текст, который затем может быть обработан, например, современными генеративными большими языковыми моделями (LLM). Это не единственное назначение: компания предполагает, что инструмент может помочь интегрировать печатный текст в современные системы управления контентом (CMS), использоваться для архивирования или как этап в производственном конвейере.

ABBYY описывает подход FineParser как «детерминированный» ИИ. Он извлекает текст и структуру документа, а не генерирует их правдоподобное представление. Полученный результат затем может быть передан генеративной системе ИИ, ответы которой менее предсказуемы.

Компания также предлагает собственную программируемую платформу машинного обучения NeoML, которая является свободно распространяемым программным обеспечением (FOSS) и доступна на GitHub. Кроме того, ABBYY выпускает OCR SDK для компаний, желающих встроить движок FineReader в свои продукты.

Сам FineParser не является открытым исходным кодом, хотя ABBYY ведет репозиторий на GitHub с примерами и поддержкой сообщества. Самостоятельно размещаемый инструмент имеет бесплатный уровень, позволяющий обрабатывать 1000 страниц в месяц в течение одного года. ABBYY заявляет, что ее подписные уровни подключаются к серверу лицензирования для проверки; для полностью автономного развертывания требуется корпоративный план.

Сохранение структуры означает распознавание колонок в порядке чтения, заголовков и таблиц (даже без границ), а не возврат разрозненного набора извлеченного текста. ABBYY утверждает, что FineParser также работает с рукописным текстом и более чем 200 языками.

Разработчики могут отправлять документы через REST API FineParser и получать результат в виде обычного текста, JSON или DocLang — компактного формата, предназначенного для ввода в LLM.

Основная идея FineParser заключается в том, что прежде чем LLM сможет использовать документ, кто-то должен его правильно прочитать. ABBYY делает ставку на то, что ее многолетний подход к OCR — работа на CPU, сохранение структуры и передача генерации текста другим инструментам — по-прежнему имеет свое место в конвейере ИИ. Иногда именно старомодный подход оказывается наиболее полезным. ®

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: