ИИ для работы с документами

Материал из Вики Optimism
Перейти к навигации Перейти к поиску

ИИ для работы с документами это обработка потока входящих и исходящих документов компании программами, которые читают страницу, извлекают из неё нужные поля и проверяют результат перед записью в учётную систему. Счета, акты, накладные, договоры, анкеты, доверенности: всё, что раньше человек перепечатывал в базу руками.

За общим названием прячутся три разные технические задачи, и путают их постоянно. Распознать текст на картинке. Найти в распознанном тексте нужные поля и разложить их по колонкам. Понять смысл написанного и ответить на вопрос по документу. Задачи решаются разными инструментами, стоят разных денег и ломаются по-разному. Распознавание страницы печатного текста стоит у публичного поставщика около тринадцати копеек, а в прейскуранте другого поставщика извлечение полей из той же страницы тарифицируется в двадцать раз дороже, чем её распознавание.

Предмет статьи это поток документов организации; разовая загрузка файла в чат разбирается здесь как один из способов решения. Что делать с документами дальше, когда по ним нужно отвечать на вопросы, разбирают RAG и ИИ-ассистент; как содержать сами документы, разбирает База знаний. Определение оптического распознавания и метрики CER и WER стоят в статье Компьютерное зрение.

Три задачи, которые называют одним словом

Разведение этих уровней и есть главный практический вопрос темы. В разборе семнадцати страниц выдачи по трём запросам про искусственный интеллект и документы (собственный разбор, 19 сентября 2026 года) уровни полностью разведены на трёх страницах, ещё на одной частично. Остальные тринадцать говорят «нейросеть обрабатывает документы» и перечисляют бренды.

Задача Что на входе и на выходе Чем решается Чем ломается
Распознать текст (OCR, optical character recognition) картинка страницы, на выходе те же слова текстом специализированный движок распознавания качество съёмки, рукописный текст, печати поверх букв, кириллица, похожая на латиницу
Извлечь поля (извлечение ключевой информации, key information extraction) текст и координаты, на выходе пары «поле и значение» шаблон под форму либо обученная модель извлечения незнакомая форма, поле в неожиданном месте, несколько документов в одном файле
Понять смысл документ целиком, на выходе ответ или сводка Большая языковая модель с картинкой или текстом на входе выдуманное значение там, где в документе его нет

Первый уровень проверяем посимвольно, второй по полям, третий не проверяем формально вовсе, и в этом его отдельный риск.

Программный робот откроет письмо, скачает вложение и нажмёт кнопки в учётной системе; распознавание он вызывает как внешний сервис. Система документооборота ведёт маршрут согласования и версии, содержимое картинки её не касается, а её экономика разобрана в статье Автоматизация бизнес-процессов. Связка, которая сама решает, что делать с документом дальше, это уже ИИ-агент.

Откуда взялось

Распознавание печатных символов старше вычислительной техники в привычном виде. Густав Таушек получил патент на метод оптического распознавания текста в Германии в 1929 году, и машина у него была механической: шаблоны и фотодетектор. В 1950 году Дэвид Шепард построил машину, переводившую печатные сообщения в машинный язык, а её коммерческий потомок встал в редакции «Ридерс дайджест» в 1955 году.

Чтение текста, набранного любым шрифтом, появилось позже: Рэй Курцвейл основал компанию в 1974 году, устройство представили 13 января 1976 года. Кириллицу машины освоили в девяностые: программа AutoR компании «ОКРУС» начала распространяться в 1992 году, технология распознавания текстов компании ABBYY вышла в 1993 году.

Gartner определяет решения интеллектуальной обработки документов (IDP, intelligent document processing) как специализированные инструменты интеграции данных. Они автоматически извлекают данные из разных форматов и разных макетов содержимого документа и передают их в зависимые приложения и процессы (сверено 19 сентября 2026 года). Рынка с таким названием у аналитиков до конца 2010-х годов не было, а технологиям внутри него к тому моменту было полвека.

Как это устроено

Путь документа от письма до проводки

  1. Приём. Документ приходит почтой, из электронного документооборота, сканом из МФУ, снимком с телефона кладовщика. Форматы смешаны: PDF с текстовым слоем, PDF из сканера без текста, фотография, бумага.
  2. Классификация. Программа определяет тип документа и границы между документами внутри пачки.
  3. Распознавание. Картинка превращается в текст с координатами. Для PDF с готовым текстовым слоем шаг пропускается, и это самая дешёвая ветка конвейера.
  4. Извлечение полей. Из текста вытаскиваются значения для учётной системы вместе со строками табличной части.
  5. Проверка. Арифметика внутри документа, сверка со справочниками, сравнение с заказом или договором, оценка уверенности по полям.
  6. Разбор исключений. Не прошедшее проверку показывается человеку рядом с фрагментом исходной страницы.
  7. Выгрузка. Готовая запись уходит в учётную систему, а исходный файл и промежуточные значения остаются связанными с проводкой.

Последний шаг важнее, чем кажется: без связки «значение в базе и фрагмент страницы» проверить документ через полгода получится только глазами.

Шаблон, обученная модель, генеративная модель

Извлечь поля можно тремя способами, и выбор идёт по однородности потока.

Шаблон. Для конкретной формы указано, где лежит каждое поле. Работает идеально на своей форме и рассыпается на чужой. Годится на однородном потоке: анкеты своего образца, выписки одного банка.

Обученная модель извлечения. Модель машинного обучения учится на размеченных примерах и переносится на формы, которых не видела. Ей нужен размеченный набор, зато вместе со значением она отдаёт численную уверенность.

Генеративная модель. Страница отдаётся языковой модели с инструкцией вернуть поля структурой. Настраивать почти нечего, качество на разнородном потоке высокое, а формулировка инструкции относится уже к промпт-инжинирингу. Цена этого удобства разобрана ниже.

Уверенность и порог

Значение, извлечённое автоматически, приходит вместе с числом от нуля до единицы: оценкой вероятности того, что предсказание верно. В документации Azure Document Intelligence это объяснено так: уверенность 0,95 означает, что предсказание верно примерно в девятнадцати случаях из двадцати (страница обновлена 8 апреля 2026 года). Там же названы ориентиры точности обученной модели: целиться в 80% и выше, а для чувствительных случаев вроде финансовых и медицинских записей рекомендуется значение, близкое к 100%.

Порог уверенности делит поток надвое: выше порога запись уходит в учётную систему сама, ниже попадает человеку. Порог это не настройка качества, а рычаг, которым выбирают, сколько работы остаётся людям.

Уверенность распознавания и уверенность извлечения это два разных числа, и документация советует смотреть оба: низкая первая лечится качеством исходников, низкая вторая означает, что на вход подали документ другого типа.

Откуда берутся выдуманные реквизиты

В выдаче по теме живёт прямое противоречие. Первая позиция по головному запросу советует бухгалтеру попросить универсальную языковую модель вытащить даты и суммы из первичных документов, ограничиваясь напутствием проверять результат. Первая позиция по соседнему запросу про распознавание документов называет ровно этот приём источником искажения данных. Обе страницы обходятся без единой цифры. Спор решается не выбором стороны, а пониманием механизма.

Движок извлечения выбирает значение из того, что он распознал на странице, и возвращает вместе с ним координаты и уверенность. Поля на странице нет, значит оно придёт пустым либо с низкой уверенностью. Генеративная модель устроена иначе: она достраивает правдоподобное продолжение текста по данной ей инструкции. Инструкция требует вернуть номер счёта, в документе номера не видно, и модель выдаёт номер, похожий на настоящий, без сигнала о том, что он взят не со страницы. Механика разобрана в статье Большая языковая модель.

Теперь числа, которых в выдаче по теме нет ни у кого. Бенчмарк Бергхауса и соавторов от 29 августа 2025 года прогнал восемь мультимодальных моделей по трём открытым наборам: 500 синтетических счетов, 1000 сканов чеков из соревнования ICDAR 2019 и 350 сканов реальных счетов с печатями и рукописными пометками. Мерили долю полей, извлечённых точно: значение засчитывалось только при полном совпадении с эталоном после нормализации дат и пробелов.

Набор документов Максимум из восьми моделей Через промежуточное преобразование в текст
500 синтетических счетов, чистая вёрстка 96,50% полей 85,45%
350 сканов реальных счетов 92,71% полей 64,03%
1000 сканов чеков 87,46% полей 47,00%

Таблица читается в двух направлениях. Сверху вниз: качество съёмки решает больше, чем выбор модели, между чистой вёрсткой и сканом чека девять процентных пунктов у одной и той же сильнейшей модели. Слева направо: правый столбец это конвейер «распознать страницу, превратить в размеченный текст, отдать текст модели», и он проигрывает прямой подаче картинки везде. На чистых счетах он ещё и сводит все восемь моделей в узкую полосу 84-85%: узким местом становится распознавание, и сильная модель за ним уже ничего не добавляет.

96,50% на синтетике означает, что примерно одно поле из двадцати девяти извлечено неверно. Разброс велик: на том же наборе слабейшая из восьми моделей дала 45,69%. Хуже прочих давались длинные буквенно-цифровые поля вроде банковского счёта, и типичная ошибка там оптическая, ноль вместо букв O и U.

Русскому читателю нужен второй замер. Бенчмарк многоязычного разбора документов от 30 марта 2026 года собрал 3400 изображений на 17 языках, включая снимки с камеры. Средняя просадка на снятых камерой документах составила 17,8%, на нелатинских системах письма 14,0%. Про русские документы авторы говорят отдельно: модели путают кириллические буквы с визуально совпадающими латинскими. Отдельного числа по русскому языку в работе нет, поэтому переносить 14,0% на кириллицу как точное значение нельзя.

Оговорки авторов переносятся сюда целиком. Наборы открытые и могли попасть в обучающие данные моделей, то есть результат на ваших документах скорее ниже опубликованного. Документы англоязычные. Метрика точного совпадения строга: расхождение в одном символе считается ошибкой наравне с выдумкой.

Что делать на практике

Ошибку в реквизите ловят не вниманием оператора, а проверками, которые считает программа.

  1. Считать арифметику внутри документа. Сумма строк равна итогу, налог равен ставке от базы. Расхождение означает ошибку хотя бы в одном числе, и найти её здесь дешевле, чем в отчётности.
  2. Сверять со справочниками. Контрольное число в ИНН и в расчётном счёте считается по известному алгоритму, контрагент ищется в базе договоров, номенклатура в каталоге. Выдуманный реквизит чаще всего не проходит именно эту проверку.
  3. Сверять с ожиданием. Счёт сопоставляется с заказом, акт с договором, накладная с приходом на склад.
  4. Ставить пороги уверенности по полям. Номер и дата допускают низкий порог, сумма и реквизиты счёта высокий. Один порог на весь документ усредняет разную цену ошибки.
  5. Оставить человеку исключения и только их, показывая поле рядом с фрагментом страницы, чтобы решение занимало секунды.
  6. Собрать свою эталонную выборку. Сто-двести своих документов с правильными значениями, снятыми руками. Без неё сравнение поставщиков превращается в сравнение их рекламных материалов. Что с ней делают при приёмке и при смене версии модели, разобрано в статье Внедрение ИИ.
  7. Проверять на грязных документах. Демонстрация идёт на чистом PDF, а поток состоит из снимков, сделанных на складе при дневном свете.

Первый шаг проекта это не выбор поставщика. Сначала считается, сколько документов в месяц проходит через компанию, сколько минут занимает один и какая доля из них однотипна. Порядок пробного проекта разобран в статье Нейросети для бизнеса, путь от пробы к промышленной работе в статье Внедрение ИИ.

Частые ошибки

Покупать понимание смысла там, где нужна расшифровка полей. Универсальная модель на потоке однотипных счетов дороже и капризнее специализированного извлечения.

Ждать, что модель скажет «не знаю». Без явного требования вернуть пустое значение генеративная модель почти всегда что-нибудь возвращает.

Сколько это стоит

Цена за страницу или документ в рублях не названа ни на одной из семнадцати разобранных страниц выдачи: специализированные платформы пишут «цена по запросу», подборки сервисов приводят стоимость месячной подписки, а это другая величина. Ниже цены с публичных тарифных страниц двух облачных поставщиков, снятые 19 сентября 2026 года. Порядок алфавитный, оценок нет, строки напрямую не сравниваются: единица тарификации и состав услуги у поставщиков разные.

Поставщик Услуга Цена, сверено 19.09.2026
Google Document AI распознавание текста, Enterprise Document OCR первая тысяча страниц бесплатно, далее 1,50 $ за 1000 страниц, свыше 5 млн страниц 0,60 $ за 1000
Google Document AI извлечение полей, Form Parser и собственный экстрактор 30,00 $ за 1000 страниц, свыше 1 млн страниц 20,00 $ за 1000
Yandex AI Studio распознавание печатного текста 0,1321 ₽ за единицу тарификации, с НДС
Yandex AI Studio распознавание таблиц 1,22 ₽ за единицу, с НДС
Yandex AI Studio распознавание рукописного текста 1,52 ₽ за единицу, с НДС

Единица тарификации у Yandex AI Studio определена явно: каждое изображение и каждая страница многостраничного PDF считаются отдельно. Цены Google указаны в долларах и без налога. Цена распознавания паспорта здесь не повторяется, она уже стоит в справочнике.

Важнее абсолютных чисел соотношение. В одном прейскуранте чистое распознавание текста стоит 1,50 $ за тысячу страниц, а извлечение полей из тех же страниц 30,00 $, то есть в двадцать раз дороже. Разница между «прочитать» и «разложить по полям» видна прямо в счёте.

Третий уровень, понимание смысла, тарифицируется по токенам: входящие токены YandexGPT Pro 5.1 стоят 0,8 ₽ за тысячу с НДС, у Alice AI LLM Flash 0,1 ₽. Перевести это в цену за страницу корректно не выходит: публичной таблицы соответствия между страницей-картинкой и числом токенов найти не удалось, а считать её самому значит выдумывать.

Прейскурантом стоимость владения не исчерпывается: в неё входят разметка эталонной выборки, работа проверяющего на исключениях, интеграция с учётной системой и сопровождение.

Чем измеряют

  • Доля документов, прошедших без человека (straight-through processing). Главная цифра проекта: именно она превращается в сэкономленные часы.
  • Доля полей, извлечённых верно, считается отдельно по каждому полю. Среднее по документу прячет то, что номер счёта извлекается хуже даты.
  • CER и WER для слоя распознавания, они определены в статье Компьютерное зрение.
  • Доля выдуманных значений отдельно от доли неверно прочитанных. Прочитанное с ошибкой обычно ловится проверками, выдуманное выглядит правдоподобно.
  • Время и стоимость обработки одного документа от поступления до записи в учётную систему, со всеми статьями расходов, включая работу проверяющего.
  • Доля документов на ручном разборе в разрезе типа документа и контрагента: один поставщик с нестандартной формой умеет испортить общую цифру в одиночку.

Метрику приёмки называют числом до начала работ. Формулировка «чтобы распознавало хорошо» приёмкой не является.

Персональные данные и коммерческая тайна

Загрузка документа в чужой сервис это действие с его содержимым, и у него есть правовой режим. Толкования здесь нет: применение к конкретному договору и сервису это работа юриста.

Персональные данные. Пункт 1 статьи 3 Федерального закона от 27.07.2006 № 152-ФЗ определяет персональные данные как «любую информацию, относящуюся к прямо или косвенно определенному или определяемому физическому лицу». Пункт 3 той же статьи относит к их обработке любое действие, включая, дословно, извлечение, использование, передачу (распространение, предоставление, доступ).

Часть 3 статьи 6 говорит о поручении обработки: оператор вправе поручить обработку персональных данных другому лицу с согласия субъекта персональных данных, если иное не предусмотрено федеральным законом, на основании заключаемого с этим лицом договора. В поручении определяются перечень персональных данных, перечень действий с ними и цели обработки, а также устанавливается обязанность соблюдать конфиденциальность.

Часть 5 статьи 18 в редакции Федерального закона от 28.02.2025 № 23-ФЗ устанавливает, что при сборе персональных данных, в том числе через интернет, запись, систематизация, накопление, хранение, уточнение и извлечение персональных данных граждан Российской Федерации с использованием баз данных, находящихся за пределами территории Российской Федерации, не допускаются, за исключением случаев, указанных в пунктах 2, 3, 4 и 8 части 1 статьи 6.

Коммерческая тайна. Пункт 2 статьи 3 Федерального закона от 29.07.2004 № 98-ФЗ определяет информацию, составляющую коммерческую тайну, как сведения любого характера, имеющие действительную или потенциальную коммерческую ценность в силу неизвестности их третьим лицам, к которым у третьих лиц нет свободного доступа на законном основании и в отношении которых обладателем введён режим коммерческой тайны. Часть 1 статьи 10 перечисляет меры обладателя: перечень такой информации, ограничение доступа и порядок обращения, учёт получивших доступ лиц, договоры с работниками и контрагентами, гриф «Коммерческая тайна» на носителях. Часть 2 той же статьи: режим считается установленным после принятия этих мер.

Тексты сверены 19 сентября 2026 года по редакции 152-ФЗ от 26.07.2026 и редакции 98-ФЗ от 08.08.2024. Практический вопрос к поставщику отсюда один, и он одинаков для облака и для своего контура: где физически обрабатывается документ, что с ним делают после ответа, сколько хранят и что подписано на этот счёт.

Ограничения и спорные места

Публичных замеров на русских документах с описанной методикой найти не удалось. Оба замера выше сделаны на англоязычных документах, а многоязычный бенчмарк отдельного числа по русскому языку не публикует.

Заявленная точность без методики ничего не значит. В разобранной выдаче точность названа числом на одной странице из семнадцати, и это «до 99,9%» без размера выборки и без описания теста. Ссылки на независимое сравнение поставщиков нет ни у кого из семнадцати. Вдобавок строгая метрика точного совпадения и метрика «совпало с точностью до пробела» дают на одних данных разные числа, поэтому без общего определения ошибки заявления поставщиков несравнимы.

Спор о генеративных моделях в первичке не закрыт. Замера, сравнившего бы оба подхода на одном потоке российской первички с описанной методикой, в открытых источниках найти не удалось. До его появления спор решается эталонной выборкой на своих документах.

Суммы штрафов ходят по выдаче без ссылок на текст нормы. Здесь суммы не приводятся намеренно: размер санкции зависит от состава нарушения, и называть его без разбора состава значит вводить читателя в заблуждение.

Экономический эффект измерен слабее технического. Точность извлечения померена публично и многократно, а сколько денег экономит внедрение, не померено почти никем: отраслевые цифры вида «в разы меньше ручного ввода» приходят из материалов поставщиков, где методика замера не описана.

Мы тоже сторона. Эту статью пишет агентство, которое зарабатывает на проектах автоматизации. Поэтому в таблице цен выше нет оценок, нет рейтинга и нет строки про наш собственный продукт.

Что здесь быстро устаревает

  • Цены. Тарифы облачных поставщиков пересматриваются без предупреждения, линейки моделей переименовываются. Признак протухания: на тарифной странице другое число или другое название услуги.
  • Проценты точности. Приведённые замеры относятся к августу 2025 и марту 2026 года и к конкретным версиям моделей. Устройство ошибки живёт дольше самих процентов.
  • Редакции норм. Использованы 152-ФЗ в редакции от 26.07.2026 и 98-ФЗ в редакции от 08.08.2024. Устарело, если у любого из двух законов на КонсультантПлюс стоит редакция свежее названной.
  • Граница между уровнями. Модели, читающие страницу картинкой и сразу отдающие поля, размывают различие между распознаванием и извлечением. Экономика у этих шагов пока разная, но именно это может измениться первым.

См. также

Источники

  1. Berghaus D., Berger A., Hillebrand L., Cvejoski K., Sifa R. Multi-Modal Vision vs. Text-Based Parsing: Benchmarking LLM Strategies for Invoice Processing. arXiv:2509.04469, 29 августа 2025. Три набора счетов, восемь моделей, метрика доли точно извлечённых полей. https://arxiv.org/abs/2509.04469 (сверено 19 сентября 2026 года).
  2. Li Z. и соавторы. MDPBench: A Benchmark for Multilingual Document Parsing in Real-World Scenarios. arXiv:2603.28130, 30 марта 2026. 3400 изображений документов, 17 языков, просадка на снятых камерой документах и на нелатинских системах письма. https://arxiv.org/abs/2603.28130 (19 сентября 2026 года).
  3. Microsoft Learn. Interpret and improve model accuracy and confidence scores (Azure AI Document Intelligence): смысл оценки уверенности, порог для передачи человеку, ориентиры точности обученной модели. https://learn.microsoft.com/en-us/azure/ai-services/document-intelligence/concept/accuracy-confidence (страница обновлена 8 апреля 2026 года, сверено 19 сентября 2026 года).
  4. Google Cloud. Document AI pricing: прейскурант процессоров распознавания, разбора макета и извлечения полей за 1000 страниц. https://cloud.google.com/document-ai/pricing (19 сентября 2026 года).
  5. Yandex AI Studio. Правила тарификации, разделы «Распознавание изображений» и «Синхронный режим работы моделей»: цены в рублях с НДС и определение единицы тарификации. https://aistudio.yandex.ru/ru/docs/ai-studio/pricing (19 сентября 2026 года).
  6. Gartner Peer Insights. Intelligent Document Processing Solutions: определение класса решений. https://www.gartner.com/reviews/market/intelligent-document-processing-solutions (19 сентября 2026 года).
  7. Федеральный закон от 27.07.2006 № 152-ФЗ «О персональных данных» (ред. от 26.07.2026), статья 3, пункты 1 и 3. https://www.consultant.ru/document/cons_doc_LAW_61801/4f41fe599ce341751e4e34dc50a4b676674c1416/ (19 сентября 2026 года).
  8. Тот же закон, статья 6, часть 3: поручение обработки персональных данных другому лицу. https://www.consultant.ru/document/cons_doc_LAW_61801/315f051396c88f1e4f827ba3f2ae313d999a1873/ (19 сентября 2026 года).
  9. Тот же закон, статья 18, часть 5 в редакции Федерального закона от 28.02.2025 № 23-ФЗ. https://www.consultant.ru/document/cons_doc_LAW_61801/cbf4e15b7c330f9372e876cdf2bc928bad7950ef/ (19 сентября 2026 года).
  10. Федеральный закон от 29.07.2004 № 98-ФЗ «О коммерческой тайне» (ред. от 08.08.2024), статья 3, пункт 2. https://www.consultant.ru/document/cons_doc_LAW_48699/ea6f7bb32cdb797dc30aca18be2a215cd0211ad2/ (19 сентября 2026 года).
  11. Тот же закон, статья 10: меры по охране конфиденциальности информации и момент установления режима. https://www.consultant.ru/document/cons_doc_LAW_48699/0ca1b144b64eaa68cd80ca51ad37ac4047c47775/ (19 сентября 2026 года).
  12. Оптическое распознавание символов // Википедия. Раздел «История»: даты патентов, первых машин и первых кириллических программ. https://ru.wikipedia.org/wiki/Оптическое_распознавание_символов (19 сентября 2026 года).
  13. Собственный разбор выдачи 19 сентября 2026 года: семнадцать страниц топа по запросам «ии для работы с документами», «ии для документов» и «распознавание документов». Считались наличие числа точности, наличие методики рядом с числом, цена за страницу или документ в рублях, упоминание метрик CER и WER, ссылка на независимое сравнение, содержательный разбор персональных данных и коммерческой тайны. Ссылки на разобранные страницы не приводятся: справочник не ссылается на материалы прямых конкурентов.