с 9:00 до 18:00, г. Москва

Прежде чем документ можно обработать — извлечь данные, положить в нужный раздел архива, отправить по маршруту — нужно понять, что это за документ. В бумажном мире эту работу делает человек: берёт лист, смотрит, решает «это УПД, это в бухгалтерию». На потоке в тысячи документов такая ручная сортировка съедает часы ежедневно.

AI-обработка документов

Классификация документов с помощью AI: как это работает

8 мин чтения
Содержание статьи

AI-классификация автоматизирует именно этот шаг: система сама определяет тип каждого документа. Разберём, как это устроено.

Зачем определять тип документа автоматически

Тип документа — отправная точка всей дальнейшей обработки:

  • какие поля извлекать — у счёта-фактуры один набор реквизитов, у договора другой;
  • куда положить — в какой раздел архива, к какому делу или проекту;
  • как обработать — какой маршрут, какие проверки, какие сроки;
  • как искать потом — фильтр «показать все акты за квартал» работает, только если у документов проставлен тип.

Без классификации поток документов остаётся «кучей файлов». С ней — становится управляемым: каждый документ автоматически попадает на свою полку.

Как AI понимает, что перед ним

Система анализирует документ так же, как опытный делопроизводитель — по совокупности признаков:

  • структура и внешний вид — расположение блоков, наличие таблиц, шапки, штампов. УПД визуально отличается от договора ещё до чтения текста;
  • ключевые элементы — заголовки («Универсальный передаточный документ», «Договор поставки»), типовые формулировки, номера форм;
  • содержимое — характерные реквизиты и их сочетания: у счёта есть плательщик и назначение, у акта — «исполнитель сдал, заказчик принял».

Работает связка распознавания и AI: сначала распознавание OCR+VLM переводит документ в машиночитаемый вид с сохранением структуры, затем модель относит его к одному из типов. Многостраничные файлы при этом разбираются на составляющие: если в одном PDF отсканирован договор вместе с приложениями и актом, система видит границы документов.

Что происходит после классификации

Определённый тип запускает дальнейшую цепочку:

  1. Извлечение атрибутов по профилю типа. Для УПД — номер, дата, сумма, НДС, контрагент; для договора — стороны, предмет, срок. Как это работает — в материале про извлечение данных.
  2. Размещение в архиве. Документ попадает в свой раздел цифрового архива с правильной атрибутивной карточкой.
  3. Теги и индексация. Автоматически присваиваются теги: тип, организация, проект, тема — по ним потом строятся фильтры.

Спорные случаи и контроль человеком

Не каждый документ классифицируется однозначно: бывают нетиповые формы, плохие сканы, гибридные документы. Система оценивает уверенность в своём решении, и документы с низкой уверенностью уходят на проверку человеку — оператор подтверждает или исправляет тип, глядя на скан. Такой контур «AI + контроль» держит базу достоверной: массовые типовые документы проходят автоматически, редкие и спорные — через человека.

Классификация под задачи компании

Набор типов не фиксирован. У бухгалтерии это УПД, счета, акты, накладные; у юристов — договоры, приложения, судебные документы; у банка — анкеты, досье, справки; у архивного фонда — свои виды дел. Система настраивается под номенклатуру конкретной организации: создаются нужные типы документов и профили атрибутов под каждый — классификация документов работает по правилам вашей компании, а не по универсальному шаблону.

Где это экономит больше всего

  • входящий поток бухгалтерии — смешанные пачки первички раскладываются по типам без ручного разбора;
  • оцифровка накопленных архивов — миллионы страниц исторических документов классифицируются автоматически, вручную это заняло бы годы;
  • разбор почтовых ящиков — вложения из почты сортируются и попадают в архив с типом;
  • миграция файловых свалок — многолетние папки «Сканы» превращаются в структурированную базу.

Частые вопросы

Какие типы документов распознаёт система?

Типовые финансовые и организационные: УПД, счета, счета-фактуры, акты, накладные, договоры и другие. Набор типов настраивается под номенклатуру конкретной компании.

Что если в одном PDF несколько документов?

Система определяет границы документов внутри файла и разбирает его на составляющие, классифицируя каждый отдельно.

Может ли AI ошибиться с типом?

Может, поэтому у каждого решения есть оценка уверенности: спорные случаи направляются на подтверждение человеку.

Можно ли добавить свои типы документов?

Да, типы и профили атрибутов создаются под задачи компании — от страховых дел до проектной документации.

Зачем классификация, если можно просто хранить файлы?

Тип документа определяет всё дальнейшее: какие данные извлекать, куда положить, как искать. Без классификации архив остаётся неструктурированной папкой.

Проверьте на своём потоке: загрузите смешанные документы — система разложит их по типам.
Получить демо-доступ

Заказать звонок

Заполните форму и мы перезвоним Вам
течение 5-ти минут *

* в рабочее время

Даю согласие на обработку персональных данных

Заказать консультацию

Заполните форму и мы перезвоним Вам
течение 5-ти минут *

* в рабочее время

Даю согласие на обработку персональных данных

Оставьте заявку

Заполните форму и мы перезвоним Вам
течение 5-ти минут *

* в рабочее время

Даю согласие на обработку персональных данных

Спасибо за заявку!