Я довольно долго воспринимала распознавание текста как уже решённую задачу. Отправляешь фотографию чека, страницу книги или скриншот и через несколько секунд получаешь текст.
Но чем больше разных документов я пробовала, тем заметнее становилась одна странность: один и тот же файл разные сервисы могут распознать совершенно по-разному.
С обычным печатным текстом разница иногда почти незаметна. Но стоит взять таблицу, рукописную заметку, фотографию под углом или документ со сложной структурой, и один инструмент возвращает аккуратный результат, а другой теряет строки, смешивает колонки или ошибается в отдельных словах.
Поэтому я решила посмотреть не столько на то, "умеет ли ИИ распознавать текст", сколько на более практичный вопрос: почему современные нейросети и обычный OCR дают разные результаты и что это меняет для пользователя.
Что сегодня умеют нейросети для распознавания текста
Самая базовая задача почти не изменилась: у нас есть изображение, а на выходе нужен редактируемый текст.
Но сами исходные материалы стали намного разнообразнее.
Сегодня распознавать приходится не только хорошо отсканированные страницы, но и:
- фотографии документов с телефона
- скриншоты
- чеки и счета
- таблицы
- рукописные заметки
- страницы со сложной вёрсткой
- изображения, снятые под углом
- несколько страниц или изображений подряд
И вот здесь разница между подходами уже становится важной.
Обычный OCR прежде всего пытается найти на изображении символы и превратить их в текст. Современные ИИ-модели могут дополнительно анализировать контекст и взаимное расположение элементов на странице.
Проще говоря, для одной системы строка текста остаётся просто строкой, а другая может заметить, что перед ней заголовок, таблица, сумма в чеке или несколько связанных колонок.
На обычной фотографии книги это отличие может почти не ощущаться. На счёте или таблице оно становится гораздо заметнее.
Я проверила это на одном и том же счёте
Чтобы посмотреть на разницу не в теории, я взяла простой синтетический счёт с четырьмя позициями.

Реальных данных в документе нет. Я немного наклонила изображение, чтобы оно больше походило на обычную фотографию с телефона, а затем отправила один и тот же файл в два разных инструмента:
- Tesseract, один из самых известных классических OCR;
- Chandra OCR 2, современную модель для работы с документами, которую я запускала локально.
Мне было интересно не только количество ошибок в тексте, но и то, что произойдёт со структурой самого документа.
Что получилось у Tesseract
На первый взгляд результат выглядел вполне неплохо.
Tesseract правильно распознал основные суммы: подытог 2 062.00, налог 103.10 и итоговую сумму 2 165.10.
Но в самом тексте появилось несколько ошибок:
INVOICEпревратился вINVOICE AYSpringfieldвSpringfieiaExtra API seatsвExtra AP seats
Сами по себе эти ошибки на целый документ выглядят не так страшно.
Гораздо интереснее оказалось другое.
Исходный счёт содержал таблицу с четырьмя колонками: Description, Qty, Unit Price и Amount. После распознавания эта структура практически исчезла. Значения превратились в последовательность текста и чисел, и уже было сложно понять, к какой строке относится конкретная цена или количество.

То есть проблема оказалась не столько в распознанных буквах, сколько в том, что происходит с документом после распознавания.
А современная ИИ-модель повела себя иначе
Chandra OCR 2 получила тот же самый файл, но результат оказался намного ближе к исходному документу.
Модель сохранила связь между строками и колонками и корректнее восстановила структуру таблицы.
И мне кажется, именно этот момент лучше всего объясняет разницу между обычным OCR и современным ИИ-распознаванием.
Если задача состоит просто в том, чтобы прочитать строку печатного текста, классического OCR часто более чем достаточно.
Но если важно понять, как разные части документа связаны между собой, одной работы с символами уже мало.
Таблица должна оставаться таблицей. Значение рядом с полем "Итого" должно относиться именно к итогу. Строки формы не должны смешиваться между собой.
Именно поэтому два инструмента могут прекрасно "увидеть" почти все буквы, но дать совершенно разный результат с точки зрения дальнейшей работы с этим текстом.
Оба инструмента прочитали почти одни и те же символы. Разница проявилась в том, что осталось вокруг них: строки, колонки и связь значения со своим полем.
Чем ИИ-распознавание отличается от обычного OCR
Я бы не проводила здесь жёсткую границу в духе "старое против нового", потому что на практике современные сервисы могут комбинировать несколько технологий.
Но если сильно упростить, разница выглядит примерно так.
| Обычный OCR | Современное ИИ-распознавание | |
|---|---|---|
| Печатный текст хорошего качества | Обычно справляется очень хорошо | Обычно справляется хорошо |
| Таблицы | Может потерять колонки и строки | Лучше понимает структуру |
| Фото под углом | Качество может заметно снижаться | Часто устойчивее к искажениям |
| Сложная вёрстка | Может смешивать блоки | Лучше учитывает расположение элементов |
| Рукописный текст | Сильно зависит от движка | Современные модели часто справляются лучше |
| Контекст документа | Ограниченный | Может учитывать соседние элементы и смысл |
| Скорость и ресурсы | Обычно проще и быстрее | Может требовать больше вычислений |
Но я бы не воспринимала эту таблицу как рейтинг, где правая колонка автоматически означает "лучше".
Для чистого скана с обычным печатным текстом использовать тяжёлую vision-модель может быть просто избыточно. А если нужно восстановить таблицу из фотографии счёта, дополнительные возможности ИИ уже действительно имеют значение.
Какой подход подходит под разные задачи
После этого теста мне стало интереснее смотреть не на название технологии, а на исходный документ.
Если передо мной обычная страница книги или хорошо отсканированный текст, мне в первую очередь нужна точность распознавания символов. Здесь классический OCR вполне может дать отличный результат.
С таблицей ситуация другая. Мне важно не только получить все числа, но и сохранить связь между строками и колонками.
С чеками и формами появляется ещё одна задача: нужно понимать, где название поля, а где его значение.
С рукописным текстом многое зависит уже от самого почерка, качества фотографии и модели.
Поэтому я бы выбирала инструмент примерно так:
| Что нужно распознать | На что я бы смотрела в первую очередь |
|---|---|
| Страница книги или простой документ | Точность текста и скорость |
| Скриншот | Простота отправки и получения текста |
| Чек или счёт | Сохранение строк, сумм и структуры |
| Таблица | Сохранение колонок и связей между значениями |
| Рукописная заметка | Работа модели именно с почерком |
| Несколько страниц | Возможность обработать их вместе |
| Фото плохого качества | Устойчивость к наклону, теням и размытию |
И вот здесь становится понятнее, почему бессмысленно искать одну "самую точную нейросеть для распознавания текста" вообще.
Всё зависит от того, какой текст вы ей показываете и что хотите получить на выходе.
Где ИИ-распознавание всё ещё ошибается
После появления vision-моделей легко получить обратное впечатление: будто теперь можно показать ИИ практически любой документ и получить идеальный результат.
На практике это, конечно, не так.
Сложный почерк
Хорошо читаемые рукописные заметки современные модели действительно распознают намного увереннее, чем старые OCR-системы.
Но если буквы сливаются, автор использует много сокращений или сам почерк трудно разобрать даже человеку, ошибки всё равно будут. Отдельно я проверяла это на реальных рукописных страницах в статье Как распознать рукописный текст на iPhone и Android.
Очень низкое разрешение
ИИ может лучше учитывать контекст, но он не способен восстановить информацию, которой физически нет на изображении.
Если мелкий текст превратился в несколько пикселей, результат остаётся непредсказуемым.
Сложная или необычная вёрстка
Колонки, подписи, примечания и вложенные таблицы иногда всё равно соединяются неправильно.
Особенно это заметно в документах, где расположение элементов не соответствует привычной структуре страницы.
Похожие значения
Для документов с числами я бы в любом случае проверяла важные значения вручную.
Одна неверно распознанная цифра в книге почти ничего не меняет, а та же ошибка в счёте, дате или номере документа уже может быть существенной.
ИИ может не только ошибиться, но и додумать
Это отдельный нюанс современных моделей.
Классический OCR обычно либо распознаёт символ неправильно, либо вообще его пропускает. Модель, которая анализирует документ вместе с контекстом, в некоторых случаях может попытаться восстановить неясное значение сама.
Поэтому особенно важные данные лучше сверять с оригиналом независимо от того, насколько аккуратно выглядит результат.
ИИ убирает часть старых проблем OCR и добавляет новую: результат может выглядеть аккуратно именно потому, что модель додумала значение, которое не смогла прочитать.
Значит ли это, что обычный OCR больше не нужен?
После моего теста было бы легко сделать такой вывод, но я бы его не делала.
Если у вас тысячи простых сканов с печатным текстом, классический OCR может оказаться быстрее, дешевле и полностью достаточным.
Если же речь идёт о фотографиях с телефона, таблицах, формах, почерке или сложных документах, возможности современных моделей становятся намного полезнее.
Получается, что ИИ не столько "заменил OCR", сколько расширил круг задач, которые теперь можно решать автоматически.
И именно поэтому современные сервисы всё чаще скрывают выбор конкретной технологии от пользователя.
А если мне просто нужно получить текст с картинки?
А вот здесь я бы вернулась к самому обычному пользовательскому сценарию.
Большинству людей совершенно не важно, работает внутри Tesseract, специализированная OCR-модель или vision-модель. Им нужно отправить изображение и получить текст, который можно скопировать дальше.
Например, если у меня несколько скриншотов, фотографий страниц или заметок, я не хочу отдельно выяснять, какой движок лучше подойдёт для каждого файла.
Мне гораздо важнее весь путь: изображение → распознавание → готовый редактируемый текст. Именно этот путь я разбирала в статье Как скопировать текст с картинки на телефоне: Android и iPhone — там выбор движка вообще не возникает.
И ещё удобнее, если несколько изображений можно обработать одним запросом, а не загружать каждое отдельно.
Именно такой сценарий я использую в ImgTxtApp by LaVioLab. Бот работает прямо в Telegram: можно отправить фотографию, скриншот или несколько изображений и получить извлечённый текст ответным сообщением.
Если изображение уже находится в телефоне или Telegram, это просто убирает часть промежуточных действий между исходным файлом и готовым текстом.
Что я в итоге поняла после этого теста
Я начинала этот разбор с довольно простого вопроса: почему один OCR распознаёт документ лучше другого?
Но в итоге мне кажется интереснее другой вывод.
Сами буквы современные инструменты во многих случаях читают уже достаточно хорошо. Настоящая разница начинает проявляться тогда, когда документ становится сложнее обычной строки текста.
Нужно ли сохранить таблицу? Понять, какое значение относится к какому полю? Разобрать фотографию под углом? Прочитать почерк? Обработать несколько изображений подряд?
Именно поэтому я бы выбирала инструмент не по обещанию "AI OCR" или "нейросеть", а по тому, насколько хорошо он справляется именно с вашим типом документа и насколько удобно потом работать с получившимся текстом.
Ну и раз уж один из вариантов, которыми я пользуюсь сама, это мой Telegram-бот, оставлю его здесь.
ImgTxtApp by LaVioLab позволяет отправить изображения прямо в Telegram и получить из них редактируемый текст.
