Когда скан мешает переводу¶
На первой странице договора номер читается отчетливо, на второй печать закрывает часть фамилии, а третья снята под углом и выглядит бледной. Переводчик получает не просто неудобный файл: ему приходится разбираться, какие знаки действительно стоят в документе, а какие появились после распознавания.
Плохой скан влияет на работу задолго до перевода. OCR - оптическое распознавание символов - превращает изображение страницы в текст, который можно искать, копировать и обрабатывать. Если распознавание перепутает номер паспорта, дату, отрицание или имя, переводчик может не заметить, что ошибочная версия уже попала в текстовый слой.
Качество файла нельзя оценить по одному признаку. Microsoft перечисляет разрешение, контраст, освещение, поворот, размер и плотность текста среди факторов, влияющих на точность OCR. В документации также сказано:
“Document scan quality, resolution, contrast, light conditions, rotation, and text attributes such as size, color, and density can all affect the accuracy of OCR results.”
Проще говоря, дело не только в размытии: ровная страница с мелким текстом тоже может распознаваться хуже, чем четкая страница с крупным шрифтом. Microsoft Learn описывает ограничения OCR и рекомендует оценивать результат на материале, похожем на документы, с которыми предстоит работать.
Перед отправкой файла разделите задачу на три вопроса:
- Можно ли прочитать значимые фрагменты на исходном изображении?
- Можно ли улучшить саму геометрию или контраст страницы без потери деталей?
- Можно ли проверить текст после OCR по изображению или оригиналу?
Если ответ на первый вопрос отрицательный, фильтры не восстановят достоверный текст. Если текст читается, но странице мешает наклон, тень или фон, точечная обработка может помочь. Если изображение выглядит нормально, а распознавание дает сомнительные слова, нужна проверка самого текстового слоя.
Для переводческих команд полезно считать распознавание отдельным этапом контроля, а не невидимой кнопкой перед переводом. Страница может хорошо выглядеть на экране и при этом давать ошибочный текст после OCR. И наоборот: умеренно бледный документ способен распознаться достаточно хорошо, если буквы различимы, строки ровные, а фон не мешает.
Разница особенно важна для договоров, анкет и справок. В рекламном буклете потерянная точка может быть мелочью; в дате или сумме одна точка меняет смысл. Поэтому вопрос не в том, можно ли сделать изображение красивее, а в том, можно ли проверить каждый важный символ.
Сначала выберите тип исправления¶
Подготовка скана - не один универсальный фильтр, а набор действий для разных дефектов. Перед обработкой сохраните исходный файл отдельно, чтобы сравнивать с ним результат и вернуться к нему, если улучшенная версия окажется хуже.
Проверка исходника¶
Откройте страницу в исходном разрешении и посмотрите на нее при увеличении. Проверьте края, верхние и нижние строки, поля, печати, рукописные пометки и места, где текст проходит рядом с переплетом или сгибом.
Затем определите тип дефекта:
| Что видно | Что попробовать | Когда остановиться |
|---|---|---|
| Строки идут под углом | Выровнять страницу или строки | Когда выравнивание обрезает символы по краю |
| Буквы слишком бледные | Сохранить серые оттенки, осторожно поднять локальную читаемость | Если штрихи букв начинают пропадать |
| Темный фон или тень | Проверить коррекцию фона на копии | Если вместе с фоном исчезают тонкие элементы |
| Размытые буквы | Запросить более резкий скан или фото | Если границы символов уже отсутствуют |
| Мелкий текст | Переснять или отсканировать с большим разрешением | Если увеличение только растягивает размытые пиксели |
| Текст обрезан | Получить страницу целиком | Если утраченная часть не видна в другом источнике |
Таблица помогает не тратить время на неподходящий фильтр. Например, повышение контраста может выделить текст на серой бумаге, но не вернуть букву, которая смазалась при съемке.
Проверьте также, что файл содержит все страницы и каждая страница принадлежит нужному документу. Смешение страниц может пройти незамеченным, если в пакете есть похожие бланки. В переводе такая ошибка превращается в неправильный порядок абзацев или подпись не к тому приложению.
Оригинал важнее обработанной копии¶
Сохраните неизмененный источник и создавайте обработанные версии отдельно. Такой подход не позволяет случайно принять результат фильтра за первичный документ. Для сравнения полезно хранить рядом скан, текст после OCR и перевод.
Национальный архив США описывает OCR как дополнение к изображению, а не замену скану: в архивном контексте он запрашивает OCR-версии, если они доступны, вместе с изображениями. Это полезный принцип и для рабочего процесса перевода: изображение показывает, что было на странице, а текстовый слой ускоряет поиск и проверку. Рекомендации National Archives относятся к архивной передаче документов, а не устанавливают общее требование для переводческих заказов.
Типичная ситуация: система распознала фамилию в строке, но одна буква слилась с печатью. Сверка OCR-текста с изображением помогает заметить расхождение; сверка с оригиналом нужна, если изображение само не дает однозначного ответа.
Разрешение, резкость и перекос¶
Разрешение влияет на количество деталей в изображении, но большое число dpi само по себе не гарантирует удачное распознавание. Важны качество оптики, движение камеры, размер шрифта, освещение и то, как файл сохраняли после съемки.
Какое разрешение выбрать¶
Google Document AI указывает минимум 200 dpi для документов, а 300 dpi и выше обычно дает лучшие результаты OCR в рекомендациях сервиса, проверенных 10 ноября 2026 года (документация Document AI). Это ориентир конкретной системы, а не обязательный порог для любого распознавателя.
Tesseract, со своей стороны, сообщает, что его движок лучше работает при 300 dpi или выше; это рекомендация для данного инструмента, а не универсальное правило для всех OCR-систем (руководство Tesseract). Разница между рекомендациями показывает, почему нельзя обещать точность только по одному числу. Проверяйте настройки конкретного инструмента на типичных страницах проекта.
Если документ уже снят на телефон, не стоит просто увеличивать картинку в редакторе и считать, что появилось дополнительное разрешение. Растянутые пиксели не возвращают детали букв. Лучше получить новый снимок или скан, если исходник слишком мал, а важные знаки расплылись.
Для небольшого шрифта стоит оценить качество на уровне строки, а не только страницы целиком. Заголовки могут читаться прекрасно, в то время как мелкая сноска остается неразборчивой. Если сноска влияет на смысл, название приложения или условия, она требует такой же проверки, как основной текст.
Google предупреждает, что изменение размера сжатого формата вроде JPEG для уменьшения файла может снизить качество изображения и точность OCR. Поэтому не пересохраняйте одну и ту же картинку многократно с потерями. Рекомендации по поддерживаемым файлам Document AI помогают понять, почему исходник лучше хранить отдельно от уменьшенных копий.
Зачем выравнивать страницу¶
Перекошенная строка усложняет OCR: движок должен определить, где заканчивается одна строка и начинается другая. Tesseract указывает, что наклон снижает качество сегментации строк, и рекомендует поворачивать текст так, чтобы строки шли горизонтально (документация Tesseract).
Проверьте наклон по базовым линиям текста, а не только по краям листа. Лист может выглядеть ровным, хотя его фотографировали под углом; перспектива растягивает один край и сжимает другой. Исправление геометрии поможет, если символы сохранили форму. Если край страницы обрезан, выравнивание не вернет отсутствующую часть строки.
После обработки откройте увеличенные фрагменты со всех краев. Автоматическая коррекция иногда обрезает поля вместе с печатью, номером страницы или подписью. Сравните исправленный вариант с исходником до отправки на распознавание.
Что делать с размытием¶
Размытие отличается от наклона: при наклоне контуры букв обычно сохраняются, но меняется ориентация строк; при размытии границы букв теряются. Повышение резкости может подчеркнуть то, что уже есть, но не гарантирует правильного восстановления формы символов.
Если фамилия или цифра выглядит неоднозначно, не подбирайте символ по контексту без подтверждения. Контекст помогает найти место для проверки, но не доказывает, какая буква была в исходнике. Запросите повторный скан, фото или сверку с бумажным оригиналом.
Низкий контраст, выцветание и тени¶
Бледные документы требуют осторожности: чрезмерная обработка способна сделать страницу контрастнее, но одновременно стереть тонкие части текста. Поэтому сравнивайте изменения с исходником и проверяйте отдельные штрихи, а не только то, насколько темными стали буквы.
Для чистой печатной страницы черно-белое представление может быть удобным, но низкий контраст, пятна и рукописные отметки меняют задачу. National Archives различает чистые высококонтрастные материалы и документы с плохой читаемостью: для последних его архивная рекомендация предусматривает оттенки серого. Руководство опубликовано в 2002 году и относится к передаче текстовых документов в архив, а не к универсальным требованиям перевода (National Archives).
В оттенках серого сохраняются тонкие различия между бумагой, чернилами, карандашом и следами печати. Преобразование в два цвета - черный и белый - может отбросить переходные оттенки, в которых еще различимы части букв. Архивная рекомендация NARA также отмечает пользу серого режима для выцветших, испачканных и низкоконтрастных записей, а также страниц с рукописными пометками.
“Gray scale (8-bit) scanned at 300-400 ppi.”
В переводе: для указанного архивного сценария National Archives приводит сканирование в 8-битных оттенках серого при 300-400 ppi. Эти параметры относятся к архивной передаче текстовых записей, а не к обязательному стандарту для любого заказа на перевод.
Почему нельзя просто выкрутить контраст¶
Слишком светлое изображение может сделать символы «разорванными», а слишком темное тоже ухудшает распознавание. Для ориентира смотрите не на общий вид страницы, а на сохранность штрихов: остаются ли замкнутыми петли букв, не сливаются ли соседние символы и не исчезают ли тонкие элементы.
Тени, блики и неравномерное освещение делают автоматическую обработку особенно рискованной. В исследовании 2020 года авторы описывают, как тени, локальные отражения и перепады освещения могут привести к необратимой потере информации при преобразовании изображения в черно-белое. Их вывод относится к подготовке изображений для OCR, а не напрямую к качеству перевода (статья о бинаризации документов).
“the presence of shadows, local light reflections, illumination gradients, and other background distortions may lead to an irreversible loss of information during the image thresholding, causing many errors in character recognition.”
Иными словами, удаление фона не всегда безобидно: вместе с тенью обработка может убрать часть буквы. Авторы проверяли комбинированный метод бинаризации на наборе из 176 изображений с неравномерным освещением и сообщили об улучшении распознавания именно на этом наборе; результат исследования 2020 года нельзя считать гарантией для любого скана (статья исследования).
Когда фильтр не поможет¶
Сильная тень может скрывать текст, но не каждый темный участок является дефектом: там может находиться печать или рукописная пометка. Перед удалением фона проверьте, какие детали исчезают. Не уничтожайте исходное изображение даже тогда, когда очищенная копия выглядит аккуратнее.
Если скан выцвел настолько, что штрихи отдельных букв слились с бумагой, попросите более качественный источник. Для сравнения рассмотрите цветной и серый варианты: цвет иногда помогает отличить чернила от пятна, а оттенки серого сохраняют различия, которые теряются при жестком черно-белом преобразовании.
Сверка OCR и выбор рабочего варианта¶
OCR может вывести текст, даже если часть букв распознана неверно или вообще пропущена. Для перевода важно проверять не только отдельные сомнительные символы, но и целые смысловые блоки: заголовки, даты, суммы, имена и отрицания.
Microsoft определяет частоту ошибок слов OCR через замены, удаления и вставки относительно эталонного текста. Такая схема объясняет, почему проверка только очевидных опечаток недостаточна: система может не только заменить одну букву другой, но и пропустить слово или добавить лишний знак (описание ограничений OCR Microsoft).
Практический порядок проверки¶
- Сохраните исходник. Не перезаписывайте оригинал улучшенной копией.
- Определите проблемные страницы. Отметьте бледные строки, размытые поля, печати, тени и места с мелким текстом.
- Исправьте геометрию на копии. Выровняйте наклон, не обрезая важные поля.
- Сохраните детали изображения. Для бледного текста проверьте оттенки серого до жесткого черно-белого преобразования.
- Запустите OCR. Убедитесь, что выбран подходящий язык распознавания, иначе близкие по начертанию буквы и специальные знаки могут стать дополнительным источником ошибок.
- Сверьте текст с изображением. Начните с имен, дат, номеров, сумм, печатей и всех мест, помеченных системой как сомнительные.
- Зафиксируйте нерешенные фрагменты. Передайте их переводчику как нечитаемые или запросите новый источник; не подменяйте проверку догадкой.
Тестируйте процесс на страницах, похожих на реальные входящие документы. Microsoft рекомендует оценивать распознавание на выборке, которая представляет материалы конкретной организации, и использовать оценки уверенности, чтобы направлять результаты на человеческую проверку. Приведенный в документации порог 0,80 - пример, а не универсальная граница приемки (Microsoft Learn).
Оценка уверенности - подсказка, не свидетельство достоверности. Высокая оценка не доказывает, что номер прочитан правильно; низкая не означает, что весь документ непригоден. Настройте выборочную проверку по риску: если ошибка в строке меняет юридический смысл, проверьте ее независимо от оценки модели.
В документации Google Document AI описаны коррекция поворота, оценки качества изображения и информация о дефектах на уровне страниц. Такой подход позволяет направить слабые страницы на ручную проверку, вместо того чтобы считать весь пакет одинаково читаемым (описание Enterprise Document OCR). Смысл для рабочего процесса простой: сортируйте страницы по качеству и отмечайте проблемные места до передачи файла переводчику.
“the presence of shadows, local light reflections, illumination gradients, and other background distortions may lead to an irreversible loss of information during the image thresholding…”
Фраза напоминает о конкретном риске: очистка страницы может необратимо убрать данные, а не только фон. Сохраняйте обе версии и оставляйте возможность сверить распознанный текст с первичным изображением.
Как это устроено в ChatsControl¶
Если скан читается достаточно хорошо и нужен перевод документа, а не простой текстовый фрагмент, в ChatsControl можно загрузить PDF или фото: сервис сначала распознает текст, затем переводит документ и собирает форматированный результат. Такой вариант избавляет от ручного копирования текста, но сам по себе не подтверждает точность каждого распознанного символа.
У сервиса есть двуязычный просмотр, где исходный и переведенный текст показаны рядом. Такой способ проверки помогает заметить расхождение при последующем просмотре, но не решает проблему символа, который неразличим даже на исходном изображении. ChatsControl не предназначен для рукописных и очень плохих сканов; в этих случаях нужен человек, который сверит текст с оригиналом.
Платформа работает в облаке. Если документ нельзя передавать в облачный сервис по правилам вашей организации, выберите локальный процесс или другой допустимый канал. Автоматическое удаление загруженных документов по умолчанию настроено через 30 дней согласно данным продукта; срок хранения важен для решения о загрузке, но не заменяет проверку внутренних требований к данным.
Сравнение способов подготовки скана¶
Выбор зависит от того, есть ли у вас оригинал, сколько страниц нужно обработать и кто будет проверять распознавание. Сравнивайте не только скорость получения текста, но и возможность вернуться к изображению при сомнении.
| Вариант | Что подходит исправлять | Сильная сторона | Ограничение |
|---|---|---|---|
| Пересканировать или переснять документ | Размытие, плохая резкость, обрезанные края | Дает новый исходник вместо обработки утраченных деталей | Нужен доступ к документу или к владельцу |
| Обработать изображение | Наклон, часть проблем освещения и фона | Можно применить конкретную коррекцию к копии | Не восстанавливает отсутствующие символы |
| Использовать OCR и вычитку | Поиск, извлечение и подготовка текста к переводу | Ускоряет работу с читаемым сканом | Ошибки OCR нужно сверять с изображением |
| Поручить проверку переводчику по оригиналу | Спорные имена, цифры, печати, рукописные элементы | Позволяет разрешить сомнения на первичном источнике | Нужен доступ к оригиналу или новому скану |
Для небольшой выборки полезно сравнить два состояния: исходный скан и версию после выбранной обработки. Сравнивайте не только внешний вид, но и результат OCR. Изображение может стать контрастнее, а текстовый результат - хуже, если пропали тонкие штрихи.
При поточном приеме документов удобно вести простую таблицу качества:
| Поле проверки | Что записать |
|---|---|
| Страница | Номер страницы или идентификатор файла |
| Дефект | Наклон, размытие, бледность, тень, обрезка |
| Важный фрагмент | Имя, дата, номер, сумма, печать или рукописная запись |
| Действие | Новый скан, коррекция, ручная сверка или запрос оригинала |
| Статус | Проверено, ожидает уточнения или не читается |
Таблица не заменяет систему управления проектами, но делает передачу проблемных мест понятной для переводчика, редактора и клиента. В частности, отметка «не читается» лучше, чем пустое поле, которое принимают за пропуск OCR или забытый фрагмент.
Если перевод нужен для официальной подачи, отдельно уточните, какие требования предъявлены к самому документу, способу заверения и комплекту материалов. Читаемость изображения не определяет, достаточно ли электронной копии для получателя. Переводчик может подготовить текст, но вопрос о допустимом формате подачи решается требованиями соответствующей организации.
Пошаговая инструкция для команды¶
Проверка до перевода помогает избежать повторной работы: получить новый скан обычно проще, чем разбирать спорные места после завершения перевода. Для каждого пакета используйте один и тот же порядок, чтобы ничего не пропустить.
- Откройте документы до назначения переводчика. Убедитесь, что страницы на месте, в правильном порядке и относятся к одному комплекту.
- Проверьте тип дефекта. Отдельно отметьте наклон, размытие, выцветание, тени, низкий контраст, обрезанные края и мелкие сноски.
- Оцените значимость плохих фрагментов. Потерянный элемент оформления и плохо читаемый номер документа - разные риски.
- Попросите повторный файл, когда информация утрачена. Новый скан или фото полезнее фильтра, если буквы смазаны, обрезаны или закрыты бликом.
- Обработайте копию, если детали сохранились. Сначала исправьте наклон, затем испытайте аккуратную коррекцию контраста и фона.
- Распознайте текст на пробных страницах. Сравните OCR с оригиналом; при большом пакете оцените и чистые, и проблемные страницы.
- Передайте переводчику исходник и текстовый слой. Оригинальное изображение остается источником проверки, а OCR-текст помогает ориентироваться в материале.
- Пометьте сомнительные места явно. Запишите, что именно не читается, вместо того чтобы оставлять переводчику возможность догадаться.
- Сверьте результат после перевода. Проверьте, что важные имена, числа и даты соответствуют документу, а не только предварительному распознаванию.
Короткий чек-лист перед отправкой:
- Исходный файл сохранен отдельно.
- Все страницы видны целиком.
- Строки не наклонены или наклон отмечен.
- Проверены бледные зоны, печати и рукописные пометки.
- OCR-текст сверяли по изображению.
- Сомнительные цифры и имена отмечены.
- Переводчику доступен источник для проверки.
- Нечитаемые части не заполнены догадками.
Первые несколько страниц из нового типа документа полезно проверять особенно внимательно. Формат бланка, печать или нестандартное расположение подписей могут отличаться от привычных материалов, даже если тема документа знакома. После проверки обновите правила отбора страниц для ручного просмотра, а не переносите вывод с одного хорошо читаемого файла на весь пакет.
Для команды с повторяющимися заказами зафиксируйте, кто запрашивает пересъемку, кто применяет коррекцию и кто сверяет текст после OCR. Одно ответственное лицо должно видеть и оригинал, и распознанный текст. Если на исправление страницы ушло время, запишите причину: это поможет отличить повторяющийся дефект сканирования от разовой ошибки.
Ошибки, из-за которых подготовка ухудшает результат¶
Обработка становится рискованной, когда цель сформулирована как «сделать страницу красивой», а не «сохранить все читаемые детали». Исправление должно облегчить проверку, а не подменить источник.
Слишком агрессивная очистка¶
Удаление теней или пятен может стереть части тонких букв, печатей и карандашных пометок. Исследование неравномерно освещенных страниц показывает, что пороговая обработка способна приводить к потере информации; авторы получили улучшение на конкретном тестовом наборе, но их результат не подтверждает безопасность любого фильтра на любом документе (исследование 2020 года).
Сравните увеличенные фрагменты до и после. Если тонкие штрихи исчезли, вернитесь к исходнику и попробуйте более мягкую настройку либо сохраните серый вариант. Важнее сохранить неоднозначный след для ручной проверки, чем удалить его ради однородного белого фона.
Увеличение с повторным сжатием¶
Увеличение размера картинки не добавляет исходных деталей. Повторное сохранение JPEG с потерями может ухудшить качество, и Google прямо предупреждает о возможном снижении точности OCR при изменении размера таких файлов (Google Document AI).
Храните мастер-файл, а рабочие варианты делайте копиями. Если файл слишком тяжелый для передачи, согласуйте формат и способ передачи, а не уменьшайте изображение несколько раз без проверки результата.
Проверка только первой страницы¶
Первая страница часто содержит крупный заголовок и основные реквизиты, поэтому может выглядеть лучше продолжения. Не считайте ее представительной для всего документа: страницы могли сканировать при разном освещении или с разной резкостью.
Если система показывает качество отдельно по страницам, направляйте слабые страницы на дополнительную проверку. Google Document AI описывает оценки качества и дефекты на уровне страницы как часть Enterprise Document OCR; функция относится к продукту Google, а принцип сортировки страниц можно использовать и в ручном процессе (документация Enterprise Document OCR).
Догадка вместо уточнения¶
Контекст может подсказать, какое слово ожидается в строке, но ожидание не заменяет исходный текст. Особенно опасно угадывать имена, номера, даты и суммы: в этих полях даже одна неверная буква или цифра меняет результат.
Если переводчик не может разобрать фрагмент, передайте его как нечитаемый и запросите подтверждение. Для этого полезно приложить страницу целиком и увеличенный фрагмент, а не только выписать свою версию сомнительного слова. Если владелец документа может прислать оригинал или повторный снимок, дождитесь подтверждения перед финальной сверкой.
Считать балл OCR доказательством¶
Оценка уверенности помогает сортировать результаты, но ее значение зависит от распознавателя, языка и типа документа. Microsoft рекомендует настраивать проверку на репрезентативной выборке; число 0,80 в его материалах приведено как пример порога для конкретного процесса, а не как обязательный стандарт для всех задач (Microsoft Learn).
Проверяйте и то, что система пропустила, и то, что она вставила. Совпадение текста с ожиданиями не доказывает, что все слова были на странице. Сверка по изображению остается частью контроля даже при высокой оценке распознавания.
Перед передачей файла зафиксируйте, какие страницы обработали и какие детали остаются сомнительными. Такая запись не делает скан лучше, но не дает незаметно превратить предположение в установленный факт.
Частые вопросы¶
Что исправить в размытому скане перед переводом?¶
Сначала запросите более четкий исходник, если важные символы расплылись. Резкость фильтра не возвращает детали, которых нет в изображении; сомнительные имена и цифры нужно проверять по оригиналу.
Какое разрешение скана нужно для OCR и перевода?¶
Google Document AI указывает минимум 200 dpi, а 300 dpi и выше обычно дает лучшие результаты в рекомендациях сервиса, проверенных 10 ноября 2026 года (документация Google). Tesseract также рекомендует 300 dpi или выше для своего движка; это не универсальная гарантия для всех систем (руководство Tesseract).
Нужно ли выравнивать перекошенный скан перед OCR?¶
Да, заметный наклон стоит исправить до распознавания: документация Tesseract связывает перекос с ухудшением сегментации строк и рекомендует выравнивать текст по горизонтали (Tesseract). После коррекции проверьте края страницы, чтобы обработка не срезала символы, печать или подпись.
Можно ли надежно перевести бледный или выцветший документ?¶
Если буквы различимы на исходном изображении, аккуратная обработка и сверка OCR могут помочь. Сохраните оттенки серого для слабоконтрастного текста и не повышайте контраст до исчезновения тонких штрихов; National Archives описывает серый режим для выцветших и низкоконтрастных текстовых записей в архивных рекомендациях (NARA).
Когда нужно запросить новый скан вместо исправления изображения?¶
Запросите новый источник, если важные буквы, цифры или части печати неразличимы, обрезаны либо закрыты бликом. Фильтр может изменить видимый сигнал, но не подтверждает содержание утраченного фрагмента.
Можно ли переводить плохой скан через онлайн-сервис?¶
Онлайн-сервис может распознать читаемый скан и подготовить перевод, но качество результата зависит от исходного изображения и последующей проверки. В ChatsControl OCR запускается до перевода, однако сервис не рассчитан на рукописные и очень плохие сканы; сомнительные места все равно нужно сверять с оригиналом.
Нужно ли отдавать переводчику и OCR-текст, и изображение?¶
Да, когда OCR-текст доступен, передайте его вместе с оригинальным изображением. Текст облегчает поиск и работу с документом, а скан нужен для проверки имен, чисел, отметок и мест, где распознаватель мог пропустить или заменить символ.
Достаточно ли оценки уверенности OCR, чтобы не вычитывать текст?¶
Нет. Оценка уверенности помогает отбирать фрагменты для проверки, но не доказывает правильность распознавания. Microsoft рекомендует проверять качество на репрезентативных документах и использовать пороги с учетом конкретного процесса, а не принимать один примерный порог за универсальное правило (Microsoft Learn).