Сканированный PDF в Word для перевода: сравнение способов¶
Тридцать страниц скана могут выглядеть как обычный документ, но для переводчика оказаться набором картинок: текст нельзя выделить, сосчитать или загрузить в привычный переводческий процесс. Перед переводом нужно распознать изображения, проверить результат и решить, действительно ли Word нужен как промежуточный формат.
Сложность не только в распознавании букв. OCR может правильно прочитать слова, но перепутать порядок колонок, разделить одну строку таблицы на несколько абзацев или принять печать за символ. После автоматического перевода такие ошибки не исчезают, а переходят в итоговый текст.
В этом руководстве сравниваем четыре маршрута: конвертацию средствами Word, OCR в Google Drive, распознавание в Acrobat и ABBYY FineReader, а также перевод скана без предварительного экспорта в Word. Разберём, кому подходит каждый вариант, что проверить перед передачей документа переводчику и как собрать воспроизводимый рабочий процесс для команды.
Что нужно сделать до перевода¶
Сканированный PDF обычно хранит изображение страницы, а не текст, доступный для поиска и редактирования. OCR - оптическое распознавание символов - анализирует изображение, определяет буквы и слова и добавляет к документу текстовый слой. Adobe объясняет, что скан бумажного документа в PDF содержит только изображения, если распознавание ещё не выполнялось.
Проверить наличие текстового слоя просто: попробуйте выделить предложение мышью и скопировать его в текстовый редактор. Если копируется текст, PDF уже содержит распознаваемый слой. Если выделяется прямоугольная область страницы или не копируется ничего, перед переводом потребуется OCR. Иногда в одном файле встречаются обе разновидности страниц: например, часть документа создана в редакторе, а часть добавлена как скан.
Подготовка к переводу состоит из нескольких разных задач:
- Распознать текст. OCR должен определить слова, цифры, подписи полей и другие видимые символы.
- Восстановить порядок чтения. Заголовки, основной текст, боковые колонки, таблицы и сноски должны идти в правильной последовательности.
- Экспортировать результат. Word удобен, когда нужно редактировать текст, исправлять распознавание и передавать документ переводчику.
- Проверить критичные элементы. Особенно внимательно смотрите на имена, даты, суммы, номера, адреса и реквизиты.
- Подготовить материал к переводу. Уберите случайные разрывы внутри предложений и убедитесь, что исходный и распознанный текст совпадают.
Word-файл нужен не во всех ситуациях. Если переводчик работает с системой, которая принимает исходный скан и сама выполняет OCR, промежуточный DOCX может оказаться лишним. А если исходный редактируемый файл сохранился, лучше передать его: преобразование в Word из PDF в любом случае требует восстановления структуры.
Для профессионального процесса полезно разделять распознавание, редактуру и перевод. Когда все три операции смешивают в один шаг, труднее понять, где появилась ошибка: в исходном скане, в OCR или в переводе. Практический ориентир - сохранить оригинальный PDF отдельно и не перезаписывать его результатами обработки.
Как выбрать способ: таблица для команды¶
Подходящий инструмент зависит от четырёх факторов: качества изображения, сложности макета, объёма файлов и требований к конфиденциальности. Ни один метод не гарантирует идеальное восстановление сложной страницы, поэтому сравнивайте не обещание «конвертировать в Word», а способность инструмента корректно распознать конкретный образец.
| Способ | Подходит, когда | Ограничения | Что проверить после экспорта |
|---|---|---|---|
| Microsoft Word | PDF преимущественно текстовый, нужно быстро получить DOCX | Полностью графический скан может остаться изображением; вёрстка может измениться | Выделяется ли текст, сохранились ли таблицы и разрывы страниц |
| Google Drive и Google Docs | Нужен доступный онлайн-способ для простого документа | Для указанного Google способа действует ограничение на размер файла; сложные элементы распознаются ненадёжно | Язык, порядок колонок, списки, таблицы, сноски |
| Adobe Acrobat OCR | Нужно распознать текст в PDF, указать язык и сохранить поисковую версию | Текстовый слой сам по себе не гарантирует аккуратный DOCX | Язык распознавания, диапазон страниц, результат экспорта |
| ABBYY FineReader PDF | В процессе много сканов и важна отдельная OCR-среда | Платный продукт; региональные цены и условия лицензии различаются | Имена, цифры, таблицы, структура и редактура |
| OCR в составе перевода | Нужно передать документ на перевод без ручного промежуточного экспорта | Сканы и сложные макеты всё равно нужно проверять; доступность форматов зависит от системы | Качество OCR и итоговый макет вместе |
Сама конвертация не исправляет качество исходника. В рекомендациях RWS по обработке PDF указано, что распознаванию мешают низкое разрешение, перекос, пятна, складки, рукописные пометки и слабый контраст. RWS рекомендует разрешение не ниже 300 dpi для OCR, чёрно-белое сканирование вместо серого или цветного и один язык в PDF, если это возможно. Значение 300 dpi - рекомендация поставщика, а не обязательная норма для любого документа.
В руководстве RWS сказано: “Since PDFs are complex formats, especially when resulting out of scanning another document, you may need to perform some manual extraction of the document to an editable format.” Простыми словами: сложный PDF после сканирования иногда приходится разбирать вручную, а автоматическая конвертация не заменяет редактуру.
Практический вывод для менеджера проекта: перед запуском большого пакета сделайте пробу на страницах с разными типами содержимого. Возьмите обычную текстовую страницу, страницу с таблицей и страницу со штампами или колонками. Сравните не только скорость обработки, но и объём ручной проверки после неё.
Чек-лист перед выбором инструмента
- Есть ли в PDF выделяемый текст, или каждая страница представляет собой изображение?
- На каком языке написан документ? Есть ли несколько языков на одной странице?
- Встречаются ли таблицы, формы, колонки, сноски, штампы и рукописные записи?
- Нужно ли сохранить внешний вид страницы или достаточно достать текст?
- Разрешено ли загружать файл в облачный сервис?
- Кто будет проверять распознавание и по какому оригиналу?
- Можно ли передать переводчику исходный файл вместо скана?
Вариант 1: открыть PDF в Microsoft Word¶
Microsoft Word для настольного компьютера умеет открывать PDF и создавать его копию в формате Word, оставляя исходный PDF без изменений. Microsoft уточняет, что преобразование лучше всего работает с файлами, которые преимущественно состоят из текста.
Для текстового PDF этот путь часто самый простой: откройте файл в настольном Word, согласитесь на преобразование, дождитесь появления DOCX и проверьте результат. Но сканированный PDF отличается от текстового. Если в файле в основном изображения, Word может вставить целую страницу как картинку. На вид документ откроется, но редактировать слова внутри изображения не получится.
Microsoft формулирует рекомендацию так: “The conversion works best with files that are mostly text.” По-русски: конвертация лучше справляется с PDF, где уже есть текст, чем с набором отсканированных страниц.
Значит, перед тем как считать задачу выполненной, проверьте, можно ли поставить курсор внутрь предложения и изменить отдельное слово. Если можно выделить только всю страницу как единый объект, Word не выполнил OCR для текста на скане. В этом случае запустите OCR в отдельном инструменте и только потом экспортируйте или откройте результат в Word.
Даже при распознанном тексте макет может измениться. Microsoft предупреждает о возможных отличиях в разрывах страниц и расположении элементов. Среди проблемных объектов указаны таблицы с расстояниями между ячейками, рамки и цвет страницы, плавающие текстовые блоки, сноски, концевые сноски, закладки и комментарии. Документация Microsoft также объясняет причину: PDF фиксирует расположение элементов, но не всегда хранит информацию о том, как связаны абзацы, таблицы и колонки. Программе приходится угадывать структуру для Word.
Когда Word подходит: PDF уже содержит текстовый слой, страницы устроены просто, а команде нужно быстро получить редактируемую копию. Такой способ может быть удобен для договоров с последовательным текстом или простых писем, если после конвертации кто-то сравнит результат с оригиналом.
Когда Word не решает задачу: скан состоит из изображений, нужные слова не выделяются или в документе много сложных таблиц и колонок. Сам факт появления DOCX не означает, что внутри есть текст для перевода.
Microsoft отдельно описывает процесс «сканировать и редактировать» с использованием настольного Word; поведение веб- и мобильных приложений может отличаться, а соответствие страниц оригиналу не гарантируется. Подробности приведены в инструкции Microsoft по сканированию и редактированию.
Для переводчика важнее не совпадение номеров страниц, а правильная последовательность смысловых блоков. После преобразования проверьте, не попала ли подпись к таблице внутрь соседнего абзаца и не разорвалась ли строка адреса или реквизита.
Вариант 2: распознать PDF через Google Drive¶
Google Drive позволяет открыть PDF через Google Docs и получить распознанный текст. Справка Google указывает поддерживаемые типы входных файлов: PDF, JPEG, PNG и GIF. Максимальный размер входного файла для этого способа составляет 2 МБ по справке, доступной на момент подготовки статьи; перед массовой обработкой проверьте, не изменились ли ограничения.
Для простого документа процесс выглядит так: загрузите PDF в Drive, откройте его с помощью Google Docs и проверьте созданный документ. Если результат нужно передать переводчику в Word, сохраните или скачайте его как DOCX и проведите редактуру до перевода.
Google советует перед распознаванием располагать страницу правильной стороной вверх, использовать резкое изображение, равномерное освещение и чёткий контраст. Высота текста должна быть не меньше 10 пикселей; Google также рекомендует распространённые шрифты, например Arial или Times New Roman. Эти рекомендации помогают улучшить входное изображение, но не превращают сложную форму в идеально восстановленный Word.
Главное ограничение касается структуры. Google пишет, что распознавание может сохранить жирный и курсивный текст, размер и тип шрифта, а также разрывы строк. При этом списки, таблицы, колонки, сноски и концевые сноски, по справке сервиса, распознаются ненадёжно.
Google предупреждает: “Lists, tables, columns, footnotes, and endnotes are not likely to be detected.” Иными словами, обычный текст может получиться приемлемо, но элементы, которые задают структуру документа, придётся проверять и, возможно, восстанавливать вручную.
Показательный пример - банковская выписка с колонками «дата», «описание» и «сумма». OCR способен распознать все отдельные значения, но соединить сумму одной операции с описанием другой. Для перевода такая ошибка опаснее некрасивого форматирования: переводчик может добросовестно обработать неверно собранные данные.
Google Drive разумно рассматривать для пробной обработки короткого документа без сложного макета. Для пакетной работы оцените размер файлов, число страниц, требования к защите данных и затраты на проверку. Если файл больше ограничения, таблицы занимают центральное место или результат должен точно соответствовать оригиналу, проверьте другой маршрут.
Не считайте Google Docs полноценной OCR-редактурой только потому, что текст появился на экране. Сверьте начало и конец каждой страницы, названия разделов, нумерацию пунктов и сноски. Ошибки в нескольких словах на простой странице исправляются быстро, а пропущенный элемент формы может изменить смысл всего документа.
Вариант 3: использовать Adobe Acrobat для OCR¶
В Acrobat распознавание запускается через раздел Scan & OCR: выберите распознавание текста в текущем файле, укажите диапазон страниц и язык, затем выполните обработку. Текущая инструкция находится в справке Adobe по распознаванию текста. Названия команд в интерфейсе могут меняться, поэтому сверяйтесь с актуальной инструкцией для своей версии.
Выбор языка - не формальность. Adobe указывает, что распознавание использует словари, зависящие от языка, а для нелатинских письменностей нужно выбрать соответствующий язык. Если распознавать кириллический документ с неверно заданным языком, программа может путать похожие буквы, пропускать окончания или ошибаться в словах, которые словарь не ожидает.
После OCR Acrobat создаёт версию PDF с доступным для поиска текстом. Программа может обрабатывать как отдельный файл, так и несколько файлов, что удобно для команды, работающей с сериями документов. Но распознаваемый PDF и редактируемый DOCX - не одно и то же: проверьте, какой формат экспорта нужен вашему переводчику, и сравните экспортированный Word с оригиналом.
Рабочий сценарий:
- Откройте скан в Acrobat и выберите распознавание текста.
- Укажите язык именно исходного документа, а не будущего перевода.
- Выберите нужный диапазон страниц и запустите OCR.
- Найдите в PDF характерные слова и цифры, чтобы проверить текстовый слой.
- Экспортируйте в Word, если переводчику нужен DOCX.
- Сверьте таблицы, колонки, списки и критичные реквизиты с изображением оригинала.
Для смешанного документа проверяйте язык по страницам и фрагментам. На одной странице могут встретиться название организации на латинице, основной текст на кириллице и печать с ещё одним языком. Правильно заданный язык помогает распознаванию, но не гарантирует, что программа верно определит все имена и сокращения.
Acrobat полезен, когда нужен OCR внутри PDF и контроль языка распознавания, а не только быстрая попытка открыть документ в Word. Для большого потока файлов дополнительное преимущество - обработка нескольких файлов. Для команды с повторяющимися типами документов имеет смысл создать внутренний шаблон проверки: какие страницы выбирать для теста и какие поля сверять обязательно.
Не делайте вывод о качестве по одному предложению. Удачный абзац может соседствовать с ошибкой в таблице или пропуском номера страницы. Особенно внимательно проверяйте поля, где одна буква или цифра меняет идентификатор: имя, номер дела, дата выдачи, сумма, индекс или номер документа.
Вариант 4: выбрать ABBYY FineReader для регулярной работы¶
ABBYY FineReader PDF предназначен для работы с OCR и преобразования сканов и PDF в редактируемые документы, в том числе Word и Excel. На странице тарифов ABBYY указаны разные варианты лицензирования, включая локальную установку и корпоративные опции для Windows. Цена и доступность зависят от региона, налогов и условий продления.
На странице европейского магазина во время подготовки материала были указаны цены €99 в год за Standard для Windows, €165 в год за Corporate для Windows и €69 в год за версию для Mac. Это цены, отображавшиеся на странице ABBYY в момент исследования, а не гарантированный прайс для вашей страны. Перед покупкой проверьте актуальный региональный тариф и стоимость продления по странице ABBYY.
Для корпоративного плана на той же странице был указан лимит автоматизированной обработки до 5 000 страниц в месяц. Сноска ABBYY уточняет, что лимит относится к обработке через Hot Folder. Эти условия тоже нужно перепроверить перед расчётом рабочего процесса: тарифы и функциональность могут измениться.
FineReader имеет смысл оценивать не по названию продукта, а по конкретным документам команды. Проведите тест на страницах с таблицами, мелким шрифтом, штампами и несколькими колонками. Замерьте не только время распознавания, но и время ручной очистки. Если программа обрабатывает скан быстро, но редактор затем долго восстанавливает таблицы, выигрыш может исчезнуть.
Небольшое агентство: на входе приходят отдельные договоры и справки. Важнее всего корректно распознавать текст и быстро проверить проблемные места. Решение можно сравнить с другими OCR-инструментами на реальных, обезличенных образцах.
Команда обработки однотипных PDF: файлы повторяются, а загрузка и проверка устроены по стандартному сценарию. Здесь автоматизированные процедуры могут оказаться полезны, если сотрудники понимают, какие типы страниц всё равно требуют ручного контроля.
Проект со сложной вёрсткой: в файлах много форм, колонок и плавающих блоков. Даже специализированный OCR не отменяет проверки структуры. Сравните, сколько времени занимает восстановление макета в DOCX, и решите, нужен ли Word как результат или достаточно извлечённого текста для перевода.
Adobe описывает OCR как распознавание текста в PDF, а не как обещание идеального восстановления исходной вёрстки. Поэтому оценивайте отдельно поисковый текстовый слой и качество документа, который передадите переводчику.
Перед выбором платной лицензии зафиксируйте критерии приёмки: отсутствие пропущенных страниц, корректные имена и цифры, читаемые таблицы и возможность сверки с оригиналом. Без таких критериев сравнение превращается в оценку интерфейсов, хотя главный расход команды часто связан с последующей ручной проверкой.
Вариант 5: передать скан сразу в перевод¶
Предварительная конвертация в Word нужна не каждому проекту. Некоторые системы принимают сканированный PDF и распознают его внутри процесса перевода. Такой вариант сокращает число промежуточных файлов, но не отменяет OCR и контроль результата.
Например, Google Cloud Document Translation поддерживает документы PDF и DOCX, а также входные сканированные PDF. Google предупреждает, что перевод сканированного PDF может потерять форматирование; сложные таблицы, многоколоночные макеты и диаграммы с подписями тоже могут отображаться иначе. Если у команды есть редактируемый исходник DOCX или PPTX, Google рекомендует переводить его вместо PDF, потому что редактируемый формат обычно лучше сохраняет стиль и расположение элементов.
Для онлайн-запросов Google Cloud указывает лимит 20 МБ для PDF. Сканированный PDF ограничен 20 страницами, тогда как для нативного PDF при включённой соответствующей опции доступна обработка до 300 страниц; при включённом удалении теней лимит для нативного PDF составляет 20 страниц. Эти ограничения опубликованы в документации Google Cloud, доступной на момент подготовки статьи, и их нужно перепроверить перед запуском в производственную среду.
Есть и важное ограничение для смешанных документов: согласно документации Google Cloud, сканированная часть смешанного нативного и сканированного PDF не переводится. Преобразование PDF в DOCX в описанном процессе доступно для пакетного перевода нативных PDF, но не для сканированных PDF таким же способом. Не предполагайте, что смешанный файл обработан целиком, только потому что сервис вернул готовый результат.
Для отдельной команды, которой нужен именно перевод документа с сохранением структуры, можно рассмотреть ChatsControl. Сервис принимает сканированные PDF и фотографии, выполняет OCR, а затем собирает форматированный результат; для работы с документами также доступны DOCX и PowerPoint. После загрузки система анализирует текст, переводит его и выполняет самопроверку, а двуязычный экран показывает оригинал рядом с переводом для последующей проверки. Есть контроль качества перевода и настройки контекста, например предметной области и предпочтительной терминологии. Это облачный инструмент для перевода документов, а не полноценная CAT-система: в нём нет памяти переводов и управления проектами на уровне сегментов. Рукописные тексты и очень плохие сканы остаются задачей для человека, который может свериться с оригиналом. Цена зависит от объёма использования; конкретный тариф указан в сервисе, поэтому не стоит переносить в расчёт неподтверждённую цену.
Прямой перевод скана может сэкономить промежуточный экспорт, если макет простой, файл укладывается в ограничения системы, а команда готова проверить результат. Если важна точная структура таблиц, требуются правки исходного текста или документ должен служить базой для нескольких языков, удобнее сначала получить и отредактировать DOCX.
При любом онлайн-маршруте сначала проверьте правила работы с документами внутри вашей организации. Паспортные данные, медицинская информация, договоры и внутренние документы могут иметь ограничения на передачу внешнему сервису. Наличие OCR или перевода в облаке не отвечает на вопрос, разрешено ли конкретной команде загружать туда конкретный файл.
Сравнительная таблица и выбор маршрута¶
| Маршрут | Входной файл | Сильная сторона | Основной риск | Подходит для |
|---|---|---|---|---|
| Word | Быстрый DOCX для текстового PDF | Скан может остаться картинкой, макет изменится | PDF с уже доступным текстом | |
| Google Drive | PDF или изображение | Простой способ получить распознанный текст | Ограничения по размеру и слабое распознавание сложной структуры | Небольшой простой документ |
| Acrobat OCR | Настройка языка и распознавание внутри PDF | После OCR всё равно нужен контроль и, возможно, экспорт | PDF, где важен текстовый слой | |
| ABBYY FineReader | Скан или PDF | Отдельный OCR-инструмент и корпоративные варианты | Лицензия, региональные условия и ручная проверка | Регулярные потоки документов |
| Облачный перевод с OCR | Сканированный PDF | OCR и перевод объединены в одном процессе | Потеря форматирования и лимиты конкретной системы | Простой документ, когда важен быстрый перевод |
Сделайте выбор по результату теста, а не по числу поддерживаемых форматов. Если инструмент выдаёт DOCX, но текст остаётся частью изображения, переводчику нечего редактировать. Если текст распознан, но таблица собрана неверно, файл требует восстановления перед переводом. Если документ простой и система корректно обрабатывает его напрямую, отдельная конвертация может не принести пользы.
При расчёте стоимости процесса учитывайте все этапы:
- подготовку или повторное сканирование;
- запуск OCR и экспорт;
- сверку с оригиналом;
- восстановление таблиц и списков;
- проверку переводчиком;
- финальную сборку и сравнение итогового файла.
Платная программа может окупиться при регулярной обработке, но не автоматически. Сравните стоимость лицензии с временем сотрудников на проверку и исправление. Для разовых документов бывает разумнее использовать доступный инструмент и заложить ручную проверку; для регулярной серии важнее повторяемость и контроль процесса.
Чтобы посчитать трудозатраты, протестируйте каждый кандидат на одинаковых страницах. Запишите, сколько ошибок обнаружили, какие элементы пришлось перестроить и сколько времени заняла проверка. Выбор должен учитывать не только «сколько страниц распознано», но и «сколько страниц можно безопасно передать в перевод».
Полезно также определить владельца проверки. Один сотрудник отвечает за качество OCR и исправления исходного текста, другой - за перевод. Такое разделение помогает не исправлять переводом ошибку, которая возникла при распознавании, и сохраняет понятный след изменений.
Пошаговый процесс подготовки скана к переводу¶
Надёжный процесс начинается с оригинала и заканчивается проверенным текстом, а не просто файлом DOCX. Даже если в команде уже есть привычный инструмент, эти шаги помогают обнаружить пропуски до того, как они попадут в перевод.
- Сохраните оригинальный PDF. Создайте рабочую копию, чтобы OCR и редактура не затронули исходник. Оригинал нужен для постраничной сверки.
- Проверьте, есть ли текстовый слой. Попробуйте выделить и скопировать несколько фрагментов. Если копируется изображение или ничего не выделяется, нужен OCR.
- Оцените качество изображения. Проверьте ориентацию, резкость, контраст, перекосы, пятна, складки и рукописные пометки. RWS рекомендует для OCR разрешение не ниже 300 dpi, чёрно-белое изображение и один язык в PDF, если это возможно (руководство RWS).
- Выберите инструмент по макету. Для PDF с доступным текстом попробуйте Word. Для скана выполните OCR в подходящей программе и задайте исходный язык.
- Начните с тестовых страниц. Проверьте текстовую страницу, страницу с таблицей и страницу с печатями или колонками. Убедитесь, что распознанные фрагменты идут в правильном порядке.
- Экспортируйте в DOCX, если он нужен. Сохраните редактируемую копию отдельно от PDF. Если результат нужен только как поисковый PDF, не добавляйте ненужный этап экспорта.
- Сверьте критичные данные. Сравните с изображением имена, числа, даты, адреса, суммы, номера и заголовки таблиц. Исправляйте исходный распознанный текст до перевода.
- Подготовьте структуру для переводчика. Уберите случайные разрывы внутри предложений, но не удаляйте намеренные заголовки, нумерацию и границы ячеек.
- Передайте исходник вместе с рабочим файлом. Переводчик должен иметь возможность посмотреть на скан там, где текст неясен или OCR мог ошибиться.
- Проверьте перевод относительно оригинала. Финальная сверка должна охватывать не только DOCX, но и цифры, подписи, штампы и элементы, которые OCR мог пропустить.
RWS отдельно предупреждает, что переносы строк и табуляция внутри предложений могут ухудшить машинный перевод. Колонки, встроенные изображения, таблицы и плавающие текстовые поля могут потребовать ручного извлечения и очистки. Рекомендации RWS полезны именно как напоминание: «редактируемый» не всегда значит «готовый к переводу».
Перед передачей файла отметьте места, которые невозможно проверить по скану: например, закрытая печатью часть слова или нечитаемая рукописная пометка. Не подставляйте догадку как установленный факт. Переводчик должен видеть, где оригинал не позволяет уверенно восстановить текст.
Если страниц много, разделите проверку по типам ошибок. Первый проход - полнота страниц и порядок чтения. Второй - цифры и имена. Третий - таблицы, сноски и подписи. Такой порядок помогает не тратить время на красивую вёрстку, пока не подтверждено, что исходный текст распознан полностью.
Подводные камни: что часто ломается¶
Самая заметная ошибка OCR не всегда самая опасная. Лишний пробел легко увидеть, а неверно прикреплённая цифра в таблице может пройти незамеченной и изменить смысл перевода.
Неверно выбран язык. Acrobat использует языковые словари при распознавании, поэтому неверная настройка может ухудшить результат. Для документа на кириллице укажите соответствующий язык оригинала, а для смешанного текста отдельно проверьте имена и термины на латинице. Настройка языка описана в справке Adobe.
Таблица превратилась в строку текста. Google прямо предупреждает, что таблицы и колонки не всегда распознаются. При проверке сравнивайте каждую строку с оригиналом, а не только отдельные суммы или названия. Если связи между ячейками потеряны, восстановите их до перевода.
Колонки прочитаны не по порядку. OCR может сначала собрать текст слева, потом справа, а может перемежать их. Проверьте, не вклинились ли заголовки боковой колонки в основное предложение. В документах с несколькими колонками ошибка порядка способна сделать текст бессвязным.
Потерялись сноски или подписи. Google предупреждает о проблемах со сносками и концевыми сносками; Microsoft также указывает на возможные изменения при преобразовании PDF в Word. Проверьте, что сноски остались рядом с нужными фрагментами, а подписи к изображениям не переместились в другой раздел (Google Drive Help, Microsoft Support).
Сканы слишком низкого качества. Низкий контраст, перекос, пятна, складки и рукописные пометки ухудшают распознавание, по рекомендациям RWS. Если скан можно переснять, исправьте входное изображение до OCR. Если оригинал доступен только в таком виде, передайте проблемные фрагменты человеку для проверки.
Смешанный PDF обработан не целиком. Для облачного перевода проверьте, как система работает со страницами, где текстовый PDF чередуется со сканами. Документация Google Cloud указывает, что в смешанном нативном и сканированном PDF сканированное содержимое не переводится. Не принимайте завершённую обработку за подтверждение того, что переведены все страницы (Google Cloud Translation).
DOCX выглядит нормально, но не редактируется. Файл может содержать вставленную картинку каждой страницы. Выделите отдельное слово и проверьте, можно ли заменить его без редактирования изображения. Если нельзя, текстовый слой не создан или не попал в экспорт.
Промежуточный файл подменил оригинал. Никогда не отправляйте в перевод только результат OCR, если у переводчика нет возможности сверить сомнительный фрагмент с исходником. Храните обе версии и называйте их так, чтобы не перепутать скан и распознанный DOCX.
Типовой рабочий пример: команда получила скан многостраничной формы. Обычные абзацы распознались хорошо, но поля с адресом и датой попали в соседние ячейки. Если переводчик начнёт работу без проверки, документ может звучать гладко, но содержать неверные данные. Здесь правильное решение - сначала восстановить связи между полями и сверить их с оригиналом, а затем переводить.
Для сложных сканов не существует универсального процента точности, который можно честно обещать без тестирования конкретного файла. Точность зависит от качества изображения, языка, шрифта и структуры. Сравните результат на собственном образце и не переносите результат теста на другой тип документа без проверки.
Если документ юридически или финансово значимый, заранее определите, кто подтверждает спорные места. OCR не устанавливает содержание нечитаемого фрагмента и не заменяет оригинал. При сомнении оставьте отметку для уточнения вместо того, чтобы незаметно исправить слово по контексту.
FAQ¶
Как преобразовать сканированный PDF в редактируемый Word перед переводом?¶
Сначала выполните OCR, выберите язык исходного документа и сохраните распознанный результат в DOCX. Затем сравните текст и структуру с PDF, отдельно проверив таблицы, имена, даты и числа.
Какой инструмент лучше сохраняет таблицы и форматирование при OCR?¶
Универсального победителя нет: результат зависит от конкретного скана и сложности макета. Google предупреждает, что его OCR не всегда распознаёт таблицы, колонки и сноски; протестируйте несколько страниц в выбранном инструменте и оцените объём ручной правки.
Может ли Microsoft Word напрямую распознать сканированный PDF?¶
Word может открыть PDF и преобразовать его копию в документ Word, но лучше справляется с файлами, состоящими преимущественно из текста. Если страница целиком графическая, она может вставиться в DOCX изображением без редактируемого текста.
Подходит ли Google Drive для подготовки скана к переводу?¶
Google Drive умеет извлекать текст из PDF через Google Docs, но по справке Google размер входного файла для этого способа ограничен 2 МБ. Инструмент также ненадёжно распознаёт таблицы, списки, колонки и сноски, поэтому результат нужно проверять.
Нужно ли делать OCR перед машинным переводом скана?¶
Если скан содержит только изображения, OCR нужен, чтобы получить текст для обработки. После распознавания проверьте язык, порядок чтения и критичные данные: автоматический перевод сам по себе не обнаруживает ошибки исходного OCR.
Можно ли переводить сканированный PDF без конвертации в Word?¶
Да, некоторые системы принимают сканированный PDF напрямую, но качество форматирования зависит от инструмента и сложности макета. Google Cloud поддерживает сканированные PDF, предупреждая о потерях форматирования; если доступен редактируемый оригинал DOCX или PPTX, Google рекомендует использовать его вместо PDF.
Почему после OCR в Word появляются ошибки и съезжают таблицы?¶
PDF часто хранит расположение элементов, но не их смысловые связи: программе приходится восстанавливать структуру таблиц, колонок и абзацев. Низкое качество изображения и сложная вёрстка затрудняют эту задачу, поэтому DOCX нужно сравнивать с исходным сканом.
Чем проверить качество OCR перед отправкой переводчику?¶
Проверьте, выделяется ли текст, совпадает ли порядок чтения и сохранены ли таблицы, списки и сноски. Затем сверьте имена, даты, номера, суммы и другие критичные поля с оригинальным PDF и передайте обе версии переводчику для проверки.