Сканированные PDF в Trados и memoQ: почему импорт не работает¶
Утром агентство получает скан договора на перевод, к обеду проект уже должен быть у переводчика, а Trados Studio или memoQ открывает пустые сегменты либо отказывается извлекать текст. Причина часто не в сбое CAT-системы: файл может выглядеть как документ, но внутри состоять только из изображений страниц.
Для человека страница читаема. Для программы изображение без текстового слоя - набор пикселей. Пока OCR (оптическое распознавание символов) не превратит изображение в машинно-читаемый текст, CAT-система не сможет корректно сегментировать содержимое.
Разберем, как отличить скан от PDF с текстом, что именно поддерживают Trados и memoQ, как устроить агентский процесс и что проверять, если распознавание перепутало колонки или имена. Если нужно отдельно оценить исходный файл и объем работы, пригодится руководство как посчитать слова в сканированном PDF. А о возможностях и ограничениях OCR для пользовательского перевода рассказывает статья перевод PDF и сканов с помощью AI-OCR.
Что происходит при импорте PDF¶
PDF - это формат представления страниц, а не гарантия того, что внутри лежит редактируемый текст. Один файл может содержать настоящий текстовый слой, другой - только фотографии страниц, а третий сочетать распознанный текст и изображения.
Именно состав файла определяет, что сможет извлечь CAT-инструмент. Если программа не находит текстовый слой, импорт не превращает изображение в текст автоматически.
Текстовый PDF и скан - не одно и то же¶
PDF с текстовым слоем хранит символы как текстовые данные. Их обычно можно выделить мышью, скопировать и вставить в текстовый редактор. Сканированный PDF хранит изображение страницы; похожие на буквы пиксели не становятся текстом сами по себе.
OCR анализирует изображение, распознает предполагаемые символы и создает текстовый слой или документ с извлеченным текстом. Результат не равен исходнику: OCR может ошибиться в букве, цифре, пробеле, переносе строки или порядке чтения.
Быстрая проверка занимает несколько секунд: откройте PDF в программе для чтения и попробуйте выделить одно слово. RWS указывает в описании новой технологии конвертации PDF, что выделяемый текст можно попытаться конвертировать, а отсутствие выделяемого текста служит признаком, что сначала нужен OCR.
Проверка полезна, но не заменяет анализ документа целиком. Один файл может содержать страницы с настоящим текстом, страницы-изображения и вставленные сканы отдельных приложений. Проверяйте несколько страниц, особенно таблицы, печати, приложения и развороты с двумя колонками.
Почему CAT-системы не «видят» буквы на картинке¶
CAT-система (система автоматизированного перевода) делит извлеченный текст на сегменты, показывает переводчику исходные фрагменты и применяет память переводов и терминологию. Для этого ей нужен текст, а не только изображение с визуально читаемыми символами.
Если текстового слоя нет, у системы нет исходной последовательности слов для сегментации. Импорт может завершиться ошибкой, создать пустой файл, пропустить страницы или дать неподходящий для перевода результат. Конкретное поведение зависит от способа импорта и версии программы.
Поэтому фраза «PDF открывается на компьютере» не означает «PDF готов для CAT». Просмотрщик рисует страницу для человека; фильтр импорта пытается извлечь данные, которые можно редактировать и переводить. Это разные задачи.
Как устроен предварительный этап¶
Рабочий процесс обычно состоит из нескольких самостоятельных операций:
- Проверить, выделяется ли текст и какие страницы содержат только изображения.
- Если текстового слоя нет, выполнить OCR во внешней программе или в подходящем конвертере.
- Сохранить распознанное содержимое в DOCX либо в PDF с текстовым слоем - формат зависит от дальнейшего процесса.
- Сверить структуру и критичные фрагменты с изображением оригинала.
- Только после проверки импортировать подготовленный файл в CAT-систему.
На каждом переходе возможна потеря структуры. OCR может распознать текст правильно, но поставить подпись перед основным текстом. Конвертер может сохранить таблицу визуально похожей на исходную, но превратить ее в набор несвязанных строк. Поэтому контрольный этап не стоит сводить к тому, что «файл открылся».
Для агентства полезно разделять две проверки: техническую - можно ли извлечь текст - и редакторскую - соответствует ли извлеченная последовательность оригиналу. Подробный обзор OCR для перевода документов и сканов поможет разобраться, где заканчивается распознавание и начинается вычитка.
Почему Trados Studio не импортирует сканированный PDF¶
В Trados Studio поведение зависит от того, есть ли в PDF текст, какая технология конвертации используется и какой результат нужен от макета. Новая технология обработки PDF, введенная с 13 марта 2023 года и Studio CU6, не конвертирует страницу, которая представляет собой только сканированное изображение. RWS описывает это ограничение в официальном объявлении.
Тот же механизм может попытаться преобразовать PDF, если сканированный текст уже распознается и его можно выделить. Важное различие здесь не между «сканом» и «не сканом» в бытовом смысле, а между изображением страницы без текста и изображением, к которому добавили распознанный текстовый слой.
Что проверить перед повторным импортом¶
Начните не с переустановки Trados, а с самого документа:
- Выделяется ли текст в PDF-просмотрщике?
- Одинаково ли ведут себя первая, средняя и последняя страницы?
- Не защищен ли файл паролем или ограничениями доступа?
- Есть ли в документе таблицы, колонки, формулы, подписи и нестандартные символы?
- Получается ли открыть исходный файл в Word или другой программе и сохранить его как DOCX?
Если текст выделяется, но импорт в Trados все равно дает сбой, проверьте настройки типа файла и сделайте пробную конвертацию. Если выделение невозможно, сначала нужен OCR. Повторный импорт неизмененного скана не добавит отсутствующий текстовый слой.
В обсуждении работы со сканированными PDF в Trados 2024 представитель RWS описал случай, когда конвертация задерживалась из-за окна подтверждения в Word. В обсуждении сообщества Trados пользователь сообщил, что заметил запрос лишь через несколько минут. Этот эпизод - диагностическая зацепка, а не универсальный способ исправить любой зависший импорт.
Старый IRIS и новые варианты¶
Агентства могут встретить старые инструкции, которые советуют использовать IRIS для распознавания PDF в Trados. RWS сообщила, что прежний тип PDF-файла, работавший с IRIS, был снят с поддержки в марте 2023 года; страница IRIS в RWS AppStore указывает на несовместимость с Studio 2022 версии 4.0.0.0 и новее. Поэтому старый учебник не обязательно описывает текущий процесс.
RWS перечисляет несколько обходных путей: открыть PDF в Microsoft Word и сохранить как DOCX, воспользоваться преобразованием Adobe PDF-to-Word или подготовить файл в стороннем PDF/OCR-приложении, например ABBYY FineReader или Readiris. Продукты и совместимость могут меняться, поэтому агентству стоит проверять доступность выбранного инструмента и его работу на собственной версии ПО.
RWS также представила PDF Assistant for Trados Studio как альтернативу для улучшения конвертации сканированных PDF. В описании первого выпуска указано, что приложение использовало Microsoft Word для преобразования PDF в DOCX и задействовало возможности Word для сканов, двунаправленных письменностей и азиатских языков. Эти сведения относятся к первому выпуску, описанному в объявлении RWS; текущую совместимость и поведение приложения нужно проверять отдельно.
При любом маршруте DOCX сначала стоит сохранить как промежуточный файл и открыть для проверки. В статье RWS о PDF Assistant прямо оговорено, что конвертация не гарантирует стопроцентную точность и что для проблемного файла может потребоваться специализированное ПО для работы с PDF.
По словам Trados Product Management в объявлении RWS, «PDF всегда следует считать обходным решением на случай, когда исходный файл недоступен».
Для агентства практический смысл простой: если клиент может прислать исходник, запрашивайте его до того, как вкладывать время в OCR и восстановление верстки. DOCX, презентация или исходный макет часто сохраняют структуру лучше, чем конвертированная копия PDF.
Режимы восстановления макета¶
Документация Trados Studio 2024 SR1 описывает режимы Flowing, Continuous и Exact. Эти названия и доступность относятся к указанной версии, поэтому их не нужно автоматически переносить на другие выпуски Studio.
Режим Flowing ориентирован на сохранение потока текста и элементов страницы. Exact пытается восстановить внешний вид страницы с помощью текстовых блоков Word. Точные настройки могут быть полезны для разных задач, но визуальное сходство не гарантирует удобной редактируемости: текстовые блоки иногда осложняют дальнейшую правку и перевод.
Перед большим проектом сделайте тестовую конвертацию на представительных страницах. Выберите страницу с обычным текстом, страницу с таблицей, страницу с колонками и страницу с печатью или подписью. Сравните DOCX с PDF не только визуально, но и по порядку чтения.
RWS предупреждала, что новый тип PDF может отличаться от прежнего по статистике анализа, поиску единиц перевода, извлечению изображений, обработке специальных символов и переносу PerfectMatch. Для азиатских и других нелатинских исходных языков RWS предлагает рассмотреть альтернативную обработку. Если проект зависит от этих функций, протестируйте файл до подготовки сметы и назначения исполнителя.
Что умеет memoQ и где нужен внешний OCR¶
В memoQ PDF можно импортировать как содержимое, преобразованное в DOCX, или как обычный текст. Но текущая справка memoQ о PDF прямо сообщает, что программа не извлекает текст из сканированных PDF, где страницы сохранены как изображения. Перед импортом такого файла требуется OCR во внешней программе.
В справке memoQ сказано: «Не удается импортировать сканированные PDF: memoQ не извлекает текст из сканированных PDF, страницы которых сохранены как изображения, а не как текст».
Значит, попытка выбрать такой PDF напрямую не заменяет распознавание. Для перевода подготовьте DOCX с текстовым потоком и сохраненным форматированием настолько, насколько это возможно. В справке memoQ в качестве примеров программ для чтения страниц и OCR названы Nuance OmniPage и ABBYY FineReader.
Выбрать DOCX или обычный текст¶
При преобразовании PDF в DOCX приходится выбирать, что важнее: сохранить порядок чтения или сохранить как можно больше исходного форматирования. В справке memoQ описан этот компромисс: режим с сохранением текстового потока может пожертвовать частью оформления, а попытка сохранить форматирование может привести к потере части текста.
Импорт обычного текста убирает форматирование. Документация memoQ не рекомендует этот вариант для документов, которые будут переводить; он может пригодиться для импорта корпуса в LiveDocs или для выравнивания. Если нужно перевести договор, инструкцию или форму, plain text обычно создает дополнительную работу по восстановлению структуры.
Еще одно ограничение касается экспорта: memoQ не создает переведенный PDF из PDF-источника. В зависимости от способа импорта результатом экспорта будет обычный текст или DOCX. Если клиент ожидает готовый PDF, агентству нужно заранее включить восстановление или верстку в процесс и согласовать, кто отвечает за финальную сборку.
Документация также сообщает, что memoQ не импортирует PDF, защищенные паролем. Если импорт не срабатывает, проверьте защиту файла и попросите клиента предоставить доступную для обработки версию. Не пытайтесь обходить ограничения доступа без согласования с владельцем документа.
Не ориентируйтесь на старые инструкции TransPDF¶
В сети по-прежнему встречаются инструкции о связке memoQ с TransPDF. В текущей документации memoQ указано, что интеграция TransPDF недоступна в memoQ 10.4 и более поздних версиях. Значит, прежние описания нельзя считать актуальным встроенным способом обработки PDF.
Историческая статья memoQ о версии 8.1 рассказывает, что изображения в PDF требовали OCR, а распознавание могло вносить ошибки в символы и форматирование. Там же описывался платный OCR в прежнем процессе TransPDF. Эта публикация полезна как объяснение старых рабочих процессов, но не как инструкция для современного memoQ.
Агентству лучше закрепить текущий внешний маршрут в своей процедуре: кто выбирает OCR-инструмент, в какой формат сохраняет файл, кто сверяет результат и кто принимает решение, достаточно ли качества для перевода. Такая договоренность избавляет команду от попыток повторить недоступный интеграционный процесс.
Рабочий процесс агентства: от запроса исходника до CAT¶
Когда PDF не импортируется, самая быстрая техническая реакция не всегда самая выгодная. Внешний OCR добавляет этапы, а ошибки распознавания могут попасть в память переводов, сегментацию и итоговый документ. Устойчивый процесс начинается с вопроса клиенту об исходнике, а не с серии случайных конвертаций.
Шаг 1. Запросить исходный файл¶
RWS рекомендует использовать исходный или нативный файл, если он доступен: PDF неудобен для локализации и создает дополнительную обработку. Попросите DOCX, исходную презентацию, таблицу или макет, из которого экспортировали PDF.
Если исходника нет, уточните, есть ли у клиента сканирование более высокого качества или PDF с текстовым слоем. Эти варианты могут сократить ручную подготовку. Уточните также, какой результат нужен: перевод текста, DOCX для последующей верстки или файл с сохранением визуального оформления.
В той же публикации RWS рекомендует по возможности использовать исходный файл, потому что PDF создает дополнительную работу и плохо подходит для локализации.
Практический вывод для менеджера проекта: уточните формат результата до оценки срока и стоимости. Объем OCR, проверка распознавания и восстановление макета - отдельные виды работы, которые не исчезают только потому, что заказчик прислал один PDF.
Шаг 2. Провести первичную диагностику¶
Сохраните копию файла и проверьте несколько страниц. Выделение текста подскажет, есть ли текстовый слой, но не покажет, насколько правильно распознаны символы или порядок чтения.
Запишите, какие страницы требуют OCR, и отметьте участки повышенного риска: мелкий шрифт, бледная печать, поворот страницы, две колонки, таблицы, рукописные пометки, штампы и специальные символы. Не делайте вывод о качестве всего файла по одной странице.
Если PDF защищен паролем, запросите доступную версию у клиента. Если скан нечеткий или поврежден, согласуйте ручную сверку с оригиналом. Не обещайте, что OCR автоматически исправит плохой источник.
Шаг 3. Распознать текст и выбрать выходной формат¶
Для Trados и memoQ удобной промежуточной целью часто становится DOCX: его проще открыть, исправить и проверить до импорта. memoQ прямо описывает вариант с OCR во внешнем приложении и сохранением DOCX, при этом советует удержать текстовый поток и форматирование настолько, насколько позволяет конвертер.
Не смешивайте две цели: «получить редактируемый текст» и «восстановить страницу как в оригинале». Первая нужна для перевода; вторая - для удобства чтения, сверки или финальной сдачи. Один и тот же способ конвертации не всегда хорошо решает обе задачи.
Шаг 4. Сверить DOCX с изображением¶
Проверьте начало и конец каждой страницы, порядок колонок, таблицы, заголовки, колонтитулы, сноски и подписи. Отдельно сверьте фамилии, названия компаний, даты, номера, единицы измерения и повторяющиеся термины.
Руководство Trados по переводу PDF в Studio советует просматривать результат OCR и исправлять ошибки в исходном тексте, например путаницу похожих символов и имен. Статья описывает более старый рабочий процесс, поэтому конкретные шаги нельзя считать гарантией для каждой текущей версии, но сама проверка распознанного текста остается необходимой.
Сверка должна идти по изображению, а не по тому, насколько гладко читается DOCX. Ошибочное имя может выглядеть вполне естественно, а пропущенное отрицание - не бросаться в глаза. Для критичных мест сравните исходную страницу и извлеченный текст бок о бок.
Шаг 5. Импортировать проверенный файл¶
Когда DOCX проходит проверку, импортируйте его в CAT-систему и оцените результат на тестовом проекте. Посмотрите, не появились ли пустые сегменты, повторы из колонтитулов, некорректные разрывы и неожиданные символы.
После импорта проверьте статистику и несколько сегментов в начале, середине и конце документа. В Trados учитывайте возможные различия новой обработки PDF в анализе и поиске единиц перевода, о которых предупреждала RWS. Если важны PerfectMatch, изображения или специальные символы, сравните поведение на конкретном файле до начала основной работы.
Шаг 6. Согласовать, кто восстанавливает макет¶
Перевод в CAT-системе не означает, что исходная страница автоматически восстановлена. Уточните, кто собирает итоговый DOCX или PDF, кто проверяет расположение подписей и таблиц и входит ли эта работа в объем заказа.
Для клиента заранее разграничьте перевод текста и верстку. Для команды зафиксируйте, какой файл считается проверенным источником и где хранятся исправления OCR. Такая запись помогает не переводить заново ошибки, которые уже обнаружили на подготовительном этапе.
Что ломается после OCR и как не пропустить ошибку¶
OCR может создать файл, который выглядит аккуратно, но содержит опасные ошибки. Самые заметные проблемы связаны с качеством скана и сложной структурой: размытые или бледные буквы распознаются хуже, строки могут смешиваться, а заголовок боковой колонки - вклиниваться в середину абзаца.
В руководстве Trados перечислены перекошенный, размытый, бледный и смазанный текст, а также рукописные фрагменты как слабые кандидаты для описанного там OCR-процесса. Статья посвящена более старому рабочему сценарию, поэтому точное поведение зависит от используемого распознавателя. Общий риск остается: чем хуже исходное изображение, тем больше ручной проверки.
Ошибки порядка чтения¶
Две колонки - частый источник тихих ошибок. OCR может прочитать первую строку левой колонки, затем первую строку правой, а потом продолжить в непредсказуемом порядке. Переводчик видит грамматически странный исходник, хотя проблема возникла еще при извлечении.
Таблицы требуют отдельной проверки: значения, единицы измерения и заголовки могут разъехаться по строкам. Если импортировать такой DOCX без контроля, сегменты не обязательно покажут, какой показатель относится к какой строке или колонке.
Для теста используйте страницу со сложной структурой, а не только первую страницу с обычным текстом. Исправьте порядок чтения до импорта. Если восстановить его автоматически не получается, согласуйте ручную обработку или попросите исходный файл.
Ошибки символов, чисел и имен¶
OCR может спутать похожие символы, потерять знак препинания или изменить число. Риск особенно неприятен для дат, кодов, адресов и имен: переводчик может не знать, что в исходном тексте уже появилась ошибка, и аккуратно перенести ее дальше.
Создайте короткий список контрольных элементов для вычитки: имена и организации, номера документов, даты, суммы, единицы измерения, отрицания, сноски и специальные знаки. Для конкретного проекта добавьте термины и обозначения, которые важны именно этому клиенту.
Не используйте гладкость текста как критерий точности. Прочитайте DOCX рядом со сканом и сверьте элементы, которые OCR чаще всего искажает. Такой контроль дешевле, чем исправление ошибки после перевода и верстки.
Ошибки макета и потери фрагментов¶
Сохранение форматирования и сохранение текста могут конфликтовать. memoQ предупреждает, что при PDF-конвертации выбор в пользу форматирования может привести к потере части текста, а выбор в пользу текстового потока - к потере элементов оформления. Поэтому оценка только по внешнему виду DOCX недостаточна.
Если на странице есть рамки, колонтитулы или повторяющиеся элементы, проверьте, не попали ли они в поток несколько раз. Если текст в DOCX кажется короче исходника, не считайте это автоматическим удалением «мусора»: сверка покажет, потерялись ли подписи, строки таблицы или фрагменты мелкого текста.
Ошибки из-за старых инструкций¶
Советы в блогах и на форумах могут относиться к другой версии Trados или memoQ. Историческая интеграция TransPDF для memoQ не является текущим встроенным маршрутом для версии 10.4 и новее, а старый IRIS PDF file type несовместим с указанными RWS версиями Studio.
Сверяйте рекомендацию с документацией конкретной версии и проверяйте дату публикации. Если инструкция предлагает кнопку, тип файла или интеграцию, которых нет в вашей установке, не тратьте время на поиск скрытой настройки - проверьте, не устарел ли сам процесс.
FAQ¶
Почему Trados Studio не импортирует сканированный PDF?¶
PDF из одних изображений не содержит текстового слоя, который CAT-система могла бы извлечь. Сначала выполните OCR и сохраните распознанный текст в DOCX или в PDF с текстовым слоем; RWS описывает это ограничение для новой технологии обработки PDF, введенной с 13 марта 2023 года и Studio CU6 (объявление RWS).
Можно ли импортировать сканированный PDF прямо в memoQ?¶
Нет, текущая документация memoQ говорит, что программа не извлекает текст со страниц, сохраненных как изображения. Выполните OCR во внешней программе и импортируйте подготовленный DOCX (справка memoQ).
Как проверить, есть ли в PDF текстовый слой?¶
Откройте файл в программе для чтения PDF и попробуйте выделить и скопировать слово. RWS указывает, что выделяемый текст можно попытаться конвертировать, а невозможность выделения - повод выполнить OCR до импорта (объявление RWS).
Что делать, если после OCR текст в PDF идет в неправильном порядке?¶
Не запускайте перевод до проверки DOCX. Сверьте текст с изображениями страниц, исправьте порядок колонок и строк таблиц, а затем повторно импортируйте подготовленный файл.
Подходит ли PDF Assistant для Trados Studio для сканированных документов?¶
RWS описывала PDF Assistant как способ конвертировать PDF в DOCX с использованием Microsoft Word, включая сканированные документы в первом выпуске. Совместимость и поведение нужно проверить для конкретной версии приложения, а результат - вычитать, поскольку конвертация не гарантирует полной точности (описание PDF Assistant).
Можно ли получить переведенный PDF из memoQ?¶
Нет, memoQ не экспортирует переведенный PDF из PDF-источника. В зависимости от способа импорта экспорт будет обычным текстом или DOCX, поэтому формат сдачи и ответственность за финальную верстку лучше согласовать заранее (справка memoQ).