Как машинный перевод уничтожает форматирование документов и как это предотвратить

Почему МТ разрушает таблицы, шрифты и макеты, и 3 проверенных метода профессионалов для сохранения структуры при переводе.

Также: RU EN UK
Как машинный перевод уничтожает форматирование документов и как это предотвратить

Ты уже три часа переформатируешь 40-страничный финансовый отчет, вернувшийся от машинного перевода. Таблицы перепутаны, маркеры разбросаны по страницам, шрифты искажены, а тот тщательно разработанный шаблон контракта? Выглядит как если бы пережил проклятие принтера. Добро пожаловать на кладбище форматирования — где машинный перевод и структура документа идут умирать.

Проблема не в самом переводе. Это то, что большинство систем МТ удаляют коды форматирования перед переводом, работают с чистым текстом, а затем возвращают кучу слов без какой-либо структурной информации. Реконструкция макета, которая следует за этим? Её либо нет, либо она настолько грубая, что ты тратишь больше времени на исправление формата, чем на уточнение языка.

Это не крайний случай — это норма. По опросу переводчиков 2025 года, 66% сообщают, что вывод МТ требует значительных правок после постредактирования, а четверть говорят, что качество просто плохое. Однако 87% профессионалов все еще используют MTPE (постредактирование машинного перевода), потому что при правильном использовании это может сэкономить до 63% времени на повторяющейся работе. Хитрость в том, чтобы знать, когда использовать какой метод, и как структурировать рабочий процесс, чтобы поймать разрушение форматирования до того, как это будет стоить тебе часов работы.

Давай разберемся, почему МТ разрушает форматирование, что действительно работает, и какой подход подходит для твоей ситуации.

Техническая причина, почему МТ искажает твои документы

Системы машинного перевода работают с текстом, а не с документами. Эта фундаментальная разница объясняет все, что идет не так.

Вот что происходит:

1. Коды форматирования удаляются при извлечении. Когда МТ читает твой DOCX или PDF, он не видит “Заголовок 1 в Calibri Bold”. Он видит чистый текст: “Финансовое резюме компании”. Все метаданные — шрифт, размер, цвет, стиль абзаца — удаляются. То же самое с таблицами: структурная разметка исчезает, остаётся только содержимое ячеек.

2. Текст переводится изолированно. Движок МТ переводит этот простой текст без какого-либо осознания того, как он вписывается в более крупный макет. Предложение из 14 слов на английском может стать 18 словами на немецком или 10 словами на китайском. Система не волнует — она просто выдает перевод.

3. Форматирование повторно вставляется вслепую. Инструмент пытается повторно вставить коды, но он делает образованные предположения. Закончился ли период абзац или предложение? Был ли этот разрыв строки намеренным или просто автоматическим переносом? Результат — лучшее приближение реконструкции, часто неправильное.

4. Сложные структуры (таблицы, многоколоночные макеты, заголовки, связанные с нижними колонтитулами) полностью разрушаются. Когда ячейки таблицы содержат разное количество текста до и после перевода, вся структура дестабилизируется. Изображения, привязанные к конкретному тексту, теперь плавают. Заголовки, предназначенные для одной строки, теперь нуждаются в двух. Таблицы в PDF-ах? Забудь — PDF-ы имеют фиксированную структуру на основе пикселей, и текст не может переливаться.

Именно поэтому профессионалы говорят: PDF — твой враг для перевода. Жесткая структура формата означает нулевую гибкость для расширения или сжатия текста. Тот же документ в DOCX может перетекать; в PDF это кирпич.

Почему изменение длины текста разрушает всё

Вот цифра, которая имеет значение: переведенный текст редко имеет такую же длину, что и исходник.

По словам профессионалов перевода, языковые пары имеют предсказуемые коэффициенты расширения или сжатия:

  • Английский → Немецкий: +15% до +20% количества слов (длинные немецкие сложные слова занимают место)
  • Английский → Испанский: +10% до +15% (испанский использует больше слов для одной концепции)
  • Английский → Китайский: -20% до -30% количества слов (китайские иероглифы плотно упаковывают значение)
  • Английский → Французский: +10% до +15%

Это расширение не абстрактно. Когда ты переводишь однострочный английский контракт на немецкий, он становится минимум 1,2 страницы. Та таблица с 5 колонками? 6-я колонка сбрасывается вниз. Заголовки, разработанные для одной строки, теперь требуют двух. Маркеры, которые аккуратно помещались, теперь разбросаны по страницам.

Общие инструменты (Google Translate, ChatGPT, бесплатный браузерный инструмент DeepL) не имеют механизма для работы с этим. Они извлекают текст, переводят его и возвращают — надеясь, что структура выживет. Как показывают исследования, это редко происходит.

Три профессиональных подхода, которые действительно работают

Подход 1: САТ-инструменты (Trados, memoQ) - для повторяющейся работы

САТ (Computer-Assisted Translation) инструменты разработаны для профессионалов, которые переводят повторно. Они работают на уровне формата файла, что означает они извлекают текст, сохраняя базовые коды структуры, переводят текст безопасно в изолированной среде сегмент-за-сегментом, и затем повторно вставляют коды в новый документ, используя оригинальный шаблон.

Как это работает:

  1. Ты открываешь свой DOCX в Trados или memoQ.
  2. Инструмент анализирует файл и определяет сегменты: абзацы, ячейки таблицы, заголовки, подписи. Коды форматирования остаются привязанными к каждому сегменту.
  3. Ты (или МТ) переводишь сегменты внутри редактора инструмента — сегмент остается привязанным к своему контексту форматирования.
  4. Инструмент реконструирует документ, повторно вставляя все коды. Таблицы остаются таблицами, шрифты остаются шрифтами, разрывы страниц выживают.

Сильные стороны: - Обрабатывает сложные файлы (Word, PowerPoint, InDesign, Excel, HTML, XML). - Память переводов означает, что ты не переводишь повторяющиеся фразы. - Проверки качества ловят пропущенные числа, несогласованную терминологию, нарушенные коды. - Интегрируется с движками МТ (Google, DeepL, пользовательские нейронные модели) для автоматизации первого черновика.

Слабые стороны: - Крутая кривая обучения; требует недель для настройки команды. - Стоимость лицензии: €500-1000+ в год на переводчика. - Избыточно сложно, если ты переводишь раз в полгода. - Требует чистых исходных файлов (допустимая структура таблицы, нет встроенных изображений в ячейках, согласованные стили). Мусор на входе = мусор на выходе.

Лучше всего для: Бюро переводов, внутренних команд с большим объемом, повторяющихся документов (юридические шаблоны, технические руководства, отчеты о соответствии).

Подход 2: Предварительная подготовка твоего документа - быстрое решение

Перед отправкой чего-либо на МТ исправляй сам документ. Это требует времени на начальном этапе, но экономит массивную работу по постредактированию.

Чек-лист перед отправкой на МТ:

  1. Удали встроенные изображения и текст в графике. Если твой логотип или диаграмма имеет наложенный текст, система МТ попытается перевести этот текст — он закончится искаженным или разбросанным. Вместо этого извлекай текст в выноски.
  2. Разбей таблицы на простые структуры. Нет вложенных таблиц, нет объединённых ячеек, нет контента, охватывающего несколько колонок. Плоские таблицы выживают МТ; сложные разрушаются.
  3. Последовательно используй стили. Не применяй жирный шрифт напрямую — используй стиль “Выделение”. Не регулируй интервалы вручную — используй стили абзацев. Когда стили согласованны, инструмент может предсказуемо их повторно применить.
  4. Размещай текст в текстовых полях, а не в формы. Формы (особенно повернутые или расположенные) не переводятся чисто; их расположение теряется или текст внутри не переводится.
  5. Удали прямое форматирование. Удали прямые выделения шрифта/размера/цвета; полагайся на шаблон. Когда форматирование привязано к стилям, оно выживает; прямое форматирование часто не выживает.
  6. Упрости заголовки и колонтитулы. Сложные макеты заголовков (изображения + таблицы + текст) часто разрушаются. Используй простые текстовые заголовки; добавляй сложность при постредактировании.
  7. Отметь необычный контент. Добавь комментарии или заметки: “Эта таблица о ценах — сохранить выравнивание,” или “Это изображение содержит японский текст, который требует отдельного перевода.”

Усилия: 30 минут до 2 часов на документ, в зависимости от размера. Выигрыш: На 30-50% быстрее постредактирование, потому что система МТ имеет более чистый вход.

Лучше всего для: Отдельных документов, отчетов, которые ты переводишь внутренне, отсканированных документов, которые ты оцифровываешь перед переводом.

Подход 3: AI-инструменты со встроенным сохранением форматирования - самый быстрый для отдельных документов

Новая категория инструментов (как ChatsControl) разработана специально для перевода целых документов при сохранении форматирования — без настройки САТ-инструмента, без подготовки предварительной подготовки.

Как это работает:

  1. Загрузи свой DOCX, PDF или PowerPoint.
  2. Инструмент запускает OCR, если это скан, затем анализирует структуру документа (определяя текст, таблицы, изображения, заголовки, стили).
  3. Он переводит контент, сохраняя структурное осознание — таблицы остаются таблицами, шрифты остаются шрифтами.
  4. Ты получаешь обратно тот же формат файла с сохраненным форматированием и двуязычным просмотром рядом для проверки.
  5. Используй функцию чата для запроса изменений конкретных отрывков без повторного перевода всего документа.

Сильные стороны: - Нет настройки, нет кривой обучения — загрузи и вперед. - Автоматически обрабатывает PDF-ы, сканы и форматированные документы. - Двуязычный просмотр встроен, поэтому ты видишь исходник и перевод рядом. - Встроенные проверки качества для чисел, имен, упущенного контента. - Быстро: большинство документов возвращаются за минуты на часов, а не дни. - Работает для отдельных переводов, а не только для повторяющейся работы большого объема.

Слабые стороны: - Нет памяти переводов (поэтому повторяющиеся фразы не отслеживаются для согласованности в проектах). - Не полноценный инструмент командного рабочего процесса — нет управления поставщиками, нет формальных ворот качества. - Не поддерживает рукописные документы или сканы очень плохого качества (они все еще требуют ручной обработки).

Лучше всего для: Фрилансеров, отдельных профессиональных переводов, рабочих процессов двуязычного просмотра, документов, где скорость имеет значение, сертификаций, которые ты хочешь QA перед доставкой клиентам.

Сравнение рядом

САТ-инструменты (Trados, memoQ) Предварительная подготовка AI-инструменты (ChatsControl)
Время настройки Дни до недель Нет 5 минут
Кривая обучения Крутая Нет Нет
Стоимость €500-1500/год + обучение Время (подготовка) За символ ($20-50 типично)
Лучше всего для Рабочие процессы агентства, большой объем Смешанные рабочие процессы Быстрые отдельные, двуязычный просмотр
Сохранение форматирования 95%+ (если исходник чист) 80-90% (зависит от постредактирования) 90%+ (AI-встроенный)
Память переводов Да Нет Нет
Командная коллаборация Да (с функциями) Ограниченно Ограниченно (общие ссылки)
Хорошо обрабатывает PDF-ы С плагином OCR Сложно Да, по умолчанию
Время за документ 5000 слов 4-8 часов (перевод+просмотр) 2-4 часа (подготовка+МТ+редактирование) 1-2 часа (загрузка+просмотр+уточнение)

Как профессиональные рабочие процессы действительно это обрабатывают

Реальный мировой перевод форматированных документов не полагается на один подход — это комбинация.

Типовой рабочий процесс для юридического контракта (20 страниц, оглавление, форматированные таблицы, блок подписей):

  1. Предварительная подготовка исходника (30 минут). Упрости заголовок/нижний колонтитул, уплотни сложные таблицы, добавь комментарии, отмечая необычное форматирование.
  2. Запусти через САТ-инструмент или AI-инструмент (2 часа). Позволь Trados или ChatsControl переводить, сохраняя структуру.
  3. Двуязычный просмотр (1,5 часа). Читай исходник и перевод рядом, лови ошибки перевода, несоответствие терминологии, и начальное разрушение форматирования.
  4. Постредактирование форматирования (1 час). Переведи текст, который не подходил, исправь разбросанные маркеры, переровняй содержимое таблицы, отрегулируй интервалы.
  5. Прохождение QA (30 минут). Запусти автоматизированные проверки (или ручное сканирование) для: пропущенных чисел, измененных собственных имен, нарушенной структуры таблицы, разрывов страниц в странных местах.
  6. Доставка (5 минут). Экспортируй в финальный формат (PDF, подписанный DOCX, что б ни требовал клиент).

Общее время: 5-6 часов за 20 страниц. Без инструментов форматирования тот же документ займет 12-16 часов, потому что ты или борешься с общим инструментом МТ, или перестраиваешь документ с нуля.

Распространённые ошибки, которые убивают форматирование (и как их избежать)

Ошибка 1: Перевод PDF напрямую без OCR или восстановления исходника. PDF-ы отображаются в первую очередь, что означает они оптимизированы для просмотра, а не редактирования. Текст привязан к координатам пикселей, изображения встроены, шрифты заблокированы. Перевод PDF без предварительного преобразования его в DOCX — это просьба на разрушение.

Решение: Всегда запрашивай исходные DOCX или PPTX. Если у тебя только PDF, используй OCR для переобстройки редактируемой версии сначала (ABBYY FineReader, Acrobat Pro), затем переводи DOCX.

Ошибка 2: Копирование вывода МТ в твой оригинальный файл. Ты переводишь в Google Translate, получаешь текст, копируешь-вставляешь его в твой форматированный документ Word. Шрифты меняются, интервалы взрываются, таблицы разрушаются.

Решение: Никогда не копируй-вставляй МТ в твой форматированный оригинальный. Либо используй инструмент, который сохраняет форматирование (САТ или AI-инструмент), либо перестрой документ из чистого шаблона.

Ошибка 3: Предположение, что САТ-инструменты обрабатывают плохие исходники. САТ-инструмент настолько хорош, насколько хорош исходный файл. Если твой оригинальный DOCX имеет нарушенные таблицы (несоответствие числа строк, неверная разметка), или если ячейки содержат изображения, инструмент не может это исправить — он просто наследует беспорядок.

Решение: Предварительная подготовка жестко. Если исходник нарушен, перевод будет нарушен.

Ошибка 4: Недооценка расширения текста при постредактировании. Ты получаешь назад немецкий текст, который на 20% длиннее. Ты вставляешь его назад в свой однострочный английский макет, надеясь, что он подойдет. Он не подойдет. Теперь половина твоих маркеров разбросана и твой нижний колонтитул сидит посередине страницы.

Решение: Предположи расширение/сжатие заранее. Зарезервируй дополнительное пространство в полях, используй стили, которые могут переливаться, или перестрой страницы при постредактировании вместо того, чтобы втискивать новый текст в старые контейнеры.

Ошибка 5: Отношение ко всем языковым парам одинаково. Английский-испанский? Разрушение форматирования умеренное (текст растет на 10-15%). Английский-китайский? Текст сжимается на 20-30%, и тебе возможно нужно уменьшить размеры шрифтов. Английский-японский? Похоже на китайский, плюс тебе нужно проверить проблемы с макетом справа налево.

Решение: Перед переводом на новый язык оцени расширение текста, используя отраслевые бенчмарки. Оставляй пространство соответственно.

Комбинирование всего вместе: твоё дерево решений

Переводишь впервые или отдельные документы? → Используй AI-инструмент типа ChatsControl. Быстрее, без настройки.

Большой объем повторяющейся работы (100+ документов/год)? → Инвестируй в Trados или memoQ. Память переводов окупает себя после 30-50 документов.

Комбинация обоих? → Предварительная подготовка в Word (30 мин за док), запусти через AI-инструмент или МТ-движок, постредактирование (1-2 часа).

Только сканы или только PDF-ы? → AI-инструмент или OCR + Trados. Общая МТ не поможет.

Требуешь сертифицированные/юридически обязывающие переводы? → Используй AI для черновика (двуязычный просмотр + QA встроены), затем попроси присяжного переводчика проверить и поставить печать.

Суть: разрушение форматирования в МТ решаемо, но это требует выбора правильного инструмента для твоего рабочего процесса. САТ-инструмент не поможет, если ты переводишь пять документов в год; AI-инструмент не масштабируется до 500. Знай свой объем, знай свои болевые точки и выбирай соответственно.

Часто задаваемые вопросы

Вопрос: Почему Google Translate уничтожает мой PDF, а Word лучше? Ответ: PDF-ы имеют жесткие, фиксированные макеты — текстовые поля не расширяются. Word-документы (DOCX) имеют гибкую структуру, поэтому текст может перетекать. PDF это формат-первый; Word это контент-первый. Всегда заказывай DOCX или предоставляй редактируемый исходник.

Вопрос: Могу ли я просто скопировать вывод МТ обратно в мой исходный файл? Ответ: Нет — переведенный текст редко имеет такую же длину. Немецкие и нидерландские переводы на 15-20% длиннее английских, китайские на 30% короче. Копирование разрывает текстовые поля, смещает изображения и разрушает нумерацию страниц. Перестрой из отформатированного исходника.

Вопрос: Действительно ли САТ-инструменты типа Trados сохраняют таблицы? Ответ: Да, но только если ваш исходный файл чистый (допустимый синтаксис таблицы, согласованные стили). САТ-инструменты сохраняют структуру таблицы, извлекая и повторно вставляя коды форматирования. Если исходник имеет нарушенную разметку, САТ-инструменты не могут это исправить.

Вопрос: На сколько MTPE быстрее, чем перевод с нуля? Ответ: До 63% быстрее для повторяющегося, технического контента с хорошим выводом МТ. Творческие, юридические и медицинские тексты показывают меньший прирост (20-40% быстрее), потому что требуют больше переделок. Качество перевода варьируется по языковым парам (АНГ→НЕМ лучше, чем АНГ→ЯП).

Вопрос: Нужен ли мне инструмент типа ChatsControl, если я уже использую Trados? Ответ: Нет — Trados это полная САТ/TMS для командных рабочих процессов и использования памяти переводов. ChatsControl быстрее для отдельных документов и автоматически сохраняет форматирование без настройки. Используй Trados, если управляешь рабочими процессами поставщиков; ChatsControl для быстрых двуязычных черновиков.

Вопрос: Какая разница между предварительной подготовкой и постредактированием форматирования? Ответ: Предварительная подготовка: исправь форматирование исходника перед МТ (чистые таблицы, удали встроенные изображения, упрости стили), чтобы МТ было легче. Постредактирование: исправь вывод МТ и перелей текст в целевой формат. Оба нужны для сложных документов.

Попробуйте ChatsControl

AI-платформа для профессиональных переводчиков

Попробовать бесплатно →