27 страниц отсканированной медицинской документации, английский язык, дедлайн завтра. Если просто переводить вручную - это два-три дня работы. Если запустить через машинный перевод - текст плохой, но хотя бы есть черновик. Где золотая середина? Она в MTPE - машинном переводе с постредактированием. Это рабочий цикл, который за последние три года изменил экономику переводчиков и малых агентств. Разбёрёмся в деталях: как это на самом деле работает, сколько времени занимает, какие ошибки ждут на каждом этапе.
Что такое этот рабочий цикл OCR + MT + постредактирование¶
Речь идёт о трёх последовательных этапах, каждый - отдельная работа:
-
OCR (optical character recognition) - скан превращается в текст. Компьютер “читает” изображение, распознаёт буквы, выдаёт текстовый файл. Точность зависит от качества скана, размера шрифта, сложности гарнитуры.
-
Машинный перевод - текст со скана идёт в модель (типа GPT, DeepL, специализированную), получается черновик перевода. Модель не проверяет, правильно ли OCR распознал текст - она просто переводит то, что получила.
-
Постредактирование - переводчик (или редактор) смотрит ML-черновик, сравнивает с источником, исправляет ошибки, шлифует стиль. Главное предположение: если ML сделал хорошо, редактирование быстрее, чем перевод с нуля.
Эти три фазы вместе образуют рабочий цикл. Разбираемся в каждой.
Фаза 1: OCR - от изображения к тексту¶
Скан - это, по сути, большая картинка PDF или JPG с написанным текстом. Компьютер её не “видит” как текст. OCR-движок анализирует пиксели, распознаёт символы, складывает их в слова, выдаёт текстовый файл. Если скан чистый - точность близка к 99%. Если скан старый, изношенный, с загрязнениями - точность падает до 80-95%.
Какие факторы влияют на точность OCR:
Разрешение: как указывается на DocuClipper, 300+ DPI (dots per inch) - это точка отсчёта для надёжного распознавания. При 150 DPI точность заметно падает, при <100 DPI ожидайте частых ошибок. Для мелких шрифтов или сложных гарнитур берите 400+ DPI.
Качество оригинала: пятна, помятости, перекос, слабое освещение - всё это снижает качество исходной картинки, а значит и точность OCR.
Шрифты: обычные геометричные шрифты (Arial, Times) распознаются легко. Сложные, декоративные гарнитуры - хуже. Рукопись - почти не распознаётся современным OCR.
Язык: для западноевропейских языков (английский, немецкий, французский) OCR уже давно >99%. Для языков с нестандартной письменностью (арабский, китайский, деванагари) точность ниже.
Что часто выбивает OCR:
Таблицы - распознавание структуры таблицы часто оканчивается ошибками распознавания ячеек. Формулы и математические символы - часто читаются как посторонние символы (“1×” вместо “$1”). Рукопись и почерк - точность близка к нулю. Очень старые или деградировавшие документы.
Тактика: как подготовить скан для качественного OCR
Сканируйте при 300+ DPI. Выпрямите документ, чтобы он был параллелен камере. Убедитесь, что страница хорошо освещена (без теней, без бликов). Если это рукопись или очень старый документ - решите, поможет ли вообще OCR или нужен ручной перевод.
После OCR просмотрите текст на критичных местах: цифры, даты, имена, коэффициенты. Если OCR ошибся в ‘2024’ на ‘2O24’ (ноль на букву O), это будет видно, и нужно исправить перед машинным переводом.
Фаза 2: Машинный перевод¶
Когда текст со скана очищен, его получает машинный перевод. По данным исследований на Phrase, современные модели (GPT-4, DeepL, специализированные) производят черновик качеством 70-85% для многих языковых пар.
Что делает ML хорошо:
На языковых парах, для которых много параллельных текстов (EN-DE, EN-FR, EN-RU), ML даёт черновик приемлемого качества. Структура сохраняется хорошо: если было два абзаца, будет два. Названия (из контекста) часто распознаются правильно. Терминология, правда, может поехать.
Что делает ML хуже:
На парах языков, где тренировочных данных меньше (EN-LT, EN-EL, многие азиатские пары), качество хуже. Длинные сложные предложения часто переводятся неуверенно. Расчёты - забудьте. Утончённые каламбуры, сарказм, игра слов - не распознаются. Культурные референции, требующие контекста, часто выбивают.
Главное коварство ML:
ML не проверяет себя. Если OCR ошибся в ‘2O24’ и запустил это в машинный перевод, то ML не скажет “хей, это странно”. Он просто переведёт как есть.
Если исходный текст содержит логическую ошибку (типа “пациент мужского пола с беременностью”), ML её не поймёт и не исправит - просто переведёт так же неправильно.
Если на вход даты неправильно распознаны или пропущены (например, таблица с датами), то на выходе будет таблица с неправильными датами.
Тактика: как настроить контекст для ML
Перед тем как запустить текст на перевод, дайте модели контекст: коротко скажите, о чём документ, кто аудитория, какой тон. На Crowdin рекомендуют подготовить глоссарий - список терминов, которые в документе, и их переводы. “Appraisal = оценка производственной деятельности”, не просто “оценка”. ML будет придерживаться этого глоссария. Это существенно улучшает качество.
Удалите из текста очевидные опечатки перед ML (видим ‘2O24’ - исправляем на ‘2024’). Не рассчитывайте, что ML исправит за вас.
Фаза 3: Постредактирование - как работает редактор¶
Черновик готов. На экран редактора выводится, что получил ML, рядом - оригинальный текст. Редактор сравнивает, находит ошибки, исправляет.
Что делает редактор (light PE):
Исправляет явные ошибки: если ML написал “штрьомфат” вместо “сертификат”, исправляем. Если предложение совсем неправильное или непонятное, переводим заново. Просматриваем терминологию на консистентность: если слово “user” переведено и как “пользователь”, и как “юзер”, выбираем одно и унифицируем.
Light PE на 1000 слов занимает обычно 1 час работы для опытного переводчика (зависит от качества ML и сложности текста).
Что делает редактор (full PE):
Исправляет всё, что в light, плюс шлифует стиль, корректирует грамматические тонкости, переписывает неловкие места, чтобы звучало естественно на русском. Full PE - это почти как перечитывание целого перевода. На 1000 слов - 1.5-2 часа.
Производительность:
По промышленным данным, человек, занимающийся MTPE, производит: - Light PE: 4000-8000 слов в день - Full PE: 3000-5600 слов в день
Для сравнения, ручной перевод с нуля - 2000 слов в день. Значит, при light PE человек делает в 2-4 раза больше.
Но это средняя. На практике всё зависит от: качества ML (если ML дал 40% ошибок, то PE не будет быстро), языковой пары (на EN-FR выигрыш больше, на EN-ZH - меньше), опыта редактора (новичок медленнее), типа документа (фиксированная структура - быстрее, свободная проза - медленнее).
Ловушки ошибок при PE:
Не проверили скан перед ML. OCR ошибся, ML переведёт ошибку, редактор смотрит ошибку и может её не заметить (опирается на ошибку в источнике).
Редактирование без проверки источника. Редактор должен быть внимателен: если ML написал что-то, что звучит хорошо, но не совпадает с оригиналом, это ошибка перевода, не красота ML.
Игнорирование консистентности. Если текст начался с “пользователь”, то позже должно быть “пользователь”, а не “юзер” или “пользователи”, даже если это вариант ML.
Игнорирование плохого качества ML. Если ML дал ошибок больше, чем исправить быстро, не стоит насиловать постредактирование, лучше переведите полностью.
Сравнение подходов: вручную vs. OCR+MT+PE¶
Картина расчётов становится ясной:
| Подход | Время на 1000 слов | Качество | Стоимость (за слово) | Когда использовать |
|---|---|---|---|---|
| Ручной перевод | 4-5 часов | 95-98% | $0.10-0.25 | Официальные документы, нюансы важны, небольшой объём |
| OCR + Light PE | 1.5-2 часа | 85-92% | $0.02-0.05 | Большой объём, где можно уступить в качестве |
| OCR + Full PE | 2-3 часа | 90-96% | $0.05-0.15 | Официальный документ со сканированного оригинала, скорость важна |
| ML без PE (сырой) | 0.25 часа | 60-75% | $0.01-0.03 | Неформальный контент, где ошибки допустимы |
Решение о подходе зависит от:
Качества оригинала: если скан чистый, чётко отсканирован, то OCR+MT+PE сработает хорошо. Если скан загрязненный, рукопись, очень старый - возможно, лучше сразу ручной перевод.
Объёма: 5-10 страниц - пусть будет ручной перевод. 50+ страниц - попробуйте OCR+MT+PE, выгода будет очевидна.
Языковой пары: EN-DE, EN-FR - ML подходит, выигрыш будет заметен. EN-LT, EN-JA, специализированные пары - ML слабее, выигрыш меньше.
Срочности: завтра - берите ручной или full PE. На неделю - light PE идёт. На месяц - light PE хорош.
Инструменты и платформы для этого цикла¶
Для OCR: ABBYY FineReader (поддерживает 190+ языков), Adobe Acrobat Pro DC, Google Cloud Vision API, Tesseract (бесплатный, open-source).
Для MT: DeepL, Google Translate, Claude, специализированные модели в зависимости от языковой пары.
Для организации постредактирования: memoQ, Trados, Phrase - это CAT-инструменты, они предоставляют интерфейс для редактирования ML-черновика, сохраняют глоссарии, делают статистику производительности.
Или можете использовать платформу, которая объединяет все три фазы в одном месте: загружаете скан, платформа делает OCR, запускает на ML, выдаёт результат в формате для редактирования. ChatsControl пример такой платформы: загружаете PDF или фото документа, она делает OCR, машинный перевод, выдаёт результат в интерфейсе для постредактирования (исходный текст и перевод рядом, можно тыкать на слово и редактировать). Для проверки орфографии и консистентности встроенный QA-валидатор, который замечает ошибки и противоречия.
Лучшие практики для успешного OCR+MT+PE¶
1. Сканируйте правильно с самого начала
300+ DPI, правильное освещение, документ параллельно. Если скан хороший, 70% работы уже сделано.
2. Очистите OCR-текст перед MT
Просмотрите критичные места (цифры, даты, имена), удалите опечатки. 15 минут чистки OCR-текста могут спасти час на редактировании.
3. Дайте ML контекст
Напишите, о чём документ, какие критичные термины, какой тон. Как рекомендуют на Lokalise, это улучшает качество на 10-15%.
4. Установите глоссарий терминов
Если документ содержит специальные термины (“appraisal”, “stakeholder”, финансовые термины), запишите их переводы ДО запуска ML. ML будет придерживаться.
5. Выбирайте редакторов по опыту
Человек, впервые делающий постредактирование, будет на 30% медленнее. Дайте задачу опытному редактору, если дедлайн жёсткий.
6. Для таблиц и формул - специальная обработка
Таблицы в OCR часто взрываются (ячейки перемешиваются). Вариант: скопируйте таблицу как текст отдельно, переведите отдельно, потом вставьте назад. Формулы - обычно изображения, их не переводим, только пояснительный текст.
7. Проверяйте консистентность
Один редактор - один документ, если возможно. Если нужно разбить по редакторам, дайте им общий глоссарий и проверяйте после каждого редактора.
Распространённые ошибки, которых стоит избегать¶
1. Пропуск предварительной обработки скана
Запустили грязный скан в OCR, получили грязный текст, ML переведёт грязь, редактор сидит часами. Результат: то же время как ручной перевод, но качество хуже.
2. Выбор неправильной модели ML
Для EN-DE берите DeepL или GPT-4, результат будет хороший. Для EN-LT - выбор уже меньше, можете попробовать несколько, выбрать лучшее, но не ожидайте 95%. Недооценка этого фактора - значит, ищете виноватых в редакторах, а проблема в модели.
3. Редактирование без контекста
Редактор должен видеть оригинальный текст и ML-вариант вместе. Если редактор редактирует только перевод (без источника), может не заметить ошибку перевода (на первый взгляд текст звучит хорошо, но отличается от оригинала).
4. Игнорирование специфики языка
Русский, украинский, другие языки имеют сложные правила согласования. ML часто их игнорирует. Редактор должен знать эти правила и исправлять.
5. Игнорирование плохого качества
Если ML дал качество 40-50%, не стоит толкать это в постредактирование - ручной перевод с нуля будет быстрее и качественнее. MTPE работает при качестве ML выше 70%.
Чек-лист для запуска OCR+MT+PE проекта¶
- [ ] Определите языковую пару и проверьте, хороша ли ML для неё (EN-DE/FR ✓, EN-LT ?, EN-ZH грустно)
- [ ] Отсканируйте (или принесите) оригинал на 300+ DPI
- [ ] Запустите OCR, просмотрите критичные места (цифры, даты, имена)
- [ ] Подготовьте глоссарий терминов (если документ специализирован)
- [ ] Запустите ML на очищенном тексте
- [ ] Оцените качество ML (выборочно, 3-5 абзацев) - если >70%, идите дальше; если <60%, разбёритесь, стоит ли PE или лучше ручной
- [ ] Распределите редакторам, дайте им общий глоссарий
- [ ] Проверьте 25% документа, прежде чем редакторы завершат всё
- [ ] Финальная проверка: консистентность терминов, форматирование, нет ли проскочивших ошибок
FAQ¶
Сколько времени экономит MTPE по сравнению с ручным переводом?
На EN-DE или EN-FR - 50-70% времени, то есть то, что делалось за день, делается за 3-4 часа (light PE). На взаимно сложных парах (EN-LT, EN-ZH) экономия 20-40%. Всё зависит от качества ML.
Какое минимальное качество ML для постредактирования?
70% и выше. Если проверка показывает, что ошибок больше 30%, лучше переведите вручную.
Должен ли редактор знать исходный язык при постредактировании?
Идеально - да. Хотя бы на уровне понимания. Если редактор не знает английского и редактирует русский перевод текста - это верная ошибка (редактор не проверит точность).
Как организовать постредактирование в команде из 3-5 редакторов?
Распределите документ по редакторам так, чтобы каждый работал с однотипным контентом (один - таблицы, один - прозу, один - списки). У каждого редактора должен быть общий глоссарий терминов, чтобы унифицировать. Проверяйте 10% документа от каждого редактора на консистентность.
Если в документе рукопись, как быть?
OCR на рукописи работает плохо, точность 30-50%. Вариант 1: исправить рукопись вручную перед OCR (если это возможно). Вариант 2: перевести документ вручную, без OCR. Вариант 3: считать, что рукопись - это изображение, вставить как картинку без перевода.
Примет ли посольство перевод, сделанный через MT+PE?
Если это присяжный перевод, то присяжный засвидетельствовал финальный результат - алгоритм создания не важен (ML, ручной, гибрид). Если это свободный перевод (не официальный) - требований нет, поэтому посольство примет и чистый ML-перевод, хотя это плохо. Если это полу-официальное требование (типа выписка из реестра) - проверьте требования конкретного учреждения.
Что делать, если ML переведёт информацию в таблице неправильно?