27 сторінок відсканованої медичної документації, англійська, дедлайн завтра. Якщо просто перекласти вручну — це два-три дні роботи. Якщо запустити через машинний переклад — текст гірший за вибір, але вже є чернетка. Де золота середина? Вона в MTPE — машинному перекладі з постредагуванням. Це робочий цикл, який за останні три роки змінив економіку перекладачів і малих агенцій. Давай розберемося у деталях: як це насправді працює, скільки часу займає, які помилки чекати на кожному кроку.
Що таке цей робочий цикл OCR + MT + постредагування¶
Йдеться про три послідовні етапи, кожен з яких — окремою роботою:
-
OCR (optical character recognition) — скан перетворюється в текст. Комп’ютер “читає” зображення, розпізнає букви, видає текстовий файл. Точність залежить від якості скану, розміру шрифту, вишуканості шрифтів.
-
Машинний переклад — текст зі скану йде в модель (типу GPT, DeepL, спеціалізовану), отримується чернетка перекладу. Модель не перевіряє, чи правильно OCR розпізнав текст — вона просто перекладає те, що отримала.
-
Постредагування — перекладач (або редактор) переглядає ML-чернетку, порівнює зі джерелом, виправляє помилки, шліфує стиль. Головна вмотивованість: якщо ML зробив добре, редагування швидше, ніж переклад з нуля.
Ці три фази разом утворюють робочий цикл. Давайте розібратись у кожній.
Фаза 1: OCR — від зображення до тексту¶
Скан — це, по суті, велика картинка PDF або JPG з написаним текстом. Комп’ютер її “не бачить” як текст. OCR-движок аналізує піксели, розпізнає символи, складає їх у слова, видає текстовий файл. Якщо скан чистий — точність близька до 99%. Якщо скан старий, креслений, з забруднень — точність падає до 80-95%.
Які фактори впливають на точність OCR:
Розміри: як зазначено на DocuClipper, 300+ DPI (dots per inch) — це точка відліку для надійного розпізнавання. При 150 DPI точність помітно падає, при <100 DPI треба очікувати частих помилок. Для дрібних шрифтів або вишуканих гарнітур беріть 400+ DPI.
Якість оригіналу: плями, зім’ятість, перекошення, слабке освітлення — все це знижує якість вихідної картинки, а значить і точність OCR.
Шрифти: звичайні геометричні шрифти (Arial, Times) розпізнаються легко. Вишукані, декоративні гарнітури — гірше. Рукопис — майже не розпізнається сучасним OCR.
Мова: для західноєвропейських мов (англійська, німецька, французька) OCR уже давно >99%. Для мов з нестандартною писемністю (арабська, китайська, деванагарі) точність нижча.
Що часто вибухує OCR:
Таблиці — розпізнавання структури таблиці часто марнує помилками розпізнавання комірок. Формули й математичні символи — часто читаються як сторонні символи (“1×” замість “$1”). Рукопис і почерк — точність наближається до нуля. Дуже старі чи деградовані документи.
Тактика: як підготувати скан для якісного OCR
Скануйте при 300+ DPI. Розпрямте документ, щоб він був паралельно до камери. Переконайтесь, що сторінка добре освітлена (не тіні, не бліск). Якщо це рукопис або дуже старий документ — розберіться, чи взагалі OCR допоможе, чи потрібен ручний переклад.
Після OCR перегляньте текст на критичних місцях: числа, дати, імена, коефіцієнти. Якщо OCR помилився в ‘2024’ на ‘2O24’ (нуль на літеру O), це буде видно, і треба виправити до машинного перекладу.
Фаза 2: Машинний переклад¶
Коли текст зі скану очищений, його отримує машинний переклад. За даними досліджень на Phrase, сучасні моделі (GPT-4, DeepL, спеціалізовані) виробляють чернетку якісної на 70-85% для багатьох парних мов.
Що робить ML добре:
На мовних парах, для яких є багато паралельних текстів (EN-DE, EN-FR, EN-RU), ML дає чернетку з бази прийнятна. Структура зберігається добре: якщо було два абзаци, буде два. Назви (з контексту) часто розпізнаються правильно. Терміни, щоправда, можуть поїхати.
Що робить ML гірше:
На парах мов, де тренувальних даних менше (EN-LT, EN-EL, чимало азійських пар), якість гаршає. Довгі складні речення часто перекладаються невпевнено. Калькулювання — берег немає. Вишукані каламбури, сарказм, гра слів — не розпізнаються. Культурні референції, які потребують контексту, часто вибіхають.
Головна вловиння ML:
ML не перевіряє себе. Якщо OCR помилився в ‘2O24’ і запустив це в машинний переклад, то ML не скаже “хей, це дивно”. Він просто перекладе як є.
Якщо вихідний текст містить якусь логічну помилку (типу “пацієнт чоловічого роду з вагітністю”), ML її не впіймає й не виправить — просто перекладе так само невірно.
Якщо на вхід дати неправильно розпізнані або пропущені (наприклад, таблиця з датами), то на виході буде таблиця з невірними датами.
Тактика: як налаштувати контекст для ML
Перед тим як запустити текст на переклад, дайте моделі контекст: коротко скажіть, про що документ, хто аудиторія, який тон. На Crowdin рекомендують підготувати глосарій — список термінів, які в документі, і їх переклади. “Appraisal = оцінка виробничої діяльності”, не просто “оцінка”. ML буде дотримуватися цього глосарія. Це суттєво покращує якість.
Видаліть із тексту очевидні опечатки перед ML (бачимо ‘2O24’ — виправимо на ‘2024’). Не розраховуйте, що ML виправить за вас.
Фаза 3: Постредагування — як робить редактор¶
Чернетка готова. На екран редактора виводиться, що отримав ML, поруч — оригінальний текст. Редактор порівнює, знаходить помилки, виправляє.
Що робить редактор (light PE):
Виправляє явні помилки: якщо ML написав “штрьомфат” замість “сертифікат”, виправляємо. Якщо речення зовсім неправильне або незрозуміле, перекладаємо ново. Проглядаємо терміни на консистентність: якщо слово “user” перекладено і як “користувач”, і як “юзер”, вибираємо одне й уніфікуємо.
Light PE на 1000 слів займає зазвичай 1 годину роботи на дозвіл перекладача (залежить від якості ML і складності тексту).
Що робить редактор (full PE):
Виправляє все, що у light, плюс шліфує стиль, коригує граматичні тонкощі, переписує невловкі місця, щоб звучало природно українською. Full PE — це майже як перечитування целого перекладу. На 1000 слів — 1.5-2 години.
Продуктивність:
По промисловим даним, людина, яка робить MTPE, виробляє: - Light PE: 4000-8000 слів на день - Full PE: 3000-5600 слів на день
Для порівняння, ручний переклад з нуля — 2000 слів на день. Значить, при light PE людина робить в 2-4 рази більше.
Але це середня. На практиці все залежить від: якості ML (якщо ML дав 40% помилок, то PE не буде швидко), мовної пари (на EN-FR виграш більший, на EN-ZH — менше), досвіду редактора (новачок повільніше), типу документа (фіксованна структура — швидше, вільна проза — повільніше).
Лова помилки при PE:
Не перевірили скан перед ML. OCR помилився, ML перекладе помилку, редактор переглядатиме помилку й може її не помітити (твердить на помилку у джерелі).
Редагування без звірки зі джерелом. Редактор мав бути уважний: якщо ML написав щось, що звучить добре, але не варто зі оригіналом, це помилка перекладу, не помилка ML’єю виглядовості.
Ігнорування консистентності. Якщо стан розпочався з “користувач”, то пізніше треба “користувач”, а не “юзер” або “користувачки”, навіть якщо було варіант ML.
Кидання погане якості ML. Якщо ML дав помилок більше, ніж исправити швидко, не варто насилувати постредагування, краще перекласти свідомо.
Порівняння підходів: вручну vs. OCR+MT+PE¶
Картинка розпорядження дається чітко:
| Підхід | Час на 1000 слів | Якість | Вартість (за словом) | Коли використовувати |
|---|---|---|---|---|
| Ручний переклад | 4-5 годин | 95-98% | $0.10-0.25 | Офіційні документи, нюанси важливі, невеликий обсяг |
| OCR + Light PE | 1.5-2 години | 85-92% | $0.02-0.05 | Великий обсяг, утяжувати якість де можна |
| OCR + Full PE | 2-3 години | 90-96% | $0.05-0.15 | Офіційний документ зі сканованого оригіналу, швидкість важлива |
| ML без PE (сирий) | 0.25 години | 60-75% | $0.01-0.03 | Інформальний контент, де помилки допустимі |
Рішення про підхід залежить від:
Якості оригіналу: якщо скан чистий, чітко відскановано, тоді OCR+MT+PE спрацює добре. Якщо скан забрудненим, рукопис, дуже старий — можливо, краще одразу ручний переклад.
Обсягу: 5-10 сторінок — хай буде ручний переклад. 50+ сторінок — спробуйте OCR+MT+PE, вигода буде очевидна.
Мовної пари: EN-DE, EN-FR — ML годнийся, виграш буде видимий. EN-LT, EN-JA, спеціалізовані пари — ML слабше, виграш менше.
Терміновості: завтра — беріть ручний або full PE. На тиждень — light PE йде, на місяць — light PE вільне.
Інструменти й платформи для цього циклу¶
Для OCR: ABBYY FineReader (підтримує 190+ мов), Adobe Acrobat Pro DC, Google Cloud Vision API, Tesseract (безплатний, open-source).
Для MT: DeepL, Google Translate, Claude, спеціалізовані моделі залежно від мови пари.
Для організації постредагування: memoQ, Trados, Phrase — це CAT-інструменти, вони дають інтерфейс для редагування ML-чернетки, зберігають глосарії, роблять статистику продуктивності.
Або ви можете використовувати платформу, яка об’єднує всі три фази в одному місці: завантажуєте скан, платформа робить OCR, пускає на ML, видає результат у форматі для редагування. ChatsControl приклад такої платформи: завантажуєте PDF або фото документа, вона робить OCR, машинний переклад, видає результат в інтерфейсі для постредагування (вихідний текст і переклад поруч, можна тиснути на слово й редагувати). Для правлення орфографії і консистентності вбудований QA-валідатор, який помічає помилки й суперечності.
Найкраще практики для успішного OCR+MT+PE¶
1. Скануйте правильно і відразу
300+ DPI, правильне освітлення, документ паралельно. Якщо скан гарний, 70% роботи вже зроблено.
2. Очистіть OCR-текст перед MT
Перегляньте критичні місця (числа, дати, імена), видаліть опечатки. 15 хвилин чищення OCR-тексту можуть врятувати годину на редагуванні.
3. Дайте ML контекст
Напишіть, про що документ, які є критичні терміни, коли тон. Як рекомендують на Lokalise, це збільшує якість на 10-15%.
4. Встановіть глосарій термінів
Якщо документ містить спеціальні терміни (“appraisal”, “stakeholder”, фінансові терміни), запишіть їх переклади ПЕРЕД запуском ML. ML дотримуватиметься.
5. Вибирайте редакторів по досвіду
Людина, яка вперше робить постредагування, буде на 30% повільніше. Дайте задачу дослідженому редакторові, якщо дедлайн крутий.
6. Для таблиць і формул — спеціальна обробка
Таблиці в OCR часто вибухають (комірки змішуються). Варіант: скопіюйте таблицю як текст окремо, перекладіть окремо, потім вставте назад. Формули — зазвичай зображення, їх не перекладаємо, лише пояснювальний текст.
7. Перевіряйте консистентність
Один редактор — один документ, якщо можливо. Якщо треба розбити по редакторам, дайте їм спільний глосарій і перевіря після кожного редактора.
Поширені помилки, яких варто уникати¶
1. Пропуск попередньої обробки скану
Запустили брудний скан в OCR, отримали брудний текст, ML перекладе брудь, редактор сидить годинниці. Результат: то сама часу як ручний переклад, але якість гірша.
2. Вибір неправильної моделі ML
Для EN-DE беріть DeepL або GPT-4, результат буде хороший. Для EN-LT — вибір вже менше, можете спробувати кілька, вибрати найкраще, але не очікуйте 95%. Недооцінка цей фактор — значить, шукаєте винуватців у редакторах, а справа в моделі.
3. Редагування без контексту
Редактор мав бачити оригінальний текст і ML-варіант разом. Якщо редактор редагує тільки переклад (без джерела), може не помітити помилку перекладу (на перший погляд текст звучить добре, але гірше від оригіналу).
4. Ігнорування специфіки мови
Українська й російська, наприклад, різні закінчення на числах (“1 слово”, “2-4 слова”, “5+ слів”). ML часто це ігнорує. Редактор мав знати ці правила й виправляти.
5. Кидання повинні якість
Якщо ML дав якість 40-50%, не варто штовхати це в постредагування — деквалер переклад з нуля буде швидче й якісніше. MTPE працює при якості ML вище 70%.
Чек-лист для запуску OCR+MT+PE проекту¶
- [ ] Визначте мовну пару й мате, чи ML для неї добра (EN-DE/FR ✓, EN-LT ?, EN-ZH сумно)
- [ ] Скануйте (або принесіть) оригіналу на 300+ DPI
- [ ] Запустіть OCR, перегляньте критичні місця (числа, дати, імена)
- [ ] Вишикуйте глосарій термінів (якщо документ спеціалізований)
- [ ] Запустіть ML на очищеному тексті
- [ ] Оцініть якість ML (вибірно, 3-5 абзаців) — якщо >70%, йдеться далі; якщо <60%, розберіться, чи варто PE або краще ручний
- [ ] Розподіліть редакторам, дайте їм спільний глосарій
- [ ] Перевіря в 25% документа, перш ніж редактори завершать все
- [ ] Фінальна перевірка: консистентність термінів, форматування, немає вислизання помилок
FAQ¶
Скільки часу економить MTPE порівняно з ручним перекладом?
На EN-DE або EN-FR — 50-70% часу, тобто те що робилось за день, робиться за 3-4 години (light PE). На взаїмо складних парах (EN-LT, EN-ZH) економія 20-40%. Все залежить від якості ML.
Яка мінімальна якість ML для постредагування?
70% і вище. Якщо BLEU-оцінка або вибіркова перевірка показує, що помилок більше 30%, краще перекласти ручно.
Чи повинен редактор знати мову-джерело при постредагуванні?
Ідеально — так. Хоча б на рівні розуміння. Якщо редактор не знає англійської й редагує російський переклад українця — це вірна помилка (редактор не перевірить точність).
Як організувати постредагування в команді з 3-5 редакторів?
Розподіліть документ по редакторам так, щоб кожен робив однотипний контент (один — таблиці, один — прозу, один — списки). Кожен редактор потрібен спільний глосарій термінів, щоб уніфікувати. Перевіря 10% документа від кожного редактора на консистентність.
Якщо в документі рукопис, як бути?
OCR на рукописі працює слабо, точність 30-50%. Варіант 1: виправити рукопис вручну перед OCR (якщо це можливо). Варіант 2: перекласти документ ручно, без OCR. Варіант 3: скласти, що рукопис — це зображення, вставити як картинку без перекладу.
Посольство прийме переклад, який зроблено через MT+PE?
Якщо це присяжний переклад, то присяжний засвідчив фінальний результат — це не важливо, як він був зроблений (ML, ручний, гібрид). Якщо це вільний переклад (не офіційний) — немає вимог, тому посольство прийме й сирий ML переклад, хоча це погано. Якщо це напів-офіційна вимога (типу виписка з реєстру) — перевірте вимоги конкретного закладу.
Що робити, якщо ML перекладе інформацію в таблиці помилково?
Якщо таблиця містить цифри, дати, коефіцієнти, OCR часто їх гублює або перекладає неправильно. Вариант: скопіювати таблицю окремо як текст (наприклад, CSV), перекласти окремо, потім вставити на місце. Або — виправити в уже переведеній таблиці вручну.