Скрытая стоимость масштабирования человеческого перевода¶
Клиент звонит в понедельник с утра: «Нам нужно 500 тысяч слов на 12 языков к пятнице. Бюджет небольшой». Считаете: 500K слов ÷ 200 слов/час (человек) = 2500 часов. Это 62 переводчика на неделю. Или вы сдвигаете дедлайн на 6 недель.
Так жила и живёт переводческая индустрия: либо скорость, либо санитет, но не оба.
По данным Slator, человеческий перевод дает 2000-3000 слов в день. MTPE (машинный перевод с постредактированием) скачет до 7000 слов в день, при этом стоимость падает с $0.20-0.30 до $0.08-0.15 за слово. Тот же проект из 500K слов вместо 6 недель — это 10 дней, и маржи не рушатся.
Playbook существует. Тысячи агентств его запускают. Но большинство оставляет на столе 40-60% выигрыша в производительности, потому что не маршрутизируют сегменты умно, не работают с терминологией и не очищают исходный текст.
Вот как построить высокообъёмный MTPE-процесс, который действительно работает.
Что такое MTPE? (И почему масштабирование меняет всё)¶
MTPE — это не «пусть AI всё переведёт и считай готово». Это гибридный процесс: нейронный машинный перевод создаёт черновик, редакторы его прорабатывают, и весь цикл повторяется умно, а не в лоб.
Ключевой сдвиг для высокообъёмных проектов — дифференцированное редактирование: не все сегменты нужна одинаковая глубина работы. Повторяющееся описание товара, которое уже на 95% правильно, не должно редактироваться с той же тщательностью, что юридический пункт, вышедший на 60%. Когда вы работаете с 100+ тысячами слов в месяц, эта разница — разница между профитом и выгоранием.
По исследованиям Phrase, современный MTPE-стек включает:
- Машинный перевод (нейронные модели: DeepL, Google, custom-модели на основе ваших памятей)
- Оценку качества (автоматические инструменты, которые оценивают каждый сегмент)
- Умную маршрутизацию (высокое качество — в skip, среднее — в light PE, низкое — в full PE или переделка)
- Терминологию и память (глоссарии и TM предотвращают разночтения)
- Финальное редактирование (глаза человека на edge cases и стиль)
Без этой оркестровки MTPE — это просто дорогущий сырой MT. С ней вы получаете 3x выход, 50% экономии и качество, которому клиенты доверяют.
На каком контенте MTPE окупается?¶
MTPE работает не на всём одинаково хорошо. Прежде чем инвестировать в глоссарии и маршрутизацию, знайте, с чем работаете.
Контент, где MTPE даёт максимум (высокий ROI): - Каталоги товаров и описания (повторяющиеся фразы, одинаковая терминология) - Техническая документация и мануалы (структурированный, фактический контент, специальные термины) - Базы знаний и статьи поддержки (FAQ-стиль, повторяющиеся вопросы) - UGC и отзывы (объём важнее совершенства) - Release notes, changelogs (шаблоны + новые фичи) - Перевод форм и шаблонов (сплошное повторение)
На этом контенте edit distance (% текста, который переделал редактор) ниже 30%. МТ уже сделал 70% работы. Редактор доводит до блеска, а не перестраивает.
Контент, где MTPE рискован (низкий ROI): - Брендированный и креативный копирайт (тон, идиомы, культура — ломаются на МТ) - Юридические контракты и compliance (одно неправильное слово = убытки) - Поэзия и литературный перевод (плотность идиом слишком высока) - Узкотехнический научный контент (жаргон и контекст) - Формальная межличностная коммуникация (политики HR, извинения)
На этом edit distance выше 40-50%, редакторы работают почти как переводчики. MTPE даёт вам ~30% экономии вместо 70%. Всё ещё выгодно на массивах в 500K слов, но 172% прирост производительности вы не получите.
Правило: Если контент повторяющийся и структурированный, MTPE — это усилитель. Если креативный или критичный — MTPE всё ещё помогает, но не волшебство.
Шаг 1: Глоссарий ДО машинного перевода¶
Самая дорогая ошибка на высокообъёмных проектах — запустить MT без глоссария.
По данным Crowdin, непоследовательная терминология — главный источник переделок. Клиент пишет “workflow”, но в одном выводе МТ даёт “workflow”, в другом “рабочий процесс”, в третьем “процедура”. Редактор ловит, переделает. Следующий батч — то же самое. Вы добавили себе 10% к времени PE.
Глоссарий — это список одобренных пар терминов: исходный термин + перевод(ы), обычно с контекстом и примечаниями. Пример:
| Английский | Русский | Контекст | Примечание |
|---|---|---|---|
| dashboard | панель управления | UI элемент | Не “приборная панель” или “консоль” |
| workflow | рабочий процесс | Поток работы | По style guide клиента |
| trigger | триггер | Событие/условие | В контексте автоматизации |
| batch processing | пакетная обработка | Технический | Для workflow документов |
Для повторяющегося контента, мини-глоссарий из 50-200 терминов сокращает PE на 43%, по исследованиям Phrase. Для каталогов товаров, средний глоссарий (200-500 терминов) может снизить стоимость на 50%, потому что одни и те же слова повторяются в сотнях описаний.
Как его строить: 1. Извлеките повторяющиеся термины из исходного текста (используйте Sketch Engine или term extractor в CAT). 2. Пусть эксперты переведут 50-100 ключевых терминов с контекстом. 3. Скормите глоссарий МТ-движку (большинство поддерживают: Trados, memoQ, Phrase, Smartcat, DeepL API). 4. Проверьте первые 5000 слов PE, добавьте термины, которые редакторы помечали.
Большинство глоссариев достигают 80% зрелости после первых 20K слов. Потом ROI приходит быстро.
Шаг 2: Quality Estimation для маршрутизации, не для редактирования всего¶
Здесь большинство агентств оставляет 40% выигрыша на столе.
Quality estimation (QE) — автоматический инструмент, который оценивает каждый сегмент МТ на шкале 0-100. Математика простая:
- Оценка >80%: Высокое качество. Вообще не редактируем (skip).
- Оценка 50-80%: Среднее качество. Light PE только (ошибки, но не стиль).
- Оценка <50%: Низкое качество. Full PE или переделка.
По исследованиям NIMDZI, QE-маршрутизация сокращает нагрузку на редакторов на 40% без потери качества. 40-50% объёма вообще не трогаем. 35% редактируем легко. 20% редактируем тщательно.
Реальный пример: 100,000 слов. - 45,000 (45%) оценка >80% → skip → 0 часов. - 35,000 (35%) оценка 50-80% → light PE 1000 слов/час → 35 часов. - 20,000 (20%) оценка <50% → full PE 500 слов/час → 40 часов. - Итого: 75 часов вместо 200, если бы редактировали всё одинаково.
Без QE вы бы отправили всё в full PE (100 часов в среднем), потеряли бы маржу и сроки.
QE встроена в большинство современных TMS/CAT (Phrase, Smartcat, Trados, memoQ c плагинами). Есть бесплатные (OpenKiwi, TER, BLEU). Установите пороги под ваш контент и качество. Для каталогов можно пропускать >85%. Для права/медицины — >95%.
Шаг 3: Pre-editing исходного текста и унификация фраз¶
Garbage in, garbage out. Но грязный исходный текст = лишняя работа в PE.
По академическим исследованиям, pre-editing (чистка и унификация источника ДО МТ) сокращает PE на 43%. Pre-editing включает:
- Исправляйте ошибки в источнике. Нечёткие фразы, опечатки, распылённые предложения ломают МТ хуже любой языковой пары. Чините сначала.
- Унифицируйте терминологию в источнике. Если источник говорит “workflow” 200 раз и “рабочий процесс” 50 раз, унифицируйте на “workflow” ДО МТ.
- Разбивайте сложные предложения. Длинные, вложенные предложения с кучей придаточных ломают МТ. “Мы обнаружили, что потому что клиент нужен X, и команда сделала Y, то получилось Z” → три отдельных предложения.
- Убирайте redundancy. MTPE любит повторение, но excessive повторение в источнике — это просто умножение переделок. Сокращайте.
- Добавляйте контекст в комментариях. Для неоднозначных терминов, добавляйте XML-теги:
Мы обрабатываем ваши <context>данные в соответствии с регуляциями приватности</context>...это скажет МТ, “это про privacy-право, не просто инфо”.
Pre-editing — это 10-20% overhead, но сокращает PE на половину. На высокообъёмах эта сделка почти всегда стоит.
Большинство агентств outsource pre-editing к junior лингвистам или редакторам на языке источника (дешевле, чем PE). Процесс: эксперт-источник → pre-editor (чистит) → МТ → post-editor (доводит).
Шаг 4: Выбор МТ-движка (и не меняйте его в процессе)¶
Выбор движка влияет на всё: edit distance, консистентность терминов, сложные синтаксисные конструкции, и — критично — интеграция с вашей CAT.
По BLEU-бенчмаркам 2026, универсального лидера нет:
- DeepL: Лучший для европейских языков (EN→DE/FR/ES BLEU 60-65). Нативная интеграция memoQ, Trados, Phrase. Консистентная терминология, минимум галлюцинаций. Выбор для DE/FR/ES на массивах.
- Google Translate: Самое широкое покрытие (130+ языков). Хорош для редких пар. Слабее DeepL на европейских, но solid fallback. Встроен в большинство TMS.
- ChatGPT / Claude: Блеск на CJK, контекстно-зависимом контенте, multilingual. Медленнее (не для 100K+ батчей), дороже по API, но выше качество для творческого или nuanced контента. Для меньших high-stakes проектов.
- Custom MT: Если вы скормите движку 100K+ слов из memory переводов клиента, он будет обыгрывать generic движки на этом клиенте (+5-10 BLEU). Окупается только на retainer-клиентах с 500K+ слов/год.
Критичное правило для масштабирования: Выбираете движок и придерживаетесь его на весь проект и все будущие проекты с этим клиентом. Смена движка удваивает PE, потому что редакторы переучиваются на новые quirks.
По исследованиям производительности, редакторы достигают пика производительности через 3 месяца с одним движком. Смена = начните с нуля.
Шаг 5: Оптимизация PE-процесса и дифференциация по сложности¶
Не все PE одинаково полезны.
Light post-editing (LPE): Исправьте ошибки, улучшите читаемость, но не переписывайте. - Таргет: 1000-1200 слов/час. - Бюджет: 4000-5000 слов/день на редактора. - Лучше всего для: Описания, FAQ, техспеки на 70%+ качестве.
Full post-editing (FPE): Исправьте ошибки и улучшите беглость; звучит как native speaker. - Таргет: 500-700 слов/час. - Бюджет: 2500-3500 слов/день. - Лучше всего для: Customer-facing, брендированный контент, <60% качество.
На высокообъёмах большинство работы — это LPE. 45% сегментов, которые QE помечает как high-quality, вообще не редактируются (full skip). Следующие 35% идут в LPE (рабочая лошадь). Только 20% идут в full PE.
Этот три-уровневый подход — skip / light / full — это то, что отличает прибыльные high-volume MTPE-операции от тех, что выжигают редакторов и мусят сроки.
Шаг 6: Терминология и gate на финальное редактирование¶
Когда PE приходит, это не конец. Финальный gate ловит:
- Compliance с глоссарием: Редакторы держали терминологию? Автоматические term-checking tools (встроены в Trados, memoQ, Phrase) ловят misses.
- Консистентность стиля: Тон соответствует brand guidelines? Это domain style-checking tools (встроены или третьи).
- Точность чисел и имён: Edit distance не поймёт “€25” → “€250” или “John” → “Joan”. Automated QA это ловит.
- Missing segments и очевидные ошибки: Spot checks 10% PE, особенно сегменты <50% качества до PE.
Этот gate обычно 2-5 часов на 100,000 слов (2-5% overhead). На высокообъёмах почти всё автоматизируется: QA checkers, потом 5-10% ручных spot checks на рискованных сегментах.
Если вы работаете 1M+ слов в месяц, этот gate — разница между “повторяемым процессом” и “хаосом с жалобами клиентов”.
Экономика: расценки и ROI¶
Считаем реальный проект 100 тыс. слов, EN→RU, технические описания (MTPE-ideal контент).
Только человеческий перевод¶
- Расценка: $0.25/слово (market для русского)
- Стоимость: 100,000 × $0.25 = $25,000
- Время: 100,000 ÷ 250 слов/час = 400 часов = 10 недель (5 переводчиков)
MTPE с QE и глоссарием¶
- МТ-движок: $0 (DeepL / Google с кредитом)
- 45,000 слов (45%) skip: $0
- 35,000 слов (35%) light PE $0.07/слово: $2,450
- 20,000 слов (20%) full PE $0.12/слово: $2,400
- Subtotal PE: $4,850
- Glossary setup (первый проект): $500
- Pre-editing 2,000 слов: $300
- QE tool / TMS: $0-200/месяц (амортизированно)
- Final review (5 часов × $50): $250
- Итого: $6,400 (или $5,900 на 3 проектах)
Сэкономить: $25,000 − $6,400 = $18,600 (74% сокращение)
Время: 100,000 ÷ 1200 слов/час = 83 часа = 2 недели (1-2 редактора)
Угол для клиента¶
Два пути:
-
Пробросить сэкономить: Предложите $0.10/слово вместо $0.25. Клиент сэкономит 60%, вы заработаете $10,000 (вместо $25,000 если бы всё человеком). Клиент доволен.
-
Расширить маржу: Держите цену на $0.20/слово ($20,000), стоимость $6,400, profit $13,600 (68% margin). Клиентов, которые ценят скорость, это радует (в 2 раза быстрее). Клиентов с бюджетом $0.25 это радует (10% экономия). Вы выигрываете в обоих случаях.
Большинство агентств делят пополам: цена $0.15/слово (40% скидка от человека), стоимость $6,400, прибыль $9,600, клиент сэкономит $10,000.
Типичные провалы масштабирования (и как их избежать)¶
Провал 1: Сырой МТ без глоссариев¶
Симптом: Редакторы переделывают одно и то же. “Dashboard” переводится тремя способами в одном батче. Корень: Нет глоссария на входе МТ. Лечение: Обязательный glossary review ДО МТ-запуска. Даже 50 терминов снижают переделки на 30%.
Провал 2: Редактируем всё одинаково¶
Симптом: Выгорание. Редакторы в автоматизме, качество дрейфует, сроки скользят. Корень: Нет QE-маршрутизации. Всё идёт в full PE. Лечение: QE + маршрутизация light PE на >60%. Производительность +50%, маржа спасена.
Провал 3: Смена МТ-движка в процессе¶
Симптом: Редакторы вдруг медленнее, ошибок больше. “Это другой МТ.” Корень: Вы переключились с DeepL на Google в середине для экономии. Лечение: Один движок на всю пару язык-проект и все будущие проекты. Не оптимизируйте по батчам.
Провал 4: No pre-editing грязного источника¶
Симптом: Edit distance 50%+. Вы делаете почти как переводчик. Корень: Исходный текст мутный, хаотичная терминология, длинные вложенные предложения. Лечение: 2-5 часов pre-editing на 100K слов. Сокращает PE на 43%. ROI сразу.
Провал 5: No feedback loop по терминологии¶
Симптом: Одни и те же неправильные термины появляются в PE. Корень: Редакторы ловят ошибки глоссария, но feedback не идёт обратно. Лечение: Еженедельный review глоссариев. Редакторы помечают, вы добавляете. Следующий батч использует обновленный глоссарий.
FAQ¶
В: С какого объёма MTPE экономнее, чем человеческий перевод? О: Проекты свыше 10 тыс. слов почти всегда экономят. 100 тыс. слов по $0.20 (человек) = $20 000, по $0.10 (MTPE) = $10 000 — 50% экономии. Главное — скорость: вместо 40 дней человека = 15 дней MTPE.
В: Что если исходный текст очень плохого качества? О: Плохой источник ломает MTPE. Ошибки в грамматике, хаос терминологии, непоследовательность стиля источника = больше работы редакторам, чем перевод с нуля. Pre-editing (чистка, унификация) сокращает PE на 43%. Начните с источника.
В: Как автоматически маршрутизировать между light и full PE? О: Quality estimation (QE) оценивает каждый сегмент 0-100. Пороги: >80% → skip, 50-80% → light PE (ошибки), <50% → full PE или переделка. Это сокращает нагрузку на 40% без потери качества.
В: Нужна ли память переводов (TM) для MTPE? О: Необязательна, но TM + глоссарий сокращают PE на 43%. Хорошая память гарантирует консистентность и переиспользует одобренные фразы. Для повторяющегося контента можно снизить стоимость на 50%.
В: Какой движок лучше для MTPE: DeepL, Google или ChatGPT? О: Нет абсолютного лидера. DeepL лучший на европейские языки (EN→DE/FR/ES BLEU 60-65), ChatGPT/Claude на азиатские и контекстные. Для масштабирования выбирайте, что нативно в вашей CAT — Trados, memoQ, Phrase. Смена движка удваивает PE.
В: Какая самая частая ошибка на высокообъёмах? О: Сырой МТ без глоссариев или QE. Непоследовательная терминология, отсутствие маршрутизации — редактируем всё одинаково и теряем маржу. Лечение: глоссарий первым, QE вторым, сегментация третьим.
В: Можно ли масштабировать до 1M+ слов в месяц? О: Да, если соблюдать три условия: (1) глоссарий для консистентности МТ, (2) QE для skip высокого качества, (3) light PE для среднего, full PE только для <50%. Агентства на 1M+ слов/месяц именно так работают.
В: Как продать MTPE клиентам без претензий на «это хуже»? О: Позиционируйте как «быстрее, не дешевле». MTPE даёт 50% сэкономить и 2-3x ускорить. Клиентам, ценящим сроки, это нравится. Фрейм: «Готово за 3 дня вместо 2 недель» лучше, чем «$10K вместо $20K».