500 страниц контракта, 8 языков, дедлайн 6 недель, бюджет тесный. Математика не складывается без автоматизации — но чистый машинный перевод вернется с неуклюжей фразеологией и пропущенной терминологией. Нужно сочетание: машинная скорость + человеческие глаза. Именно для этого нужна интеграция машинного перевода в твой CAT-инструмент.
Этот гайд проведет тебя через подключение МТ-движков, выбор правильного подхода для твоей команды и измерение реальных результатов.
Что ты на самом деле делаешь, когда “интегрируешь МТ”¶
Это не означает заменить переводчиков роботами. Ты подключаешь свой CAT-инструмент (Trados, memoQ, Phrase, Smartcat) к машинному переводу (DeepL, Google, Microsoft или обученному движку) — и тот показывает предложения МТ рядом с совпадениями памяти переводов и записями терминологии в одном интерфейсе.
Переводчик видит:
- Исходный сегмент
- 100% совпадение из памяти (если есть)
- Нечеткие совпадения (75-99%)
- Предложение МТ
- Записи терминологии
- Предыдущую работу на похожих сегментах
Переводчик выбирает лучшее начало (часто память сначала, потом МТ если память холодная), редактирует и подтверждает. CAT-инструмент записывает редакцию, возвращает ее в память и учится на этой правке. Скорость: не от пропуска перевода — от старта с 70-80% правильным черновиком вместо пустой страницы.
Это редакция машинного перевода (MTPE), и именно так масштабируются профессиональные агентства.
На сколько на самом деле ускорится?¶
Реальные цифры от команд, работающих с live MTPE:
Легкое редактирование (исправление грамматики, очевидные ошибки, ошибки перевода на уровне сегмента; сохранение структуры МТ): 2-3x слов в час против традиционного перевода. Переводчик, делающий 250 слов/час чистого перевода, может достичь 600-800 в легком MTPE. Компромисс: ниже качество, подходит для большого низкорискового контента (техническая документация, строки ПО, FAQ).
Полное редактирование (обеспечение человеческого качества для тона, стиля, культурного соответствия): 15-30% ускорение против чистого человеческого перевода. Тот же переводчик достигает 280-325 слов/час. Выше качество, подходит для маркетинга, юриспруденции, публичного контента.
Почему такая разница? Легкое MTPE рассматривает МТ как грубый черновик; полное редактирование означает переводить существенные части — ты экономишь меньше времени, но все равно быстрее чистого перевода, так как терминология и собственные имена часто правильны в МТ.
Сочетание МТ с крепкой памятью переводов: Сегменты без редакции (то, что МТ или память идеально обрабатывает) прыгают на 30-50% для профессиональных движков против 5-20% для облачного Google без контекста памяти.
Три пути интеграции — выбери свой¶
Путь 1: Встроенные коннекторы (Проще всего, Меньше контроля)¶
Твой CAT-инструмент уже имеет встроенные опции МТ. Открой настройки → МТ провайдеры → включи DeepL или Google → готово.
Время настройки: 15 минут.
Доступные МТ-провайдеры: Trados подключается к Language Weaver (RWS), DeepL, Google, Microsoft. MemoQ поддерживает Google, Microsoft, DeepL, ChatGPT. Phrase включает DeepL, Google, AWS, пользовательские. Smartcat имеет собственный МТ + сторонние коннекторы.
Контроль, который ты получаешь: Нулевой. Ты подаешь текст в движок, получаешь результат. Без обучения, без внедрения терминологии, без специализации. МТ работает на своей стандартной модели.
Стоимость: Обычно бесплатна или включена в подписку CAT-инструмента; или измеряемые платежи от провайдера (DeepL ~15-20$ за миллион символов).
Когда использовать: Быстрые пилоты, низкорисковый контент, языковые пары где общий МТ достаточен.
Подвох: Качество генерично. Если твоя область имеет специальную терминологию или тон (юридическая, медицинская, маркетинговая), генеричный МТ хромает.
Путь 2: Интеграция API через плагины (Гибко, Требует умеренной подготовки)¶
Поставщик CAT-инструмента предоставляет плагин, который подключается к МТ API. Ты настраиваешь аутентификацию, ключи API и параметры — тогда CAT-инструмент общается с МТ-сервисом напрямую, с большим контролем.
Время настройки: 2-5 дней. Включает: получение учетных данных API, настройку в CAT-инструменте, тестирование на образце контента, обучение команды.
МТ-провайдеры: Любой провайдер с публичным API (DeepL API, Google Cloud Translate, Microsoft Translator, AWS Translate, Language Weaver API, Custom.MT, или открытый код Argos, LibreTranslate).
Контроль, который ты получаешь: Больше. Ты можешь указать: - Языковую пару - Уровень формальности (для некоторых движков) - Пользовательскую терминологию (если API это поддерживает) - Компромиссы приоритета/скорости/стоимости
Некоторые API поддерживают специфичные для домена предварительно обученные модели — ты передаешь им параллельные данные (твои старые переводы) и они уточняют базовый движок.
Стоимость: Платежи API за миллион символов. DeepL API ~15-20$/million. Google Cloud Translate ~15-25$/million. Пользовательские предварительно обученные движки: $500-3000+ в месяц в зависимости от объема и поставщика.
Когда использовать: Масштабирование команд (10+ переводчиков), последовательный контент, когда ты хочешь тонкой настройки качества. Агентства, управляющие несколькими TM клиентов, часто используют это.
Подвох: Требует IT координации если ты на локальном CAT-инструменте. Облачные CAT-инструменты (Smartcat, Phrase, Crowdin) это обрабатывают гладче.
Путь 3: Пользовательский специфичный для домена МТ (Лучшее качество, Дороже всего)¶
Ты обучаешь собственный нейронный машинный перевод (NMT) на твоих исторических переводах. Передаешь движку 50,000+ параллельных сегментов (пары исходных + целевых из твоей памяти переводов), и он учится твоей терминологии, стилю и паттернам домена. Потом подключаешь его к CAT-инструменту через API.
Время настройки: 3-8 недель. Включает: сбор и очистку данных TM, выбор NMT платформы (Unbabel Tower, Custom.MT, Language Weaver Advanced Customization, или открытый код Marian/OpenNMT), обучение модели, тестирование, интеграция.
МТ-провайдеры: Unbabel (Tower), Custom.MT (интегрирует Claude/Lara/Widn LLMs), RWS (Language Weaver Custom), Amazon Translate Custom Terminology, открытый код Marian, OpenNMT.
Контроль, который ты получаешь: Максимальный. Модель учится твоего точного словаря, фразовых паттернов и тона. Для нишевых доменов (право, фарма, финтех), пользовательский МТ может достичь 50-70% сегментов без редакции до человеческого редактирования.
Стоимость: $2,000-10,000+ настройка; $500-2,000/месяц для хостинга и обновлений. Требует объема контента чтобы это оправдать (минимум ~100,000 слов собственной TM).
Когда использовать: Агентства, обрабатывающие 500K+ слов/месяц в специализированном домене; корпоративные отделы перевода.
Подвох: Требует хороших исторических данных. Если твоя старая TM неточна, непоследовательна или полна ошибок, пользовательский движок учится плохим паттернам. Планируй 2-3 недели очистки TM перед обучением.
Шаг за шагом: Настройка МТ интеграции¶
Идем через Путь 2 (самый распространенный для растущих команд) используя memoQ. Процесс похож в Trados, Phrase и Smartcat.
Шаг 1: Выбери свой МТ-движок и Получи учетные данные¶
Выбери один: DeepL (лучшее общее качество), Google Translate (самые широкие языки), Microsoft Translator (если ты в экосистеме Azure), или специфичный для домена движок.
Пример: DeepL API
- Иди на deeplapi.com, зарегистрируйся на бесплатный уровень (500,000 символов/месяц) или платный ($10/месяц + использование).
- Получи свой ключ API (длинная строка типа sk-2f23f923f923f).
- Копируй — ты вставишь это в memoQ далее.
Шаг 2: Настрой в своем CAT-инструменте¶
В memoQ: - Tools → Options → Machine Translation. - Добавь МТ сервер: выбери “Custom Web Service” или “DeepL” если memoQ имеет родной плагин. - Вставь свой ключ API. - Выбери языковые пары, которые ты хочешь включить. - Тест: создай тестовый проект, открой сегмент, смотри появляется ли МТ предложение в панели МТ.
В Trados: - Project Settings → Machine Translation. - Выбери провайдера (Language Weaver, Google, Microsoft, или пользовательский). - Аутентифицируй и выбери языковые пары.
Шаг 3: Построй базу терминов (Критично — Это 40% улучшения качества)¶
МТ-движки гадают на терминологии. Если твой продукт имеет уникальный термин (напр., “токеномика” для крипто, “модульная архитектура” для SaaS), генеричный МТ может его неправильно перевести. Базы терминологии переважают гадание МТ.
В твоем CAT-инструменте создай глоссарий с: - Исходный термин → Целевой перевод - Часть речи (существительное, глагол, прилагательное) - Пример в контексте - Не переводить (напр., бренды, аббревиатуры)
Пример для SaaS перевода (английский → немецкий):
| EN Term | DE Term | Type | Example | Don’t Translate? |
|---|---|---|---|---|
| API | API | noun | The API returns JSON | Yes |
| workflow | Arbeitsablauf | noun | Streamline your workflow | No |
| dashboard | Dashboard | noun | View metrics on the dashboard | Yes |
| onboard | Onboarding durchführen | verb | We help you onboard users | No |
Построй это со своими SME (предметными экспертами) перед запуском. Обновляй ежемесячно когда эволюционирует продуктовая терминология. Даже база из 200 записей поднимает качество МТ на 30-40% так как это фиксирует последовательную терминологию.
Шаг 4: Определи гайды редакции¶
Скажи своей команде точно что означает “достаточно” для МТ:
Гайды легкого редактирования (2-3x скорость, для технической документации): - Исправь явные грамматические ошибки (пропущенный артикль, неправильное время глагола). - Исправь ошибки перевода на уровне сегмента (неправильный порядок слов, перевернутое значение). - НЕ переписывай для стиля или потока — сохрани фразеологию МТ если это грамматически правильно. - Целевая редакция: 10-20% слов сегмента изменено.
Гайды полного редактирования (15-30% скорость, для маркетинга/юриспруденции): - Исправь всю грамматику и терминологию (записи глоссария должны быть точны). - Обеспечь тон/регистр соответствует оригиналу (формальная для юридической, дружелюбная для маркетинга). - Переписать фразеологию если МТ неуклюжа но технически правильна. - Добавь контекст/культурные ссылки если МТ упускает нюанс. - Целевая редакция: 30-50% слов сегмента изменено.
Раздели это в рабочем пространстве CAT-инструмента и перечитай еженедельно на встречах. Непоследовательные гайды = непоследовательное качество и потраченная редакция.
Шаг 5: Пилот с одним проектом, одной языковой парой, одним редактором¶
Не переключай выключатель на 200K слов в 5 языках завтра. Начни мало.
- Выбери один проект: 5,000-10,000 слов.
- Выбери одну языковую пару: самая сильная пара переводчика.
- Запусти его 1-2 недели с МТ включено.
- Измер: слова в час, сегменты без редакции, уровень ошибок (проверь 100 сегментов на правильность).
- Сравни с базовой линией (тот же переводчик, тот же контент, без МТ).
Пример метрик для отслеживания:
| Metric | Without MT | With MT (Light MTPE) | With MT (Full MTPE) |
|---|---|---|---|
| Words/hour | 250 | 700 | 300 |
| Zero-edit rate (%) | — | 25% | 5% |
| Error rate (per 100 words) | 1-2 | 3-5 | 0.5-1 |
| Revision rounds | 1 (internal review) | 0.5 (less rework) | 1 (quality check) |
Шаг 6: Обучи свою команду¶
Даже 15-минутное обучение сокращает ошибки на 30%. Обучай: - Где найти предложения МТ в интерфейсе. - Как принимать/отклонять/редактировать их (клавиатурные сокращения — мышечная память важна). - Твои гайды редакции (легкие против полные, что считается “готово”). - Когда использовать базу терминов чтобы переважить МТ. - Паттерны усталости (редакция МТ монотонна; бери перерывы чтобы оставаться острым).
Pro tip: Проигрывай записанное редактирование. Покажи своей команде как выглядит хорошее легкое MTPE против пере-редакции. Большинство команд пере-редактируют сначала, тратя время.
Шаг 7: Мониторинг и итерация¶
После 2-4 недель: - Собери feedback команды (замедляет ли их МТ? Надежен ли он для этого домена?). - Проверь уровни ошибок (QA точка проверки на 100 сегментах, вычисли истинный уровень ошибок). - Перекалибруй терминологию если некоторые термины продолжают появляться неправильно. - Переключи МТ-движки или коригуй настройки если нужно.
Ежемесячно измеряй: стоимость на слово, тренды производительности, и действительно ли МТ снижает стоимость или просто передвигает работу вокруг.
Распространенные ошибки (и как их избежать)¶
Ошибка 1: Запуск МТ без обновления твоей базы терминов.
МТ + пустой глоссарий = garbage in, garbage out. Потрать неделю строя глоссарий. Пропусти это и качество упадет; команда выключит МТ в неделю 2.
Исправь: Требуй глоссарий с 100+ основными терминами перед запуском МТ.
Ошибка 2: Смешивание гайдов легкого и полного редактирования.
Переводчики не уверены как глубоко редактировать. Некоторые делают легкую (быстро, поверхностно), другие делают полную (медленно, глубоко). Результат непоследовательный, некий контент нужно пересмотреть.
Исправь: Выбери один на проект. Сделай это явным в настройках проекта и на встречу.
Ошибка 3: Плохой исходный текст garbage-in, garbage-out машинный перевод.
Твой исходный текст плохо написан (непоследовательная терминология, грамматические ошибки, неясные инструкции). МТ расширяет эти ошибки. Редакторы тратят 40% времени угадывая что исходный означает вместо переводу.
Исправь: Внедри QA исходного текста перед МТ. Простая проверка грамматики + проверка терминологии на исходном. Большинство платформ перевода (Phrase, Smartcat) это имеют встроено.
Ошибка 4: Не измерение перед тем как утверждать успех.
Ты внедряешь МТ, команда говорит что это ощущается быстрее, ты предполагаешь что это работает. Потом проверяешь числа и стоимость на слово возросла потому что все редактируют больше.
Исправь: Установи базовые метрики (слова/час, сегменты без редакции, стоимость) перед включением МТ. Измер снова после 2 недель и 8 недель. Сравнивай только подобные проекты.
Ошибка 5: Ожидание МТ для низкоресурсных языковых пар.
МТ для EN→DE или EN→FR крепкая (много тренировочных данных). МТ для EN→Беларуси или EN→Хауса грубая. Если ты принуждаешь MTPE на низкоресурсных парах, редакторы тратят больше времени исправляя МТ ніж переводя свежее.
Исправь: Тестируй МТ на своих языковых парах сначала. Если сегменты без редакции под 5-10%, пропусти МТ для этой пары. Используй МТ только для языковых пар где ты видишь 20%+ сегментов без редакции.
Как измерить ROI (Действительно ли МТ окупляется?)¶
После 4 недель МТ интеграции, вычисли:
Стоимость на слово перед МТ: (Почасовая ставка переводчика ÷ 250 слов/час) = стоимость/слово
Пример: $40/час ÷ 250 = $0.16/слово
Стоимость на слово с МТ: (Почасовая ставка ÷ слов/час с МТ) = стоимость/слово
Пример: $40/час ÷ 700 (легкая MTPE) = $0.057/слово
МТ накладные затраты: Платежи API + обслуживание глоссария (~2 часа/месяц) + накладные затраты QA.
Пример: DeepL API $100/месяц + 2 часа работы с глоссарием (в $40/час = $80) = ~$180/месяц. На 500K слов/месяц: $0.00036/слово.
Истинное снижение стоимости: ($0.16 - $0.057 - $0.00036) ÷ $0.16 = 64% снижение стоимости
Большинство агентств видят 20-40% чистое снижение стоимости в первом квартале. Чем дольше взаимодействие, тем лучше — старые памяти переводов дают МТ больше 100% совпадений, толкая производительность выше.
Когда НЕ использовать МТ (И что делать вместо этого)¶
- Высоко стилизованный или творческий контент (поэзия, кампании брендов, художественный перевод): Человеческий перевод + CAT-инструмент + TM только, без МТ. МТ не может захватить тон.
- Регулируемый контент с требованиями аудита (медицинский, юридический, сертифицированные переводы): Человеческий перевод требуется; МТ опция для раннего черновика только, не для финала.
- Языковые пары с плохим МТ (низкоресурсные языки, чрезвычайно разные системы письма): Пропусти МТ. Иди с человеком + TM + терминология.
- Одноразовые короткие проекты (один 500-слов документ): Время настройки превышает пользу. Просто переведи вручную.
Часто задаваемые вопросы¶
В: Нужна ли отдельная лицензия МТ, или наш CAT-инструмент его включает?
О: Твой CAT-инструмент обычно предлагает бесплатное подключение к бесплатным/фримиум МТ сервисам (Google Translate, ограниченная DeepL). Платные МТ API имеют отдельные платежи. Большинство команд тратят $100-500/месяц на МТ если делают 500K+ слов/месяц. Бюджетируй соответственно.
В: Можемо ли мы переключаться МТ-движки в середине проекта?
О: Да. Выключи старый движок, включи новый. Сегменты уже отредактированные остаются как есть; новые сегменты получают предложения от нового движка. Без потери данных.
В: Что если наши редакторы просто принимают все МТ без пересмотра?
О: Это случается, особенно под давлением дедлайнов. Исправь с: (1) проверка качества выборки (пересмотри 5-10% отредактированных сегментов, флаг ошибок назад редактору), (2) рецензирование коллегами (вращай кто рецензирует кого), (3) LQA метрики (языковая проверка качества — автоматизированные проверки грамматики, терминологии, пунктуации). Большинство CAT-инструментов это имеют встроено.
В: Заменяет ли машинный перевод человеческих переводчиков?
О: Нет. Это их усиливает. Переводчик + МТ + TM система быстрее чем переводчик один, но переводчик все еще делает каждое финальное решение. MTPE это работа переводчика, не работа робота.
Интеграция машинного перевода это не “настрой и забудь”. Это изменение рабочего процесса — новые инструменты, новые гайды, новая QA. Команды, видящие реальный ROI — это те что инвестируют в терминологию, хорошо обучают редакторов и измеряют результаты. Начни мало, измер, итерируй и масштабируй.
Твой 500-страничный 8-языковый проект становится возможным когда 40-50% сегментов предварительно переведены (через TM или МТ) и твоя команда фокусируется на полировании, не на старте с нуля.