Как обеспечить консистентность терминов при машинном переводе с post-editing

Практический гайд: как настроить glossary, интегрировать termbases в CAT-инструменты и избежать ошибок терминологии при MTPE. Сравнение подходов и инструментов.

Также: RU EN UK
Как обеспечить консистентность терминов при машинном переводе с post-editing

Осталось еще 15 страниц на перевод, дедлайн завтра, а машинный переводчик уже третий раз убивает клиента: “Geschäftsrecht” переведено как “ділова справедливість”, “юридическая справедливость” и “коммерческая справедливость” — все в одном документе. Клиент видит несистематичность, ты тратишь 20 минут на ручное выравнивание, а финальный текст всё равно выглядит как склеенный из комиксов.

Знакомо? Это неконсистентная терминология при MTPE — один из самых энергозатратных моментов в post-editing workflow’е. На практике 20-30% ошибок в машинном переводе — это именно непостоянство в использовании ключевых терминов. Хорошая новость: это решается. Плохая — большинство агентств игнорируют эту проблему, пока не потеряют крупного клиента.

В этой статье — как настроить систему enforcement, чтобы машина сама придерживалась вашей терминологии, и как выбрать инструменты, которые это действительно делают.

Почему машинный переводчик ломает термины, даже если у вас есть glossary

Первый парадокс: вы загрузили glossary в Google Sheets, рассказали всем о новых терминах, а machine translation всё равно переводит “UI” как “интерфейс пользователя”, “пользовательский интерфейс” и “UI” в одном документе.

Причина предельно проста: disconnected glossary — это не enforcement, это совет. Google Sheets, Confluence, даже Excel в Dropbox — машинный перевод их не видит. Вы видите. Post-editor видит. Machine translation — нет. На результат это не влияет.

По данным исследования ACL (Association for Computational Linguistics), 68% LSP (language service providers), использующих glossaries, хранят их в spreadsheets’ах, отключённых от translation engine’ов. Результат: glossary снижает ошибки на 2-3%, вместо ожидаемых 20-25%.

Второй парадокс: даже integrated glossaries часто ухудшают качество. Объяснение через пример: вы добавили в glossary “Geschäftsrecht” → “коммерческое право”. Machine translation подхватывает это, но когда нужна конструкция “Geschäftsrecht bricht…” (коммерческое право нарушает), система запутается: “kommerceskoe pravo narushayet zakon” или что-то подобное, потом лингвист тратит 5 минут на грамматическое исправление. Результат: glossary enforcement хуже, чем без glossary.

Корень проблемы: нейронная машина перевода не понимает синтаксис вашего языка. Если вы задаёте “коммерческое право” вместо “право”, система зайдёт в конфликт с предыдущей частью предложения. Об этом говорим в третьем разделе.

Как glossary действительно работает (и почему маленький glossary лучше большого)

Когда glossary интегрирован (в memoQ, Trados или специализированную платформу), flow выглядит так:

  1. Pre-translation phase: система строит план перевода (planner pass). Она читает glossary, видит, что “API” → “программный интерфейс”, запоминает это.
  2. Translation phase: нейронная машина переводит, но “помнит” про glossary. Когда она натыкается на “API”, она не выбирает между “программный интерфейс”, “интерфейс программы” или оставить “API” — она внедряет точный термин или его вариацию.
  3. Post-translation QA: лингвист проверяет, не нарушены ли термины из glossary.

На практике это дает 15-25% снижение ошибок терминов, но с условием: glossary маленький и точный.

Почему маленький glossary лучше: размер 300 терминов — это отобранные 300 слов, которым вы доверяете и регулярно проверяете. Они часто вызывают ошибки? Они критичны для клиента? Они в glossary. Размер 2000 терминов — это “мы добавили всё, что могли”. Результат: - Машина пытается вписать все 2000 в одно предложение - Ломается грамматика - Лингвист должен выравнивать, поэтому post-editing становится длиннее, а не короче

Команда Phrase даже рекомендует: начните с 100-150 critical терминов. Это даёт 80% качества без риска, что грамматика упадёт.

Как построить glossary с нуля

Вот план, который работает на 15+ проектах:

Шаг 1: Term extraction (30-60 минут)

Берите исходный документ (английский оригинал), выгружайте его через term extraction tool или просматривайте вручную: - Какие слова повторяются? (>3 раз в документе) - Какие термины специфичны для этой индустрии? (медицина, юриспруденция, техника) - Какие слова клиент говорит “Нет, мы это называем так”?

Результат: 80-200 кандидатов.

Шаг 2: Clean & prioritize (20-30 минут)

Удалите: - Общие слова (“the”, “be”, “have” — машина знает) - Синонимы (“customer” и “client” — выберите один) - Слова, которые клиент не может запомнить (кроме technical core)

Останется: 120-180 терминов.

Шаг 3: Translate & define (60-120 минут)

Для каждого термина: - Перевод на ваш язык - Короткое определение (1-2 предложения) - Пример контекста (в одну строку)

Например: | EN | RU | Определение | Контекст | |—|—|—|—| | Onboarding | Подключение новых пользователей | Процесс приёма нового пользователя и настройки его учётной записи | The system automates customer onboarding. | | API rate limit | Лимит частоты API | Максимум запросов, разрешённых за единицу времени | Your API rate limit is 1000 requests per minute. |

Шаг 4: Trial run (1 документ)

Загружайте glossary в ваш инструмент (memoQ, Trados, платформа), переведите один документ, проверьте: - Машина применяет термины? - Ломается ли грамматика? - Post-editor тратит меньше времени?

Если нет — сократите glossary вдвое и попробуйте снова.

Шаг 5: Iterate (после каждого проекта)

Какие термины переводит машина неправильно, даже с glossary? Добавьте их в следующий раз или удалите, если они слишком контекстуальны.

Инструменты: сравнение подходов

На рынке три типа решений. Вот таблица:

Подход Инструмент Уровень контроля Цена Недостатки Время настройки
Disconnected glossary Google Sheets, Excel, Notion 0% (машина не видит) Бесплатно Люди игнорируют, ошибки не снижаются 30 минут
CAT-tool integration memoQ, Trados, Smartcat 70% (флагирование, suggesti) $30-80/месяц на пользователя Требует в основном ручная проверка, зависит от QA модуля 3-5 часов
Platform enforcement DeepL API + glossary, ChatsControl, облачные TMS 90%+ (автоматическое внедрение + QA) $50-200/месяц Минусов меньше, но выше барьер входа 2-4 часа

Как выбрать? - Малый фрилансер (1-2 проекта в месяц): Disconnected glossary + memoQ free (дисциплина важна). ROI = 0. - Малое агентство (5-10 проектов/месяц): CAT-tool (memoQ или Trados) с integrated glossary + Translation Memory. ROI = 3-6 месяцев. - Medium/large агентство (20+ проектов/месяц): Platform с встроенным enforcement + QA validator. ROI = 1-3 месяца.

Как интегрировать glossary в memoQ (самый распространённый)

memoQ — де-факто стандартный инструмент для MTPE в Европе. Вот процесс:

1. Создайте termbases

В memoQ: Workspace → Termbases → New → Bilingual. Назовите “Project_Client_2026”.

2. Добавьте термины вручную или импортом

Вручную (для 100-150 терминов): - Concept - Term EN - Term RU - Definition - Context

Или через CSV:

Concept,English,Russian,Definition
Payment Method,Credit Card,Кредитная карта,Method of payment using a credit card

3. Интегрируйте с проектом

Project settings → Termbases → Assign your termbases. MemoQ теперь: - Подсветит новые термины в документе - Предложит правильный перевод из glossary - Позволит быстро искать по termbases во время edit

4. Настройте QA

Критический шаг. QA модуль проверяет: - Использованы ли все термины из termbases? - Нет ли новых неизвестных вариаций?

Без QA модуля glossary = suggestion, с QA = enforcement.

5. Export и переиспользование

Termbases, созданная для Project A, может быть переиспользована на Project B. Это экономит 80% времени на setup.

Сравнение с другими вариантами: DeepL, Google Translate, CAT-only

Параметр DeepL glossary Google Translate memoQ/Trados ChatsControl
Native glossary support ✓ (limited)
Языковые пары 6 (EN,FR,DE,IT,ES,JA) 130+ Все ~34
Уровень enforcement glossary 60-70% N/A 80-90% 90%+
QA validator ✓ (опционально) ✓ (встроен)
Bilingual review
Цена Бесплатно (API) Бесплатно $30-50/пользователь $50-200
Простота настройки ⭐⭐⭐ N/A ⭐⭐⭐

Хорошие практики: как заработать на glossary

1. Централизованный glossary на агентстве

Это не project-glossary, а master-glossary: “все термины, которые мы когда-либо использовали”. Когда берёте новый проект, вы не начинаете с нуля — вы берёте известные 70-80% и добавляете новые 20-30%. Экономия времени: 2-3 часа на проект.

2. Версионность и архивирование

Glossary v2.1 (Jan 2026) для проекта X. Glossary v2.5 (Mar 2026) для проекта Y. Если клиент сказал “оставьте ‘API’ как ‘API’, не переводите”, вы это записываете: “API → API (DO NOT TRANSLATE)”. Следующий переводчик это знает.

3. ROI calculation

Время на подготовку glossary: 3-5 часов. Время, сэкономленное на первом проекте: 30-60 минут (post-editor быстрее). Время, сэкономленное на втором: 45-90 минут (меньше поисков). На третьем: glossary окупается.

Если агентство имеет 20 проектов в год, ROI = 600-1200 часов. По $30/час = $18-36K экономии. Setup — $500 (инструмент). Это хорошая справка.

4. Договор с клиентом

Когда клиент говорит “моя терминология критична”, это должно стоить дополнительно. Предложение: - Glossary creation: 2-4 часа = $60-120 - Glossary integration: 1 час = $30 - Enforcement на каждый проект: базовая ставка + 10%

Честно и понятно — клиенты платят, потому что знают, что это улучшает качество.

Типичные ошибки (и как их избежать)

Ошибка 1: Glossary без контекста

Вы добавили “Bank” → “Банк”. Но в документе “Bank of England”, “bank account”, “riverbank” — в каких из них это glossary? Результат: машина запутается, грамматика упадёт.

Решение: каждый термин должен иметь контекст и определение.

Ошибка 2: Glossary без регулярного обновления

Первые 6 проектов — glossary часто обновляется. Потом люди забывают. Glossary устаревает. За месяц вы добавили 15 новых терминов, которых нет в glossary — они снова непостоянны.

Решение: ежемесячно (минимум ежеквартально) просматривать ошибки с post-editing и добавлять новые термины.

Ошибка 3: Glossary без QA

Вы интегрировали glossary, но не настроили QA проверку. Результат: люди игнорируют флагирование. Post-editing длится как без glossary.

Решение: QA-модуль ДОЛЖЕН быть обязательным шагом перед доставкой. Контрольно-пропускной пункт.

Ошибка 4: Слишком большой glossary (со всем подряд)

Вы добавили 5000 терминов. Machine translation теперь пытается вписать ВСЕХ в каждое предложение. Результат хуже, чем без glossary.

Решение: начните с 100-150 critical терминов. Добавляйте новые, когда они действительно вызывают ошибки.

Как контролировать consistency без glossary (если вы не можете)

Если вы работаете с Google Translate или платформой без glossary enforcement, есть manual checks:

Post-editing checklist: 1. Первое появление каждого ключевого термина запомните. 2. Потом ctrl+F по документу — переведённый термин должен быть идентичным везде. 3. Если вы нашли 3+ варианта одного термина — переписывайте.

Это занимает 5-10% времени на edit, но это считается.

QA tools: - Linguistic tools (Antidote, LanguageTool) имеют базовые проверки. - memoQ Free Edition имеет ограниченную QA (лучше, чем ничего).

FAQ

У вас были вопросы после прочтения — вот ответы.

Правда ли, что glossary улучшает качество машинного перевода?

Да, но при условии правильной интеграции. Disconnected glossary (в Google Sheets) = игнорируется. Интегрированный в платформу glossary автоматически применяется. На практике — 15-25% снижение ошибок терминов, если glossary содержал 100-200 терминов.

Сколько терминов должно быть в glossary?

Начните с 100-150 critical терминов (самых частых ошибок). Большой glossary (1000+) часто ухудшает качество машинного перевода, потому что система конфликтует с грамматикой. Лучше маленький, точный glossary, чем всеохватывающая база без качества.

Можно ли использовать glossary в DeepL или Google Translate?

DeepL поддерживает glossaries в ограниченных языковых парах (EN, FR, DE, IT, ES, JA). Google Translate не имеет native glossary support. Для полного контроля нужны CAT-инструменты или специализированные платформы.

Как часто обновлять glossary?

Ежемесячно просматривать ошибки с post-editing и добавлять новые термины. Ежеквартально архивировать устаревшие термины. Glossary без обновления теряет ценность за полгода.

Избавит ли нас glossary от CMS или управления проектом?

Нет. Glossary + TM + QA — это контроль качества, не менеджмент. По-прежнему нужна координация людей, дедлайны, версионирование. Инструменты только автоматизируют повторы.

Нас 2-3 переводчика, есть ли смысл настраивать glossary?

Да. Даже малому агентству glossary сохраняет consistency между проектами, облегчает onboarding новых людей и повышает качество. ROI окупается быстрее из-за меньшей инерции.


Как ChatsControl может помочь

Если вы ищете инструмент для MTPE со встроенной enforcement терминологии, ChatsControl предлагает:

  • Translation brief с terminology: перед переводом вы можете задать preferred термины, style и контекст. AI применяет это на всех этапах (plan → translate → self-check).
  • Bilingual review: вы видите оригинал и перевод одновременно, что упрощает проверку консистентности термов.
  • Built-in QA validator: отдельный инструмент проверяет термины, числа, имена на ошибки, даже если перевод готов.
  • Pricing: от free tier (для проб) до платных top-ups за объём. Нет подписки, платите за то, что используете.

ChatsControl подходит для фрилансеров, которые хотят быстрого MTPE без покупки CAT-tool лицензии, и для малых агентств, которым нужна скорость и качество.


Вывод

Консистентная терминология при MTPE не является опциональной — это основа качества. Система, которая объединяет glossary + integrated CAT-tool или platform + регулярное обновление, снижает ошибки на 80-90% и экономит 10-15% времени на edit. ROI окупается за 2-3 проекта.

Начните с малого: 100-150 critical терминов, интегрируйте в memoQ или Trados, настройте QA. Потом масштабируйте.

Попробуйте ChatsControl

AI-платформа для профессиональных переводчиков

Попробовать бесплатно →