Осталось еще 15 страниц на перевод, дедлайн завтра, а машинный переводчик уже третий раз убивает клиента: “Geschäftsrecht” переведено как “ділова справедливість”, “юридическая справедливость” и “коммерческая справедливость” — все в одном документе. Клиент видит несистематичность, ты тратишь 20 минут на ручное выравнивание, а финальный текст всё равно выглядит как склеенный из комиксов.
Знакомо? Это неконсистентная терминология при MTPE — один из самых энергозатратных моментов в post-editing workflow’е. На практике 20-30% ошибок в машинном переводе — это именно непостоянство в использовании ключевых терминов. Хорошая новость: это решается. Плохая — большинство агентств игнорируют эту проблему, пока не потеряют крупного клиента.
В этой статье — как настроить систему enforcement, чтобы машина сама придерживалась вашей терминологии, и как выбрать инструменты, которые это действительно делают.
Почему машинный переводчик ломает термины, даже если у вас есть glossary¶
Первый парадокс: вы загрузили glossary в Google Sheets, рассказали всем о новых терминах, а machine translation всё равно переводит “UI” как “интерфейс пользователя”, “пользовательский интерфейс” и “UI” в одном документе.
Причина предельно проста: disconnected glossary — это не enforcement, это совет. Google Sheets, Confluence, даже Excel в Dropbox — машинный перевод их не видит. Вы видите. Post-editor видит. Machine translation — нет. На результат это не влияет.
По данным исследования ACL (Association for Computational Linguistics), 68% LSP (language service providers), использующих glossaries, хранят их в spreadsheets’ах, отключённых от translation engine’ов. Результат: glossary снижает ошибки на 2-3%, вместо ожидаемых 20-25%.
Второй парадокс: даже integrated glossaries часто ухудшают качество. Объяснение через пример: вы добавили в glossary “Geschäftsrecht” → “коммерческое право”. Machine translation подхватывает это, но когда нужна конструкция “Geschäftsrecht bricht…” (коммерческое право нарушает), система запутается: “kommerceskoe pravo narushayet zakon” или что-то подобное, потом лингвист тратит 5 минут на грамматическое исправление. Результат: glossary enforcement хуже, чем без glossary.
Корень проблемы: нейронная машина перевода не понимает синтаксис вашего языка. Если вы задаёте “коммерческое право” вместо “право”, система зайдёт в конфликт с предыдущей частью предложения. Об этом говорим в третьем разделе.
Как glossary действительно работает (и почему маленький glossary лучше большого)¶
Когда glossary интегрирован (в memoQ, Trados или специализированную платформу), flow выглядит так:
- Pre-translation phase: система строит план перевода (planner pass). Она читает glossary, видит, что “API” → “программный интерфейс”, запоминает это.
- Translation phase: нейронная машина переводит, но “помнит” про glossary. Когда она натыкается на “API”, она не выбирает между “программный интерфейс”, “интерфейс программы” или оставить “API” — она внедряет точный термин или его вариацию.
- Post-translation QA: лингвист проверяет, не нарушены ли термины из glossary.
На практике это дает 15-25% снижение ошибок терминов, но с условием: glossary маленький и точный.
Почему маленький glossary лучше: размер 300 терминов — это отобранные 300 слов, которым вы доверяете и регулярно проверяете. Они часто вызывают ошибки? Они критичны для клиента? Они в glossary. Размер 2000 терминов — это “мы добавили всё, что могли”. Результат: - Машина пытается вписать все 2000 в одно предложение - Ломается грамматика - Лингвист должен выравнивать, поэтому post-editing становится длиннее, а не короче
Команда Phrase даже рекомендует: начните с 100-150 critical терминов. Это даёт 80% качества без риска, что грамматика упадёт.
Как построить glossary с нуля¶
Вот план, который работает на 15+ проектах:
Шаг 1: Term extraction (30-60 минут)
Берите исходный документ (английский оригинал), выгружайте его через term extraction tool или просматривайте вручную: - Какие слова повторяются? (>3 раз в документе) - Какие термины специфичны для этой индустрии? (медицина, юриспруденция, техника) - Какие слова клиент говорит “Нет, мы это называем так”?
Результат: 80-200 кандидатов.
Шаг 2: Clean & prioritize (20-30 минут)
Удалите: - Общие слова (“the”, “be”, “have” — машина знает) - Синонимы (“customer” и “client” — выберите один) - Слова, которые клиент не может запомнить (кроме technical core)
Останется: 120-180 терминов.
Шаг 3: Translate & define (60-120 минут)
Для каждого термина: - Перевод на ваш язык - Короткое определение (1-2 предложения) - Пример контекста (в одну строку)
Например: | EN | RU | Определение | Контекст | |—|—|—|—| | Onboarding | Подключение новых пользователей | Процесс приёма нового пользователя и настройки его учётной записи | The system automates customer onboarding. | | API rate limit | Лимит частоты API | Максимум запросов, разрешённых за единицу времени | Your API rate limit is 1000 requests per minute. |
Шаг 4: Trial run (1 документ)
Загружайте glossary в ваш инструмент (memoQ, Trados, платформа), переведите один документ, проверьте: - Машина применяет термины? - Ломается ли грамматика? - Post-editor тратит меньше времени?
Если нет — сократите glossary вдвое и попробуйте снова.
Шаг 5: Iterate (после каждого проекта)
Какие термины переводит машина неправильно, даже с glossary? Добавьте их в следующий раз или удалите, если они слишком контекстуальны.
Инструменты: сравнение подходов¶
На рынке три типа решений. Вот таблица:
| Подход | Инструмент | Уровень контроля | Цена | Недостатки | Время настройки |
|---|---|---|---|---|---|
| Disconnected glossary | Google Sheets, Excel, Notion | 0% (машина не видит) | Бесплатно | Люди игнорируют, ошибки не снижаются | 30 минут |
| CAT-tool integration | memoQ, Trados, Smartcat | 70% (флагирование, suggesti) | $30-80/месяц на пользователя | Требует в основном ручная проверка, зависит от QA модуля | 3-5 часов |
| Platform enforcement | DeepL API + glossary, ChatsControl, облачные TMS | 90%+ (автоматическое внедрение + QA) | $50-200/месяц | Минусов меньше, но выше барьер входа | 2-4 часа |
Как выбрать? - Малый фрилансер (1-2 проекта в месяц): Disconnected glossary + memoQ free (дисциплина важна). ROI = 0. - Малое агентство (5-10 проектов/месяц): CAT-tool (memoQ или Trados) с integrated glossary + Translation Memory. ROI = 3-6 месяцев. - Medium/large агентство (20+ проектов/месяц): Platform с встроенным enforcement + QA validator. ROI = 1-3 месяца.
Как интегрировать glossary в memoQ (самый распространённый)¶
memoQ — де-факто стандартный инструмент для MTPE в Европе. Вот процесс:
1. Создайте termbases
В memoQ: Workspace → Termbases → New → Bilingual. Назовите “Project_Client_2026”.
2. Добавьте термины вручную или импортом
Вручную (для 100-150 терминов): - Concept - Term EN - Term RU - Definition - Context
Или через CSV:
Concept,English,Russian,Definition
Payment Method,Credit Card,Кредитная карта,Method of payment using a credit card
3. Интегрируйте с проектом
Project settings → Termbases → Assign your termbases. MemoQ теперь: - Подсветит новые термины в документе - Предложит правильный перевод из glossary - Позволит быстро искать по termbases во время edit
4. Настройте QA
Критический шаг. QA модуль проверяет: - Использованы ли все термины из termbases? - Нет ли новых неизвестных вариаций?
Без QA модуля glossary = suggestion, с QA = enforcement.
5. Export и переиспользование
Termbases, созданная для Project A, может быть переиспользована на Project B. Это экономит 80% времени на setup.
Сравнение с другими вариантами: DeepL, Google Translate, CAT-only¶
| Параметр | DeepL glossary | Google Translate | memoQ/Trados | ChatsControl |
|---|---|---|---|---|
| Native glossary support | ✓ (limited) | ✗ | ✓ | ✓ |
| Языковые пары | 6 (EN,FR,DE,IT,ES,JA) | 130+ | Все | ~34 |
| Уровень enforcement glossary | 60-70% | N/A | 80-90% | 90%+ |
| QA validator | ✗ | ✗ | ✓ (опционально) | ✓ (встроен) |
| Bilingual review | ✗ | ✗ | ✓ | ✓ |
| Цена | Бесплатно (API) | Бесплатно | $30-50/пользователь | $50-200 |
| Простота настройки | ⭐⭐⭐ | N/A | ⭐ | ⭐⭐⭐ |
Хорошие практики: как заработать на glossary¶
1. Централизованный glossary на агентстве
Это не project-glossary, а master-glossary: “все термины, которые мы когда-либо использовали”. Когда берёте новый проект, вы не начинаете с нуля — вы берёте известные 70-80% и добавляете новые 20-30%. Экономия времени: 2-3 часа на проект.
2. Версионность и архивирование
Glossary v2.1 (Jan 2026) для проекта X. Glossary v2.5 (Mar 2026) для проекта Y. Если клиент сказал “оставьте ‘API’ как ‘API’, не переводите”, вы это записываете: “API → API (DO NOT TRANSLATE)”. Следующий переводчик это знает.
3. ROI calculation
Время на подготовку glossary: 3-5 часов. Время, сэкономленное на первом проекте: 30-60 минут (post-editor быстрее). Время, сэкономленное на втором: 45-90 минут (меньше поисков). На третьем: glossary окупается.
Если агентство имеет 20 проектов в год, ROI = 600-1200 часов. По $30/час = $18-36K экономии. Setup — $500 (инструмент). Это хорошая справка.
4. Договор с клиентом
Когда клиент говорит “моя терминология критична”, это должно стоить дополнительно. Предложение: - Glossary creation: 2-4 часа = $60-120 - Glossary integration: 1 час = $30 - Enforcement на каждый проект: базовая ставка + 10%
Честно и понятно — клиенты платят, потому что знают, что это улучшает качество.
Типичные ошибки (и как их избежать)¶
Ошибка 1: Glossary без контекста
Вы добавили “Bank” → “Банк”. Но в документе “Bank of England”, “bank account”, “riverbank” — в каких из них это glossary? Результат: машина запутается, грамматика упадёт.
Решение: каждый термин должен иметь контекст и определение.
Ошибка 2: Glossary без регулярного обновления
Первые 6 проектов — glossary часто обновляется. Потом люди забывают. Glossary устаревает. За месяц вы добавили 15 новых терминов, которых нет в glossary — они снова непостоянны.
Решение: ежемесячно (минимум ежеквартально) просматривать ошибки с post-editing и добавлять новые термины.
Ошибка 3: Glossary без QA
Вы интегрировали glossary, но не настроили QA проверку. Результат: люди игнорируют флагирование. Post-editing длится как без glossary.
Решение: QA-модуль ДОЛЖЕН быть обязательным шагом перед доставкой. Контрольно-пропускной пункт.
Ошибка 4: Слишком большой glossary (со всем подряд)
Вы добавили 5000 терминов. Machine translation теперь пытается вписать ВСЕХ в каждое предложение. Результат хуже, чем без glossary.
Решение: начните с 100-150 critical терминов. Добавляйте новые, когда они действительно вызывают ошибки.
Как контролировать consistency без glossary (если вы не можете)¶
Если вы работаете с Google Translate или платформой без glossary enforcement, есть manual checks:
Post-editing checklist: 1. Первое появление каждого ключевого термина запомните. 2. Потом ctrl+F по документу — переведённый термин должен быть идентичным везде. 3. Если вы нашли 3+ варианта одного термина — переписывайте.
Это занимает 5-10% времени на edit, но это считается.
QA tools: - Linguistic tools (Antidote, LanguageTool) имеют базовые проверки. - memoQ Free Edition имеет ограниченную QA (лучше, чем ничего).
FAQ¶
У вас были вопросы после прочтения — вот ответы.
Правда ли, что glossary улучшает качество машинного перевода?
Да, но при условии правильной интеграции. Disconnected glossary (в Google Sheets) = игнорируется. Интегрированный в платформу glossary автоматически применяется. На практике — 15-25% снижение ошибок терминов, если glossary содержал 100-200 терминов.
Сколько терминов должно быть в glossary?
Начните с 100-150 critical терминов (самых частых ошибок). Большой glossary (1000+) часто ухудшает качество машинного перевода, потому что система конфликтует с грамматикой. Лучше маленький, точный glossary, чем всеохватывающая база без качества.
Можно ли использовать glossary в DeepL или Google Translate?
DeepL поддерживает glossaries в ограниченных языковых парах (EN, FR, DE, IT, ES, JA). Google Translate не имеет native glossary support. Для полного контроля нужны CAT-инструменты или специализированные платформы.
Как часто обновлять glossary?
Ежемесячно просматривать ошибки с post-editing и добавлять новые термины. Ежеквартально архивировать устаревшие термины. Glossary без обновления теряет ценность за полгода.
Избавит ли нас glossary от CMS или управления проектом?
Нет. Glossary + TM + QA — это контроль качества, не менеджмент. По-прежнему нужна координация людей, дедлайны, версионирование. Инструменты только автоматизируют повторы.
Нас 2-3 переводчика, есть ли смысл настраивать glossary?
Да. Даже малому агентству glossary сохраняет consistency между проектами, облегчает onboarding новых людей и повышает качество. ROI окупается быстрее из-за меньшей инерции.
Как ChatsControl может помочь¶
Если вы ищете инструмент для MTPE со встроенной enforcement терминологии, ChatsControl предлагает:
- Translation brief с terminology: перед переводом вы можете задать preferred термины, style и контекст. AI применяет это на всех этапах (plan → translate → self-check).
- Bilingual review: вы видите оригинал и перевод одновременно, что упрощает проверку консистентности термов.
- Built-in QA validator: отдельный инструмент проверяет термины, числа, имена на ошибки, даже если перевод готов.
- Pricing: от free tier (для проб) до платных top-ups за объём. Нет подписки, платите за то, что используете.
ChatsControl подходит для фрилансеров, которые хотят быстрого MTPE без покупки CAT-tool лицензии, и для малых агентств, которым нужна скорость и качество.
Вывод¶
Консистентная терминология при MTPE не является опциональной — это основа качества. Система, которая объединяет glossary + integrated CAT-tool или platform + регулярное обновление, снижает ошибки на 80-90% и экономит 10-15% времени на edit. ROI окупается за 2-3 проекта.
Начните с малого: 100-150 critical терминов, интегрируйте в memoQ или Trados, настройте QA. Потом масштабируйте.