MT качество: как автоматические системы помечают плохие сегменты

Что такое quality estimation для машинного перевода? Как она помогает переводчикам сократить время на MTPE, и что действительно может (и не может) автоматическая оценка качества.

Также: RU EN UK
MT качество: как автоматические системы помечают плохие сегменты

Сценарий: 5000 сегментов, треть плохая

Представь: ты получил машинный перевод документа на 5000 сегментов. MTPE по стандарту — это проверка каждого сегмента, минимум 3-5 минут на небольшое редактирование. 5000 × 5 минут = 417 часов. Твой дедлайн — в конце недели.

Реальность: не весь материал требует внимания. 30-40% уже почти идеально, не нуждается в изменениях. 50% нужна легкая правка (слово заменить, грамматику поправить). И только 10-20% — радикальные ошибки, которые переводчик не смог исправить.

Если ты вручную будешь рассматривать все подряд, потратишь время на то, что уже хорошо. Если бы можно было автоматически пометить “хорошие” сегменты и пропустить их — люди смотрели бы только 50-60% контента, а дедлайн становился реальным.

Это и делает quality estimation.


Что такое Quality Estimation (QE)

Quality Estimation (сокращенно QE или MTQE) — это поле машинного обучения, которое предсказывает качество машинного перевода БЕЗ ссылки на человеческий эталонный перевод.

Деталь, которая меняет все: традиционные метрики оценки (BLEU, METEOR, chrF) требуют эталонного перевода для сравнения. Они отвечают на вопрос “Насколько этот перевод близок к тому, что написал человек?”. А QE отвечает на другой вопрос: “Хорош ли этот перевод, независимо от того, как бы его писал человек?” — только на основе исходного и машинного текста.

На практике QE анализирует перевод через призму типичных ошибок: пропущенные слова, неправильная грамматика, несовпадение имен, ошибки в структуре. Система вучается на миллионах аннотированных сегментов и учит себя предсказывать качество для новых текстов.

Ключевое отличие: когда действительно нужна QE

QE абсолютно необходима в трех сценариях:

  1. On-the-fly (в реальном времени). Тебе нужна оценка качества прямо сейчас, в момент перевода, а эталонного перевода еще нет и не будет. Идеально для live-контента, постоянно поступающих документов.

  2. На массивных объемах. Когда у тебя есть 50K сегментов, и каждый просмотр стоит человеческой работы в 2 евро, необходимо автоматически сортировать контент — экономия в тысячи евро.

  3. Поиск “иголки в сене”. Когда нужно не оценить каждый сегмент на 100%, а просто захватить самые худшие 10-20% и сконцентрироваться там.


Как Она Действительно Работает

На поверхности: система берет исходный текст + машинный перевод → выдает оценку качества (число от 0 до 1, или бинарный флаг OK/BAD).

Внутри — это ML-модель, которая обучена распознавать паттерны ошибок. Исторически развитие шло так:

Первый способ: Ручные признаки (2000-е годы)

Эксперты определяли “лингвистические признаки” — вещи, которые часто означают ошибку в переводе: - Длина перевода отличается от оригинала на >20% (может быть пропуск слова) - Неизвестное слово из исходного текста в переводе (может быть расхождение в словаре) - Подозрительные грамматические паттерны (например, два глагола подряд в некоторых языках)

Система складывала эти “счетчики” и выдавала оценку. Просто, но часто неточно — если счетчики не учитывали контекст, случались ошибки.

Современный способ: Neural Networks (2018-2024)

Вместо того чтобы вручную писать счетчики, система учится лучшим представлениям сама.

Процесс (упрощенно): 1. Исходный язык кодируется в числовые векторы через multilingual BERT или XLM-R (эти модели уже знают 100+ языков). 2. Перевод также кодируется в векторы. 3. Специальная нейросеть (часто Transformer или RNN) сравнивает эти векторы и предсказывает качество.

Навык модели: она обучена на миллионах (исходный текст, перевод, оценка качества) триплетов. Она учится, что “когда векторы сильно расходятся, часто бывают ошибки”, “когда части исходного текста полностью исчезли в переводе — значит пропуск” и так далее.

Результат: 70-85% точности на знакомых доменах (новости, туристические гайды) и ниже на нишевом контенте (медицина, юриспруденция), где слова означают иное.

Немного новший способ: Unsupervised QE

В 2020-х исследователи придумали, как оценивать качество БЕЗ каких-либо обучающих данных с аннотациями. Метод: “back-translation” — переводят результат обратно в исходный язык, сравнивают с оригиналом. Если они близки — значит перевод выглядит хорошо.

Плюс: не требует аннотированных данных. Минус: медленнее (два перевода) и ниже точность.

Адаптивная QE: обучение на лету

ModernMT и некоторые другие платформы пошли дальше: вместо использования одной глобальной модели, они тренируют отдельную модель для каждого клиента, на его собственных данных.

Метод: система получает перевод, делает оценку; затем человек проверяет и поставляет коррекцию. Система обновляет модель на этой обратной связи. Через 1000-2000 сегментов модель уже адаптирована под конкретный домен, терминологию и стиль клиента.

Эффект: при адаптивной QE система может ловить 90% серьезных проблем, просматривая только 20% сегментов, тогда как общая модель ловит 60% проблем в 40% контента.


Уровни Оценки: Слово, Фраза, Сегмент

Quality Estimation не обязательно одна оценка на весь сегмент. Она работает на трех уровнях:

Sentence-level (Segment-level) QE

Одна оценка на весь сегмент: “Хороший перевод (0.85) или Плохой (0.22)?”

Когда используют: при сортировке контента в режиме “auto-approve vs manual edit”. Если оценка >0.75, сегмент идет прямо в продакшн, <0.5 — на ручную проверку.

Пример: “The organization has approved the budget.” → “Организация утвердила бюджет.” → Оценка: 0.88 (хороший, позволяет auto-approve).

Word-level (Word-level) QE

Для каждого слова в переводе: OK (это слово верно) или BAD (ошибка).

Когда используют: при MTPE, чтобы переводчику сразу показать, на какие слова обращать внимание. Не нужно читать весь сегмент, вот красные флаги и готово.

Пример:

Original: "The meeting is scheduled for Tuesday morning."
Translated: "Встреча запланирована на вторник утро."
            [OK]         [BAD - нужно "утром"]     [OK]

Переводчик сразу видит: слово “утро” требует поправки (добавить “м”, выбрать правильную форму).

Span-level (Error Span) QE

Новое направление исследований (WMT 2023+): не просто “слово OK/BAD”, а точные координаты ошибки и тип ошибки.

Это дает: не просто красный флаг, а объяснение того, что именно не так и какая ошибка.

Пример:

Translated: "The company has approved the purchase."
Error span: [13:21] (слово "purchase")
Error type: "mistranslation" (нужно "закупку", не "покупку")
Severity: "major"

Как Это Помогает MTPE-Workflow

MTPE (Machine Translation Post-Editing) — это процесс, когда переводчик берет машинный перевод и исправляет ошибки. Традиционно:

  1. Перевод (машина) → Проверка (человек вручную читает каждый сегмент) → Правка → Финализация.

Скорость: 250-500 слов в час, в зависимости от качества MT.

С QE уже так:

  1. Машинный перевод → Quality Estimation считается (0.1 сек на сегмент)
  2. Сортировка: High QE → auto-approve, Low QE → manual review
  3. Человек редактирует только low-QE сегменты → работы намного меньше
  4. High-QE сегменты идут прямо в продакшн

Практические цифры (из исследований 2024): - Без QE: 100% сегментов требуют человеческой проверки, 40 часов на 5000 сегментов - С QE: 50-60% сегментов auto-approved, только 40-50% вручную, 22-25 часов на те же 5000

Сокращение времени: 15-20 часов на 5000 сегментов = 37% сокращение времени.

Сокращение денег: если редактор стоит €25/час, это €425-500 меньше на один проект.

На масштабе (50 проектов/месяц) = экономия €20K-25K в месяц.


Реальные Сценарии & Кейсы

Кейс 1: Локализация игры (среднее качество MT)

Игра на 80K слов, переведена на 12 языков через нейросеть. Некоторые языки хорошие (французский, испанский — мало ошибок), некоторые хуже (японский — странные структуры предложений).

Без QE: 60 часов редактуры × 12 языков = 720 часов = 1 человек на 4.5 месяца.

С QE: система помечает 40% сегментов как high-quality (игровые фразы не меняются, формулы не меняются), 60% требуют правку. - High-QE auto-approved: 32K слов × 12 = 384K слов сокращено - Manual edit: 48K × 12 = 576K слов - Времени: 34 часа × 12 = 408 часов = 2.5 месяца

Экономия: 3 месяца работы 1 человека, или 1 месяц работы 3 человек.

Кейс 2: Техническая документация (лучшее качество MT)

Документация 20K слов, только английский → немецкий. MT уже хороший, очень мало ошибок.

Без QE: 15 часов редактуры (кажется немного времени, но его надо считать, так как каждый сегмент нужно проверить)

С QE: система видит, что 85% сегментов уже хорошие (технические термины, форматы, мало нарратива). Ручная проверка не обязательна — можно просто быстро просмотреть. - High-QE сегменты: 17K слов (просмотр на разум, не по словам) - Low-QE сегменты: 3K слов - Времени: 2-3 часа + 10 минут на быстрый просмотр

Экономия: 12-13 часов. На небольших проектах это весомо.

Кейс 3: Адаптивная QE на постоянного клиента

Клиент — медицинское издательство, каждый месяц 50K слов материалов. MT очень хороший, медицинское озеро уже изучено, но есть домена-специфичные ребра (например, названия препаратов, не переводятся).

Месяц 1 (генеричная QE): система ловит 60% ошибок, 40% пропускает.

Месяц 3 (адаптивная QE): модель уже обучена на 150K слов клиента, система ловит 90% ошибок, только пропускает редкие новые термины, которых не было в данных.

Эффект: обнаружение ошибок близко к человеческой точности, редакторам действительно нужно смотреть только на помеченный контент, не быть параноиком.


Ограничения & Когда QE Не Помогает

То, что она действительно не делает:

1. Не ловит семантические ошибки

Если перевод механически верен (правильная грамматика, все слова на месте), но смысл потерян, QE часто пропустит.

Пример:

Original: "We rejected the proposal."
Translated: "Мы отклонили предложение." (OK по грамматике)
Но если имеется в виду: "Мы отклонили предложение" (более природно),
QE видит форму и может не заметить.

Для этого требуется более глубокое понимание контекста, которое дается человеку.

2. Не работает на рукописные и очень старые сканы

QE тренируется на “чистом” тексте. Если вход — скан рукописного документа или 50-летний архив с нечеткостью, OCR уже дает ошибки, QE работает на мусоре и выдает мусор.

3. Точность падает на новых, нишевых доменах

Если тренировка на новостях и документации, а вы применяете ее на поэтические тексты или специализированную юридическую терминологию — точность падает на 10-15%.

4. Требует качественных данных для тренировки

Supervised QE (самая точная) требует 2000-10000 аннотированных сегментов. Если аннотации плохие (аннотатор ленивый или не эксперт), модель хуже.

5. Не заменяет человека на критичном контенте

Контракты, медицинские инструкции, государственные документы — QE может помочь, но финальная проверка человека обязательна. Алгоритм ошибок не гарантирует.


FAQ

Чем quality estimation отличается от BLEU и метрик оценки?

BLEU, METEOR, chrF сравнивают перевод с эталонным (reference) и требуют человеческого перевода для сравнения. QE предсказывает качество БЕЗ эталонного перевода — только из исходного и машинного. QE работает on-the-fly, BLEU — только как post-hoc анализ.

Насколько точна automatic quality estimation на практике?

Современные neural QE системы достигают 70-85% точности на знакомых доменах. Однако на новом контенте или нишевых языках точность падает на 10-15%. Чаще всего QE используют как сортировку (флаг, а не окончательная оценка).

Заменит ли QE человеческую работу при MTPE?

Нет. QE сокращает время человека, направляя его туда, где он нужен больше всего — на низкокачественные сегменты. Полная автоматизация без текущей проверки опасна для критичного контента.

Какие данные нужны QE системе для обучения?

Зависит от подхода. Supervised QE требует 2000-10000 аннотированных сегментов с оценками качества. Unsupervised QE (новый метод) работает без аннотаций, но менее точна. Adaptive QE учится на лету из данных клиента.

Будет ли QE ловить смысловые ошибки (неправильный перевод значения)?

Современная QE лучше ловит механические ошибки (пропущенные слова, неправильная грамматика). Для семантических ошибок (потеря смысла предложения) точность ниже. Поэтому QE в комбо с человеческой проверкой.


Заключение

Quality Estimation — это не магия и не замена человеческой проверке. Это инструмент для разумного распределения работы: машина говорит “этот сегмент хороший, пропусти”, и человек фокусируется на действительно проблемных местах.

На практике QE сокращает время MTPE на 20-35%, позволяя редакторам смотреть не на весь контент, а на 40-50% худших сегментов. Для проектов с 50K+ слов экономия измеряется днями работы и тысячами евро.

Ограничения реальны: QE не ловит семантику, не работает на сканах, требует качественных данных. Поэтому она лучше всего работает в комбо: AI делает первый pass, человек делает финальную проверку.

Если ты в MTPE-workflow и еще не попробовал QE — стоит. Если ты менеджер проекта и думаешь, что MTPE всегда это 100% просмотр контента — переосмысли. Есть лучший способ.

Попробуйте ChatsControl

AI-платформа для профессиональных переводчиков

Попробовать бесплатно →