Цена перепечатки сканов: где бюро теряет маржу

Разбираем скрытую себестоимость перевода сканов: OCR, ручная сверка, подсчёт слов, форматирование и контроль качества. Схема расчёта для агентства.

Также: EN UK RU
Цена перепечатки сканов: где бюро теряет маржу

Реальная цена перепечатки сканов: где исчезает маржа бюро

Клиент присылает скан договора, просит перевод по цене за слово и ждёт смету к обеду, а менеджер пока не знает, сколько в файле текста и сколько времени уйдёт на таблицы. Здесь и начинается разрыв между выручкой по проекту и его реальной себестоимостью.

Для бюро переводов скан - не просто документ, который нужно «пропустить через распознавание». Сначала приходится выяснить, что именно есть в файле, затем извлечь текст, проверить его по изображению, разобраться с форматом и только после этого передать материал переводчику. Если эти задачи не отражены в смете или внутреннем учёте, работа съедает маржу незаметно.

Речь не о том, что OCR всегда невыгоден или что ручная перепечатка всегда нужна. Вопрос в другом: какой объём работы остаётся после распознавания и кто за него платит - клиент или бюро.

Что именно называют перепечаткой скана

Сканированный документ - это изображение страницы, а не готовый текстовый файл. OCR (оптическое распознавание символов) превращает изображение в текст, который можно искать, копировать, считать и передавать в последующие этапы обработки. Такое определение даёт экспертный материал о рисках OCR, размещённый на сайте Европейского совета по защите данных (EDPB).

На практике слово «перепечатка» часто скрывает несколько разных задач:

  • получить изображение в читаемом виде и проверить, все ли страницы на месте;
  • распознать текст или набрать его вручную;
  • исправить ошибки распознавания;
  • восстановить порядок абзацев, списков и таблиц;
  • выделить текст, который не нужно переводить;
  • определить объём исходного текста;
  • сохранить сведения о печатях, подписях, рукописных пометках и расположении блоков;
  • подготовить файл, пригодный для перевода и проверки.

Эти задачи не одинаковы по трудоёмкости. Ровная страница с печатным текстом и контрастными буквами может хорошо поддаваться распознаванию. Фотография под углом, мелкий шрифт, блики, перекос, сложная таблица или рукописная пометка создают дополнительную работу даже в том случае, если программа выдала текстовый файл.

Полезно различать три результата. Первый - изображение, из которого текст ещё нельзя посчитать или передать в обычный рабочий процесс. Второй - сырой OCR-текст, который может содержать пропуски, перестановки и неверные символы. Третий - проверенный исходный текст с понятной структурой, который можно передать переводчику. Оплачивать клиент может перевод, подготовку скана или оба этапа, но внутренний учёт должен показывать, где именно потрачено время.

Для расчёта помогает разложить работу на операции, а не на одно общее поле «скан»:

Операция Что проверять Почему возникает расход
Приём и разбор файла Страницы, ориентация, качество, язык Нужно понять, пригоден ли файл для автоматического распознавания
OCR или ручной набор Полнота и читаемость текста Распознавание не равно подтверждённому тексту
Вычитка по изображению Цифры, имена, даты, отрицания, знаки Ошибка в этих местах может изменить смысл
Восстановление структуры Таблицы, колонки, заголовки, сноски Плоский текст часто теряет порядок чтения
Подсчёт объёма Правила включения повторов, печатей, пустых полей Без единой методики смета и фактическая работа расходятся
Передача в перевод Инструкции, справочные файлы, пометки Переводчику нужны не только символы, но и контекст

Перепечатка скана - это подготовка изображения в проверенный текст и рабочую структуру, потому что переводчику и менеджеру недостаточно получить случайный набор символов. Если в смете есть только количество слов, но нет подготовительных операций, часть проекта остаётся неоплаченной.

Как формируется себестоимость до начала перевода

Классическая тарификация по словам делает оценку скана неудобной: до распознавания исходный объём не всегда доступен, а после распознавания цифра ещё требует проверки. По отчёту Slator за 2024 год, оплату по исходному или целевому слову использовали 91% опрошенных поставщиков языковых услуг (Slator). Для агентства это означает, что ошибка в количестве слов может повлиять не только на счёт клиенту, но и на планирование загрузки переводчика.

Та же страница приводит результаты опроса лингвистов за 2024 год: 77% опрошенных получали оплату за исходное слово, а 13% - за целевое слово (Slator). Эти показатели описывают результаты конкретного опроса, а не правило для каждого рынка или каждого договора. Но они показывают, почему подсчёт исходного текста остаётся важной частью коммерческого процесса.

Перевод по слову - не единственная модель. В отчёте Slator за 2024 год 14% опрошенных поставщиков языковых услуг указывали оплату за документ, а 64% - почасовую оплату за отдельные виды работ (Slator). Почасовая строка может быть полезна для подготовки материалов, если агентство заранее объясняет клиенту, какая именно работа считается отдельной услугой.

Для проекта со сканом удобно считать себестоимость по этапам:

  1. Приём и сортировка. Зафиксируйте, сколько страниц поступило, какие из них читаются, есть ли повторы, пустые листы или приложения.
  2. Распознавание и подготовка. Отметьте, что сделала программа, а что пришлось выполнять вручную.
  3. Проверка. Учтите время на сверку OCR с изображением, включая отдельную проверку критичных данных.
  4. Определение объёма. Зафиксируйте метод подсчёта: исходные слова, символы с пробелами, страницы или фиксированную стоимость подготовки.
  5. Восстановление структуры. Запишите дополнительную работу с таблицами, многостолбцовой версткой и подписью к иллюстрациям.
  6. Передача и контроль. Учтите работу менеджера, проверку комплектности и устранение вопросов переводчика по исходнику.

Внутренняя формула может выглядеть так:

Себестоимость подготовки = время на приём файла + время на OCR или набор + время на сверку + время на восстановление структуры + время на передачу и контроль.

Если агентство переводит работу в денежный эквивалент через внутреннюю часовую ставку, каждый участок можно умножить на ставку сотрудника, который его выполняет. Здесь не нужна единая отраслевая цифра: у разных бюро отличаются зарплаты, процессы, инструменты и правила учёта. Важно, чтобы одна и та же операция не исчезала из модели лишь потому, что её выполняет менеджер, а не переводчик.

Доход по проекту тоже нужно разложить: перевод, подготовка исходника, верстка или иные согласованные работы. Затем сравните доход с прямыми затратами и временем сотрудников. Низкая цена подготовки может казаться удобной для продажи, но если сотрудник тратит на неё часы без отдельной строки в смете, бюро оплачивает этот этап из маржи перевода.

При оценке объёма можно использовать методы подсчёта слов в сканированном PDF. Отдельный разбор себестоимости слова в переводе помогает увидеть, как к ставке переводчика добавляются расходы на управление проектом и контроль качества.

Важно не смешивать две величины: прогноз времени и подтверждённые трудозатраты. Прогноз нужен для сметы, фактическое время - для проверки, насколько прогноз совпал с реальной работой. Если агентство не записывает фактические затраты, оно не сможет понять, на каких типах сканов подготовка стабильно выходит за пределы заложенного бюджета.

OCR ускоряет набор, но не отменяет проверку

OCR превращает изображение в текст, но качество распознавания зависит от входного файла и особенностей страницы. Google Cloud Document AI описывает распознавание структуры документа на уровне блоков, абзацев, строк, слов и символов, а также работу с PDF и изображениями (Google Cloud). Для рабочего процесса это полезно: системе можно поручить не только извлечение букв, но и распознавание расположения текста.

Та же документация перечисляет оценку качества изображения, исправление поворота, определение языка и выбор диапазона страниц среди функций OCR. Оценка качества страницы включает восемь характеристик, в том числе размытие, слишком мелкий шрифт и блики (Google Cloud). Такие признаки можно использовать как сигналы для дополнительной проверки, но они не заменяют чтение результата по оригиналу.

Amazon Textract описывает оценку уверенности OCR по шкале от 0 до 100. Документация формулирует смысл так: «Оценка уверенности - это число от 0 до 100, которое показывает вероятность правильности данного предсказания» (Amazon Textract). Иными словами, оценка относится к предсказанию системы, а не служит сертификатом точности всего файла.

Порог для ручной проверки нужно выбирать с учётом последствий ошибки. AWS приводит финансовые решения как пример сценария, в котором может быть уместен порог 90% или выше (Amazon Textract). Документация не называет этот пример универсальным стандартом: агентству нужно оценить собственный тип проекта, последствия и правила клиента, а не переносить число в договор без анализа.

Вычитка OCR должна быть организована по риску, а не только по удобству. В первую очередь проверяйте:

  • фамилии, имена и названия организаций;
  • даты и номера документов;
  • суммы, валюты, проценты и единицы измерения;
  • отрицания и знаки, меняющие смысл;
  • нумерацию разделов и перекрёстные ссылки;
  • заголовки и порядок колонок;
  • строки и столбцы таблиц;
  • текст в печатях, сносках и мелких примечаниях.

У ошибки могут быть разные последствия. Пропущенный декоративный элемент и неверно распознанная сумма не относятся к одному уровню риска. Поэтому контроль лучше строить так: автоматические сигналы помогают найти подозрительные места, а специалист сверяет их с изображением и принимает решение по контексту.

В рекомендациях AWS говорится, что подходящий порог уверенности зависит от сценария использования, а пример с финансовыми решениями предполагает порог 90% или выше (Amazon Textract).

Для бюро практический смысл здесь не в том, чтобы объявить все строки ниже выбранного порога неверными. Смысл - направлять на ручную проверку места, где цена ошибки высока, и не считать показатель OCR заменой редакторского решения.

Ручной набор не избавляет от контроля. Сотрудник также может пропустить строку, неверно прочитать цифру или перенести таблицу не в том порядке. Сравнивать следует не «безошибочную перепечатку» с «неидеальным OCR», а два процесса подготовки с их временем, проверками и характерными ошибками.

Подробнее о том, как OCR работает со сканами и где у него ограничения, полезно прочитать до того, как агентство выбирает единый процесс для всех типов файлов. Условия входа тоже имеют значение: AWS рекомендует качественное изображение и указывает, что для изображения идеальным считается разрешение не ниже 150 DPI (Amazon Textract). Такая рекомендация относится к документации AWS и не обещает одинакового результата на любом скане.

Где ручная перепечатка действительно нужна

Автоматизация полезна, если она сокращает повторяющийся набор и оставляет человеку понятную задачу: проверить спорные места, восстановить структуру и подтвердить текст. Ручной набор становится оправданным, когда качество изображения мешает распознаванию или цена ошибки слишком велика для выборочной проверки.

Типовой пример - скан договора с печатным текстом и простой версткой. OCR может подготовить черновой текст, а специалист сверяет имена, даты, суммы и абзацы, после чего передаёт файл переводчику. Здесь задача не в том, чтобы вручную повторить каждый символ, а в том, чтобы обнаружить ошибки до перевода и не заставлять переводчика разбираться с нечитабельным исходником.

Иная ситуация - фотография документа, снятая под углом, с бликами и мелкой печатью. Распознавание может перепутать символы, нарушить порядок строк или пропустить фрагмент. Если сотрудник вынужден сверять каждую строку и исправлять каждую страницу, экономия на автоматическом наборе может исчезнуть. Агентству нужно сравнить фактическое время, а не предполагать, что любой OCR быстрее.

Особенно внимательно стоит оценивать таблицы. AWS предупреждает, что извлечение таблиц может быть непоследовательным, если ячейки объединены через несколько колонок или если отдельные строки, ячейки и столбцы отличаются от остальной таблицы; в качестве обходного подхода документация предлагает обнаружение текста (Amazon Textract). Обнаруженный текст всё равно потребуется расположить в правильном порядке и проверить связь между значением и заголовком.

Рукописные вставки требуют отдельного решения. Даже если сервис распознаёт часть рукописного текста, агентству нужно подтвердить, что нужный язык, шрифт и качество поддерживаются в выбранной конфигурации. Если прочитать запись по изображению нельзя, угадывать её при подготовке исходника опасно: переводчик не должен получать догадку, замаскированную под текст оригинала.

Когда ручной набор может оказаться выгоднее

Ручная подготовка может быть разумнее, если специалист быстрее восстановит небольшой фрагмент, чем будет исправлять множество ошибок распознавания. Важно записать причину выбора: нечитаемый участок, сложная таблица, нестандартный порядок чтения или отсутствие подходящей поддержки языка.

Ручной набор также полезен как способ работы с конкретным проблемным фрагментом, а не обязательно со всем документом. Если основная часть страниц распознаётся нормально, а одна страница содержит рукописные пометки и таблицу, можно направить на ручную обработку только её. Выборочный подход снижает риск оплачивать ручную перепечатку там, где OCR уже дал проверяемый результат.

Когда автоматизация не должна означать автоматическое принятие результата

Успешное завершение обработки не означает, что текст можно сразу отправлять переводчику. Распознавание отвечает на вопрос «какой текст система извлекла?», а проверка - «соответствует ли извлечённое изображению и задаче?». Эти этапы нельзя объединять в один флажок «обработано».

Внутреннее правило может описывать три маршрута: автоматическое распознавание с обычной вычиткой, усиленная проверка для сомнительных страниц и ручная обработка фрагмента, который не удаётся надёжно извлечь. Для каждого маршрута зафиксируйте, кто принимает решение, как помечаются сомнительные места и кто отвечает за окончательную сверку.

Скрытые расходы: структура, управление и приватность

Подготовку скана часто оценивают только по работе с текстом. Между тем менеджер может тратить время на согласование непонятного объёма, запрос повторных страниц, уточнение языка и передачу ограничений переводчику. Расход появляется не потому, что кто-то «работал медленно», а потому что проект включает больше операций, чем видно в исходной ставке.

Форматирование - один из таких расходов. Текст из двух колонок может превратиться в строку с перемешанным порядком чтения. Таблица может потерять связь между заголовками и значениями. Печать, подпись, сноска или отметка на полях могут содержать текст, который нужно перевести, описать или оставить без изменений. Решение зависит от задания клиента, поэтому менеджеру важно зафиксировать его до передачи файла.

При оценке перевода Slator отмечает, что в смете могут учитываться объём и сложность проекта, локализация графики и предполагаемая работа с форматированием (Slator). Для сканов тот же принцип применим к подготовке исходника: количество слов не всегда показывает всю работу, необходимую для аккуратного результата.

Ещё одна зона затрат - повторная работа. Переводчик обнаруживает, что часть строки пропущена; менеджер возвращается к исходнику; исправленный текст снова передаётся в проект; затем кто-то проверяет, не изменились ли связанные фрагменты. Учёт одного только времени OCR не покажет этот цикл. В журнале проекта полезно фиксировать, на каком этапе обнаружена проблема и почему она не была поймана раньше.

Пример для внутреннего разбора можно составить без выдуманных тарифов. Возьмите реальный проект бюро и запишите отдельными строками фактическое время на приём файла, распознавание, проверку, исправление таблиц, подсчёт и коммуникацию. Затем сопоставьте его со сметой и доходом по подготовке и переводу. Так станет видно, была ли потеря связана с недооценённым объёмом, неоплаченным этапом или повторной работой.

Персональные данные нельзя считать технической мелочью

Сканы могут содержать имена, адреса и номера удостоверений личности. Европейская комиссия указывает, что персональные данные - это информация об идентифицированном или идентифицируемом живом человеке, и приводит имена, адреса и номера удостоверений личности как примеры (Европейская комиссия).

Сбор, запись, организация, хранение, изменение, поиск, использование и уничтожение данных входят в определение обработки по описанию Комиссии со ссылкой на статьи 2 и 4(2) GDPR (Европейская комиссия). Поэтому загрузка скана в OCR-систему может быть частью обработки персональных данных, а не только выбором удобной технической функции.

Псевдонимизация не всегда выводит документ из сферы защиты данных. Европейская комиссия поясняет, что информация, по которой человека всё ещё можно повторно идентифицировать, остаётся персональными данными (Европейская комиссия). Если при подготовке файла бюро скрывает часть сведений, но сохраняет ключ, позволяющий восстановить личность, это само по себе не отменяет необходимости разобраться с применимыми правилами.

Комиссия также описывает различие между контролёром, который определяет цели и способы обработки, и обработчиком, который действует по документированным указаниям контролёра (Европейская комиссия). Роль агентства зависит от фактических решений и договоров. Одной фразы в процессе «клиент прислал файл» недостаточно, чтобы определить обязанности всех участников.

Экспертный проект, размещённый на сайте EDPB, отдельно рассматривает риски конфиденциальности и защиты данных при закупке, разработке и использовании OCR и систем распознавания именованных сущностей (EDPB). На странице уточняется, что отчёт подготовили внешние подрядчики и он не является официальной позицией EDPB. Использовать его стоит как указание на существование вопросов для оценки, а не как самостоятельное юридическое заключение.

Перед включением внешнего OCR-сервиса в рабочий процесс агентству стоит проверить, какие документы туда загружаются, кто имеет к ним доступ, какие условия хранения применяются и как файл удаляется. Требования клиента, договоры и применимые правила обработки нужно анализировать отдельно. Этот этап тоже требует времени и не исчезает из себестоимости только потому, что происходит до распознавания.

Практический процесс: считать не страницы, а работу

Простой рабочий процесс помогает не обещать клиенту точный объём до проверки и не перекладывать весь риск на переводчика. Отправная точка - прозрачная разница между черновым результатом OCR и текстом, который уже прошёл проверку.

  1. Зафиксируйте исходные материалы. Запишите количество полученных файлов, вид документа и наличие изображений, таблиц или приложений. Не считайте повторные и пустые страницы полноценным текстовым объёмом без основания.
  2. Проверьте качество. Отметьте перекос, размытие, мелкий шрифт и блики. Документация Google Cloud описывает эти характеристики среди измерений качества изображения (Google Cloud).
  3. Выберите способ подготовки. Используйте OCR там, где он даёт материал для проверки; направляйте слабые страницы или фрагменты на дополнительную обработку. Рекомендации AWS по входному качеству включают ориентир не ниже 150 DPI для изображения (Amazon Textract).
  4. Подсчитайте предварительный объём. Укажите, что подсчёт относится к полученному тексту и может измениться после сверки с изображением.
  5. Проверьте критичные сведения. Сравните имена, даты, суммы, номера и таблицы с оригиналом; зафиксируйте спорные места вместо молчаливого исправления.
  6. Согласуйте границы работ. Разделите перевод, подготовку исходника и форматирование в смете или договорённости с клиентом.
  7. Сохраните фактические затраты. Запишите время каждого этапа и причину повторной работы. Используйте записи для будущих оценок, а не как доказательство того, что все документы одного типа одинаковы.

Короткий шаблон для менеджера проекта можно оформить прямо в карточке заказа:

Поле учёта Что записать
Файл и версия Название полученного документа и дата поступления
Состояние скана Читаемость, ориентация, блики, мелкий шрифт
Структура Таблицы, колонки, печати, подписи, рукописные фрагменты
Подготовка OCR, ручной набор или сочетание методов
Проверка Кто сверил файл и какие участки проверялись отдельно
Подсчёт Метод и объём после согласованной проверки
Дополнительная работа Восстановление структуры, верстка, повторная обработка
Данные и доступ Требования клиента и согласованный способ передачи

Эта форма не устанавливает тариф и не заменяет договор. Она позволяет сравнить похожие проекты по одинаковым признакам. Когда в учёте есть качество входного файла, структура и фактическое время, менеджеру проще объяснить, почему смета для двух документов с одинаковым числом страниц может отличаться.

Для более широкого контекста можно посмотреть разбор подготовки сканированного PDF в Word перед переводом. Перенос в редактируемый файл решает задачу доступа к тексту, но сам по себе не подтверждает, что слова, порядок строк и таблицы совпадают с изображением.

Частые вопросы

Как агентству рассчитать стоимость перепечатки скана для перевода?

Разделите подготовку на распознавание, проверку OCR, восстановление структуры и исправление текста. Учитывайте время каждого этапа отдельно от перевода и сравнивайте фактические затраты с доходом по проекту. Если подготовка входит в цену за слово, проверьте, покрывает ли эта цена работу на сложных сканах.

Сколько времени OCR экономит по сравнению с ручной перепечаткой?

Универсальное время экономии нельзя назвать без данных о скане, языке, структуре и процессе проверки. Сравните на типичных для бюро документах время ручного набора с суммой времени на OCR, сверку и исправления. Учитывайте качество результата, а не только скорость получения текстового файла.

Какие скрытые расходы учитывать при переводе сканированных документов?

Учитывайте разбор и сортировку файлов, проверку исходного объёма, исправление OCR, восстановление таблиц и колонок, контроль имён и цифр, работу менеджера и повторную обработку. Для документов с персональными данными отдельно проверьте условия передачи и хранения.

Как проверить результат OCR перед переводом?

Сверьте текст с изображением по страницам, уделяя особое внимание именам, датам, суммам, номерам, отрицаниям и таблицам. Используйте оценку уверенности и признаки качества изображения как сигналы для маршрутизации, а не как подтверждение безошибочности. Для важных сведений сохраняйте ручную проверку по оригиналу.

Можно ли считать оценку уверенности OCR гарантией точности?

Нет. AWS описывает оценку уверенности как показатель вероятности правильности конкретного предсказания, а не гарантию точности всего документа (Amazon Textract). Порог проверки зависит от задачи: ошибка в декоративной подписи и ошибка в финансовом значении имеют разные последствия.

Нужно ли учитывать защиту персональных данных при обработке сканов?

Да, если скан содержит сведения об идентифицированном или идентифицируемом человеке. Европейская комиссия включает в понятие персональных данных, среди прочего, имена, адреса и номера удостоверений личности (Европейская комиссия). Проверьте фактические роли сторон, договоры и порядок передачи материалов до выбора OCR-процесса.

Sources:

  • “How Much Does Translation Cost?” - https://slator.com/resources/how-much-does-translation-cost/
  • “Best Practices - Amazon Textract” - https://docs.aws.amazon.com/textract/latest/dg/textract-best-practices.html
  • “Enterprise Document OCR - Google Cloud Document AI” - https://cloud.google.com/document-ai/docs/enterprise-document-ocr
  • “Data protection explained” - https://commission.europa.eu/law/law-topic/data-protection/data-protection-explained_en
  • “AI Risks: Optical Character Recognition and Named Entity Recognition” - https://www.edpb.europa.eu/documents/support-pool-of-experts/ai-risks-optical-character-recognition-and-named-entity_en

Попробуйте ChatsControl

AI-платформа для профессиональных переводчиков

Попробовать бесплатно →