Скан із дедлайном: що агенція рахує, а що часто забуває¶
Сорок сторінок сканованої документації вже у твоїй пошті, клієнт чекає кошторис, а система перекладу не бачить у PDF жодного слова. Рахунок за переклад ще не виставлено, а робота вже почалася: треба оцінити якість зображень, отримати текст, перевірити його й з’ясувати, що саме агенція перекладатиме.
У таких проєктах маржа зникає не через одну велику помилку, а через низку дрібних неоплачених робіт. Координатор відкриває файл, перекладач виправляє пропущені рядки, верстальник відновлює таблиці, редактор звіряє числа, а в кошторисі враховано лише ставку за перекладені слова.
Сканований документ - це зображення тексту, а не текстовий файл. Оптичне розпізнавання символів, або OCR, перетворює зображення на машинозчитуваний текст, який можна шукати, рахувати й обробляти далі. Саме так OCR описано в матеріалі експертного проєкту на сайті Європейської ради із захисту даних.
Але після розпізнавання текст ще не готовий до перекладу. Система може пропустити символ, переплутати цифру, неправильно прочитати ім’я або зламати таблицю. Потім ця помилка вплине на підрахунок слів, ставку виконавця й готовий переклад.
За звітом Slator за 2024 рік, 91% опитаних постачальників мовних послуг використовували тариф за слово; ці дані наведено на сторінці, доступній 18 квітня 2026 року (Slator). Такий тариф зручний, коли вихідний текст уже можна порахувати. Але перед цим скан треба перетворити на текст, а ця робота нікуди не зникає лише тому, що клієнт надіслав один PDF.
Як пише Slator у матеріалі про ціноутворення: “For decades, per-word rates have been the standard throughout the translation industry.”
Простими словами, тариф за слово давно став звичним способом рахувати переклад, але він не охоплює всю роботу зі сканом. Якщо агенція не виділяє підготовку окремо, OCR і виправлення непомітно з’їдають дохід від перекладу.
Щоб побачити реальні витрати, розклади проєкт на етапи: оцінювання файлу, отримання тексту, перевірка, переклад, контроль якості й підготовка результату. Так ти зрозумієш, хто що робить, скільки це займає й чи є ця робота в кошторисі.
Де виникає собівартість: від файлу до готового тексту¶
Собівартість сканованого проєкту складається з кількох робіт, навіть якщо клієнт надіслав лише один файл. Відокремлюй ціну інструмента від вартості людського часу: OCR може створити текст, але людина має вирішити, чи можна з ним працювати.
Оцінювання файлу починається до розпізнавання. Координатор перевіряє, чи відкриваються сторінки, чи всі вони належать до замовлення, чи немає поворотів, розмиття, обрізаних полів і сторінок різної якості. Якщо в документі є зайві додатки, відділи їх до обробки, щоб команда не витрачала час дарма.
Розпізнавання тексту перетворює зображення на слова й структуру. Можливості залежать від інструмента та його налаштувань. Документація Google Cloud Document AI описує розпізнавання блоків, абзаців, рядків, слів і символів у PDF та зображеннях. Там само згадані оцінювання якості зображення, виправлення повороту, визначення мови й вибір діапазону сторінок (Google Cloud Document AI, документація доступна 18 квітня 2026 року).
Виправлення OCR часто недооцінюють найбільше. Розпізнаний текст треба звірити з оригіналом, виправити пропуски й помилкові символи, перевірити порядок читання та зібрати рядки, які розпалися. Саме тут автоматичний результат перестає бути «безкоштовним текстом» і стає робочим документом.
Структурування потрібне, якщо в документі є таблиці, колонки, нумеровані пункти, підписи чи примітки. Простий витяг тексту може зберегти слова, але розірвати зв’язок між заголовком стовпця й числом у рядку. Перекладач із таким файлом може помилитися не через брак мовних знань, а через неправильно відновлену структуру.
Підрахунок слів і кошторис залежать від якості розпізнаного тексту. Якщо система пропустила сторінку або двічі додала абзац, кількість слів буде неправильною. Якщо агенція рахує лише основний текст і пропускає примітки, штампи чи текст у таблицях, оцінка обсягу може не збігтися з реальною роботою.
Переклад і контроль якості теж дорожчають через помилки на підготовчому етапі. Якщо число розпізналося неправильно, його треба помітити, звірити зі сканом і виправити до здачі. Якщо помилку в OCR пропустили, команда витрачатиме час, щоб з’ясувати, звідки вона взялася: з оригіналу, розпізнавання чи перекладу.
Форматування й передавання результату додають роботи, якщо клієнт чекає на документ, а не суцільний текст. Таблиці, заголовки й нумерацію треба відновити, особливо коли оригінал має складне компонування. У матеріалі Slator за 2024 рік серед чинників кошторису названі обсяг, складність проєкту, локалізація графіки й оцінювання робіт із форматування (Slator; сторінка доступна 18 квітня 2026 року).
Для обліку часу заведи окремі позиції, навіть якщо клієнт бачить одну підсумкову суму. Наприклад: перегляд скану, OCR, звірка, відновлення структури, переклад, редактура й фінальна перевірка. Так стане зрозуміло, на якому етапі команда витрачає більше часу, ніж планувала.
Slator повідомляє, що в опитуванні лінгвістів за 2024 рік 77% респондентів отримували оплату за вихідне слово, а 13% - за слово перекладу (Slator; дані опубліковано на сторінці, доступній 18 квітня 2026 року).
Цей розподіл показує, чому точний підрахунок вихідного тексту важливий не лише для клієнтського кошторису. Помилка в OCR може змінити оцінку навантаження перекладача або розрив між рахунком клієнтові й оплатою виконавцю.
Як порахувати повну вартість¶
Почни з фактичного часу, а не з припущення, що OCR автоматично дешевший за ручне введення. Для кожного типу документа записуй час на обробку, виправлення й повторну перевірку. Потім порівняй його з часом ручного передруку документа подібної якості.
Ось зручна внутрішня формула:
- Підготовка: час на приймання файлу, перевірку сторінок і вибір способу обробки.
- Отримання тексту: вартість роботи інструмента або час ручного введення.
- Перевірка: час на звірку OCR з оригіналом і виправлення помилок.
- Перекладацька робота: обсяг тексту за погодженим способом підрахунку й ставка виконавця.
- Завершення: редактура, контроль якості, форматування та передавання файлу.
- Ризики проєкту: додаткова перевірка конфіденційних, технічних або критичних для клієнта даних.
Ця формула не дає універсальної ціни: у наведених джерелах немає єдиного тарифу на OCR чи передрук. Її завдання простіше - показати роботи, які губляться в загальній ставці.
Для кожного етапу записуй виконавця, хвилини або години, спосіб оплати та причину відхилення від плану. Після кількох схожих проєктів стане видно, які документи варто автоматизувати, які перевіряти вручну, а для яких спершу треба переглянути зразок.
Коли рахувати за слово, а коли за роботу¶
Оплата за слово підходить для текстового обсягу, який можна виміряти. Але вона автоматично не враховує підготовку нерозбірливого скану. За звітом Slator за 2024 рік, 14% опитаних постачальників мовних послуг виставляли рахунок за документ, а 64% застосовували погодинну оплату для певних робіт (Slator; дані наведено на сторінці, доступній 18 квітня 2026 року).
Тому в одному кошторисі можуть бути різні способи розрахунку. Переклад рахують за словом, складне відновлення таблиць - за часом, а оцінювання й запуск невеликого замовлення - за окремою проєктною платою. Тут важливо не те, яку модель ти обереш, а чи розуміє клієнт, за які саме роботи платить.
Проблеми починаються, коли всі операції ховають у непомітній націнці на слово. Тоді складніше зрозуміти, чому проєкт виявився збитковим: через слабкий скан, зайву ручну перевірку, помилковий підрахунок чи невраховане форматування.
OCR проти ручного передруку: як вибрати процес¶
OCR - це спосіб отримати перший шар машинозчитуваного тексту, а не чарівна кнопка. Ручний передрук - це створення тексту руками. Тож на практиці агенція порівнює не «автоматизацію» з «людьми», а два повні процеси: OCR зі звіркою та ручне введення з перевіркою.
| Підхід | Що робить команда | Що варто перевірити | Де виникають витрати |
|---|---|---|---|
| OCR без належної звірки | Розпізнає текст і передає його далі | Пропуски, помилкові символи, порядок читання | Виправлення помилок після початку перекладу |
| OCR зі звіркою | Розпізнає, порівнює з оригіналом і відновлює структуру | Імена, числа, таблиці, примітки | Інструмент, людський контроль, форматування |
| Ручне введення | Створює текст вручну з оригіналу | Повноту, точність, розмітку документа | Час введення і подальша перевірка |
| Гібридний процес | Використовує OCR для придатних сторінок і ручну роботу для проблемних | Відмінності між групами сторінок | Координація різних методів і спільний контроль |
Розділи файл на групи сторінок із подібними характеристиками. Чіткий друкований текст і фотографія з тінню можуть потребувати різних способів обробки. Загальна оцінка «скан хороший» приховує окремі проблеми: додаток може читатися добре, а сторінка з підписом поруч - ні.
Якість зображення впливає на OCR. Amazon Textract радить якісні зображення й називає роздільність щонайменше 150 DPI бажаною в документації, доступній 18 квітня 2026 року (Amazon Textract). Але ця порада не гарантує точності: мають значення також чіткість, контраст, поворот, шрифт і компонування.
За тією самою документацією станом на 18 квітня 2026 року Amazon Textract радить не конвертувати й не зменшувати підтримувані PDF, TIFF, JPEG або PNG перед завантаженням (Amazon Textract). Для агенції висновок простий: не погіршуй файл перед розпізнаванням заради зручнішого пересилання чи меншого розміру, не перевіривши наслідки.
Як перевіряти OCR, а не просто довіряти йому¶
Прив’яжи перевірку до ризику помилки. Не кожен хибно розпізнаний символ має однакові наслідки: помилка в декоративному заголовку й помилка в ідентифікаційному номері потребують різної уваги.
Amazon Textract описує оцінку впевненості на шкалі від 0 до 100 у документації, доступній 18 квітня 2026 року (Amazon Textract). Така оцінка показує, наскільки система впевнена в розпізнаванні, але не підтверджує, що значення правильне в контексті документа.
Документація Amazon Textract пояснює: “A confidence score is a number between 0 and 100 that indicates the probability that a given prediction is correct.” (Amazon Textract)
Українською: оцінка впевненості відображає ймовірність правильності передбачення системи. Агенція може використовувати її, щоб знайти фрагменти для ручної перевірки, але звірку з оригіналом вона не замінює.
Amazon наводить поріг 90% або вище як приклад для рішень із фінансовими наслідками. Це рекомендація для конкретного сценарію, а не універсальний професійний стандарт (Amazon Textract; документація доступна 18 квітня 2026 року). Не копіюй цей поріг автоматично: спершу визнач, які помилки критичні для твого типу документа.
Перевіряй результат у такому порядку:
- Переконайся, що всі сторінки на місці й стоять у правильній послідовності.
- Зістав зображення з витягнутим текстом і знайди пропуски, повтори та зміни порядку читання.
- Окремо перевір імена, адреси, дати, суми, номери, одиниці виміру та скорочення.
- Переглянь структуру таблиць: заголовки, рядки, об’єднані комірки й відповідність значень стовпцям.
- Познач нерозбірливі місця й попроси уточнення, якщо за наявним файлом не можна надійно відновити текст.
Таблиці й верстка: де автоматизація дає збій¶
У таблиці важливі не лише слова, а й зв’язки між рядками та стовпцями. Якщо OCR розпізнає всі числа, але віднесе їх не до тих комірок, текст виглядатиме правдоподібно, хоча дані будуть не на своїх місцях.
Amazon попереджає, що вилучення таблиць може бути непослідовним, коли комірки об’єднані через стовпці або структура окремих комірок, рядків чи колонок відрізняється від решти таблиці. Для таких ситуацій документація радить розглянути розпізнавання тексту замість вилучення таблиць (Amazon Textract; сторінка доступна 18 квітня 2026 року).
Але після розпізнавання структуру все одно доведеться перевірити й відновити. Звичайний витяг тексту сам не визначить, до якого заголовка належить значення і чи має значення пропущена порожня комірка.
Оцінка якості зображення теж може допомогти вирішити, які сторінки віддати на ручну перевірку. Google Cloud описує сторінкову оцінку якості за вісьмома вимірами, серед яких розмитість, надто дрібний шрифт і відблиски. Документація доступна 18 квітня 2026 року (Google Cloud Document AI). Ці сигнали допомагають вибрати сторінки для перевірки, але самі собою не підтверджують правильність тексту.
Що включити в кошторис і як не втрачати маржу¶
Не обов’язково показувати клієнтові кожну хвилину роботи. Але команда має знати, з яких етапів складається ціна й що саме змінює вартість конкретного скану.
| Позиція кошторису | Що охоплює | Що повідомити клієнтові |
|---|---|---|
| Оцінювання скану | Перевірку читабельності, комплектності й структури | Чи потрібна додаткова підготовка |
| OCR або передрук | Отримання машинозчитуваного тексту | Який спосіб використає команда |
| Звірка тексту | Перевірку повноти, чисел, назв і пропусків | Які фрагменти потребують ручної уваги |
| Переклад | Роботу з підтвердженим текстовим обсягом | Який обсяг і принцип підрахунку закладено |
| Форматування | Відновлення таблиць, заголовків і порядку | Який формат результату отримає клієнт |
| Контроль якості | Перевірку перекладу та критичних елементів | Який обсяг фінальної перевірки включено |
| Опрацювання даних | Вибір інструментів і порядок роботи з персональними даними | Як файл обробляється і хто має до нього доступ |
Якщо точного обсягу ще не знаєш, розділи попередню оцінку й остаточний кошторис. Поясни, що ціну перекладу визначать за перевіреним текстом, а відновлення складної структури чи нерозбірливих фрагментів порахують після оцінювання.
Для внутрішнього контролю заведи таблицю з назвою документа, кількістю сторінок, типом вмісту, якістю скану, часткою сторінок із ручною звіркою, часом на підготовку й виправлення та причинами повторної роботи. Точні середньогалузеві норми не потрібні: збирай власні дані за завершеними проєктами.
Як зрозуміти, де саме зникає прибуток¶
Порівнюй план із фактичним часом на кожному етапі, а не лише загальну суму рахунку з оплатою перекладача. Витрати можуть ховатися не в самому OCR, а в повторному виправленні таблиць чи кількох уточненнях обсягу через пропущені сторінки.
Розділяй витрати, які зростають разом із кількістю слів, і ті, що залежать від складності документа. Додаткові сторінки збільшують мовний обсяг. А перевірка налаштувань, відновлення незвичної таблиці чи погодження нерозбірливої ділянки можуть забрати час незалежно від кількості слів.
За звітом Slator за 2024 рік, 64% опитаних постачальників мовних послуг застосовували погодинну оплату для певних робіт; цифру наведено на сторінці, доступній 18 квітня 2026 року (Slator). Практичний висновок простий: не кожну операцію з документом треба ховати в оплаті за слово.
Для незнайомих типів файлів веди журнал відхилень. Записуй, що змусило команду повторно перевіряти текст, який фрагмент створив проблему та на якому етапі помилку помітили. Ці записи допоможуть точніше формулювати питання клієнту, правила приймання сканів і попередню оцінку.
Персональні дані теж створюють роботу¶
У скані можуть бути імена, адреси й номери посвідчень. Європейська комісія визначає персональні дані як інформацію про ідентифіковану або таку, що можна ідентифікувати за певними ознаками, живу людину. Серед прикладів Комісія наводить імена, адреси та номери посвідчень (Європейська комісія; пояснення доступне 18 квітня 2026 року).
У тому самому поясненні Комісія описує обробку даних широко: це збирання, запис, упорядкування, зберігання, зміна, отримання, використання, розкриття, видалення й знищення. Отже, OCR скану з персональними даними може бути не просто технічним розпізнаванням, а опрацюванням даних, на яке поширюються відповідні правила (Європейська комісія; пояснення доступне 18 квітня 2026 року).
Псевдонімізовані дані теж залишаються персональними, якщо за ними можна повторно ідентифікувати людину. За поясненням Європейської комісії, приховування одного поля не обов’язково знімає питання конфіденційності, якщо решта документа дає змогу встановити особу (Європейська комісія; пояснення доступне 18 квітня 2026 року).
Перед запуском процесу з’ясуй роль агенції та умови договору. Європейська комісія пояснює: контролер визначає цілі й способи обробки, а процесор опрацьовує персональні дані за задокументованими інструкціями контролера. Роль агенції треба визначати за реальним процесом і домовленостями, а не лише за назвою послуги (Європейська комісія; пояснення доступне 18 квітня 2026 року).
Європейська комісія формулює визначення так: “Personal data is any information that relates to an identified or identifiable living individual (data subject).” (Європейська комісія)
Українською: персональні дані - будь-яка інформація про ідентифіковану або таку, яку можна ідентифікувати, живу людину. Для агенції висновок практичний: врахуй вибір OCR-інструмента й доступ до скану під час оцінювання проєкту, а не після запуску робіт.
Європейська комісія пояснює, що правила технологічно нейтральні: автоматизована й ручна обробка можуть підпадати під захист персональних даних. Тож паперовий чи цифровий формат сам собою не знімає цих зобов’язань (Європейська комісія; пояснення доступне 18 квітня 2026 року). У кошторисі враховуй не лише спосіб отримання тексту, а й погоджений порядок роботи з документом.
Помилки, які перетворюють швидкий OCR на дорогий проєкт¶
Дорогі проблеми часто починаються з думки, що файл «достатньо читабельний». Команда може не помітити, що таблиця розпалася, ім’я змінилося або сторінка випала з послідовності - аж поки помилка не з’явиться в перекладі.
Передавати OCR далі без звірки. Оцінка впевненості не гарантує правильності. Amazon Textract пов’язує вибір порога з чутливістю конкретного завдання й наводить фінансові рішення як приклад, де може знадобитися суворіший підхід; документація доступна 18 квітня 2026 року (Amazon Textract). Визначай обсяг перевірки за ризиком, а не за бажанням зекономити час.
Рахувати слова до перевірки повноти. Спершу переконайся, що текст охоплює всі потрібні сторінки й елементи. Інакше клієнт погодить один обсяг, а команда перекладатиме інший.
Вважати всі сторінки однаково складними. Кількість сторінок нічого не каже про щільність тексту, розмір шрифту, кількість таблиць чи якість зображення. Два файли з однаковою кількістю сторінок можуть потребувати різної підготовки, тож лічильника сторінок замало для надійного кошторису.
Не перевіряти таблиці окремо. Слова можуть розпізнатися правильно, але втратити зв’язок із заголовками. Попередження Amazon про об’єднані комірки й нерівномірну структуру таблиць особливо важливе, якщо значення мають залишатися у своїх рядках і стовпцях (Amazon Textract; документація доступна 18 квітня 2026 року).
Погіршувати файл під час підготовки. Конвертація або зменшення підтримуваних зображень перед завантаженням може змінити їхню якість. Amazon радить не конвертувати й не зменшувати такі вхідні файли без потреби (Amazon Textract; документація доступна 18 квітня 2026 року).
Не закладати форматування. Якщо клієнт хоче отримати перекладений файл зі збереженою структурою, агенція має оцінити час на таблиці, заголовки, списки й розміщення тексту. Матеріал Slator за 2024 рік називає оцінювання форматування та локалізацію графіки серед можливих чинників ціни (Slator; сторінка доступна 18 квітня 2026 року).
Ігнорувати персональні дані, бо джерело - папір. Захист даних не залежить лише від того, чи був початковий документ паперовим або цифровим. Європейська комісія пояснює, що правила охоплюють автоматизовану й ручну обробку, тож перетворення скану на текст не знімає питання відповідальності (Європейська комісія; пояснення доступне 18 квітня 2026 року).
Обіцяти точний обсяг до перевірки. Для скану надійний кошторис може починатися з попереднього діапазону робіт, а не з удавано точного підрахунку. Якщо ще невідомо, чи вдасться розпізнати таблиці, заздалегідь зафіксуй умови перегляду кошторису. Так агенції не доведеться покривати невраховану роботу власною маржею.
Перед передаванням тексту перекладачеві перевір короткий список:
- усі сторінки на місці й розташовані в правильному порядку;
- рукописні або нерозбірливі фрагменти позначено;
- імена, дати, номери й суми звірено;
- заголовки таблиць пов’язані з відповідними даними;
- межі підрахунку слів зрозумілі;
- форматування, роботу з даними й фінальну перевірку враховано.
Як порахувати слова у сканованому PDF для перекладу допоможе розібрати підрахунок обсягу, а сканований PDF у Word перед перекладом дасть змогу порівняти способи підготовки файлу. Далі можна зіставити приховані витрати з собівартістю слова в перекладі: overhead, PM, QA і технологіями.
Навіть охайний текстовий витяг не покаже всіх ризиків професійного проєкту OCR. Експертний звіт про ризики OCR і розпізнавання імен, розміщений на сайті Європейської ради із захисту даних, окремо розглядає ризики для конфіденційності й захисту даних. На сторінці зазначено, що звіт підготували зовнішні підрядники і він не є офіційною позицією Ради (звіт про ризики OCR; проєкт завершено у вересні 2023 року).
FAQ¶
Як агенції рахують вартість передруку сканованого документа?¶
Агенції окремо оцінюють підготовку тексту: OCR або ручне введення, звірку розпізнаного матеріалу, відновлення структури й підрахунок слів. Потім додають переклад, редагування, форматування та контроль якості. Якщо точний обсяг ще невідомий, відокрем попередню оцінку від остаточного кошторису.
Скільки часу OCR заощаджує порівняно з ручним передруком?¶
Наведені джерела не встановлюють єдиної економії часу для всіх документів. Результат залежить від скану, мови, шрифту, таблиць і кількості помилок, які треба виправити. Порівнюй повний час OCR зі звіркою з часом ручного передруку документів подібного типу.
Які приховані витрати врахувати в кошторисі перекладу сканів?¶
Урахуй перевірку файлу, OCR або ручне введення, виправлення тексту, контроль імен і чисел, відновлення таблиць, переклад, форматування та фінальну перевірку. Окремо визнач, як команда працюватиме з персональними даними й хто матиме доступ до файлу. Одні роботи можна рахувати за обсягом, інші - за фактичним часом або складністю.
Як перевірити результат OCR перед перекладом?¶
Зістав розпізнаний текст зі сканом і переконайся, що жодну сторінку, рядок чи примітку не пропущено. Окремо перевір імена, адреси, числа, дати, одиниці виміру й таблиці. Оцінки впевненості та якості зображення допомагають знайти проблемні місця, але не замінюють звірки з оригіналом.
Коли скан краще передрукувати вручну, а не обробляти через OCR?¶
Ручне введення або докладна ручна перевірка доречні, коли зображення нечітке, текст написаний від руки або структура заважає надійному розпізнаванню. Для нестандартних таблиць перевір, чи збереглися зв’язки між заголовками й значеннями. Обирай процес за його повною вартістю й потрібною точністю, а не лише за ціною запуску OCR.