Пів сторінки договору читається нормально, а дві цифри в номері рахунку злилися в пляму. Якщо перекласти такий скан без перевірки, дефект зображення легко перетвориться на помилку в імені, сумі чи даті.
Тут треба вирішити не просто, чи «покращувати файл», а що саме заважає читати текст і чи можна це виправити без втрати інформації. Нахил сторінки часто можна вирівняти. Вицвілий текст іноді краще видно у відтінках сірого. А цифра, якої немає на зображенні, не з’явиться від фільтра контрастності.
Для бюро, агенції або перекладача цей вибір впливає на весь процес. Спочатку оціни оригінал, потім за потреби підготуй копію для OCR і звір результат із зображенням. Якщо ключове слово чи число все одно не читається, попроси кращий примірник або познач невизначеність. Вгадувати не можна.
Що виправити перед перекладом: короткий план¶
Поганий скан - це зображення, де дефекти заважають надійно розрізнити символи або зберегти структуру документа. OCR, тобто оптичне розпізнавання символів, перетворює текст на зображенні на цифровий текст. На результат впливають не лише можливості рушія, а й роздільна здатність, контраст, освітлення, нахил і властивості самого тексту.
Microsoft Learn перелічує чинники, від яких залежить точність OCR: якість скану, роздільна здатність, контраст, освітлення, поворот, розмір, колір і щільність тексту. Одна проблема не визначає якість усієї сторінки: великий чіткий заголовок може розпізнатися добре, а дрібний блідий номер поруч - погано.
Почни з трьох запитань:
- Чи читаються важливі поля на зображенні без такого збільшення, коли вже видно самі пікселі?
- Дефект геометричний або тональний - тобто його можна обережно виправити, не домислюючи текст?
- Після обробки й OCR у тебе залишиться оригінал для звірки?
Якщо заважає нахил, обрізання чи нерівномірне тло, підготовка копії може допомогти. Якщо штрихи літер злилися, частину сторінки закрито або важливе поле обрізане краєм кадру, фільтр не відновить текст. Тут потрібен кращий скан або інший примірник, а не ще одна обробка.
| Дефект | Що перевірити | Що спробувати | Коли зупинитися |
|---|---|---|---|
| Нахил сторінки | Чи лишаються рядки прямими по всій сторінці | Вирівняти копію перед OCR | Якщо обрізання після повороту забирає частину тексту |
| Низький контраст | Чи розрізняються штрихи букв і фон | Перевірити відтінки сірого та помірне налаштування рівнів | Якщо тонкі штрихи зникають або зливаються |
| Розмиття | Чи відрізняються сусідні символи | Перевірити інший примірник або попросити новий скан | Якщо форму символу неможливо визначити |
| Тінь чи відблиск | Чи проходить текст через темні або пересвічені ділянки | Пересканувати сторінку рівномірно освітленою | Якщо частина тексту фізично не видима |
| Низька роздільна здатність | Чи вистачає пікселів на дрібний текст | Отримати скан з оригіналу з вищою роздільною здатністю | Якщо збільшений файл лише розтягує нечіткі пікселі |
| Стиснення JPEG | Чи є блоки, ореоли або шум біля літер | Повернутися до оригінального файлу чи пересканувати | Якщо артефакти вже замінили деталі символів |
Google Cloud Document AI радить для сканів щонайменше 200 dpi, а для найточнішого OCR за рекомендаціями самого сервісу - 300 dpi або вище. Це рекомендація, а не гарантія для кожного документа (документація Google Cloud, актуальність перевірено 10 листопада 2026 року). Навіть із такою роздільною здатністю сторінка з дрібним шрифтом, плямами чи слабким друком може потребувати окремої перевірки.
Джерела називають різні значення, бо говорять про різні умови. Google Cloud Document AI вказує мінімум 200 dpi й орієнтир 300 dpi або вище, а документація Tesseract радить для свого рушія 300 dpi або більше (Tesseract, документацію перевірено 10 листопада 2026 року). Не сприймай жодну рекомендацію як обіцянку, що OCR правильно прочитає кожен рядок.
Які дефекти можна виправити, а які потребують нового скану¶
Перед обробкою поділи дефекти на три типи: ті, що змінюють форму сторінки; ті, що заважають бачити текст; і ті, що означають втрату самого вмісту. Так ти не витрачатимеш час на фільтр, який не може розв’язати проблему.
Перекіс і поворот¶
Нахил помітний по рядках, які піднімаються або опускаються відносно краю аркуша. Вирівнювання, або deskew, повертає зображення так, щоб рядки стали горизонтальними. Така підготовка перед OCR допомагає системі знаходити межі рядків.
Документація Tesseract зазначає, що перекіс погіршує сегментацію рядків, і радить повертати їх до горизонтального положення (Tesseract ImproveQuality, рекомендації перевірено 10 листопада 2026 року). Вирівнювання доречне, коли трохи повернута вся сторінка, а не коли текст на ній іде під різними кутами.
Після повороту перевір краї. Корекція може обрізати номер сторінки, печатку, підпис або частину рядка біля краю. Залиш вихідний файл і працюй зі скоригованою копією. Якщо важливі елементи зникли за обрізом, перескануй сторінку, а не вважай її виправленою.
Розмиття та мала роздільна здатність¶
Рух камери, неправильний фокус, поганий оригінал або надмірне збільшення після сканування можуть розмити текст. Для перекладу важливо не те, чи стала сторінка «чіткішою» після фільтра, а те, чи можна впевнено відрізнити кожен потрібний символ від сусіднього.
Якщо дві літери злилися, підсилення різкості може додати контури, але не покаже, де закінчується одна літера і починається інша. Так само й із цифрами в реєстраційних номерах і датах: приємніша на вигляд копія не обов’язково містить більше інформації.
Google Cloud Document AI попереджає, що зміна розміру JPEG із втратами заради зменшення файлу може погіршити якість зображення й точність OCR (документація про типи файлів, перевірено 10 листопада 2026 року). Не перезаписуй JPEG після кожного кроку. Збережи оригінал, обробляй копію і, якщо є така можливість, використовуй файл без повторного стиснення з втратами.
Контраст, вицвітання, тіні та відблиски¶
Текст із низьким контрастом мало відрізняється від фону. Так буває з вицвілим друком, плямистим папером, фото документа в тіні або нерівномірним освітленням сторінки. Перш ніж перетворювати зображення на чорно-біле, перевір, чи не зберігають відтінки сірого слабкі штрихи.
Національне управління архівів і документації США пояснює, що відтінки сірого підходять для записів із низьким контрастом, плямами, вицвітанням і рукописними примітками. Для таких матеріалів градація сірого може зберегти деталі, які чорно-біле перетворення відкине (NARA, архівні рекомендації видано 2002 року). Ці вимоги стосуються передачі текстових записів до NARA, а не є загальним стандартом для комерційного перекладу.
Дослідження обробки зображень, опубліковане 2020 року, описує ризик порогового перетворення: тіні, локальні відблиски, градієнти освітлення та інші спотворення фону можуть призвести до втрати інформації й помилок розпізнавання (стаття в PubMed Central, 2020 рік). Чорно-біле перетворення не завжди спрощує роботу: разом із тлом воно може стерти частину літери.
«наявність тіней, локальних відблисків, градієнтів освітлення та інших спотворень фону може призвести до незворотної втрати інформації під час порогового перетворення зображення, спричиняючи багато помилок у розпізнаванні символів» - автори дослідження, опублікованого 2020 року.
Практично це означає ось що: збережи копію у відтінках сірого й порівняй її з чорно-білою на складних ділянках. Не обирай варіант лише через чистіше тло. Якщо тонкий штрих літери зник, чистий фон його не поверне.
Які документи перевіряти особливо уважно¶
Перевіряй не лише середню якість сторінки, а й поля, від яких залежить точність перекладу. У договорі це можуть бути назви сторін, суми, дати й посилання на пункти. У посвідченні чи формі - прізвище, номер документа, орган видачі й відмітки. У медичному висновку - скорочення, числові значення й одиниці виміру.
Різні дефекти несуть різні ризики. Заголовок на початку сторінки може розпізнатися добре, а дрібний рядок унизу - ні. Печатка може закривати слово, складений аркуш - деформувати рядок, а фото з перспективним спотворенням - стискати символи біля одного краю.
| Тип документа | Що перевірити на скані | Що може піти не так | Рішення перед перекладом |
|---|---|---|---|
| Договір або додаток | Нумерацію пунктів, дати, реквізити, таблиці | OCR пропустить рядок або прочитає іншу цифру | Зіставити структуру й критичні дані з оригіналом |
| Особисте свідоцтво або посвідчення | Імена, дати, номери, печатки | Схожі символи можуть змішатися | Попросити чіткіший примірник, якщо ідентифікаційне поле не читається |
| Медичний документ | Числові дані, скорочення, примітки | Пропущений символ змінить значення показника | Вручну перевірити OCR за зображенням |
| Форма з клітинками | Відповідність тексту полю, позначки, межі таблиці | Сусідні клітинки можуть зчитатися як один блок | Порівняти розпізнаний текст зі структурою форми |
| Архівний або вицвілий запис | Текст під плямами, рукописні доповнення | Чорно-біле перетворення прибере слабкі штрихи | Зберігати відтінки сірого; позначати нечитабельне |
| Сторінка з підписом і печаткою | Текст, перекритий відбитком, обрізані краї | Елементи зображення можуть закрити частину слова | Не домислювати закритий текст, запросити інший примірник |
Національне управління архівів і документації США розрізняє чистий висококонтрастний друк і записи з поганою читабельністю. Для архівної передачі воно вказує 300-600 ppi у бітональному режимі для чистого висококонтрастного друку та 300-400 ppi у відтінках сірого для записів із поганою читабельністю, з рекомендацією 400 ppi для градації сірого (NARA, рекомендації видано 2002 року). Це значення для архівної роботи, а не заміна перевірки конкретного файлу перед перекладом.
Типовий сценарій для агенції: у пакеті є чисті комп’ютерні сторінки, копії з печатками й фотографії старих документів. Не обробляй усе одним фільтром. Для чистої сторінки може вистачити OCR, а для вицвілої чи затіненої потрібні окрема перевірка й ручне зіставлення.
Для роботи з архівними копіями корисний принцип NARA: зберігати скан окремо від шару OCR, якщо текстовий шар доступний. Архівна настанова просить передавати OCR-версії, якщо вони є, додатково до сканованих зображень (NARA, архівні рекомендації видано 2002 року). Для перекладача це теж зручно: розпізнаний текст можна шукати й рахувати, а зображення залишається джерелом для звірки.
Варіант 1: бюро, фрилансер або внутрішня підготовка¶
Поганий скан можна віддати бюро, окремому перекладачеві або підготувати самостійно всередині команди. Вибір залежить від того, чи потрібне тільки розпізнавання, чи ще й перевірка нерозбірливих місць та звірка з оригіналом.
Бюро¶
Бюро може організувати окремі етапи: підготувати зображення, запустити OCR, перекласти й перевірити результат. Такий варіант зручний для документів, де важливі терміни, структура чи погодження кількома учасниками. До передачі файлів домовся, хто позначатиме нерозбірливі місця і як бюро запитуватиме уточнення.
Попроси описати не просто «обробку скану», а сам порядок роботи. Чи залишиться оригінальне зображення? Чи редактор звірятиме числа, імена й пропуски? Як позначать сумнівний символ? Без відповідей незрозуміло, де закінчується автоматичне розпізнавання і починається перевірка людиною.
Фрилансер¶
Фрилансер може підійти для окремого документа або мовної пари, якщо завдання описане чітко. Передай оригінальний файл і вкажи, які поля не можна вгадувати. Якщо маєш паперовий примірник або чіткіші сторінки, скажи про це до початку роботи.
Тут важливо домовитися, хто за що відповідає. Якщо спочатку файл обробляє одна людина, OCR запускає інша, а переклад редагує третя, усім потрібні ті самі джерела для перевірки. Інакше перекладач отримає вже очищений текст і не зможе побачити, чи правильно OCR прочитав суму або прізвище.
Внутрішня підготовка чи документний онлайн-інструмент¶
Внутрішня команда може підготувати копію скану й окремо запустити OCR, а потім передати перекладачеві і текст, і зображення. Це дає контроль над файлами, але вимагає чіткого порядку: оригінал не перезаписують, сумнівні поля позначають, а результат розпізнавання звіряють.
Якщо важливо зберегти розмітку, типовий процес у ChatsControl починається із завантаження сканованого PDF або фото. Інструмент запускає OCR і формує перекладений документ зі структурою. Це зручно, коли потрібен документ, а не просто суцільний текст. Але сервіс не призначений для рукописів і дуже поганих чи пошкоджених сканів: їх потрібно перевіряти вручну за оригіналом.
Точність OCR усе одно перевіряй. Google Document AI Enterprise OCR має корекцію повороту й показники якості зображення на рівні сторінки. Вони допомагають відправити слабкі сторінки на перевірку, а не вважати весь документ однаково читабельним (документація Enterprise Document OCR, перевірено 10 листопада 2026 року). Сам показник не підтвердить правильність конкретного імені, числа чи пропуску.
«Якість скану, роздільна здатність, контраст, освітлення, поворот, а також розмір, колір і щільність тексту можуть впливати на точність результатів OCR» - Microsoft Learn.
Ця цитата добре пояснює, чому одна настройка дає різні результати навіть на сторінках одного пакета. Для важливих документів налаштуй окрему перевірку сторінок із поганою читабельністю, а не покладайся на одну загальну настройку.
Порівняння способів підготовки¶
Єдиного способу для всіх поганих сканів немає. Рішення залежить від типу дефекту, потрібної точності й того, чи маєш доступ до паперового примірника.
| Варіант | Підходить, коли | Переваги | Обмеження |
|---|---|---|---|
| Корекція нахилу й підготовка зображення | Рядки нахилені, але символи видно | Може полегшити OCR і зберегти вихідну структуру сторінки | Поворот може обрізати краї; корекція не повертає втрачені символи |
| OCR з подальшою звіркою | Друкований текст читається, потрібен цифровий текст | Дає основу для пошуку, перекладу й перевірки | OCR може пропускати, підмінювати або додавати символи |
| Ручне введення або перевірка | Окремі поля нечіткі, але їх можна прочитати на оригіналі | Людина може зосередитися на критичних місцях | Потребує доступу до джерела й уважної перевірки |
| Новий скан | Текст обрізаний, розмитий, затінений або надто дрібний | Дає шанс отримати більше вихідної інформації | Потрібен доступ до оригіналу чи чіткішого примірника |
| Переклад із позначенням невизначеності | Читабельного примірника немає, частина тексту невідновна | Не приховує межі достовірності | Не дає підстав вигадувати відсутній текст |
Microsoft радить оцінювати OCR на зразках, схожих на реальні документи організації, і використовувати показники впевненості, щоб обирати фрагменти для ручної перевірки (Microsoft Learn. Значення 0,80 там наведене як приклад порога, а не універсальна межа для всіх мов, документів і рушіїв.
Показник упевненості не доводить, що текст правильний. Система може бути впевнена в неправильному прочитанні схожих символів, а низька впевненість може стосуватися другорядного елемента. Перевіряй з огляду на ризик: прізвище, дата, номер чи сума заслуговують на увагу, навіть якщо решта сторінки виглядає добре.
Microsoft визначає частоту помилок OCR на словах через підстановки, пропуски й вставки, поділені на кількість слів у контрольному тексті (Microsoft Learn, документацію перевірено 10 листопада 2026 року). Тут важливо пам’ятати: помилкою буде не лише неправильний символ. Відсутнє слово або доданий OCR рядок теж можуть змінити переклад.
Покрокова перевірка скану перед перекладом¶
Результат залежить не від кількості фільтрів, а від послідовності дій. Спочатку перевір зображення, потім OCR-текст і залиш собі шлях назад до оригіналу.
- Збережи вихідний файл. Не перезаписуй єдину копію після повороту, підсилення контрасту чи зміни формату. Назви робочі версії так, щоб було видно, де оригінал, а де оброблений файл.
- Переглянь кожну сторінку. Знайди обрізані краї, тіні, плями, перекіс, слабкий друк, дрібні примітки й місця, де текст накладається на печатку чи підпис.
- Визнач критичні поля. Познач імена, дати, числа, ідентифікатори, суми, заголовки таблиць і підписи до графіків. Переконайся, що ці ділянки читаються на зображенні.
- Виправ явний нахил. Зроби копію з вирівняними рядками, а потім перевір краї сторінки, щоб не обрізати текст.
- Обережно налаштуй тон. Порівняй оригінал, відтінки сірого та помірно скоригований варіант. Не перетворюй сторінку на чорно-білу, поки не переконаєшся, що слабкі штрихи лишилися.
- Запусти OCR на тестовому фрагменті або слабкій сторінці. Перевір, чи зчиталися структура, колонки, таблиці й критичні поля. Не роби висновок про весь документ за однією чистою сторінкою.
- Зістав розпізнаний текст із зображенням. Шукай пропуски, підстановки, зайві символи, переплутані колонки й змінені цифри. Показник упевненості допомагає знайти фрагменти для перевірки, але не замінює звірку.
- Виріши, що робити з нерозбірливими місцями. Попроси новий скан, перевір інший примірник або передай перекладачеві місце для явного позначення невизначеності. Не підставляй символ за контекстом без підтвердження.
- Передай оригінал разом із підготовленим файлом. Перекладачеві потрібні обидва: очищений варіант для роботи й вихідне зображення для контролю.
Ось короткий чекліст для команди:
- Оригінал збережено окремо від обробленої копії.
- Краї, печатки, підписи й номери сторінок залишилися на місці.
- Слабкі ділянки переглянуто у відтінках сірого.
- Критичні імена, дати й числа звірено із зображенням.
- Нечитабельні поля позначено, а не доповнено припущенням.
- Перекладач отримав і текст OCR, і зображення джерела.
У ChatsControl двомовний перегляд показує текст джерела поруч із перекладом, а автоматична перевірка якості допомагає шукати помилки в числах, іменах, термінах і пропусках. Після OCR це зручно для перевірки, чи відповідає переклад розпізнаному тексту. Але такий перегляд не підтвердить, що OCR правильно прочитав погано видимий символ: для цього звір результат із самим зображенням.
Плануючи процес, заклади окрему перевірку слабких сторінок. Google Document AI Enterprise OCR підтримує корекцію повороту та оцінки якості зображення на рівні сторінки (документація Google Cloud, перевірено 10 листопада 2026 року). Принцип простий: відправляй слабкі сторінки на окрему перевірку, а не вважай весь пакет однорідним.
Підводні камені, які псують переклад¶
Найбільший ризик - не завжди очевидно поганий скан. Іноді оброблений файл виглядає чисто, тож команда перестає звіряти текст. Але фільтр міг прибрати частину символу, а OCR - пропустити рядок.
Збільшення не дорівнює відновленню¶
Збільшений маленький файл показує літери більшими, але це не означає, що з’явилися нові деталі. Google прямо попереджає, що зміна розміру JPEG із втратами може погіршити якість і точність OCR (документація Google Cloud, перевірено 10 листопада 2026 року). Якщо символи не розрізнити на наявному зображенні, шукай оригінал або чіткіший примірник.
Максимальний контраст може стерти штрихи¶
Підсилення контрасту іноді допомагає побачити текст, але надмірна корекція може прибрати слабкі елементи або злити символи з фоном. Дослідження нерівномірного освітлення пояснює, чому тіні та градієнти можуть призвести до втрати інформації під час порогового перетворення (дослідження 2020 року). Порівнюй скориговану копію з оригіналом, а не тільки з попереднім фільтром.
Чистий OCR-текст може містити пропуски¶
OCR може пропустити ціле слово або додати зайвий фрагмент, навіть якщо решту сторінки розпізнав добре. Microsoft включає підстановки, пропуски й вставки до визначення помилки OCR на словах (Microsoft Learn, рекомендації перевірено 10 листопада 2026 року). Перевіряй не лише очевидні підміни символів, а й повноту тексту.
«Очевидне» прочитання не завжди правильне¶
Контекст може підказувати, яке слово чи число там мало би бути. Але переклад має відтворювати документ, а не заповнювати прогалини правдоподібними припущеннями. Якщо печатка закриває частину слова або цифра нерозбірлива, познач місце для уточнення й за можливості попроси кращий примірник.
Типова ситуація: у номері документа є дві схожі цифри, і обидва варіанти підходять за контекстом. Не вибирай одну лише тому, що вона «схожа на правильну». Для перевірки потрібне читабельне джерело або інше підтвердження від замовника.
Різні сторінки потребують різної обробки¶
У одному PDF можуть бути чистий текст, вицвіла копія й сторінка з тінню. NARA описує відтінки сірого як доречний варіант для матеріалів із низьким контрастом, плямами, вицвітанням і рукописними примітками (NARA, рекомендації для архівної передачі видано 2002 року). Обробляй проблемну сторінку окремо: фільтр, який добре працює на чистому друці, може зіпсувати вицвілий текст.
«8-бітний відтінок сірого, сканований із роздільною здатністю 300-400 ppi» - NARA, архівна рекомендація, видана 2002 року.
Ці значення стосуються текстових записів, які передають до Національного управління архівів і документації США. Для перекладу це не обов’язкова вимога. Корисний тут сам принцип: вицвілий запис варто перевіряти у відтінках сірого, а не автоматично зводити до двох кольорів.
Вихідний файл і OCR-шар виконують різні завдання¶
Текстовий шар допомагає шукати й редагувати, а зображення показує, що саме було на сторінці. NARA просить передавати OCR-версії, якщо вони доступні, додатково до сканованих зображень (архівні рекомендації, видано 2002 року). Не замінюй одне іншим: перекладачеві може знадобитися звірити розпізнаний номер зі сканом оригіналу.
«Сторінки з низькою впевненістю потребують людського перегляду, а поріг 0,80 може слугувати прикладом, а не універсальною межею» - Microsoft Learn.
Microsoft наводить 0,80 як приклад порога, а не як правило для кожного OCR-процесу. Перевір це значення на зразках власних документів і врахуй, що помилка в номері чи імені може бути важливішою за помилку в другорядному фрагменті тексту.
FAQ¶
Яку роздільну здатність скану обрати для OCR і перекладу?¶
Google Cloud Document AI рекомендує мінімум 200 dpi, а для найкращого результату за рекомендаціями сервісу - 300 dpi або вище (документація, перевірено 10 листопада 2026 року). Tesseract радить 300 dpi або більше для свого рушія (Tesseract, перевірено 10 листопада 2026 року). Жодне значення не гарантує розпізнавання дрібного, вицвілого чи пошкодженого тексту.
Чи потрібно вирівнювати скан перед OCR?¶
Так, якщо рядки помітно нахилені. Tesseract пояснює, що перекіс погіршує сегментацію рядків, і радить вирівнювати текст до горизонтального положення (документація, перевірено 10 листопада 2026 року). Після повороту перевір краї, щоб не втратити частину тексту.
Чи можна надійно перекласти вицвілий документ?¶
Іноді так, якщо потрібні символи ще можна розрізнити на зображенні. Відтінки сірого можуть зберегти деталі вицвілого або малоконтрастного тексту, тоді як чорно-біле перетворення може їх відкинути (NARA, рекомендації для архівних записів видано 2002 року). Нерозбірливі фрагменти звір з іншим примірником або познач як нечитабельні.
Коли варто просити новий скан замість корекції зображення?¶
Проси новий скан, якщо текст обрізаний, штрихи злилися, текст перекритий або його не видно через тінь чи відблиск. Обробка змінює вигляд зображення, але не підтверджує втрачені символи; зміна розміру JPEG із втратами також може знизити якість OCR (Google Cloud, перевірено 10 листопада 2026 року).
Чи достатньо автоматичної перевірки OCR перед перекладом?¶
Ні, якщо важливі точні імена, дати, числа й повнота тексту. Microsoft радить тестувати OCR на зразках, схожих на реальні документи, і використовувати показники впевненості, щоб обирати фрагменти для перевірки людиною (Microsoft Learn, перевірено 10 листопада 2026 року). Показник не замінює звірку з оригіналом.
Чи можна збільшити роздільну здатність розмитого JPEG і повернути деталі?¶
Збільшення не гарантує відновлення символів, яких уже немає на зображенні. Google попереджає, що зміна розміру JPEG із втратами може погіршити якість і точність OCR (документація Google Cloud, перевірено 10 листопада 2026 року). Якщо деталей не видно, шукай оригінальний файл, інший примірник або можливість пересканувати документ.
Що робити, якщо OCR і перекладач по-різному читають одне слово?¶
Зістав обидва варіанти із зображенням і не вибирай прочитання лише за контекстом. Якщо символи все одно неоднозначні, познач фрагмент для уточнення й попроси чіткіший скан або підтвердження від власника документа. Правдоподібне припущення не є перевіреним текстом джерела.