Таблиці й колонки в PDF: чому CAT-інструменти плутають текст

Дізнайтеся, чому під час перекладу PDF розпадаються таблиці й колонки, як перевірити порядок читання та підготувати файл до CAT-інструмента.

Також: EN UK RU
Таблиці й колонки в PDF: чому CAT-інструменти плутають текст

Чому PDF перекладається не так, як виглядає

На сторінці дві колонки: читаєш спершу ліву, потім праву. Але після імпорту в CAT-інструмент абзаци можуть перемішатися, а рядки таблиці - від’єднатися від заголовків. Часто проблема виникає ще до перекладу: програма не так зчитує вміст PDF.

PDF передусім описує, де елементи стоять на сторінці. Текст, лінії, комірки й зображення для тебе можуть складатися в цілісну таблицю, але сам файл не обов’язково зберігає зв’язки між ними. CAT-інструмент отримує те, що зміг витягти, а не обов’язково ту логічну структуру, яку бачить людина.

W3C пояснює порядок читання PDF: логічна послідовність залежить від структури й тегів документа. Якщо багатоколонкову сторінку розмітили недбало, програма може прочитати її впоперек колонок. А складні макети з таблицями, виносками й бічними блоками не завжди автоматично потрапляють у правильний порядок.

Для команди тут одразу два завдання. Спершу перевір, чи повний і послідовний текст потрапив у редактор. Потім з’ясуй, чи вдасться зібрати переклад у потрібному вигляді. Те, що файл успішно завантажився, ще не означає, що обидва завдання вирішені.

Розберімося, як програма витягує текст, чому плутає таблиці й колонки, що перевірити до початку роботи та коли варто попросити вихідний DOCX або інший редагований файл.

Як CAT-інструмент читає PDF

CAT-інструмент - програма, у якій перекладають сегменти, керують термінами, повторюваними фрагментами й проєктами. Щоб працювати з PDF, програма спершу має отримати текст у придатному форматі, а вже потім показати його перекладачеві. Вигляд сторінки й логічна структура - різні речі, хоч на екрані вони можуть здаватися одним цілим.

PDF може зберігати позиції текстових фрагментів, але не пояснювати, який із них є заголовком, а який належить до лівої чи правої колонки. Для людини все зрозуміло завдяки рамкам, відступам і вирівнюванню. Програмі ж доводиться визначати порядок за даними самого файла.

Текст іноді витягується повністю, але в неправильному порядку. Наприклад, програма спершу зчитує заголовки обох колонок, а потім чергує абзаци. Так отримуєш потік, який не збігається зі звичним порядком читання сторінки. Окремі сегменти можна перекласти точно, але в загальному контексті вони опиняться не там.

Після вилучення текст часто переходить у проміжний формат, наприклад DOCX. Його можна редагувати й передати в перекладацький процес, але конвертація сама по собі не гарантує ані точного макета, ані правильних зв’язків між елементами сторінки. Тож замість готового PDF перекладач може отримати DOCX або звичайний текст.

Текстовий потік і вигляд сторінки - не одне й те саме

Текстовий потік - це порядок, у якому програма подає фрагменти для читання. Вигляд сторінки - це місце, де вони розташовані візуально. Коли ці два порядки збігаються, імпорт працює передбачувано. Коли ні, помилятися починають колонки й таблиці.

Уяви брошуру з двома колонками: у лівій - вступ, у правій - продовження. Якщо програма сприйме верхні рядки обох колонок як один широкий ряд, у витягнутому тексті вступ може перемішатися з продовженням. Такий збій іноді видно навіть під час звичайного копіювання тексту, хоча сам PDF виглядає охайно.

Текстова таблиця може підкинути ще більше сюрпризів. Комірки візуально стоять на місцях, але слова всередині PDF можуть бути незалежними текстовими об’єктами. Якщо межі комірок не описані структурно, інструмент виводить зв’язки з розташування та відстаней. Об’єднані комірки, заголовки у кілька рядків і вузькі стовпці ускладнюють це завдання.

Що дають теги структури

Позначений, або тегований, PDF зберігає інформацію про типи елементів і їхній логічний порядок. Дерево тегів може підказати, як читати текст, навіть коли його розташування на сторінці складне. PDF Association пояснює роль тегів у доступному PDF: логічний порядок має відповідати задуму документа, а не просто розташуванню фрагментів.

Теги не роблять будь-який PDF безпомилковим для перекладу. Структуру могли не додати, додати неправильно або не оновити після зміни макета. Тож теги - привід перевірити файл, а не гарантія, що імпорт мине без проблем.

Не плутай доступність із версткою. Структурні теги допомагають визначити порядок і тип вмісту, але не відтворюють макет після перекладу й не вирішують, як умістити довше речення у вузьку комірку.

Чому ламаються таблиці, колонки та виноски

Програма не читає сторінку так, як людина. Два фрагменти стоять поруч - але це не означає, що один є заголовком іншого. Горизонтальна лінія теж не обов’язково задає рядок таблиці. Тому збій може трапитися не лише в дивному файлі, а й у цілком звичайному на вигляд документі.

Дві колонки, які зливаються в одну

У двоколонковому макеті читач зазвичай іде згори донизу в першій колонці, а потім переходить до наступної. Через погану або відсутню розмітку програма може обрати інший порядок - наприклад, читати впоперек обох колонок. W3C описує ризик неправильного порядку читання в багатоколонкових PDF.

Проблема не лише в тому, що текст незручно читати. Перекладач може не помітити, що фрагмент із сусідньої колонки потрапив усередину абзацу. У короткому матеріалі така плутанина кидається в очі. А у звіті з повторюваними підзаголовками чи списками неправильна послідовність може навіть здатися правдоподібною.

Таблиці без семантичних зв’язків

Семантична таблиця описує не тільки сітку на сторінці, а й зв’язки між заголовками, рядками й комірками. Лінії та вирівняні фрагменти такої інформації не замінюють. Якщо зв’язків немає, програма може неправильно визначити, до якого стовпця належить значення і який заголовок його пояснює.

Перевір особливо уважно таблиці, що переходять на наступну сторінку. Повторений заголовок може бути частиною таблиці, а може виглядати як окремий блок. Об’єднані комірки й вкладені таблиці теж легко збивають програму з пантелику. Посібник PDF Association з найкращих практик для тегованих PDF радить перевіряти, чи відповідають комірки заголовкам і чи не порушується таблиця на межі сторінок.

У перекладі є ще один нюанс: новий текст може виявитися довшим. Фраза, яка займала один рядок, розтягується на кілька. Навіть якщо текст зчитався правильно, старої ширини комірки може не вистачити. Тому після мовної перевірки потрібен і огляд верстки.

Виноски, бічні блоки та верхні колонтитули

Виноска внизу сторінки візуально прив’язана до фрази в основному тексті. У витягнутому потоці вона може опинитися після цілого блока або зовсім в іншому місці. Бічна примітка може вклинитися між двома абзацами, хоча автор задумував її як окремий коментар.

Верхні й нижні колонтитули створюють схожий безлад. Назва розділу або номер сторінки можуть повторюватися у тексті після кожного розриву. Якщо не відокремити ці фрагменти до перекладу, повтори потраплять у сегменти й ускладнять подальше зіставлення.

Перевір і переноси слів на межі рядка. Розрив рядка та дефіс можуть зберегтися в тексті, хоча слово треба читати без розриву. У старому обговоренні перекладачі описували, як чистять PDF перед вирівнюванням: прибирають колонтитули й жорсткі розриви рядків, виправляють переноси та перевіряють пробіли біля лігатур (обговорення на ProZ). Форумна порада - не специфікація програми, але вона добре показує, що саме іноді доводиться виправляти вручну.

Сканований PDF - це зображення, а не готовий текст

Сканований PDF зберігає сторінки як зображення, а не як текст, який можна виділити. OCR - оптичне розпізнавання символів - перетворює зображення літер на текст для подальшої обробки. Огляд Adobe про доступність PDF пояснює різницю між сканом-зображенням і пошуковим текстом, отриманим завдяки розпізнаванню.

OCR не вгадує задум автора безпомилково. Розмиті символи, дрібний шрифт і складна сітка можуть призвести до помилок, пропусків або неправильного розподілу комірок. Особливо легко не помітити число, яке програма розпізнала як схоже на інше, якщо перевіряти тільки загальний вигляд абзацу.

В обговоренні проблем PDF-верстки учасник ProZ описував такий робочий підхід: перетворити файл у редагований формат, виправити таблиці до перекладу, а після експорту перевірити й за потреби відновити макет (обговорення про проблеми форматування PDF). Автор також попереджав, що OCR не дає бездоганного тексту, а після перекладу можуть знадобитися ручні правки. Це не універсальний рецепт, але нагадування просте: і OCR, і верстку треба окремо перевіряти.

Як перевірити PDF перед перекладом

Не обмежуйся перевіркою, чи відкривається файл. До імпорту з’ясуй, чи збережено порядок читання, чи правильно пов’язані заголовки таблиць і чи потрібне OCR. Так ти зрозумієш, де починається власне переклад, а де ще треба підготувати документ.

Кроки попередньої перевірки

  1. Визнач тип сторінок. З’ясуй, де можна виділити текст, а де сторінка складається зі сканованого зображення. Якщо текст не виділяється, заклади OCR і подальшу звірку.

  2. Перевір порядок вилучення. Скопіюй або експортуй невеликий фрагмент із кожного типу сторінки. Порівняй послідовність заголовків і абзаців із тим, як ти читаєш сторінку. Переходи між колонками перевір особливо уважно.

  3. Зістав таблицю з її текстовим поданням. Переконайся, що кожне значення стоїть під правильним заголовком, а рядки не злилися з наступними. У довгій таблиці перевір і продовження після розриву сторінки.

  4. Перевір виноски й бічні блоки. Знайди номери виносок, примітки, колонтитули та елементи на полях. Звір, чи стоять вони в тексті там, де задумав автор.

  5. Оціни якість OCR. Звір розпізнані числа, скорочення, власні назви й текст у тісних комірках із зображенням оригіналу. Пошуковий текст сам по собі не доводить, що OCR усе прочитав правильно.

  6. Узгодь результат до початку роботи. Зафіксуй, що саме отримає замовник: перекладений DOCX, текст, відновлений макет чи окремо підготовлений PDF. Окремо домовся, хто відповідає за перевірку й верстку.

Adobe описує інструменти, які показують області сторінки та допомагають перевіряти порядок читання. Матеріал про створення доступних PDF в Acrobat застерігає: автоматичне тегування може неправильно розпізнати складну структуру й порядок читання, зокрема колонки, розташовані близько одна до одної. Автоматична перевірка допомагає знайти проблему, але результат усе одно треба звірити вручну.

Що занести до робочого чекліста

Що перевірити Як виявити проблему Що зробити до перекладу
Порядок колонок Абзаци з різних колонок чергуються або перетинаються Виправити порядок у редагованому файлі або визначити інший спосіб підготовки
Рядки й стовпці таблиці Значення відриваються від заголовків Перевірити структуру комірок і зв’язки із заголовками
Повторені заголовки таблиці Заголовок сприймається як новий рядок або окремий абзац Узгодити повтори й позначити їх у проміжному файлі
Виноски Примітки вставляються не біля потрібного місця Відновити відповідність між позначкою та текстом виноски
Колонтитули Назви розділів і номери сторінок дублюються Відокремити повторювані елементи від основного вмісту
Скановані сторінки Текст не виділяється або не шукається Запустити OCR і звірити розпізнані фрагменти з оригіналом
Формат результату Очікування щодо PDF не збігаються з результатом імпорту Погодити проміжний та кінцевий формат і відповідальність за верстку

Використай цю таблицю як короткий чекліст для передавання проєкту між координатором, перекладачем і фахівцем із верстки. Якщо щось неможливо перевірити в самому PDF, зафіксуй це до перекладу, а не після здавання.

Як підготувати проміжний файл і зібрати результат

Проміжний файл дає змогу працювати з текстом у редагованому форматі. Команда часто конвертує PDF у DOCX або інший придатний файл, перевіряє структуру й тільки тоді передає матеріал у CAT-інструмент. Сприймай конвертацію як окремий етап, а не як натискання кнопки без наслідків.

До перекладу виправ помилки, які змінюють зміст: переплутані колонки, злиті рядки, заголовки без відповідних значень, загублені виноски. Прибери й зайві розриви рядків, через які речення розбиваються на непотрібні сегменти. Якщо таблиця переходить на наступну сторінку, перевір, чи зрозуміло, де її продовження.

Не перекладай і не відновлюй водночас складну структуру, якщо файл уже читається неправильно. Перекладач не має вгадувати, чи належить число до стовпця «Кількість» або «Ціна». Поверни цю невизначеність на етап підготовки: звір фрагменти з оригіналом і зафіксуй правильні зв’язки.

Після перекладу переглянь сторінку окремо. Текст іншою мовою може бути довшим: рядок переноситься, таблиця розтягується, а текст торкається меж комірки. Це не обов’язково помилка перекладу, але читати такий документ може бути складніше.

У форумному обговоренні фахівці описували подібний підхід: привести PDF до редагованого стану, виправити структуру до перекладу, а після цього перевірити експорт і за потреби відновити макет (досвід користувачів на ProZ). Висновок простий: сам імпорт не гарантує точного макета. Заздалегідь домовся, хто перевірить сторінки після перекладу.

Коли варто шукати вихідний файл

Якщо PDF створили з DOCX, презентації або іншого редагованого документа, попроси саме оригінал. У ньому можуть зберегтися таблиці й колонки, які PDF показує візуально, але не дає зручно редагувати.

Вихідний файл теж треба перевірити. Автор міг зберегти таблицю як зображення, розкласти текст у блоки або вирівняти колонки пробілами. Та все ж DOCX із правильною структурою часто стає кращою відправною точкою, ніж відновлення сторінки з окремих елементів PDF.

Якщо редагованого оригіналу немає, знайди сторінки з найскладнішою структурою й заплануй для них ручну перевірку. Без вихідного файла робота не стає неможливою. Просто обговори заздалегідь ризик помилок під час вилучення та обсяг верстки.

Контроль після перекладу

Фінальна перевірка має охопити і зміст, і вигляд. Звір числа, назви стовпців, примітки та зв’язки між заголовками таблиці й даними. Переконайся, що абзац не загубився на переході між колонками або сторінками.

У таблиці, яка переходить на наступну сторінку, звір початок і кінець кожного фрагмента. Повторений заголовок має залишатися зрозумілим, а останній рядок сторінки не повинен випадково приєднатися до наступного розділу. Якщо працювали зі сканом, звір сумнівні символи OCR із зображенням оригіналу.

Після виправлень відкрий документ на сторінці, а не лише в режимі сегментів CAT-інструмента. Режим перекладу зручний для мовної роботи, але не завжди показує, як читач сприйматиме готовий макет. Якщо замовнику потрібен PDF, перевір саме експортований PDF.

Коли перекладати PDF напряму, а коли обрати інший формат

Рішення залежить від структури документа, а не тільки від розширення файла. Простий PDF із послідовним текстом може потребувати мало підготовки. Складна таблиця або сканована сторінка потребує окремої перевірки, навіть якщо файл легко відкривається.

Ситуація Доцільний підхід Основний ризик
PDF має прості абзаци та передбачуваний порядок Перевірити витягнутий текст і передати його в перекладацький процес Втрачений формат або приховані фрагменти
Документ має дві чи більше колонок Перевірити послідовність читання до перекладу Змішування абзаців між колонками
PDF містить складні або довгі таблиці Відновити структуру таблиці в редагованому файлі Відрив даних від заголовків і розриви на сторінках
Сторінки є сканами Виконати OCR, а тоді звірити текст із зображенням Хибно розпізнані символи, числа та межі комірок
Є вихідний DOCX або презентація Попросити оригінал і перевірити його структуру Вихідний файл теж може містити плоскі або вручну зібрані елементи
Потрібен відтворений макет PDF Визначити окремий етап верстки та перевірки CAT-інструмент може повернути проміжний файл, а не готовий PDF

Прямий імпорт не означає, що файл можна не готувати. Навіть якщо програма приймає PDF, переглянь кілька характерних сторінок. Якщо тестовий витяг показує правильні абзаци й заголовки, плануй наступний етап. Якщо порядок порушений, не перенось цю помилку в переклад.

Конвертація у Word теж не виправляє все автоматично. Вона створює редагований текст, але під час перетворення можуть змінитися відступи, потік тексту й вигляд сторінки. Деякі слова можуть загубитися, якщо обробка намагається точно відтворити візуальний макет. Після конвертації перевір і зміст, і вигляд.

Звичайний текст без форматування іноді підходить, коли потрібен сам вміст, наприклад для підготовки корпусу або зіставлення матеріалів. Але якщо треба зберегти структуру документа, такий варіант потребує особливої уваги: зв’язки між колонками, таблицями й заголовками можуть зникнути.

Як оцінити обсяг робіт без вигаданих нормативів

Не оцінюй ціну чи строк лише за кількістю сторінок. Одна сторінка простого тексту й одна сторінка зі сканованою таблицею потребують різної підготовки. Без огляду файла оцінка може не врахувати OCR, виправлення структури й верстку.

Для первинної оцінки розділи сторінки за типами: звичайний текст, колонки, таблиці, скани та комбіновані макети. Познач сторінки, де незрозумілий порядок читання або таблиця переходить через розрив. Так команда матиме предметну основу для узгодження робіт.

Не обмежуйся фразою «PDF готовий». Уточни, чи є редагований оригінал, чи виділяється текст, чи потрібен кінцевий PDF і хто виправляє верстку. Відповіді на ці запитання часто важливіші за те, що документ відкривається на комп’ютері.

Типові помилки під час роботи з таблицями та колонками

Команда часто помиляється не через складний переклад, а тому, що вважає: імпорт уже владнав структуру. Нижче - речі, які можна помітити до початку роботи, якщо дивитися не лише на сторінку, а й на витягнутий текст.

Починати переклад без перевірки порядку

Файл імпортувався, сегменти з’явилися - значить, усе готово? Не обов’язково. Переглянь по одному прикладу кожного типу сторінок. У двоколонковому документі порівняй витягнутий текст із візуальним порядком читання, а в таблиці перевір кілька зв’язків між заголовками й значеннями.

Вважати рамки доказом структури

Лінії на сторінці можуть бути просто графічними елементами. Вони не гарантують, що текст усередині має зв’язки комірок. Навіть таблиця з чіткою сіткою може експортуватися як набір незалежних фрагментів.

Перевір не лише те, чи збереглася сітка, а й те, чи залишилися дані в правильних рядках і стовпцях. Особливо уважно подивися на комірки з багаторядковим текстом: фрагмент може виглядати так, ніби він стоїть поруч, але в порядку читання потрапити до іншої комірки.

Припускати, що OCR уже виправив сторінку

OCR створює текстове представлення зображення, але не підтверджує точність розпізнавання. Зістав результат з оригіналом, особливо там, де одна помилка змінює число, скорочення чи позначення в таблиці.

Перевір сторінки з дрібним текстом і щільною сіткою. Якщо символи розпізналися нечітко, познач їх для звірки із зображенням. Не передавай неперевірений текст далі як надійну основу для перекладу.

Відкладати верстку до останньої хвилини

Після перекладу довжина тексту змінюється, а колонки й комірки мають обмежений простір. Якщо команда заздалегідь не домовилася, хто перевіряє експортований файл, проблема може вилізти вже під час підготовки до здавання.

До початку роботи визнач формат результату й межі мовної та технічної перевірки. Перекладач відповідає за зміст, але це не означає, що він автоматично відповідає за повне відтворення складного макета. Якщо потрібен готовий PDF, заплануй окрему перевірку сторінок.

Не фіксувати сумнівні місця

Якщо незрозуміло, до якого заголовка належить комірка або якій колонці відповідає абзац, не вгадуй. Познач фрагмент у проміжному файлі й звір його з оригіналом. Розв’язати таку невизначеність до перекладу простіше, ніж виправляти зміст і верстку після здавання.

FAQ

Чому CAT-інструмент плутає таблиці під час перекладу PDF?

PDF може показувати таблицю візуально, але не містити машинозрозумілої структури рядків, стовпців і заголовків. Коли програма витягує окремі фрагменти тексту, вона може неправильно визначити їхню послідовність або зв’язок із комірками.

Як перекласти PDF у дві колонки й не змішати порядок читання?

Спочатку витягни тестовий фрагмент і порівняй порядок абзаців із виглядом сторінки. Якщо вміст колонок перемішався, виправ структуру проміжного файла або підготуй текст в іншому редагованому форматі до імпорту в CAT-інструмент.

Чи варто конвертувати PDF у Word перед імпортом у CAT-інструмент?

Конвертація у Word допомагає отримати редагований проміжний файл, але не гарантує правильного порядку читання чи точного макета. До перекладу перевір колонки, таблиці, виноски, колонтитули й розриви рядків.

Чи може CAT-інструмент перекласти сканований PDF із таблицями?

Для сканованого PDF спершу потрібне OCR, яке перетворює зображення сторінки на текст. Після розпізнавання звір результат з оригіналом, особливо числа й дані в комірках таблиці.

Як перевірити порядок тексту в PDF перед перекладом?

Витягни текст і зістав його послідовність із заголовками, абзацами, таблицями та виносками на сторінці. Окремо перевір багатоколонкові фрагменти й таблиці, які продовжуються після розриву сторінки.

Чи збереже перекладений файл початковий макет PDF?

Не обов’язково. Перекладацький процес може працювати з DOCX або текстом і не повертати готовий PDF, а довший переклад може змінити розташування вмісту. До початку роботи погодь кінцевий формат і перевірку верстки.

Спробуйте ChatsControl

AI-платформа для професійних перекладачів

Спробувати безкоштовно →