Глосарій перекладу та локалізації: терміни, що реально трапляються в роботі
Пам’ять перекладу, неточні збіги, MTPE, XLIFF, TMX, леверидж, транскреація. Доступні пояснення всіх термінів, що зустрічаються в кошторисах, CAT-інструментах чи розмовах із вендорами, а також опис їхнього взаємозв’язку.

На цій сторінці
У перекладі є проблема з термінологією. Половина слів тут — абревіатури, чимало з них означають майже одне й те саме, а деякі — зовсім різне, залежно від того, хто говорить. Приходить кошторис з обіцянкою «80% левериджу при порозі неточних збігів 85%», і не зовсім зрозуміло, чи це гарна новина.
Це робочий глосарій: терміни, з якими ви стикаєтеся в кошторисах, CAT-інструментах чи під час спілкування з вендорами, наведені не за алфавітом, а в порядку їхньої появи. Якщо термін має специфічне для Transept значення, це вказано окремо.
У чому різниця між глосарієм, термінологічною базою та пам'яттю перекладу?
У розмовах ці три поняття часто вживають як синоніми, хоча в інструментах вони мають різне значення.
Глосарій
Список термінів із затвердженими перекладами та примітками щодо контексту їхнього вживання. Назви продуктів, імена персонажів, юридична лексика — слова, на яких наполягає замовник. Глосарій відповідає на одне питання: яким має бути цей термін у перекладі?
У Transept глосарії закріплюються в промпті під час кожного запуску та додатково перевіряються на виході, тож термін, узгоджений на першій сторінці, залишиться незмінним і на п’ятсотій.
Термінологічна база (TB)
Так у CAT-інструментах називають глосарій. Зазвичай він містить більше метаданих для кожного запису: частину мови, галузь, список заборонених варіантів, а іноді й визначення. Якщо хтось каже «термінологічна база», а ви чуєте «глосарій» — ви все правильно зрозуміли.
Пам'ять перекладу (TM)
Сховище вже перекладених сегментів (оригінал у парі з перекладом), які використовуються повторно, коли трапляється схожий текст. Глосарій працює на рівні окремих термінів, а пам'ять перекладу — на рівні цілих речень.
Класична пам'ять шукає збіги за текстом. Пам'ять перекладу від Transept також враховує зміст і зберігає аргументацію (відхилені варіанти, коментарі редакторів) — саме це дозволяє їй допомагати з реченнями, які сформульовані інакше, але вирішують ту саму задачу. Ми розповіли про те, що це змінило.
Неточний збіг
Збіг у пам’яті, близький, але не ідентичний оригіналу, що оцінюється у відсотках. 85% — це загальноприйнятий поріг: якщо показник вищий, збережений варіант пропонується як основа для роботи, якщо нижчий — сегмент вважається новим. Ця цифра вказує на текстову схожість, а не на те, наскільки вдалим був старий переклад.
Точний збіг, 100% та 101%
Точний або 100-відсотковий збіг означає, що сегмент оригіналу повністю ідентичний тому, що вже є в пам’яті. 101-відсотковий збіг (його також називають точним збігом у контексті, або ICE) означає, що ідентичним є не лише сам сегмент, а й ті, що його оточують. Оскільки контекст той самий, збережений переклад із набагато більшою ймовірністю підійде і в цьому випадку.
Леверидж
Відсоток нового замовлення, який уже покриває пам’ять перекладу. Леверидж безпосередньо впливає на вартість: агенції роблять великі знижки на слова з високим левериджем, оскільки 100-відсотковий збіг потребує лише перевірки, а не перекладу. Коли в кошторисі вказують леверидж, вам повідомляють, яку частину роботи планують пропустити.
Що означають абревіатури машинного перекладу?
Машинний переклад (MT)
Будь-який автоматичний переклад, незалежно від технології, на якій він базується. Це загальна назва.
Нейронний машинний переклад (NMT)
Машинний переклад за допомогою нейронних мереж, спеціально навчених для перекладу. Це покоління систем, до якого належать DeepL та Google Translate. NMT добре створює природні речення, але не здатний сприймати інструкції: ви не можете попросити його змінити тон на більш офіційний посеред тексту.
LLM-переклад
Переклад за допомогою універсальної великої мовної моделі. Практична відмінність від NMT полягає в тому, що з моделлю можна «спілкуватися»: надати їй глосарій, стайл-гайд, контекст документа чи вказівки щодо тону. Transept працює на базі передових LLM і використовує модель як взаємозамінний бекенд.
MTPE (постредагування машинного перекладу)
Редагування людиною результатів машинного перекладу до стану готового перекладу. Інколи вживається абревіатура PEMT. Це панівна модель роботи в індустрії, і саме її LLM змінили найбільше: старі системи MT видавали відверто «сирий» текст, де помилки одразу впадали в око, тоді як результат LLM може звучати бездоганно, навіть якщо в ньому пропущено цілу частину речення.
Наш посібник із MTPE пояснює, як організувати роботу так, щоб людська експертиза залучалася ще до створення чернетки, а не лише після.
Спрощене та повне постредагування
Це два рівні послуг. Мета спрощеного постредагування — забезпечити точність і зрозумілість, при цьому допускається певна стилістична сухість. Повне постредагування орієнтоване на якість рівня публікації: такий текст неможливо відрізнити від перекладу, виконаного з нуля. Ці формулювання в інвойсі мають велике значення, адже за ними стоїть суттєва різниця в обсязі витраченого людського часу.
Як інструмент перекладу розбиває документ на частини?
Сегмент
Одиниця, на яку інструмент розбиває текст — майже завжди це речення. Пам'ять зберігається на рівні сегментів, збіги оцінюються для кожного сегмента, а кількість слів підраховується посегментно.
Оригінал і переклад
Оригінал — це мова, з якої ви перекладаєте, а переклад — та, на яку ви перекладаєте. Сегмент оригіналу та відповідний йому сегмент перекладу разом утворюють один запис у пам'яті. «Слова оригіналу» зазвичай є основою для розрахунку вартості, зокрема й у нас.
Блок
Одиниця роботи в Transept, яка навмисно є більшою за сегмент: абзац, заголовок, елемент списку або комірка таблиці. Блок утримує речення поряд із сусідніми реченнями, щоб модель бачила, що займенник трьома реченнями нижче стосується чогось на початку. При цьому всередині блоку зберігається можливість керування на рівні окремих речень.
Вирівнювання
Зіставлення наявного перекладу з оригіналом посегментно, завдяки чому робота, виконана ще до появи інструменту, стає частиною його пам'яті. Вирівнювання — це також перевірка, що запускається під час імпорту готових перекладів: якщо дві сторони не збігаються один до одного, це означає, що щось було додано або пропущено.
Які формати файлів використовуються для обміну між інструментами?
XLIFF
XML Localization Interchange File Format. Це стандартний контейнер для обміну контентом між системами: кожна одиниця містить оригінал, переклад, статус і часто примітку для перекладача. Якщо клієнт надсилає вам двомовний файл, найімовірніше, це XLIFF. Ми пропонуємо безкоштовний конвертер XLIFF для перегляду таких файлів у таблицях.
TMX
Translation Memory eXchange. Універсальний формат для пам'яті перекладу, який дозволяє переносити базу, створену в одному інструменті, до іншого. Саме завдяки TMX пам'ять перекладу є вашим власним активом, а не чимось, що залишається у підрядника.
TBX
TermBase eXchange. Аналогічний формат для глосаріїв та термінологічних баз. Він менш поширений, ніж TMX, оскільки глосарії зазвичай мають невеликий обсяг, і їх простіше пересилати електронною поштою у вигляді звичайних таблиць.
PO та gettext
Формат рядків, що використовується у величезній кількості програмного забезпечення з відкритим кодом, у WordPress, а також у проєктах на Python та PHP. У файлі .po кожному рядку оригіналу відповідає його переклад, а також зберігаються коментарі перекладача; .pot — це порожній шаблон.
SRT та VTT
Формати субтитрів: часові мітки та текст, по одній репліці за раз. Перекладати їх — означає зважати на швидкість читання та довжину рядка так само, як і на зміст, адже точний, але занадто довгий титр буде неможливо прочитати на екрані.
Файли ресурсів
Це специфічні для кожної платформи контейнери, в яких застосунок зберігає рядки інтерфейсу: .strings на платформах Apple, .resx у .NET, .arb для Flutter, а майже в усіх інших випадках — звичайні JSON або YAML. Переклад програмного забезпечення означає роботу саме з такими файлами, а не з документами, тому робочі процеси з таблицями рядків відрізняються від процесів роботи з документами.
Що означають терміни, пов'язані з якістю та процесами?
Локаль
Це поєднання мови, регіону та притаманних йому норм: формату дати, десяткового розділювача, валюти, формату адреси, а іноді й іншої системи письма. pt-BR та pt-PT — це португальська мова, але в продукті вони не є взаємозамінними. Вибір локалі замість мови гарантує, що бразильський читач не натрапить на європейські мовні звороти.
i18n та l10n
Це нумероніми — скорочення, утворені підрахунком літер між першою та останньою. Інтернаціоналізація (i18n) — це інженерна підготовка, що робить продукт технічно придатним до перекладу: текст не «вшивається» в зображення, речення не збираються з фрагментів, а в макеті передбачено місце для розширення тексту (як-от у німецькій). Локалізація (l10n) — це адаптація під конкретну локаль. i18n виконується один раз, а l10n — для кожної мови окремо.
Стайл-гайд
Правила, що не стосуються термінології: рівень офіційності, тон, манера звернення до читача, особливості пунктуації та вживання лапок, правила написання чисел і одиниць вимірювання. Стайл-гайди допомагають перекладу звучати цілісно, навіть якщо над ним працювали різні люди в кілька етапів.
LQA (лінгвістичний контроль якості)
Структурована перевірка: рецензент оцінює вибірку за категоріями помилок (точність, термінологія, стиль, норми локалі), визначаючи ступінь критичності кожної помилки. Це дозволяє отримати числовий показник замість суб’єктивного враження. Такий підхід використовується для прийняття або відхилення виконаної роботи, а також для порівняння підрядників.
Транскреація
Це переписування тексту задля досягнення потрібного ефекту, а не просто переклад для передачі змісту. Слоган, побудований на грі слів в англійській мові, не спрацює в японській, тому технічне завдання звучить як «зробіть, щоб це зачепило», а не «зробіть це точно». Вартість такої роботи розраховується за годину або за концепцію, але ніколи не за слово.
Зворотний переклад
Переклад цільового тексту назад мовою оригіналу іншим перекладачем, який не бачив першоджерела, щоб перевірити, чи зберігся зміст. Це стандартна практика для клінічних випробувань та регульованих сфер, де помилка коштує надто дорого. Він перевіряє зміст, а не стиль.
Часті запитання
Які з цих термінів мені справді знадобляться від самого початку?
Чотири: глосарій, пам’ять перекладу, сегмент і локаль. Вони описують, як зберігається та розподіляється робота, і цього цілком достатньо, щоб розібратися в кошторисі. Абревіатури — це переважно професійна лексика для спілкування з підрядниками та роботи з інструментами; їхнє значення можна просто подивитися, коли вони траплятимуться.
Чи можна перенести пам’ять перекладу з іншого інструмента в Transept?
Ви можете перенести самі переклади, і вони додаються безкоштовно: плата за роботу моделей чи кількість слів не стягується, оскільки роботу вже виконано. Це можна зробити за допомогою імпорту таблиці рядків, як описано в розділі Перенесення наявних перекладів, або завантаживши вже перекладений документ. Наразі прямий імпорт файлів .tmx у сирому вигляді не підтримується. Наш безкоштовний інструмент TMX Cleaner конвертує їх у формат Excel або CSV прямо у вашому браузері (дані нікуди не завантажуються) — зазвичай це найшвидший спосіб привести стару пам’ять перекладу до вигляду, придатного для роботи.
Чи конфліктують між собою глосарії та пам’ять перекладу?
Вони виконують різні функції й використовуються разом. Глосарій закріплює переклад конкретного терміна, а пам’ять відтворює те, як цілий сегмент було опрацьовано минулого разу. Інструмент, що використовує обидві технології, застосовує глосарій до термінів, а пам’ять — до формулювань навколо них. Завдяки цьому навіть у реченні, підтягнутому з пам’яті, завжди використовуватиметься ваша актуальна термінологія.
Чи залишається постредагування необхідним із появою сучасних моделей?
Так, і причина тепер інша. Раніше машинний переклад помилявся відверто, тож огріхи було легко помітити й виправити. Сучасна ж модель видає цілком природний текст, який, проте, може втратити частину речення, згладити стилістику або вжити слово в хибному значенні. Тож сьогодні редагування — це не стільки робота над граматикою, скільки перевірка того, чи справді вдалося зберегти зміст і авторський голос.
Яка різниця між перекладом і локалізацією?
Переклад — це робота з текстом. Локалізація — це все інше, що потрібно змінити, аби продукт прижився на новому ринку: формат дат і валют, написання імен та адрес, зображення й кольорова гама, юридичні застереження та коригування верстки, коли те саме речення стає на 30% довшим. Перекладений продукт усе ще може здаватися чужим; локалізований — ні.
Автор

Співзасновниця Transept. Має три дипломи з англійської мови та літератури — Київ, Острава та рік у Зальцбурзі — і, як українка, більшу частину свого письменницького життя проводить англійською. Прийшла в AI як промпт-інженерка, потім займалася продуктовим маркетингом. Вона пише напіввигадані історії про реальних людей і постійно повертається до питання про те, що втрачається між мовами.