LokalizaceAI překladPřekladová paměťterminology

Glosář překladu a lokalizace: termíny, se kterými se v praxi skutečně setkáte

Překladová paměť, fuzzy match, MTPE, XLIFF, TMX, leverage, transkreace. Srozumitelné definice všech pojmů, na které narazíte v cenové nabídce, CAT nástroji nebo při komunikaci s dodavatelem, a vysvětlení jejich vzájemných souvislostí.

Mariia Ivakhnenko
Mariia Ivakhnenko9 min čtení
Na této stránce

Obor překladu má problém s terminologií. Polovinu výrazů tvoří zkratky, řada z nich znamená skoro totéž a pár dalších má různý význam podle toho, s kým zrovna mluvíte. Pak vám dorazí cenová nabídka slibující „80% leverage při 85% fuzzy prahu“ a není vůbec jasné, jestli je to dobrá zpráva.

Toto je praktický glosář: termíny, se kterými se setkáte v cenové nabídce, CAT nástroji nebo při komunikaci s dodavatelem, jsou definovány v pořadí, v jakém na ně obvykle narazíte, nikoliv abecedně. Pokud má některý pojem specifický význam pro Transept, je to u něj vyznačeno.

Jaký je rozdíl mezi glosářem, terminologickou databází a překladovou pamětí?

V běžné řeči se tyto tři pojmy často zaměňují, ale v rámci nástrojů má každý z nich jiný význam.

Glosář

Seznam termínů s jejich schválenými překlady a poznámkami k jejich použití. Patří sem názvy produktů, jména postav, právní terminologie nebo výrazy, na kterých klient trvá. Glosář dává jasnou odpověď na jedinou otázku: jakou podobu musí tento termín mít, když se v textu objeví?

V Transeptu jsou glosáře u každého spuštění připnuty přímo do promptu a následně znovu kontrolovány, takže termín zvolený na první straně bude platit i na straně 500.

Terminologická databáze (TB)

Takto se v CAT nástrojích říká glosáři, který u jednotlivých hesel obvykle obsahuje více metadat: slovní druh, obor, seznam zakázaných variant a někdy i definici. Pokud někdo mluví o terminologické databázi a vy slyšíte „glosář“, pochopili jste to správně.

Překladová paměť (TM)

Úložiště již přeložených segmentů, kde je zdroj spárován s cílem. Tyto dvojice se znovu využívají, kdykoliv se v textu objeví něco podobného. Glosář funguje na úrovni termínů, paměť na úrovni celých vět.

Klasická paměť hledá shody v textu. Překladová paměť od Transeptu však rozpozná i shodu významovou a uchovává si i zdůvodnění jednotlivých rozhodnutí (zamítnuté alternativy, komentáře z revizí). Právě díky tomu dokáže pomoci i u vět, které jsou formulovány jinak, ale řeší stejný problém. O tom, co se tím změnilo, jsme se rozepsali podrobněji.

Fuzzy match

Shoda v paměti, která je blízká, ale nikoliv identická, vyjádřená v procentech. Obvyklou hranicí bývá 85 %: nad touto hodnotou se uložený překlad nabídne jako výchozí bod, pod ní se segment považuje za nový. Číslo vyjadřuje textovou podobnost, nikoliv to, zda byl původní překlad kvalitní.

Přesná shoda, 100% a 101%

Přesná neboli 100% shoda znamená, že zdrojový segment je identický se segmentem, který již v paměti existuje. 101% shoda (označovaná také jako kontextová přesná shoda neboli ICE) znamená, že segment je identický a zároveň se shodují i segmenty v jeho okolí. Kontext je tedy stejný a je mnohem pravděpodobnější, že uložený překlad bude i nadále sedět.

Leverage

Podíl nové zakázky v procentech, který už pokrývá paměť. V leverage jde především o peníze: agentury na slova s vysokou mírou leverage dávají výrazné slevy, protože 100% shoda vyžaduje jen revizi, nikoliv nový překlad. Pokud cenová nabídka uvádí leverage, v podstatě vám říká, kolik práce se díky paměti ušetří.

Co znamenají zkratky pro strojový překlad?

Strojový překlad (MT)

Jakýkoliv automatický překlad bez ohledu na použitou technologii. Jde o zastřešující pojem.

Neurální strojový překlad (NMT)

Strojový překlad využívající neurální sítě trénované přímo pro účely překladu. Do této generace překladačů patří například DeepL nebo Google Translate. NMT sice vyniká v tvorbě plynule znějících vět, ale neumí pracovat s instrukcemi – nemůžete mu tedy v průběhu práce nařídit, aby byl formálnější.

Překlad pomocí LLM

Překlad prováděný velkým jazykovým modelem pro obecné účely. Praktický rozdíl oproti NMT spočívá v tom, že s ním můžete komunikovat: můžete mu poskytnout glosář, stylistickou příručku, kontext dokumentu nebo instrukce ohledně tónu. Transept využívá nejmodernější LLM a k modelu přistupuje jako k vyměnitelnému backendu.

MTPE (post-editace strojového překladu)

Proces, při kterém člověk upravuje výstup ze stroje do podoby hotového překladu. Někdy se používá i zkratka PEMT. V oboru jde o převládající pracovní model a právě ten prošel s příchodem LLM největší proměnou: starší systémy MT byly očividně nedokonalé, takže chyby hned bily do očí, zatímco výstupy z LLM mohou znít skvěle, i když v nich chybí část věty.

Náš průvodce post-editací (MTPE) se věnuje tomu, jak tento proces nastavit tak, aby se lidský úsudek zapojil ještě před vznikem samotného návrhu, nikoliv až po něm.

Lehká a úplná post-editace

Dvě úrovně služeb. Cílem lehké post-editace je přesnost a srozumitelnost, přičemž se toleruje i stylistická strohost. Úplná post-editace pak směřuje k publikační kvalitě, která je k nerozeznání od překladu vytvořeného od nuly. Na fakturách na těchto pojmech záleží – vyjadřují totiž zásadní rozdíl v množství vynaloženého lidského času.

Jak překladatelský nástroj rozděluje dokument?

Segment

Základní jednotka, na kterou nástroj rozděluje text – téměř vždy se jedná o větu. Překladová paměť se ukládá po segmentech, po segmentech se vyhodnocují shody a počítá se i počet slov.

Zdroj a cíl

Zdroj je jazyk, ze kterého překládáte, cíl ten, do kterého překládáte. Zdrojový segment a jeho cílový protějšek společně tvoří jeden záznam v paměti. „Počet zdrojových slov“ je pak běžným základem pro stanovení ceny, a to i u nás.

Blok

Jednotka v Transeptu, záměrně větší než segment: odstavec, nadpis, položka seznamu nebo buňka tabulky. Blok uchovává věty v jejich přirozeném kontextu, takže model vidí, že zájmeno o tři věty dál odkazuje na něco v úvodu. I v rámci bloku je však stále k dispozici kontrola na úrovni jednotlivých vět.

Alignment

Spárování stávajícího překladu s jeho zdrojem segment po segmentu, díky čemuž se může i práce odvedená před vznikem nástroje stát součástí jeho paměti. Alignment slouží také jako kontrola při importu hotových překladů: pokud si obě strany přesně neodpovídají, znamená to, že v nich něco přebývá nebo chybí.

Jaké formáty souborů se předávají mezi nástroji?

XLIFF

XML Localization Interchange File Format. Jde o standardní formát pro přenos obsahu k překladu mezi systémy: každá jednotka obsahuje zdroj, cíl, stav a často i poznámku pro překladatele. Pokud vám klient pošle dvojjazyčný soubor, pravděpodobně to bude právě XLIFF. Nabízíme bezplatný převodník XLIFF, díky kterému si můžete soubor otevřít v tabulkovém procesoru.

TMX

Translation Memory eXchange. Přenosný formát pro překladové paměti, díky kterému lze paměť vytvořenou v jednom nástroji přenést do jiného. Právě díky TMX je paměť aktivem, které skutečně vlastníte, a nikoliv něčím, co zůstává u dodavatele.

TBX

TermBase eXchange. Jde o stejný koncept jako u TMX, ale pro glosáře a terminologické databáze. Používá se méně často než TMX, protože glosáře bývají natolik malé, že si lidé místo nich raději posílají tabulky e-mailem.

PO a gettext

Formát řetězců, který využívá velká část open-source softwaru, WordPress a projekty v Pythonu a PHP. Soubor .po páruje každý zdrojový řetězec s jeho překladem a uchovává i komentáře překladatele; .pot pak slouží jako prázdná šablona.

SRT a VTT

Formáty titulků: časování a text, jeden titulek za druhým. Jejich překlad vyžaduje brát v úvahu nejen význam, ale i rychlost čtení a délku řádků – titulek, který je sice věrný, ale příliš dlouhý, je totiž na obrazovce nečitelný.

Soubory prostředků

Platformově specifické kontejnery, do nichž aplikace ukládá řetězce svého rozhraní: .strings na platformách Apple, .resx v .NET, .arb pro Flutter a téměř všude jinde prostý JSON nebo YAML. Překlad softwaru znamená překládat právě tyto soubory namísto dokumentů, a proto pracovní postupy s tabulkami řetězců vypadají jinak než ty pro dokumenty.

Co znamenají pojmy týkající se kvality a procesů?

Locale

Jazyk, region a související konvence: formát data, oddělovač desetinných míst, měna, formát adresy a někdy i odlišné písmo. pt-BR i pt-PT jsou v obou případech portugalština, ale v rámci produktu nejsou zaměnitelné. Právě volba konkrétního locale namísto pouhého jazyka zajistí, že brazilský čtenář nenarazí na evropské obraty.

i18n a l10n

Numeronyma, která vznikají spočítáním písmen mezi prvním a posledním znakem. Internacionalizace (i18n) je technická příprava, díky níž je produkt vůbec možné přeložit: text není vložen přímo v obrázcích, věty se neskládají z útržků a v rozvržení je dostatek místa pro němčinu. Lokalizace (l10n) představuje přizpůsobení produktu pro konkrétní locale. i18n proběhne jen jednou, l10n se provádí pro každý jazyk zvlášť.

Stylistická příručka

Pravidla, která se netýkají terminologie: míra formálnosti, tón, způsob oslovování čtenáře, zvyklosti v interpunkci a uvozovkách nebo nakládání s čísly a jednotkami. Právě stylistické příručky zajišťují, aby překlad působil jednotně i tehdy, když se na něm podílelo více lidí v několika různých fázích.

LQA (zajištění jazykové kvality)

Strukturovaná kontrola: hodnotitel u vzorku textu boduje různé kategorie chyb (přesnost, terminologii, styl, konvence locale) a u každé chyby určuje její závažnost. Výsledkem je číselné skóre, nikoli jen subjektivní dojem. Tento postup slouží k přijetí či odmítnutí dodávky a k porovnávání dodavatelů.

Transkrece

Přepisování s ohledem na účinek namísto překládání významu. Slogan založený na anglické slovní hříčce nebude v japonštině fungovat, takže zadání nezní „přeložte to přesně“, ale „zařiďte, aby to mělo ten správný dopad“. Cena se určuje podle hodinové sazby nebo za koncept, nikdy od slova.

Zpětný překlad

Překlad cílového textu zpět do zdrojového jazyka, který vypracuje jiný překladatel bez znalosti originálu, aby se ověřilo, že význam zůstal zachován. Je to standardní postup u klinických studií a regulovaných materiálů, kde každá chyba vyjde draho. Ověřuje se jím význam, nikoliv styl.

Často kladené dotazy

Které z těchto pojmů skutečně potřebuji hned od začátku?

Čtyři: glosář, překladová paměť, segment a locale. Tyto pojmy popisují, jak se práce ukládá a dělí, a bohatě stačí k tomu, abyste se zorientovali v cenové nabídce. Akronymy tvoří hlavně slovní zásobu pro komunikaci s dodavateli a práci s nástroji; jejich význam si můžete vyhledat, až na ně narazíte.

Mohu si do Transeptu převést překladovou paměť z jiného nástroje?

Můžete si převést samotné překlady, a to zcela zdarma: neúčtují se žádná spuštění modelu ani počet slov, protože práce už byla hotová. Využít k tomu můžete import tabulky řetězců popsaný v části Import stávajících překladů, nebo nahrání již přeloženého dokumentu. Přímý import souborů .tmx v surovém stavu zatím není možný. Náš bezplatný nástroj TMX Cleaner je v prohlížeči převede do Excelu nebo CSV (nic se nikam nenahrává), což je obvykle nejrychlejší způsob, jak starou paměť dostat do podoby, se kterou lze pracovat.

Mohou se glosáře a překladová paměť dostat do konfliktu?

Každý z těchto nástrojů slouží k něčemu jinému a používají se společně. Glosář pevně stanovuje podobu jednotlivých termínů, zatímco paměť uchovává způsob, jakým byl minule přeložen celý segment. Nástroj, který využívá obojí, aplikuje glosář na termíny a paměť na okolní text – díky tomu i věta vyvolaná z paměti vždy odpovídá vaší aktuální terminologii.

Je u moderních modelů posteditace stále nutná?

Ano, důvody jsou však dnes jiné. Starší systémy strojového překladu selhávaly viditelně, takže chyby byly patrné na první pohled a daly se snadno opravit. Moderní modely sice generují plynulý text, ten však může postrádat část věty, mít zploštělý stylistický rejstřík nebo obsahovat slovo použité v nesprávném významu. Editace se už tedy netýká ani tak opravování gramatiky, jako spíše kontroly, zda zůstal zachován původní význam a tón textu.

Jaký je rozdíl mezi překladem a lokalizací?

Překlad se týká samotného textu. Lokalizace zahrnuje vše ostatní, co je potřeba změnit, aby produkt fungoval na jiném trhu: formáty data a měny, formáty jmen a adres, výběr obrázků a barev, právní upozornění i úpravy rozvržení nutné v případech, kdy je stejná věta o 30 % delší. Přeložený produkt může stále působit cize, ten lokalizovaný nikoliv.

Autor

Mariia Ivakhnenko
Mariia IvakhnenkoSpoluzakladatelka

Spoluzakladatelka Transeptu. Tři tituly z anglického jazyka a literatury – Kyjev, Ostrava a rok v Salcburku – a rodilá Ukrajinka, která většinu svého spisovatelského života prožívá v angličtině. K AI se dostala jako prompt inženýrka, poté přešla k produktovému a lifecycle marketingu. Píše semifiktivní příběhy o skutečných lidech a neustále krouží kolem otázky, co se ztrácí mezi jazyky.