LokalizacjaTłumaczenie AIPamięć tłumaczeniowaterminology

Słowniczek pojęć z zakresu tłumaczeń i lokalizacji: terminy, z którymi faktycznie się zetkniesz

Pamięć tłumaczeniowa, fuzzy match, MTPE, XLIFF, TMX, leverage, transkreacja. Przystępne definicje wszystkich pojęć, z którymi zetkniesz się w wycenach, narzędziach CAT czy rozmowach z dostawcami, oraz wyjaśnienie, jak się one ze sobą łączą.

Mariia Ivakhnenko
Mariia Ivakhnenko9 min czytania
Na tej stronie

W branży tłumaczeniowej mamy problem z terminologią. Połowa pojęć to skrótowce, wiele z nich oznacza niemal to samo, a znaczenie innych zależy od tego, z kim akurat rozmawiasz. Gdy dostajesz wycenę obiecującą „80% leverage przy 85-procentowym progu fuzzy”, nie od razu wiadomo, czy to dobra wiadomość.

Oto praktyczny słowniczek: znajdziesz tu terminy z wycen, narzędzi CAT czy rozmów z dostawcami, ułożone w kolejności, w jakiej zazwyczaj się na nie natykasz, a nie alfabetycznie. Jeśli dane pojęcie ma w Transept specyficzne znaczenie, wyraźnie to zaznaczyliśmy.

Czym różnią się glosariusz, baza terminologiczna i pamięć tłumaczeniowa?

W rozmowach te trzy pojęcia bywają używane zamiennie, ale w samym narzędziu każde z nich oznacza co innego.

Glosariusz

Lista terminów wraz z ich zatwierdzonymi tłumaczeniami oraz uwagami dotyczącymi ich stosowania. Nazwy produktów, imiona postaci, słownictwo prawnicze czy wyrażenia, na których użyciu zależy klientowi. Glosariusz odpowiada na jedno pytanie: jak musi brzmieć dany termin, gdy pojawi się w tekście?

W Transept glosariusze są dołączane do promptu przy każdym zadaniu i weryfikowane ponownie po jego zakończeniu. Dzięki temu termin ustalony na 1. stronie pozostaje aktualny aż do strony 500.

Baza terminologiczna (TB)

Tak w narzędziach CAT określa się glosariusz, zazwyczaj wzbogacony o dodatkowe metadane przy każdym haśle: część mowy, dziedzinę, listę wariantów zakazanych, a niekiedy definicję. Jeśli ktoś mówi „baza terminologiczna”, a Ty słyszysz „glosariusz”, to znaczy, że wiesz, o co chodzi.

Pamięć tłumaczeniowa (TM)

Baza przetłumaczonych już segmentów (tekst źródłowy sparowany z docelowym), wykorzystywana ponownie, gdy pojawi się podobny tekst. Glosariusz działa na poziomie terminów, natomiast pamięć – na poziomie całych zdań.

Klasyczna pamięć bazuje na dopasowywaniu tekstu. Pamięć tłumaczeniowa Transept dopasowuje również znaczenie i zachowuje uzasadnienie podjętych decyzji (odrzucone warianty, uwagi z weryfikacji) – to właśnie dzięki temu pomaga przy zdaniach sformułowanych inaczej, ale rozwiązujących ten sam problem. Opisaliśmy, co to zmieniło.

Fuzzy match

Trafienie z pamięci bliskie oryginałowi, ale nie identyczne, wyrażone procentowo. Częstym progiem jest 85%: powyżej tej granicy system podpowiada zapisane tłumaczenie jako punkt wyjścia, poniżej traktuje segment jako nowy. Ta liczba opisuje podobieństwo tekstowe, a nie to, czy poprzednie tłumaczenie było dobre.

Exact match, 100% i 101%

Exact match lub dopasowanie 100% oznacza, że segment źródłowy jest identyczny z wpisem znajdującym się już w pamięci. Dopasowanie 101% (zwane również dopasowaniem kontekstowym – in-context exact match – lub ICE) oznacza, że identyczny jest sam segment oraz segmenty sąsiadujące. Dzięki temu wiemy, że kontekst pozostaje ten sam, a zapisane tłumaczenie z dużo większym prawdopodobieństwem będzie pasować.

Leverage

Procentowy stopień, w jakim nowe zlecenie jest już pokryte przez pamięć tłumaczeniową. Leverage przekłada się na pieniądze: agencje oferują duże zniżki na słowa z wysokim wskaźnikiem leverage, ponieważ dopasowanie 100% kosztuje tyle, co weryfikacja, a nie pełne tłumaczenie. Informacja o leverage w wycenie mówi o tym, jaką część pracy można pominąć.

Co oznaczają skróty dotyczące tłumaczenia maszynowego?

Tłumaczenie maszynowe (MT)

Dowolne tłumaczenie automatyczne, niezależnie od zastosowanej technologii. To termin nadrzędny.

Neuronowe tłumaczenie maszynowe (NMT)

Tłumaczenie maszynowe oparte na sieciach neuronowych szkolonych specjalnie pod kątem tłumaczeń. To generacja silników, do której należą DeepL i Tłumacz Google. NMT świetnie radzi sobie z budowaniem płynnych zdań, ale nie potrafi realizować instrukcji – nie można mu nakazać, by w połowie tekstu zaczęło pisać bardziej formalnie.

Tłumaczenie LLM

Tłumaczenie wykonywane przez duży model językowy ogólnego przeznaczenia. Praktyczna różnica względem NMT polega na tym, że z modelem LLM można „rozmawiać”: dostarczyć mu glosariusz, przewodnik stylistyczny, kontekst dokumentu czy wytyczne dotyczące tonu wypowiedzi. Transept bazuje na najnowocześniejszych modelach LLM i traktuje model jako wymienny backend.

MTPE (postedycja tłumaczenia maszynowego)

Poprawianie przez człowieka tekstu wygenerowanego przez maszynę do postaci gotowego tłumaczenia. Niekiedy zapisywane jako PEMT. To dominujący model pracy w branży i ten, który modele LLM zmieniły najbardziej: starsze systemy MT były ewidentnie toporne, więc błędy same rzucały się w oczy. Tymczasem tekst z modelu LLM może brzmieć znakomicie, nawet jeśli brakuje w nim fragmentu zdania.

Nasz przewodnik po MTPE wyjaśnia, jak zorganizować ten proces, aby ludzki osąd był obecny jeszcze przed powstaniem wersji roboczej, a nie dopiero po niej.

Post-edycja lekka i pełna

Dwa poziomy usług. Post-edycja lekka stawia na poprawność i zrozumiałość, dopuszczając przy tym płaski styl. Post-edycja pełna dąży do jakości publikacyjnej – tekst ma być nie do odróżnienia od tłumaczenia napisanego od zera. Te określenia na fakturze mają znaczenie: oznaczają dwa zupełnie inne nakłady czasu pracy człowieka.

Jak narzędzie tłumaczeniowe dzieli dokument?

Segment

Jednostka, na którą narzędzie dzieli tekst – niemal zawsze jest to zdanie. To na poziomie segmentów przechowywana jest pamięć, wyliczany jest stopień dopasowania i obliczana jest liczba słów.

Język źródłowy i docelowy

Język źródłowy to ten, z którego tłumaczysz, a docelowy – ten, na który tłumaczysz. Segment źródłowy i segment docelowy tworzą razem jeden wpis w pamięci. „Słowa źródłowe” stanowią zazwyczaj podstawę wyceny, w tym również naszej.

Blok

Jednostka Transept, celowo większa niż segment: akapit, nagłówek, element listy lub komórka tabeli. Blok grupuje powiązane ze sobą zdania, dzięki czemu model widzi, że zaimek użyty trzy zdania dalej odnosi się do czegoś na samym początku. Wewnątrz bloku wciąż jednak masz kontrolę na poziomie pojedynczych zdań.

Alineacja

Zestawianie istniejącego tłumaczenia z tekstem źródłowym segment po segmencie, aby praca wykonana przed wdrożeniem narzędzia mogła zasilić jego pamięć. Alignment to także proces weryfikacji przeprowadzany przy imporcie gotowych tłumaczeń: jeśli obie wersje nie pokrywają się w stosunku jeden do jednego, oznacza to, że coś dodano lub pominięto.

Jakie formaty plików są wymieniane między narzędziami?

XLIFF

XML Localization Interchange File Format. To standardowy format służący do przenoszenia treści między systemami: każda jednostka zawiera tekst źródłowy, tekst docelowy, status, a często także notatkę dla tłumacza. Jeśli klient przesyła plik dwujęzyczny, najprawdopodobniej jest to właśnie XLIFF. Udostępniamy bezpłatny konwerter XLIFF, który pozwala na otwarcie takiego pliku w arkuszu kalkulacyjnym.

TMX

Translation Memory eXchange. Przenośny format pamięci tłumaczeniowej, który pozwala na przenoszenie danych między różnymi narzędziami. To właśnie dzięki TMX pamięć jest Twoim własnym zasobem, a nie czymś, co pozostaje w rękach dostawcy.

TBX

TermBase eXchange. Ta sama idea, tyle że dla glosariuszy i baz terminologicznych. Format rzadziej stosowany niż TMX, ponieważ glosariusze są zazwyczaj na tyle małe, że zamiast tego po prostu przesyła się arkusze kalkulacyjne.

PO i gettext

Format stringów wykorzystywany w ogromnej części oprogramowania open-source, WordPressie oraz projektach w Pythonie i PHP. Plik .po łączy każdy string źródłowy z jego tłumaczeniem i zawiera komentarze tłumacza; .pot to pusty szablon.

SRT i VTT

Formaty napisów: znaczniki czasu i tekst, segment po segmencie. Tłumaczenie ich wymaga dbania o tempo czytania i długość wersów na równi z samym sensem – wierny, lecz zbyt długi napis staje się na ekranie nieczytelny.

Pliki zasobów

Specyficzne dla poszczególnych platform kontenery, w których aplikacja przechowuje stringi interfejsu: .strings na platformach Apple, .resx w .NET, .arb we Flutterze, a niemal wszędzie indziej – zwykłe pliki JSON lub YAML. Tłumaczenie oprogramowania polega na tłumaczeniu właśnie tych plików, a nie dokumentów – dlatego procesy oparte na tabelach stringów wyglądają inaczej niż te dotyczące dokumentów.

Co oznaczają terminy dotyczące jakości i procesów?

Locale

Język wraz z regionem i właściwymi dla nich konwencjami: formatem daty, separatorem dziesiętnym, walutą, strukturą adresu, a niekiedy nawet innym rodzajem pisma. pt-BR i pt-PT to w obu przypadkach język portugalski, jednak w produkcie nie można ich stosować zamiennie. Wybór konkretnego locale zamiast samego języka sprawia, że czytelnik z Brazylii nie trafi na sformułowania typowe dla odmiany europejskiej.

i18n i l10n

Numeronimy – skróty tworzone przez zliczanie liter między pierwszą a ostatnią. Internacjonalizacja (i18n) to proces inżynieryjny, dzięki któremu produkt w ogóle nadaje się do tłumaczenia: oznacza brak tekstów zaszytych w grafikach, rezygnację ze zdań składanych z fragmentów i zapewnienie w układzie miejsca na język niemiecki. Lokalizacja (l10n) to dostosowanie go do konkretnego locale. Internacjonalizację przeprowadza się raz, lokalizację zaś – dla każdego języka z osobna.

Przewodnik stylistyczny

Zasady wykraczające poza samą terminologię: stopień sformalizowania, ton, sposób zwracania się do czytelnika, reguły interpunkcji i stosowania cudzysłowów oraz sposób zapisu liczb i jednostek. Przewodniki stylistyczne sprawiają, że tłumaczenie brzmi spójnie, nawet jeśli pracowało nad nim wiele osób w ramach kilku różnych etapów.

LQA (lingwistyczna kontrola jakości)

Ustrukturyzowany przegląd: weryfikator ocenia próbkę pod kątem kategorii błędów (wierność, terminologia, styl, konwencje locale), przypisując każdemu z nich określoną wagę. W ten sposób powstaje wynik liczbowy, a nie tylko subiektywne wrażenie. Metoda ta pozwala na obiektywne przyjmowanie lub odrzucanie zleceń oraz porównywanie jakości pracy dostawców.

Transkreacja

Pisanie tekstu na nowo z myślą o wywarciu konkretnego wrażenia, a nie tylko o oddaniu znaczenia. Gra słów zawarta w angielskim sloganie nie zadziała po japońsku, dlatego wytyczne sprowadzają się do tego, by przekaz „trafił” do odbiorcy, a nie by był wierny oryginałowi. Transkreację wycenia się za godzinę pracy lub za koncepcję, nigdy od liczby słów.

Tłumaczenie wsteczne

Polega na przetłumaczeniu tekstu docelowego z powrotem na język źródłowy przez innego tłumacza, który nie widział oryginału, aby sprawdzić, czy sens został zachowany. To standard w badaniach klinicznych i materiałach regulowanych, gdzie błędy są kosztowne. Tłumaczenie wsteczne służy do weryfikacji znaczenia, nigdy stylu.

FAQ

Których z tych terminów faktycznie potrzebuję na start?

Wystarczą cztery: glosariusz, pamięć tłumaczeniowa, segment i locale. Określają one, jak praca jest przechowywana i dzielona, co w zupełności wystarczy do zrozumienia wyceny. Akronimy to przede wszystkim słownictwo przydatne w kontaktach z dostawcami i przy obsłudze narzędzi – możesz je sprawdzać na bieżąco, gdy tylko na jakiś trafisz.

Czy mogę przenieść pamięć tłumaczeniową z innego narzędzia do Transepta?

Możesz przenieść same tłumaczenia, a ich zasilenie jest bezpłatne: nie naliczamy opłat za pracę modelu ani za liczbę słów, ponieważ praca została już wykonana. Można to zrobić poprzez import tabeli tekstów opisany w sekcji Przenieś swoje istniejące tłumaczenia lub poprzez zasilenie bazy przetłumaczonym już dokumentem. Obecnie nie obsługujemy bezpośredniego importu surowych plików .tmx. Nasze darmowe narzędzie TMX Cleaner konwertuje taki plik do formatu Excel lub CSV bezpośrednio w przeglądarce (nic nie jest przesyłane na serwer), co jest zazwyczaj najszybszym sposobem na doprowadzenie starej pamięci do formy, z którą można pracować.

Czy glosariusze i pamięć tłumaczeniowa wchodzą ze sobą w konflikt?

Służą do innych celów i wzajemnie się uzupełniają. Glosariusz narzuca brzmienie konkretnych terminów, natomiast pamięć przywołuje sposób, w jaki cały segment został przetłumaczony poprzednio. Narzędzie korzystające z obu tych rozwiązań stosuje glosariusz do terminów, a pamięć do otaczających je sformułowań – dzięki temu przywołane zdanie zawsze uwzględnia aktualną terminologię.

Czy w dobie nowoczesnych modeli postedycja nadal jest potrzebna?

Tak, tyle że zmienił się powód. Starsze systemy tłumaczenia maszynowego myliły się w sposób oczywisty, więc błędy łatwo było wyłapać i naprawić. Nowoczesne modele generują płynny tekst, w którym jednak wciąż może zdarzyć się pominięcie fragmentu zdania, spłaszczenie rejestru czy wybór niewłaściwego znaczenia słowa. Edycja nie polega już tyle na poprawianiu gramatyki, co na sprawdzaniu, czy sens i styl oryginału faktycznie przetrwały.

Jaka jest różnica między tłumaczeniem a lokalizacją?

Tłumaczenie to sam tekst. Lokalizacja to wszystko inne, co musi się zmienić, aby produkt mógł funkcjonować na innym rynku: daty i waluty, formaty nazwisk i adresów, obrazy i dobór kolorystyki, noty prawne oraz dostosowanie układu graficznego niezbędne, gdy to samo zdanie jest o 30% dłuższe. Przetłumaczony produkt wciąż może sprawiać wrażenie obcego; zlokalizowany – już nie.

Autor

Mariia Ivakhnenko
Mariia IvakhnenkoWspółzałożycielka

Współzałożycielka Transept. Posiada trzy dyplomy z filologii angielskiej – studiowała w Kijowie, Ostrawie i spędziła rok w Salzburgu. Z pochodzenia Ukrainka, która większość swojego pisarskiego życia spędza w języku angielskim. Do świata AI weszła jako inżynierka promptów, a następnie zajęła się marketingiem produktu i cyklu życia. Pisze na wpół fikcyjne historie o prawdziwych ludziach i wciąż krąży wokół pytania o to, co gubi się w tłumaczeniu między językami.