ローカライズAI翻訳翻訳メモリ専門用語

翻訳・ローカライズ用語集:実務でよく使われる用語

翻訳メモリ、ファジーマッチ、MTPE、XLIFF、TMX、レバレッジ、トランスクリエーション。見積書や翻訳支援ツール(CATツール)、翻訳会社とのやり取りで目にする用語をわかりやすく解説し、それぞれの関係性を整理しました。

Mariia Ivakhnenko
Mariia Ivakhnenko読了目安:21分
目次

翻訳の用語はとにかくわかりにくいものです。半分は略語で、ほぼ同じ意味の言葉がいくつもあり、人によって違う意味で使う言葉まであります。見積書に「ファジーマッチのしきい値85%でレバレッジ80%」と書かれていても、それが良い条件なのかどうかはすぐにはわかりません。 このガイドは、見積書や翻訳支援ツール(CATツール)、翻訳会社とのやり取りで目にする用語を、アルファベット順ではなく実務で出てくる順に解説する実用的な用語集です。Transept独自の意味を持つ用語には、その旨を明記しています。

用語集、用語ベース、翻訳メモリの違いとは?

この3つは会話では同じ意味で使われがちですが、ツールの中ではそれぞれ別のものを指します。

用語集(Glossary)

用語と承認済みの訳語に、それぞれをどんな場面で使うかのメモを添えたリストです。製品名、登場人物名、法律用語、クライアントが指定する言葉などを収めます。用語集が答える問いはただ1つ、「この語が出てきたら、何と訳すべきか?」です。 Transeptでは、用語集が実行のたびにプロンプトに組み込まれ、実行後にもあらためてチェックされるため、1ページ目で決めた訳語が500ページ目でもぶれません。

用語ベース(TB)

CATツールでの用語集の呼び方です。一般的には用語集よりもエントリごとの情報(メタデータ)が多く、品詞、分野、禁止訳語のリスト、ときには定義まで含みます。「用語ベース」や「タームベース」と言われて用語集のことだと受け取れば、それで正しく理解できています。

翻訳メモリ(TM)

翻訳済みのセグメントを原文と訳文のペアで蓄積し、似た文がまた出てきたときに再利用するデータベースです。用語集が用語単位で働くのに対し、翻訳メモリは文単位で働きます。 従来の翻訳メモリは文字列の一致で検索します。Transeptの翻訳メモリは意味の近さでも検索し、訳を決めた経緯(却下された候補やレビューコメント)も残します。そのため、言い回しが違っても、訳すうえで同じ問題を抱えた文に役立ちます。これで何が変わったのかは、記事にまとめています。

ファジーマッチ(あいまい一致)

翻訳メモリで見つかった、完全一致ではないものの近い候補のことです。一致の度合いはパーセントで示されます。しきい値は85%がよく使われ、それを上回れば保存済みの訳文がたたき台として提示され、下回れば新規のセグメントとして扱われます。この数値が示すのは文字列の類似度で、過去の訳文の良し悪しではありません。

完全一致、100%一致、101%一致

完全一致または100%一致とは、原文のセグメントが翻訳メモリ内のセグメントと完全に一致している状態を指します。101%一致(コンテキスト完全一致、またはICEとも呼ばれます)は、セグメント自体が一致しているだけでなく前後のセグメントも一致している状態を意味します。文脈まで同一であるため、保存されている訳文をそのまま使える可能性が極めて高くなります。

レバレッジ(Leverage)

新規案件のうち、既存の翻訳メモリでカバーできる割合をパーセンテージで表したものです。レバレッジは費用に直結します。100%一致の箇所は新規翻訳ではなく確認(レビュー)だけで済むため、翻訳会社はメモリでカバーされる語に大きな割引をかけます。見積書にレバレッジが書かれていれば、作業のうちどれだけを省けると見込んでいるかを示しています。

機械翻訳の略語はそれぞれ何を意味しますか?

機械翻訳(MT)

どんな技術を使っているかにかかわらず、自動翻訳全般を指す総称です。

ニューラル機械翻訳(NMT)

翻訳専用にトレーニングされたニューラルネットワークによる機械翻訳です。DeepLやGoogle 翻訳などがこの世代のエンジンに該当します。NMTは流暢な文を生成することに長けていますが、途中で「もっとフォーマルなトーンにしてほしい」といった指示を与えることはできません。

LLM翻訳

汎用の大規模言語モデル(LLM)による翻訳です。NMTとの実用上の違いは、モデルと対話できることです。用語集、スタイルガイド、前後の文章、トーンの指示などを渡せます。Transeptは最先端のLLMで動いており、モデルを差し替え可能なバックエンドとして扱っています。

MTPE(機械翻訳ポストエディット)

機械翻訳の出力を人が編集して、完成した訳文に仕上げる作業です。PEMTと書かれることもあります。翻訳業界で主流の作業形態で、LLMによって最も大きく変わったのもこの作業です。従来のMTは粗さが一目でわかり、誤りが自然と目に付きましたが、LLMの出力は流暢に読めても節がまるごと抜けていることがあります。 人の判断を下書きの後ではなく前に入れる進め方は、TranseptのMTPEガイドで解説しています。

ライトポストエディットとフルポストエディット

ポストエディットの2つのサービスレベルです。ライトポストエディットは、正確で意味が通じる訳文を目指し、平板な言い回しは許容します。フルポストエディットは出版できる品質を目指し、一から人が訳したものと見分けがつかない訳文に仕上げます。請求書ではこの言葉の違いが大きく響きます。必要な人の作業時間がまったく違うからです。

翻訳ツールはドキュメントをどのように分割しますか?

セグメント

ツールがテキストを分割する単位であり、ほぼ常に「1文」に相当します。翻訳メモリはセグメント単位で保存され、一致率の判定や単語数の計算もセグメント単位で行われます。

ソースとターゲット(翻訳元と翻訳先)

「ソース」は翻訳元の言語(ソース言語)、「ターゲット」は翻訳先の言語(ターゲット言語)を指します。ソースのセグメント(原文)とターゲットのセグメント(訳文)が対になって、翻訳メモリのエントリ1件になります。Transeptの料金プランを含め、料金は「原文の語数」を基準にするのが一般的です。

ブロック(Block)

Transept独自の単位で、あえてセグメントより大きくしています。段落、見出し、リスト項目、表のセルがそれぞれ1ブロックです。ブロック単位なら文がつながりのある前後の文と一緒に扱われるため、3文後の代名詞が冒頭の何を指しているかをモデルが読み取れます。ブロックの中でも、文単位での操作はできます。

アライメント(Alignment)

既存の訳文と原文をセグメント単位で対応付け(ペアリング)する処理です。ツール導入前に行われた過去の翻訳資産を、ツール内の翻訳メモリとして活用できるようにします。また、アライメントは完成した訳文をインポートする際の検証処理としても機能します。原文と訳文が1対1で対応していなければ、何かが追加されたか、訳抜けがあるということです。

ツール間で受け渡されるファイル形式にはどのようなものがありますか?

XLIFF

XML Localization Interchange File Formatの略です。システム間で翻訳対象のコンテンツを受け渡すための標準的なコンテナ形式で、各ユニットに原文、訳文、ステータス、そして多くの場合は翻訳者向けのメモが入っています。クライアントからバイリンガルファイルが届いたら、おそらくXLIFFです。Transeptでは、XLIFFをスプレッドシートで読める無料のXLIFF変換ツールを公開しています。

TMX

Translation Memory eXchangeの略です。翻訳メモリをツール間で持ち運ぶための形式で、あるツールで作った翻訳メモリを別のツールに移せます。TMXがあるからこそ、翻訳メモリはベンダーに預けたままのものではなく、自分で所有する資産になります。

TBX

TermBase eXchangeの略です。TMXと同じ考え方を、用語集や用語ベースに当てはめた形式です。ただ、用語集はサイズが小さく、スプレッドシートをメールで送れば済むため、TMXほど普及していません。

POとgettext

多くのオープンソースソフトウェア、WordPress、PythonやPHPのプロジェクトで採用されている文字列フォーマットです。.poファイルは原文の各文字列とその訳文を対にして保持し、翻訳者コメントを含めることもできます。.potは未翻訳の空のテンプレートです。

SRTとVTT

字幕のファイル形式です。各キュー(字幕の表示単位)ごとに、表示タイミングとテキストが記録されています。字幕翻訳では、意味の正確さだけでなく、視聴者が読む速さや1行の長さにも配慮する必要があります。原文に忠実であっても長すぎる字幕は、画面上で読み切れないためです。

リソースファイル

アプリケーションが画面表示用の文字列(UIテキスト)を保持する、プラットフォームごとのコンテナファイルです。Appleのプラットフォームでは.strings、.NETでは.resx、Flutterでは.arbが用いられ、その他の多くの環境では通常のJSONやYAMLが使われます。ソフトウェアの翻訳では、ドキュメントではなくこれらのファイルを訳します。文字列テーブルのワークフローがドキュメントのワークフローと違う形をしているのはそのためです。

品質やプロセスに関する用語にはどんな意味がありますか?

ロケール(Locale)

言語と地域、そしてそれに伴う表記の慣習(日付の順序、小数点の記号、通貨、住所の書き方、場合によっては文字体系)をひとまとめにしたものです。pt-BR(ブラジルポルトガル語)とpt-PT(ヨーロッパポルトガル語)はどちらもポルトガル語ですが、プロダクトの中で入れ替えはききません。言語ではなくロケールを選ぶことで、ブラジルの読者にヨーロッパの言い回しが届くのを防げます。

i18nとl10n

最初と最後の文字の間の文字数を数字に置き換えた略語(ヌメロニム)です。国際化(i18n)は、プロダクトを翻訳できるようにするためのエンジニアリング作業を指します。具体的には、画像へのテキストの焼き込みを避ける、文を断片から組み立てない、ドイツ語のような長いテキストに対応できるレイアウト余白を確保する、といった設計が挙げられます。一方、ローカライズ(l10n)は、プロダクトを特定のロケールに合わせる作業です。i18nは一度きりですが、l10nは言語ごとに行われます。

スタイルガイド(Style guide)

用語以外のルールのことです。敬体か常体か、トーン、読者への呼びかけ方、句読点やかぎ括弧の使い方、数字や単位の書き方などを定めます。複数の人が関わり、何度も実行を重ねた訳文でも、1人が書いたような統一感を保てるのはスタイルガイドがあるからです。

LQA(言語品質保証)

評価基準に沿って行う体系的なレビューです。レビュアーがサンプルの訳文を、エラーの種類(正確さ、用語、スタイル、ロケールの表記慣習)ごとに重大度をつけて採点し、印象ではなく数値で品質を示します。納品物を受け入れるか差し戻すかの判断や、ベンダーの比較に使われます。

トランスクリエーション(Transcreation)

意味をそのまま訳すのではなく、意図した効果や響きを生み出すために文章を再構築する作業です。たとえば英語の駄洒落や言葉遊びを効かせたスローガンは、そのまま日本語にしても伝わりません。そのため、指示書(ブリーフ)の内容も「正確に訳す」ことではなく「読者の心に響かせる」ことになります。料金は時間単位やコンセプト単位で設定され、単語数ベースで計算されることは決してありません。

逆翻訳(Back-translation)

原文を見ずに別の翻訳者が訳文を元の言語へ翻訳し直し、意味が正しく保持されているかを確認する手法です。誤訳が重大なリスクや損失につながる臨床試験や規制対象の文書などで標準的に用いられます。文体ではなく、意味の整合性のみを検証します。

FAQ

最初から覚えておくべき用語はどれですか?

用語集、翻訳メモリ、セグメント、ロケールの4つです。作業がどう保存され、どう分割されるかを表す用語で、この4つがわかれば見積書は読めます。略語の多くはベンダーやツールとやり取りするための言葉なので、出てきたときに調べれば十分です。

ほかのツールの翻訳メモリをTranseptに移行できますか?

訳文そのものは移行できます。すでに翻訳済みなので、無料で反映(シード)され、モデルの実行もクレジットの請求も発生しません。方法は、既存の訳文データのインポートで説明している文字列テーブルのインポートか、翻訳済みのドキュメントのシードです。現時点では、.tmxファイルをそのまま取り込むことはできません。無料のTMXクリーナーなら、TMXをブラウザー上でExcelやCSVに変換できます(ファイルはアップロードされません)。古い翻訳メモリを扱いやすい形にするには、たいていこれがいちばんの近道です。

用語集と翻訳メモリは競合しますか?

役割が異なるため、組み合わせて使用します。用語集は個々の用語の訳し方を固定し、翻訳メモリは過去にセグメント全体がどう翻訳されたかを呼び出します。両方を備えたツールなら、用語には用語集を、前後の言い回しには翻訳メモリを適用するため、過去の訳文を呼び出す際にも最新の用語が反映されます。

最新のモデルでもポストエディットは必要ですか?

必要です。ただし、その理由は以前と異なります。従来の機械翻訳は破綻が目に見えていたため、誤りを見つけて修正するのは容易でした。一方、最新のモデルは流暢な文章を生成する反面、節が抜け落ちたり、トーン(レジスター)のニュアンスが失われたり、文脈に合わない語義を選んでしまったりすることがあります。そのため、現代のポストエディットは文法を直す作業というよりも、原文の意味や語り口が正しく引き継がれているかを確認する作業へと変化しています。

翻訳とローカライズの違いとは?

翻訳が対象とするのはテキストです。一方、ローカライズはプロダクトを別の市場に適応させるために変更すべきあらゆる要素を含みます。具体的には、日付や通貨、氏名や住所の表記形式、画像や配色の選定、法的表記、さらには同じ文が30%長くなった際のレイアウト調整などが挙げられます。翻訳されただけのプロダクトには違和感が残ることがありますが、適切にローカライズされたプロダクトなら自然に受け入れられます。

著者

Mariia Ivakhnenko
Mariia Ivakhnenko共同創業者

Transept共同創業者。キーウ、オストラヴァ、そしてザルツブルクでの1年間を経て、英語学・英文学の学位を3つ取得。ウクライナ出身ですが、書くのはほとんど英語です。プロンプトエンジニアとしてAIの世界に入り、その後はプロダクトマーケティングとライフサイクルマーケティングを担当。実在の人物をもとにしたセミフィクションを書きながら、言語のあいだで何がこぼれ落ちるのかという問いを追い続けています。