MTPEポストエディットAI翻訳ローカライズ

MTPEガイド(2026年):時間を節約する人間中心のLLMワークフロー

下書きが完成した後だけでなく、生成の前や生成中にも人の判断を取り入れながら、ライトポストエディットとフルポストエディットを進める方法を解説します。

Vitalii Vlasiuk
Vitalii Vlasiuk読了目安:31分
Three-phase comic titled "Guide to Human-First MTPE". Phase 1, intensive human guidance: a stick-figure human hands the Literess mascot a towering stack of past reviews, tone-of-voice guides, and 500 pages of comments ("Good luck!"). Phase 2, agent orchestration: she works as a whole agent team, appearing as translator, workflow manager, proofreader, and presenter of a targeted review. Phase 3, targeted human review and approval: the human gives a thumbs-up while she nervously thinks "OK?" surrounded by little hearts.
目次

従来の機械翻訳ポストエディット(MTPE)は、全文を機械に翻訳させた後、誤りや用語、トーン、書式を人が手作業で修正するやり方が一般的でした。ライトポストエディットは実用レベルの訳文を目指し、フルポストエディットは出版品質を目指します。

機械翻訳の粗さが一目でわかった時代には、そのワークフローにも意味がありました。LLMの登場によって誤り方が変わりました。一見自然で洗練された訳文に見えても、訳抜けや意味のズレ、文脈に合わない表現が潜んでいることがあり、完成した下書きがあると翻訳者がモデルの言葉遣いに引きずられてしまうこともあります。

これからのMTPEでは、下書きができた後だけでなく、生成の前や最中から人の判断を入れる必要があります。コメントや文脈、翻訳メモリ、用語集、スタイルガイドを活用してLLMを適切に誘導し、本当に人手を要するクリエイティブな判断や文化的・文脈的な判断に時間を使うべきです。

本ガイドでは、人の価値を最大限に活かし、無駄な時間を削減しながらライトMTPEとフルMTPEのワークフローを進める方法を解説します。筆者にとって最も使い勝手の良いTranseptを使って手順をご紹介しますが、お好みのツールでも同じように再現できます。

ライトMTPEとフルMTPEのワークフロー比較

MTPEでは、最高の品質を出すために時間をいかに効率的に使うかが鍵となります。すべてを「完璧に」仕上げようとする誘惑を抑え、目的に応じた十分な品質に留めることが大切です。

MTPEに関する解説記事でも説明したとおり、最初に機械翻訳を丸ごと走らせてから質の低いAI出力(AI slop)を手直ししていくやり方は間違っていると考えています。LLMを活用すれば、もっと速く、もっと楽しく進められる方法があります。

Transeptでのアプローチは、テキストの種類に応じて次のようになります。

  1. 事前に機械へ要望を伝えておく。
  2. 機械に全力を出させてから、弱い箇所に注意を向ける。
  3. 自動検出された問題点をもとに、最後の仕上げをする。

製品やマーケティングなどのビジネスコンテンツでは、ライトMTPEに費やす時間の約80%をステップ1と2に充て、最終的な仕上げには20%しか使いません。生成の前や最中にAIを誘導することで、手作業でのポストエディットを最小限に抑え、同じだけの事前準備から、はるかに多くの実用レベルの訳文を生み出せます。

フルMTPEも同じワークフローに沿って進めますが、ステップ3により多くの時間をかけます。ドキュメントの弱点を検証し、文体を磨き上げ、出版レベルの成果物に必要な人ならではのクリエイティブな表現を加えていきます。

人間中心のライトMTPE

このワークフローでは、機械が実際に作業を始める「前」に大部分の準備を済ませておくことで、可能な限り高い品質の出力を引き出すことに重点を置いています。

1)スタイルガイドと用語集を設定する

スタイルガイドや用語集は、実質的にはプロンプトを拡張したものです。トーンや用語、語法に関する明確なルールをLLMに指示できます。

Transeptがこれらに確実に従うよう、私たちは開発に力を注いできました。ですから、思いどおりの響きになるまで、両方を細かく調整してみてください。

筆者自身、Transeptのヘルプセンター記事などのライトMTPEでは、こうして作業時間を短縮しています。

原文の用語と訳語が登録された翻訳用語集。

通常は、既存のスタイルガイドや用語集を再利用します。しかし、初めて扱うジャンルのテキストだったり、土壇場での手直しを避けたかったりする場合は、原文から新しいスタイルガイドと用語集を生成します。

原文の用語、訳語、補足メモが登録された用語集のエントリ。

この段階でのAIの解釈に納得できることは(特に小説では)めったにないため、用語集とスタイルガイドを編集します。まだ意見が固まっておらず、直感や雰囲気しかない段階でも、補足メモや「すべきこと・避けるべきこと」を書き足しておくと、得るものが大きいと感じています。確信が持てないときはLiteressと議論します。辞書を参照したり、過去の判断や議論の履歴を調べたりしてくれるからです。

ドキュメントのスタイルと統合先のスタイルを統合するAI syncスタイルガイド。

2)見本の1ページを翻訳し、コメントを付けて文脈を設定する

次に、機械翻訳を1ページだけ生成します。使うのは「翻訳+校正」ワークフローです。下書きを作ったうえで磨きをかけようとするので、今の入力内容でLLMにどこまでできるかが現実的にわかります。

校正付きでドキュメントを翻訳、ブロック10件を選択中。

続いて、以下の点についてコメントを残します。

  • 現在の訳文で良いと感じる点
  • 不足している点や、納得がいかない点
  • 訳文をどのような方向に進めたいか

平易なテキストであれば、それだけで人間ならではのニュアンスを行き渡らせるのに十分です。難度の高いテキストの場合は、Literessエージェントに筆者の思考プロセスを模倣したコメントを残してもらうようにしています。

コメントが付いた原文と訳文の2つのテキストブロック。

すべてが意図どおりに機能しているか確認するには、そのページで改めて「校正」を実行します。コメントが反映され、改善された新しいバージョンのページが生成されます。

通常はこれで期待どおりの最終品質が得られます。ただし、小説の翻訳では、追加のコメントを残したり、スタイルガイドの誤りを修正したりしなければならないこともあります。

3)翻訳メモリを有効にする

次は、1ページ目のコメントや判断基準を100ページ目でも確実に機能させるステップです。Transeptではこれを翻訳メモリで実現します。翻訳メモリには過去の訳文だけでなく、そこに付随するコメントや、各訳文の修正前と修正後の状態も保持されます。

キーワード一致とセマンティック検索を組み合わせることで、同じ用語が使われている訳文や、文脈上似た課題を解決した過去の訳文を呼び出す仕組みです。私たちはこの仕組みに力を注いできました。詳しくは翻訳メモリの最先端技術に関するレポートをご覧ください。

右パネルには翻訳メモリの検索とフィルターが表示されています。

Transeptにおける翻訳メモリの仕組みには、重要な特徴が2点あります。

  1. 1点目は同一ドキュメント内でも機能する点です。別の箇所に残した関連コメントが、翻訳の実行時に再び呼び出されます。
  2. 2点目は校正などの推敲ステップにおいて、未編集の機械翻訳の出力が翻訳メモリから自動的に除外される点です。

ライトMTPEでは、作業中のドキュメントが翻訳メモリの検索対象から除外されていないこと、そしてニュアンスを汲み取るためにAIリランキングが有効になっていることを確認しておくと効果的です。

「他の言語ペアを含める」のチェックボックスをクリックしている様子。

4)「翻訳+推敲」ワークフローを実行する

これで、期待する仕上がりをLLMに伝えるための準備はすべて整いました。残るステップは機械翻訳の実行のみです。事前に設定したコメントやこれまでの試行内容が自動的に反映されます。

最も効果的な方法は、一連のアクションを組み合わせたワークフローを活用することです。ワークフローを使えば、翻訳、校正、対象を絞ったスキャンを連続して実行できるほか、登場人物の台詞や法的拘束力を持つ条項などに人によるレビューを挟むこともできます。Transeptでは、Zapierやn8nのようにご自身でワークフローを作成することも、テンプレートを利用することも、Literessにカスタムのワークフローを作ってもらうこともできます。

2つのステップによるドキュメントの翻訳と校正。

ライトMTPEには、標準の「翻訳+推敲」ワークフローが最適です。その理由は以下のとおりです。

  1. 翻訳メモリ、コメント、スタイルガイド、用語集を自動的に反映しながら翻訳を実行します。
  2. 続いて、判断には高性能なモデルを、修正にはStandardモデルを使用する校正エージェントを実行します。こちらも翻訳メモリを活用します。

小説やホワイトペーパーのような長文テキストには、並列エージェントモードを使用します。複数のAIがドキュメントの異なる箇所を分担して連携しながら処理するため、作業を迅速に完了できます。

「翻訳+校正」タスクにカーソルを合わせている様子。

注意点として、並列で動くAIは、手持ちの用語集やスタイルガイドを補う一時的な用語集とスタイルガイドを作成し、細かな部分まで足並みをそろえます。これらは後からメインの用語集やスタイルガイドに統合することも、自由に破棄することもできます。

5)ガイド付きの最終レビューを行う

ここからが最も気に入っている段階です。LLMは人間の代わりになろうとするのではなく、並外れた注意力と処理速度で人間をサポートしてくれます。

機械翻訳が完了した直後は、下書き全体を手作業でレビューしたくなるかもしれません。スタイルガイドやコメント、校正機能のおかげで通常のLLM翻訳よりはるかに品質が高いとはいえ、すべてを目視で確認していては時短効果が薄れてしまいます。

別の方法として、LLMエージェントに下書きのレビューを任せ、具体的な弱点や注意が必要な箇所を見つけてもらう方法もあります。利用規約であれば、法的拘束力を持つ条項や厳密な用語のチェックが該当するでしょう。原文と訳文に齟齬が生じている箇所や、スタイルがぶれている箇所の検出も指示できます。エージェントが翻訳メモリ、スタイルガイド、用語集にアクセスできれば、驚くべき精度を発揮します。

Transeptでは、このレビューを実行する方法が3つあります。

  1. レビューパネルでは、検出したい対象を指定し、スライドごとの集中モード、ドキュメント全体のレビュー、Literessからのコメントといったレビュー方法を選択できます。的確な修正をピンポイントで加えられます。
  2. ワークフロー機能を使えば、このレビュー手順をあらかじめ組み込んで設定できます。実はこの仕組みは、校正アクションの裏側でもフィルターとして働いています。たとえば、スタイルのぶれをすべて見つけてAIに直させ、そのあとで自分でテキストを確認する、といった使い方ができます。
  3. Literessにサポートを依頼することもできます。クリエイティブな判断が求められる、画面上での細かな推敲作業を得意としています。ワークフローやレビューの設定も代行してくれるため、UIを操作する手間を省けます。

「実行」ボタンがある品質チェックのダイアログボックス。

フルポストエディットのワークフロー:ベースラインからの改善

フルMTPEも同じく人間中心の基盤から始めますが、ライトMTPEの結果をベースラインとして位置づけます。そこから、より綿密な検証、表現の推敲、出版レベルの品質管理へと作業を進めていきます。

とはいえ、1ページずつ通読することだけにすべての時間を費やさなくても、よりスマートにフルMTPEを進める方法があります。

1)一連のガイド付きレビューを用意する

小説の翻訳を進めるうちに、AIを活用したレビューワークフローは、求める品質水準を保つために欠かせない一連のルーティンへと発展していきました。

  1. 登場人物の発言の裏にある思考は重要なプロット要素だったため、意図が正しく読み取られているか確かめられるよう、AIに内省描写をすべて抽出させました。
  2. また、用語集やスタイルガイドに含まれていない独自の言葉遊びや造語もすべて検出させ、それらを残すべきかどうかを自分で最終判断できるようにしました。
  3. 最後に、エージェントに登場人物の口調のぶれを探させました。これは一筋縄ではいかない作業でした。翻訳メモリの結果と比較しながら、登場人物の話し方が変わっているように見える箇所を検出する必要があったからです。多くの場合、そうした変化は妥当な感情表現によるものでしたが、人間である筆者にしか気づけない口調の変化もときどきありました。

こうして、筆者が本業をしている間に、これらの分析がTransept上で1つずつ順番に実行されるワークフローができあがりました。スマートフォンで結果を確認し、注釈がすべて付いたバージョンを受け取って、そのコメントには後から対応しました。

「小説の品質レビュー」プロセスの詳細を示すポップアップウィンドウ。

2)最適な翻訳メモリ構成を見つける

セマンティック検索を備えた高度な翻訳メモリツールなら、人間がそのまま再利用するには一致度が低すぎる「概念レベル」の一致セグメントも見つけ出せます。こうしたセグメントであっても、期待する表現の方向性を示すことでLLMを導く手がかりになります。

Transeptのように拡張されたメモリコンテキストを活用すれば、以下の方法でMTPEを効率化できます。

1. 却下された機械翻訳や人間の下書きといった別の訳案も、翻訳メモリの結果に含める。ヘルプセンター記事のウクライナ語の下書きをブラッシュアップする際、この方法が特に有効だとわかりました。ここでの人間による編集作業は、ロシア語風の表現(Russism)を取り除き、自然な流れを取り戻すことが大半を占めていました。修正前後の実例を与えることで、LLMはこの文脈で求められるウクライナ語の水準を学習しました。

図1 · メモリ内の別の訳案
却下された下書きが教訓になる
Take part in the beta test.一致率72%
✓ 承認された最終版Візьміть участь у бета-тестуванні.
This feature is available on the following plans.一致率64%
✓ 承認された最終版Ця функція доступна на таких планах.
翻訳対象の新しい文
Please take part in our survey.
LLMの下書きПрийміть участь у нашому опитуванні.以前の直訳を繰り返す

最終版のみのメモリは、モデルに目指すべきゴールを示しますが、何を避けるべきかは教えられません。放置すれば、再び直訳表現に頼ってしまいます。

ウクライナ語のヘルプセンター案件から、翻訳メモリの記録を2件。「別の訳案あり」にすると、モデルは却下された下書きと、却下の理由を書いたメモも参照します。

2. とっておきのドキュメントを見つけて活用する。更新情報のように繰り返し作るコンテンツを翻訳する場合、データベース全体を検索するのではなく、用語集と翻訳メモリ内の厳選した最良の訳文を組み合わせることができます。セマンティックマッチを活かしたこの構成により、LLMに対する「期待値」が定まり、ここでも最高品質の下書きを作成できます。

図2 · とっておきのドキュメント
モデルが模倣する対象を厳選する
検索範囲:過去に保存されたすべてのセグメント
Added dark mode to the dashboard.承認済み一致率81%
↳ Ajout du mode sombre au tableau de bord.
Fixed an issue where exports could time out.未編集のMT一致率77%
↳ Correction d'un problème d'expiration des exports.
The export failed with a timeout.過去の下書き一致率69%
↳ L'export a échoué avec un délai d'attente.
Export your project as PDF.未編集のMT一致率63%
↳ Exportez votre projet en PDF.
Bug fixes and performance improvements.過去の下書き一致率58%
↳ Corrections de bugs et amélioration des performances.
下書きの安定度
0.5

出どころが混ざれば、文体も混ざる:未編集のMTや古い下書きが承認済みの訳文と並んでいると、モデルはそのすべてを模倣します。

更新情報のように繰り返し作るコンテンツでは、保存済みのすべてを検索する代わりに、用語集と、最良の訳文を厳選した1つのドキュメントを組み合わせます。

3. 目視でのレビュー時にAIリランキングを活用する。AIリランキングは翻訳メモリの結果を読み取り、アルゴリズムによる一致度が低くても、最も関連性の高いものを上位に表示します。普段は翻訳メモリのサイドバーを開いてレビューしていますが、リランキング機能のおかげで、人間の目にとって真に関連性の高い実例だけが画面に表示されます。検索結果をスクロールして必要な情報を探す手間が省けます。

図3 · AIリランキング
本当に必要な結果が上位に表示される
確認中の文Your words, your voice — translated, not flattened.
82%Your words are saved automatically.
↳ Vos textes sont enregistrés automatiquement.
74%Voice typing is available in the editor.
↳ La saisie vocale est disponible dans l'éditeur.
66%Choose a voice for read-aloud.
↳ Choisissez une voix pour la lecture à voix haute.
58%A translation should keep the author's voice intact.
↳ Une traduction doit préserver la voix de l'auteur.
51%Flatten layers before exporting the file.
↳ Aplatissez les calques avant d'exporter le fichier.

数値上は、最上位の結果が確認中の文と最も多くの単語を共有していますが、解決すべき課題にはまったく対応していません。

TMサイドバーを開いてレビューする場面:アルゴリズムのスコアは表面的な単語の重なりで順位を付けますが、リランキングは結果を読んで、役立つ順に並べ替えます。

3)「個人的な」好みをエージェントのメモリに蓄積する

翻訳会社(エージェンシー)の基準やクライアントのブランドガイドラインにとどまらず、自分の好みやこだわりを反映させるカスタマイズの威力は、非常に過小評価されています。「AI精神病」と呼ばれる状態を経験した人々の多くが、ChatGPTのメモリを満杯にしていたことは示唆的です。そうしたパーソナライズによって、旧来のGPT-4oモデルでさえユーザーに絶大な影響力を持ち、モデルの停止を阻止しようとユーザーが騒ぎ立てるほどでした。

翻訳においては、作業の進め方や優先順位の付け方など、無数の個人的なこだわりや癖が存在します。それらは単なるワークフローの手順にとどまりません。中には非常に微細で、自分自身でもすべてを把握しきれていないものさえあります。

AIエージェント向けの真に優れたメモリモデルの開発は道半ばですが、筆者はドキュメントの作業内容についてLiteressとじっくり対話する時間をよく設けています。パターンの分析を依頼し、判断について議論を交わし、そこで得た学びを記憶させるのです。

この手法はシンプルですが、校正やブラッシュアップ、ファンタジー作品の固有名詞の訳し方に関する検討など、あらゆる作業をゼロからではなく共通認識を持った状態から始めるのに大いに役立っています。

筆者がLiteressに思い描いていたのは、まさにそういう姿です。プロンプトに盲目的に従い、いずれ人に取って代わろうとする何かではなく、同僚であり、友人であり、目をかけている後輩のような存在です。

FAQ

機械翻訳ポストエディット(MTPE)とは?

機械翻訳ポストエディットとは、機械が生成した訳文をレビューして改善し、設定した目標品質に到達させるプロセスのことです。従来は、機械がまず下書き全体を作成し、その後に人間が修正を加えていました。人間中心のMTPEワークフローでは、それに加えて、翻訳者が文脈、コメント、用語集、スタイルガイド、翻訳メモリを使い、生成の前からAIを導きます。

ライトポストエディットとフルポストエディットの違いとは?

ライトポストエディットは、正確で意味が通じ、実用的な訳文を目指す手法です。文体表現を細部まで磨き上げることはせず、意味の正確さ、訳抜けの防止、重要な用語の統一を最優先します。一方、フルポストエディットは出版品質の訳文に仕上げる手法であり、自然な文章の流れ、一貫した文体・トーン、文化的なニュアンス、より厳格な最終品質管理(QA)まで含みます。作業のワークフロー自体は共通でも、求められる品質基準と人間によるレビューの深さが異なります。

LLM翻訳にも人間によるポストエディットは必要ですか?

はい、必要です。流暢な訳文が必ずしも正確な訳文とは限りません。LLMは自然に聞こえる文章を作成できますが、意味の欠落、文脈の誤解、指定用語からの逸脱、独特の文体やトーンの均一化といった問題が生じることがあります。何をもって「良い」とするかを決め、判断の分かれる箇所で方向を示し、誤りが実害につながる箇所を確認するには、今も人間の判断が欠かせません。

MTPEが割に合うとき、一から翻訳すべきときとは?

機械が実用的な土台となる訳文を生成でき、ポストエディターが一から翻訳するよりも短時間で目標品質に到達できるなら、MTPEには価値があります。誠実に示せる一律の削減率というものはありません。代表的なコンテンツで試し、実際の編集時間を記録してください。ほとんどの文を書き直している、同じ誤りを何度も直している、下書きの構造そのものと格闘している、といった場合は、モデルに与えるコンテキストを改善するか、そのコンテンツは一から翻訳してください。

MTPEの品質はどのように測定すべきですか?

品質は単一の自動評価スコアではなく、テキストの用途に基づいて測定してください。原文への忠実さ、訳抜け、重大な誤り、用語、文体の一貫性、編集にかかった時間、QA(品質管理)で検出された問題の件数などを確認します。自動測定やAIレビューはリスク箇所の特定に役立ちますが、創造性、文化、法務、ブランドに関わる繊細な判断には、依然として専門知識を持つ人間の対応が欠かせません。Transeptでは、ガイド付きレビュー、用語集やスタイルガイドを考慮したチェック、翻訳メモリの参照を活用することで、特定のミスパターンに焦点を絞ってレビューを進められます。

多数の小さなドキュメントで人間中心のMTPEを展開するには?

人間の判断基準を一度確立し、それを再利用します。共通の用語集とスタイルガイドを作成し、基準となる代表的な訳文を承認して、その判断内容を翻訳メモリに蓄積します。Transeptの翻訳メモリは、プロジェクトやチーム内での検索に対応し、過去の議論や検討された候補、前後のコンテキストも含めて保持できます。翻訳、校正、ガイド付きレビューの各ステップを再利用可能なチームワークフローとして保存すれば、残りのドキュメントにも同じ設定をそのまま適用できます。ファイルごとに指示を出し直す必要はなく、人間は例外的な箇所やリスクの高い部分のレビューに専念できます。

著者

Vitalii Vlasiuk
Vitalii Vlasiuk共同創業者

Transept共同創業者。ペンネーム「Mevkh」名義で執筆。言語学・文学の学位を取得後、ソフトウェア開発へと転向。シニアAIエンジニアとして、RAG、エージェント型ツール、LLM-as-judgeによる評価など、実用的なLLM機能を50,000人以上のユーザーに提供してきました。小説家としてはじっくり創作を進めるタイプで、机の引き出しには12万語に及ぶ風刺ロマンスファンタジーが眠っています。AI翻訳と自身の書いた散文との間で生じた摩擦こそが、すべての始まりでした。