本地化MTPE译后编辑AI 翻译

机器翻译译后编辑 (MTPE):定义、原理与优化指南

机器翻译译后编辑 (MTPE) 实用指南:对比轻度与深度译后编辑,探讨为何原始机翻仍需人工干预,解析质量评估方式,并说明为何常见的“先批处理后校对”模式往往并非最优,最后分享一种在质量和成本上均更胜一筹的、基于翻译记忆的迭代式工作流。

Vitalii Vlasiuk
Vitalii Vlasiuk36 分钟阅读
机器翻译译后编辑 (MTPE):定义、原理与优化指南
本页内容

我之所以成为 AI 工程师,部分原因是我曾尝试翻译自己的小说。就在那时,我遇到了一个本地化行业早已司空见惯、只是称呼不同的概念:先让机器跑一遍文本,再由人工进行修正。其正式名称为机器翻译译后编辑(MTPE),这也是 2026 年专业翻译领域最主流的工作方式。

从概念上讲,这听起来很高明。然而,在功能强大的大语言模型时代,这种通行的实践方式已经显得陈旧。先由机器全量翻译,再由人工通篇校对,这种做法对人力和算力的投入顺序并不合理。

在这种模式之下,其实潜藏着一种成本更低、效果更好的工作流。

本指南将兼顾这两点。首先,我会为你剖析 MTPE 的真实面貌及其运作机制——毕竟,如果你想受雇推销自己的 B2B SaaS 产品,就必须了解传统的 ISO 标准流程。接着,我会解释传统的批处理模式在哪些地方会“掉链子”,以及如何通过更早地引入人工环节来优化流程。

什么是机器翻译译后编辑 (MTPE)?

MTPE 亦写作 PEMT(译后编辑机器翻译),是一个包含三个步骤的流程:

  1. 机器翻译 (MT)。 由机器翻译引擎或大语言模型生成源文本的翻译初稿。这份初稿被称为原始机翻 (raw MT)
  2. 译后编辑 (PE)。 人工语言专家对照原文阅读原始机翻并进行修订,纠正错误、规范术语并调整语气,直至其达到预定的质量标准。
  3. 质量保证 (QA)。 对一致性、格式以及初审中容易遗漏的错误进行最终检查。

在通常的运作模式下,这是一种批量交接:机器翻译整篇文档,然后人工编辑整篇文档。请记住这种模式,因为这正是我稍后要挑战的部分。

MTPE 之所以存在,而不是单纯地“人工翻译”或“全靠机器”,是因为对于大多数内容而言,这两个极端都不可取。

面对大规模需求,纯人工翻译往往显得又慢又贵。原始机翻固然又快又便宜,但真正像样的机翻出现至今还不到十年,而某些机翻技术其实已有数十年的历史。而且,即便拥有顶尖的 LLM 和工作流,盲目采信其输出的风险依然太高,而人类将翻译做得出彩的能力则要强大得多。

因此,MTPE 是一种务实的折中方案:让机器完成 70% 的机械性工作,而将人工精力集中在决定译文是否可靠的那 30% 上。

(这至少是翻译公司和企业理想中的状态。但在现实中,译员通常要么为了追求更好的结果而投入更多心力(报酬却并不会随之增加),要么干脆完全不投入,导致产出质量不尽如人意。)

尽管如此,到 21 世纪 20 年代,某种形式的 MTPE 已成为翻译行业的默认模式

轻度与深度译后编辑:两个等级

一句话总结:这种划分在现实中并不真正存在,但行业要求你必须了解这种二元划分。

“译后编辑”并非千篇一律。在 MTPE 项目中,最重要的决策是确定编辑到哪个等级,因为这决定了每个句段所需的时间成本,以及哪些内容可以保持原样。

团队常犯的错误是习惯性地将所有内容都处理到最高质量(包括那些只需轻度编辑的低曝光内容),结果耗尽了 MTPE 本该节省的时间。这往往不只是译员的问题,那些对轻度编辑设定了过高预期的审校和经理也同样负有责任。

而另一种错误则后果更糟:对落地页仅作轻度编辑,结果发布的内容读起来似是而非,从而透支了用户信任。这正是目前大多数 Claude Code 翻译的现状:据反映,在发布全量机翻或轻度 MTPE 的本地化版本后,应用的转化率反而会下滑

在现实中,两者的界限往往很模糊,实际的 MTPE 通常处于中间地带。根据平台或翻译公司的不同,投入程度的设定可能非常随意,也可能因项目而异。此外,各家公司还有许多内部流程和惯例,比如 QA 报告和审批环节。

正是这种定义上的模糊不清,让许多译员对 MTPE 产生抵触。它无法带来把活儿干漂亮的成就感,而把活儿干漂亮又不会在报酬上得到体现。

为什么原始机翻仍然需要人工

2026 年,一个显而易见的质疑是:现代大语言模型已经表达得非常流畅了。现**在的原始机翻难道还不够好吗?

流畅性恰恰就是陷阱所在。旧式的机器翻译产出的结果往往破绽百出,因此没人会在未经编辑的情况下信任它。而现代模型产出的结果读起来非常通顺,这反而给了读者和审校人员一种虚假的信任感。

更糟糕的是,它产出的译文虽然保留了原意,但风格上却散发着一股浓浓的“AI 味”。这会让品牌整体显得廉价。尽管这个特定问题其实很容易解决,但许多人还是掉进了这个陷阱。

Claude 坚持要我加上这一点:

  • 声誉受损。 翻译引擎并不具备语言专家那种对文化细微差别的洞察力,也无法判断在特定市场中哪些表达得体,哪些显得失礼。原文中本是中性的措辞,在译文中可能显得笨拙、傲慢或具有冒犯性,甚至只是让人觉得*怪异;*正是这些“AI 痕迹”让用户望而却步。
  • 误导客户。 即便是训练最精良的模型,也可能在不经意间漏掉一个分句,或者添加原文中没有的词。在一段读起来流畅且语气笃定的文字中,这种偶然的遗漏或事实偏差极难被察觉,而在法律、医疗或金融等领域,这可能会带来严重的后果。虽然从技术上讲,这个问题是可以解决的(例如 智能校对 正是为了捕捉此类遗漏而设计的),但这类错误依然屡见不鲜。
  • 品牌形象稀释。 原始的大模型输出很难体现品牌特定的语调和术语。当一个产品名称或标志性用语在网站各处出现十几种细微差别时,它就失去了辨识度,品牌的公众形象也会随之变得愈发模糊。虽然可以通过 风格指南术语库 来解决,但旧式的机器翻译流程往往无法很好地落实这些规范。

因此,人工介入并非可有可无——至少在文字需要发挥实际效用(如转化客户或具备法律约束力)时是如此。真正的核心问题在于人工何时介入,而标准流程对这一问题的回答并不理想。

MTPE 难在哪里:四个真正的瓶颈

在实践中,难倒译后编辑的通常不是引号或日期格式,那些属于 QA 规则。真正的难点在于评估那些看似流畅、实则具有欺骗性的输出,决定每个句段需要多大程度的干预,而且还要在一种默认“每份机器初稿都能节省同等时间”的商业模式下进行。

关于译后编辑工作量的研究将这项工作分为认知、技术和时间三个维度。这些维度并不总是同步变化的:有些句子可能只需要敲两下键盘,却需要几分钟来核实;而另一些句子虽然需要完全重写,但修改方案却一目了然。

常见的瓶颈如下。

  1. 识别那些听起来无误、实则需要结合上下文才能修正的错误。 现代机器翻译能够产出修饰完美的译文,却也可能在其中漏掉分句、歪曲原意,或误用似是而非的术语。流畅的文笔抹去了本该引起警觉的破绽,迫使编辑必须反复核对原文、文档语境和客观事实。这一切都极其耗时费力。研究一致表明,误译、连贯性问题和结构性错误是导致译后编辑工作量增加的核心诱因。
  2. 决定是接受、修补还是重译。 每个句段都需要进行筛选评估:是直接保留、进行微调、重写,还是干脆弃用机翻稿从头翻译。模糊的“轻度”或“深度”编辑指令让这种决策变得更加困难。编辑要么为了满足“尽可能少改”的要求而编辑不足,要么因为自身的专业质量标准高于项目要求而进行过度编辑
  3. 摆脱机器的思维框架。 译后编辑面对的不是白纸。他们先读到的是一份参考答案,而这份答案会锚定他们的词汇选择、句法结构和对原文的理解。对专业工作流的研究发现了启动效应:机翻中的错误和生硬措辞可能会残留在译后编辑的文本中,甚至影响修改方案本身。句子读起来越顺口,就越难察觉其框架性的错误。在大模型执行机器翻译步骤时,这种情况尤为常见。
  4. 基于错误的生产力假设。 MTPE 的定价往往默认机器输出能带来可预见的人工投入减少。但事实并非如此。翻译难度因句段、语种对、领域和错误类型而异,而侧重速度的定价模式可能会打消译者深究术语的积极性,即便客户依然要求完美的质量。这种波动最终都由译者来消化:处理简单的句段尚能让低费率显得合理,但遇到“难啃的骨头”,就会悄无声息地抵消掉原本节省下来的所有成本。

格式、术语约束、锁定句段和本地化规则依然重要,但这些管控措施应当在工作流的上游予以落实,例如通过 术语库风格指南翻译记忆库 来强制执行。

MTPE 真正的挑战在于判断力的分配:既要识别看似流畅的错误,又要确定合理的干预程度,还要摆脱机器的思维框架,并且在兼顾这三者的同时,不让定价模式左右了最终的质量。

正因如此,我很快得出结论:人工先行的交互式工作流,比批量清理的作业界面效果更好。但难道行业还没意识到这一点吗?

如何衡量 MTPE 质量:不止于 BLEU

MTPE 面临着一个衡量难题:质量在一定程度上是主观的。行业内最知名的自动评价指标是 BLEU(Bilingual Evaluation Understudy,双语评估替换指标),它通过将机器翻译结果与一个或多个高质量的人工参考译文进行对比来评分。

它的工作原理是将机器输出拆分为短词组序列(通常为 1 到 4 个词),并计算其中有多少词组也出现在参考译文中。为了防止系统通过重复正确词汇来虚增分数,重复匹配的次数设有上限;此外,如果译文短得反常,系统还会通过“短句惩罚”(brevity penalty)来降低评分。

BLEU 将这些重合度测量值综合为一个 0 到 1 之间的分值,通常显示为 0–100。分值越高,代表措辞与参考译文越接近,但不一定意味着意思表达得更好。

在我看来,到了 2026 年,这已经不再是一个真正有用的指标了,原因如下:

只有当翻译引擎在相同的数据集上、使用相同的评分设置进行测试时,BLEU 分值才具有实际的可比性。因此,并不存在“50 分就是好,10 分就是差”这种普适的阈值。它的实际价值在于受控环境下的前后对比。

在一份 TAUS 案例研究中,针对特定法律领域的 172,980 个法德句段进行训练,使 BLEU 分值提升了 7.23 分,相对提升了 19%。在另一个俄英航空领域案例中,一个经过清洗、包含 100 万个句段的翻译记忆库将 Globalese 的 BLEU 分值从 23.6 提高到接近 51,相对增幅高达 115.5%。提升幅度虽因领域、语种对、基准引擎和数据质量而异,但这两个案例都充分说明了,为什么相关性强且经过仔细清洗的翻译记忆库,其表现能优于通用的训练数据。

但 BLEU 衡量的是相似度,而非准确性。一个表达流畅、语气笃定的误译可能得分很高;而一个完全没问题的替代措辞,如果恰好与参考译文不匹配,得分可能就很低。因此,BLEU 设定的是底线(它告诉你原始机翻的结果是否尚可),而人工审核依然是决定译文是否正确、是否符合品牌调性以及是否达到交付标准的最终关口。

越来越多的团队开始引入“以大模型作为评审员”(LLM-as-judge)的质量评估来作为补充,但仅凭这一点其实并没有多大意义。

惯常 MTPE 做法的问题所在

到此为止,我将不再只是描述现状,而是要开始阐述我的观点。核心论点如下:

你在第 2 页做出的决定——比如这个角色要保持正式语气、改写这个双关语以关联当地政客、不要将那个地名拉丁化——都可以反馈给系统,用来重新生成文档的其余部分。

即便没有高级的上下文工程,示例和多样本提示(multi-shot prompting)也能让大语言模型大显神威,哪怕上下文并非 100% 匹配。在 Transept 的内部基准测试中,即便加入的是另一种语言的相关体裁示例,也能显著提升翻译表现。

先进行全量机翻,意味着你既浪费了算力去生成那些会被译员部分丢弃的页面,又得耗费人力去强行修整生硬的原始输出。

此外,模型的速度远快于人工。你不需要在人工开始之前就拟好全部 1 万字的草稿。

更优的 MTPE 工作流是先生成前几千字,让译员做出关键决策;当译员还在处理第五页时,系统便可结合这些决策和上下文中的翻译记忆库继续生成。在 Transept 的测试中,即使只是在未翻译原文中添加一些体现译员总体思路的零散*注释 *,也能显著改善后续的输出质量。

后续页面在生成时就已经吸收了先前的决策,而不再是丢给译员一整堆千篇一律、等着被修补的烂稿。

这并不代表 MTPE 这种做法是错误的。对于那些曝光度低的海量内容,先进行全量机翻再进行轻度审校确实是效率之选,尽管这种活儿干起来并不怎么舒心。

但如果内容至关重要,批量模式就会造成质量与资金的双重损失。而之所以如此,是因为短期来看,迭代模式显得成本更高。

但事实往往并非如此。

更好的方法:让人工更早介入

上述所有观点都指向同一个策略:在机器生成完整草稿之前,先将人工判断引入系统,并利用翻译记忆库将这些判断延续下去。以下四种做法最为关键。

**先做编辑,再做译者。**在生成任何内容之前,先阅读原文,并在分量较重的段落留下带有主见的注释:这个笑话必须保住;这个术语至关重要;这里可以不拘泥于原文,以保全原意。然后,再结合这些注释和你的翻译记忆库来生成草稿。

审校一份已经理解你意图的草稿,远比修整一份生硬的初稿要轻松得多。作为曾多次对自己写的书进行过这两种尝试的人,我深有体会。

用你最出色的译文来充实记忆库(前提是你的机翻工具支持这一功能)。 翻译记忆库对 AI 的价值被严重低估了。碰到难啃的段落或棘手的语对,不妨纯手工完整翻译几个片段并输入系统;模型从真实范例中捕捉语气和语域,效果远比再多的指令都更出色。

仅凭 TM 就能维持长文本风格的统一。找到合适的过往范例(结合语义与模糊搜索)本身就是一门学问,而产出高质量的范例则更难。这同样需要人工引导,因为同一个句子在统计学上可能有多种合理的译法,而只有你才知道哪一种才契合你的风格。

不过,并非所有工具都能利用 TM 生成行文流畅的译文。在 Transept,我们进行了深入研究(详见我们关于 AI 本地化翻译记忆库的文章),以确保经人工审核的语段及其背后的上下文和工作历史能够提升 LLM 的翻译质量

串联使用多个模型,而非仅靠一个大模型。 无论是学术研究还是我们的内部调研,都得出了一个一致的结论:多级 AI 角色协作的效果,在质量和成本上都优于单次强力处理。

先用廉价、快速的模型生成初稿。再由一个强大的模型审阅初稿,并针对改进点留下注释。最后由一个快速的模型来执行这些建议。

事实证明,这样做比让强大的模型包揽一切更省钱。而且,效果通常也***更好。***这着实让我大吃一惊,因为我原本很难相信,强弱模型的组合竟然能比顶级大模型单打独斗的效果还要出色。

但它确实奏效。我的假设是,评判和生成是两项不同的任务,有着不同的激活模式。将两者分开能发挥各模型所长,并减轻“认知负荷”,从而让模型更专注。

说到底,这正是整个多智能体范式的核心逻辑:通过在不同的设置和任务下对模型进行实例化,使其能够纠正自身产生的错误。

做好底层配置。 真正的性能源于 API,而非聊天应用,因为后者冗长的系统提示词和产品框架往往会成为阻碍。

译者往往低估了 LLM 的输出质量,这其实是因为“烹饪方式”不对。就像用老抽和芝麻酱精心烹制的金枪鱼排,与你印象中那种寡淡无味的鱼罐头完全不可同日而语。

优化输入,保持其简洁并利于缓存,这样成本和延迟都会降低。测试模型处理额外上下文(TM、决策、风格指南)的能力,然后尽可能多地提供信息,直到基准测试表现开始下滑。你需要有一套涵盖多种语言的高质量基准测试,才能真正看清你对 LLM 的调优方向是否正确。

在 Transept,我们花了三年时间在自己的写作中进行研究和实验,才最终摸索出这些门道。

我在翻译小说时梦寐以求的工具:Transept 给出的 MTPE 解决方案

一位具备技术背景且严谨的译者,确实可以凭着耐心,利用模型 API 和翻译记忆库重建这套工作流。然而,若想让“人工介入”的 MTPE 运行得行云流水,兼顾愉悦的体验与卓越的成果,则需要投入大量的研究。

我们打造 Transept,正是因为在翻译自己的长篇作品时,最让我们头疼的就是亲手整合这些环节。

我们将上述愿景整合进了一个统一的工作空间:及早引导模型、保留决策、执行专项处理,并进行局部审校。

先引导,后生成。 文档编辑器将原文、译文及上下文紧密关联。译者可以对区块发表评论、根据指令重新生成单句、对比备选方案,或在不干扰其他部分的情况下进行手动编辑。评论和审校记录会始终附着在文本上,因此像“保留隐喻”这样的决策会得以留存,而不会消失在聊天记录中。

即使是你拒绝的备选方案也会被保留:弃用的措辞以及放弃它的原因,都会成为下一轮处理可参考的内容。请参阅翻译变体,了解翻译记忆库如何将过去的决策转化为上下文。

将决策转化为记忆。 Transept 的翻译记忆库能将已获批的译文及其相关的决策背景引入后续工作。术语表用于固定名称、产品词汇和特定译法;风格指南则承载了语气、语体、节奏和惯例。两者均可基于你信任的既有译作或客户的品牌资料自动生成,并在 AI 调用前经过人工审核。

**分阶段处理。**与其要求一个模型一次性完成翻译、评判和润色,Transept 可以将这些任务有序串联。智能校对会对照原文、术语表和风格指南重新审视译文,并将漏译、术语偏离和语体失当等问题以可供审核的修正建议的形式呈现。

我们还提供诸如“翻译、校对与润色”之类的流程,在自动化编排比手动控制更重要时,将翻译、校对、润色和质量保证(QA)打包处理。这同样适用于同一文档的多个语言版本!

针对长文档,我们还开发了多智能体协作机制,让多个智能体能共同处理同一份文档。它们可以共享并更新风格指南和术语表,并利用特殊的梯度记忆来同步彼此的决策。

局部审校,全局扩展。 译后编辑依然保持在区块句子层级:你可以对比变体、重新生成单句、接受建议的修复,或是亲自动手重写。Literess 可以协助运行工作流并标记偏差,而批量翻译则能将共享上下文、术语表、风格指南和 QA 应用于多个文件,而无需将项目变成繁琐的电子表格。

如果内置的处理环节不符合你的需求,你还可以步进式地构建自己的工作流:挑选步骤、为其中任何环节设置人工审核,并在运行前预览预估成本。

我由衷地为我们在 Transept 取得的成果感到自豪。这些功能有助于最大限度地发挥人类宝贵时间与才华的影响力,从而深度重塑 LLM 的运作方式。

让我依然感到惊讶的是,只有少数专业译者认为这一切是可以实现的。从技术上讲,构建交互式 MTPE 工作流在 2023 年就已可行,而我们现在仍处于起步阶段。

MTPE 最佳实践清单

即便你对 Transept 并不感冒(尽管事实并非如此),这里也有一份清单,涵盖了关于 MTPE 你需要了解的一切,以及如何让这项工作不再那么消磨意志。

  • 人工及早介入。 在生成之前,而非之后,针对关键语段设定指引。
  • 用真实范例充实记忆。 亲自动手翻译几个最难的片段,让模型从中学习语调。
  • 串联使用模型。 廉价起草、强大评判、快速执行。这种方式在质量和成本上都优于单一大模型。
  • 内容分级处理。 对低曝光的大宗内容采用全自动批量 MTPE;在事关品牌形象的内容上反复打磨。
  • 在流程上游强化术语规范。 “不翻译”和“禁用译词”规则能从源头杜绝那些最常见且最具破坏性的错误。
  • 警惕区域特性与语体偏差。 地区变体、正式程度以及代词的一致性,正是区分“地道译文”与“生拼硬凑”的关键。
  • 对流畅文本的质检要更严,而非更松。 机翻初稿读起来越顺口,其中的漏译就越容易被忽略。

MTPE 不会消失,而且对于大量内容来说,它确实是合适的工具。但“先批量生成再事后修复”的模式,却是翻译技术史上的一次误入歧途。

解决这个问题在理念上并不难。人工及早介入,用真实范例和记忆库充实上下文,让廉价模型起草、强大模型评判,这样你就能以更低的成本获得更好的翻译。这正是能让翻译公司和译者双双获益的结果。

如果你想亲身体验这种“人工及早介入”的模式,可以从翻译一份文档开始;免费方案支持首次翻译,且无需绑定信用卡。

如果你想先咨询问题,可以询问 Literess,或者在任何你看到这份指南的地方联系我。

作者

Vitalii Vlasiuk
Vitalii Vlasiuk联合创始人

Transept 联合创始人,笔名“Mevkh”。拥有语言文学学位,随后转向软件开发:作为高级 AI 工程师,他为 50,000+ 用户交付了生产级 LLM 功能——包括 RAG、智能体工具和 LLM-as-judge 评估。他也是一位慢工出细活的小说家,抽屉里藏着 120,000 字的讽刺浪漫奇幻小说。正是 AI 翻译与他自身文笔之间的摩擦,促成了这一切的开始。