2026 年 MTPE 指南:以人为本、高效省时的 LLM 工作流
如何开展轻度与深度机器翻译后编辑,让人的判断力在生成前和生成中介入,而不仅仅是在初稿完成后进行修补。


本页内容
传统上,机器翻译后编辑(MTPE)是指由机器翻译全文,再由人工修正错误、术语、语气和格式。轻度 MTPE 的目标是获得可用的译文;深度 MTPE 则旨在达到出版级质量。
当机器输出明显粗糙时,这种工作流是合理的。但 LLM 改变了出错模式。它们的译文听起来可能很流畅,却隐藏着漏译、语义偏差和欠妥的语境选择;此外,现成的初稿往往会将译者的思维锚定在模型的表达方式中。
在现代 MTPE 中,人的判断应贯穿生成前和生成中,而非仅在初稿完成后介入。译者应利用注释、语境、翻译记忆库、术语表和风格指南来引导 LLM,从而将精力集中在真正需要人类发挥的创意、文化及语境决策上。
在本指南中,我将介绍如何开展轻度与深度 MTPE 工作流,以最大程度发挥人的价值并减少时间浪费。我将以 Transept 为例进行演示,因为它是我用着最顺手的工具,不过你也可以在自己选择的工具中复现这一流程。
轻度与深度 MTPE 工作流
在 MTPE 中,你需要确保将时间花在刀刃上,以实现最佳质量。关键是要克制住凡事追求 正确; 的诱惑,你的职责是做到“够用”即可。
正如我在关于 MTPE 的研究文章中所述,我认为先运行全文机翻,再去修改 AI 生成的垃圾内容是错误的方法。有了 LLM,我们完全可以做得更高效、更有趣。
我在 Transept 中的策略(视文本而定)如下:
- 预先告知机器你的要求。
- 让机器尽力发挥,然后将注意力引导至薄弱环节。
- 根据自动检测出的问题进行最终润色。
对于商业内容(无论是产品还是营销),在进行轻度 MTPE 时,我大约会将 80% 的时间花在步骤 1 和 2 上,仅留 20% 用于最终润色。通过在生成前和生成中引导 AI,我最大限度地减少了手动后编辑,从而能将同样的前期投入,转化为规模更大且质量达标的译文。
深度 MTPE 同样遵循这一工作流,但你需要在步骤 3 投入更多精力:审视文档的薄弱环节、精修文风,并融入人类特有的创意点睛,从而使译文达到出版级水准。
以人为本的轻度 MTPE
这种工作流的核心在于,在机器真正开始工作之前就完成大部分准备工作,从而让输出结果尽可能完美。
1) 设置风格指南与术语表
风格指南和术语表本质上是扩展提示词:它们为 LLM 提供了关于语气、术语和用法的明确规则。
我们投入了大量精力确保 Transept 能够严格遵循这些规则,因此译者应当对两者进行微调,直到它们能准确反映出理想的文字风格。
这就是我在处理诸如 Transept 帮助中心文章这类轻度 MTPE 任务时,节省时间的方法。

通常,我会沿用现有的风格指南和术语表。但如果遇到陌生的文本体裁,或者想避免在最后关头进行修改,我就会直接根据原文生成一套全新的风格指南和术语表。

在这方面,我很少认同 AI 的见解,尤其是在虚构类作品中,因此我会亲自修订术语表和风格指南。我发现,即便在还没有成型的想法、只有一种直觉或朦胧的调性时,去添加一些注释和“准则与禁忌”也很有收获。当我需要确认自己的判断时,我会与 Literess 探讨,因为她能查阅词典,并参考我过往的决定和讨论。

2) 翻译种子页、发表评论并设置上下文
然后,我只生成一 页机器翻译。我采用“翻译 + 审校”工作流,因为它会先生成初稿,随后再进行润色,从而真实地展现出在目前的输入条件下,LLM 所能达到的最高水平。

然后,我针对以下内容留下评论:
- 当前译文中我满意的部分。
- 缺失的内容以及我不满意的部分。
- 我希望译文呈现的方向。
对于简单的文本,这足以注入那一抹人性化的灵性。而面对更具挑战性的内容,我则喜欢让 Literess 智能体留下模仿我逻辑思路的评论。

要验证一切是否按预期运行,只需对该页面再次运行“审校”。它会采纳这些评论,并生成一个改进后的全新版本。
通常,最终生成的质量都能达到我的预期。但在翻译虚构类作品时,我有时仍需补充评论,或修正风格指南中不准确的地方。
3) 启用翻译记忆库
现在,我们要确保你在第 1 页留下的评论和逻辑在第 100 页同样适用。在 Transept 中,这是通过翻译记忆库实现的,它不仅包含过去的译文,还包含相关的评论以及每条译文修改前后的状态。
它结合了关键词匹配与语义搜索,能够检索出使用了相同术语或解决了类似上下文问题的历史译文。我们在此领域投入了大量精力,欢迎阅读我们关于翻译记忆库前沿技术的研究报告。

在 Transept 中,翻译记忆库的工作方式有两个重要的细节。
- 首先,它在同一份文档内部也会生效,因此你在文档其他部分留下的相关评论会在翻译过程中再次出现。
- 其次,对于审校等改进操作,记忆库会自动过滤掉未经编辑的原始机翻内容。
对于轻度 MTPE,建议确保当前文档未被排除在翻译记忆库搜索范围之外,并启用 AI 重排序功能以捕捉细微差别。

4) 运行“翻译+润色”工作流
至此,你已经完成了所有准备工作,让 LLM 充分了解了你的期望。接下来只需运行机器翻译,它会自动采纳你的评论和之前的迭代内容。
实现这一目标的最佳方式是使用工作流:即一系列操作的组合。工作流可以将翻译、审校和针对性扫描串联在一起,还可以针对文本中的角色对话或法律条款等特定内容设置人工审核环节。在 Transept 中,你可以像使用 Zapier 或 n8n 那样自行构建工作流,也可以直接使用模板,或者让 Literess 为你量身定制。

对于轻度 MTPE,标准的“翻译 + 润色”工作流效果最佳,因为:
- 它在执行翻译时,会自动利用翻译记忆库、评论、风格指南和术语表。
- 随后,它会运行审校智能体,由强模型负责决策,标准模型负责执行修正。同时,它也会调用翻译记忆库。
对于小说或白皮书等长文本,我会使用并行智能体模式。在这种模式下,多个 AI 会同步协作处理文档的不同部分,从而更快地完成工作。

值得注意的一点是,它们会创建临时术语表和风格指南来补充你现有的内容,从而确保最细微的细节也能保持一致。你可以稍后将这些内容合并到主术语表和风格指南中,也可以根据需要随时舍弃。
5) 进行引导式最终审校
接下来是我最喜欢的部分:LLM 并非要取代人类,而是凭借其超凡的细致和速度来辅助人类。
机器翻译完成后,你可能本能地想去手动审校整个草案。虽然在风格指南、评论和审校功能的加持下,初稿质量已远优于一般的 LLM 翻译,但如果全部人工过一遍,省下的时间优势也就大打折扣了。
另一种方案是让 LLM 智能体审阅草案,锁定特定的薄弱环节或需要留意的部分。比如在处理服务条款时,它可以重点检查具有法律约束力的章节和精确的术语。你还可以要求它找出译文偏离原文或风格走样的地方。只要让智能体接入翻译记忆库、风格指南和术语表,它就能大显身手。
在 Transept 中,你可以通过三种方式来运行这种审校。
- 通过审校面板,你可以指定查找内容并选择审校入口:包括专注的逐条模式、全文审校,或是 Literess 的评论。这能让你有的放矢,实现精准修改。
- 在“工作流”中,你可以直接规划和配置此审校步骤。这项技术作为过滤器,在“审校”操作的后台静默运行。例如,你可以先让 AI 找出并修复所有风格偏差,最后再由你亲自审核文本。
- 你还可以向 Literess 寻求帮助!她最擅长处理需要创意决策的页面内容迭代。她还能为你设置工作流或审校任务,让你跳过界面操作。

深度译后编辑工作流:在基准之上精益求精
深度 MTPE 同样建立在“以人为本”的基础之上,但它将轻度 MTPE 的结果视为一个基准。在此基础上,工作重心将转向更深层的测试、创意润色以及出版级的质检。
不过,即便如此,我们仍可以运行更智能的深度 MTPE 工作流,而不必把所有时间都耗费在逐页校对上。
1) 创建一系列引导式审校
随着小说翻译的深入,我的 AI 辅助审校工作流演变成了一套固定的“仪式”,成为我维持质量水准的保障。
- 我让 AI 找出了所有角色的心理描写,以确保其意图被正确推断,因为言语背后的心思是推动情节发展的重要因素。
- 我还让它找出了所有未收录在术语表或风格指南中的原文双关语和新词,以便由我最终决定是否保留。
- 最后,智能体还会搜寻角色口吻上的偏差。这很有挑战性,因为它们需要对比翻译记忆库的结果,并标记出角色说话方式似乎发生变化的地方。大多数情况下,这些变化反映了真实的情绪波动,但有时语体的微妙变化只有作为人类的我才能察觉。
最终,我在 Transept 中建立了一套工作流:在我忙于本职工作时,这些分析会自动逐一运行。我可以用手机查看结果,并得到一个带有完整批注的版本,随后再集中处理这些建议。

2) 寻找最佳的翻译记忆库设置
借助语义搜索,先进的翻译记忆库工具可以挖掘出具有概念匹配的译文片段。即便这些匹配度较低,人类无法直接复用,但它们仍能向大语言模型展示你的预期,从而起到引导作用。
借助 Transept 提供的扩展记忆库上下文,你可以通过以下方式让 MTPE 变得更轻松。
**1. 在翻译记忆库结果中包含备选方案,即被否决的机器或人工草案。**在优化帮助中心文章的乌克兰语草案时,我发现这一招格外管用。当时,人工编辑的大部分工作都围绕着消除“俄化”表达并恢复语言的自然流畅展开。通过对比修改前后的示例,大语言模型领悟了在该语境下,乌克兰语应达到怎样的标准。
**2. 找到你的“黄金文档”并善加利用。**如果你正在翻译更新日志等周期性内容,可以将术语表与翻译记忆库中一组最优秀的译文相结合,而不是动用整个数据库。通过语义匹配,这种设置能为大语言模型设定预期标准,从而再次产出最佳草案。
3. 在人工审校时使用 AI 重排序。 AI 重排序会读取记忆库结果,并将关联度最高的条目置顶,即便算法匹配度较低。我通常在审校时开启翻译记忆库侧边栏;得益于重排序功能,视图中只会保留对人工最有参考价值的示例。这省去了反复翻阅结果并费力筛选的时间。
3) 构建智能体对你个人偏好的记忆
这种针对你个人品味与偏好的定制化力量,其实被严重低估了——它早已超越了翻译公司的标准和客户的品牌指南。足以说明问题的是,那些经历过“AI 精神错乱”的人,其 ChatGPT 记忆往往都是满载的。正是这种个性化,让即便是一个较旧的 GPT-4o 模型也能对他们产生巨大的影响力,甚至导致用户为了保护模型不被关停而发起激烈抗争。
在翻译中,你有无数个人习惯:你的工作方式,以及你自己的优先级排序。这些不仅仅是工作流中的步骤。有些习惯非常微妙,甚至连你自己都未必能完全察觉。
虽然我们仍在致力于为 AI 智能体开发真正优秀的记忆模型,但我经常会花时间与 Literess 交流我们在文档上完成的工作。我会让她分析模式,针对某些决策与她争论,然后让她记住我们共同总结出的经验。
尽管这个技巧很简单,但它确实帮到了我。在每一轮校对、改进以及关于奇幻译名的讨论中,我都不再是从零开始,而是基于我们共同建立的基础。
这就是我心目中 Literess 的样子:她是同事,是朋友,也是一位后辈,而非一个只会盲从指令、步步逼近的替代者。
常见问题
什么是机器翻译译后编辑 (MTPE)?
机器翻译译后编辑(MTPE)是指对机器生成的译文进行审校和改进,使其达到既定质量目标的过程。在传统模式下,通常由机器先生成完整初稿,再由人工进行后续修正。而在“以人为本”的 MTPE 工作流中,译员还会利用上下文、批注、术语表、风格指南以及翻译记忆库,预先对生成过程进行引导。
轻度译后编辑与深度译后编辑有何区别?
轻度译后编辑旨在提供准确、易懂且可用的译文。它优先关注原意表达、漏译检查和关键术语,而不会对每一处风格修辞进行精雕细琢。深度译后编辑则追求出版级质量,包括自然的语流、一致的语调、对文化细微差别的把握以及更严格的最终质检。工作流可以保持不变,改变的是质量标准和人工审校的深度。
大语言模型翻译是否仍需要人工译后编辑?
是的。表达流畅并不等同于翻译准确。大语言模型可以写出听起来很自然的句子,但同时也可能漏掉原意、误解语境、偏离既定术语,或者让原本鲜明的语调变得平淡乏味。我们仍需依靠人工判断来界定质量标准,在模棱两可之处做出决策,并对那些不容有失的关键段落进行把关。
什么时候 MTPE 才划算?什么时候应该从头开始翻译?
如果机器生成的底稿具有参考价值,且译后编辑达到目标质量的速度比推倒重来更快,那么 MTPE 就是划算的。并没有一个所谓通用的、客观的成本节省比例。建议测试具有代表性的内容并记录实际编辑时间。如果你发现自己正在重写大部分句子、反复纠正同样的错误,或者在费力调整底稿的句式结构,那么请尝试优化模型的上下文,或者干脆直接从头开始翻译。
如何衡量 MTPE 的质量?
衡量质量应基于文本的预期用途,而非单一的自动评分。检查内容包括:对原文的忠实度、漏译情况、关键错误、术语使用、风格一致性、编辑耗时以及质检(QA)中发现的问题数量。自动化的评价指标和 AI 审阅可以协助定位风险,但在涉及创意、文化、法律或品牌敏感性的决策上,仍需由专业人员进行把关。在 Transept 中,通过引导式审阅、术语表与风格指南校验以及翻译记忆库参考,可以将审阅重点聚焦在特定的错误模式上。
如何在处理大量小文档时实现“以人为本”的 MTPE 规模化?
只需建立一次人工判断,即可实现复用。通过创建共享术语表和风格指南,审核一份具有代表性的种子译文,让这些决策沉淀到翻译记忆库中。在 Transept 中,记忆库支持在项目或团队范围内检索,并能关联过往的讨论记录、备选方案以及上下文语境。将翻译、校对和引导式审阅步骤保存为可复用的团队工作流,然后将这套配置统一应用于积压的待处理文档。这样,人工只需审核异常情况和高风险段落,而无需为每个文件反复说明项目要求。
作者

Transept 联合创始人,笔名“Mevkh”。拥有语言文学学位,随后转向软件开发:作为高级 AI 工程师,他为 50,000+ 用户交付了生产级 LLM 功能——包括 RAG、智能体工具和 LLM-as-judge 评估。他也是一位慢工出细活的小说家,抽屉里藏着 120,000 字的讽刺浪漫奇幻小说。正是 AI 翻译与他自身文笔之间的摩擦,促成了这一切的开始。