翻译与本地化术语表:那些实战中真正会遇到的术语
翻译记忆库、模糊匹配、MTPE、XLIFF、TMX、利用率、创译。本文用通俗易懂的语言,为您定义在报价单、CAT 工具或与供应商沟通中会遇到的每一个术语,并阐述它们之间的关联。

本页内容
翻译行业存在一个术语难题:一半的词汇是缩写,好几个词意思差不多,还有一些词的意思则因人而异。当报价单上写着“在 85% 模糊阈值下实现 80% 利用率”时,你很难一眼看出这到底是不是个好消息。
这是一份实战术语表:涵盖了您在报价单、CAT 工具或供应商沟通中会遇到的术语。我们没有按字母顺序排列,而是根据它们在实际流程中出现的先后顺序进行定义。如果某个术语在 Transept 中有特定含义,我们会特别注明。
术语表、术语库和翻译记忆库有什么区别?
在日常交谈中,这三个词经常被混用,但在工具中,它们代表着不同的概念。
术语表
一份包含术语及其核准译文的列表,并附带适用场景的说明。它涵盖了产品名称、角色名称、法律词汇以及客户坚持使用的词汇。术语表只为了回答一个问题:当这个术语出现时,必须翻译成什么?
在 Transept 中,术语表会被固定在每次运行的提示词中,并在事后再次校验。这样,第 1 页敲定的术语到第 500 页依然适用。
术语库 (TB)
这是 CAT 工具对术语表的称呼,通常每个条目包含更丰富的元数据:如词性、所属领域、禁用变体列表,有时还附带定义。如果有人提到“术语库”,你直接把它理解为“术语表”也没错。
翻译记忆库 (TM)
翻译记忆库存储了您已翻译的句段,将原文与译文成对保存,并在出现相似文本时重复使用。术语表是在术语层面发挥作用,而记忆库则是在整句层面发挥作用。
传统的记忆库仅支持文本匹配。Transept 的 翻译记忆库 则更进一步,它能识别语义,并保留决策背后的逻辑(如被否决的备选方案和审核意见)。正因如此,即便句子措辞有变,只要解决的是同一个问题,它依然能派上用场。我们专门撰文探讨了 这一转变带来的影响。
模糊匹配
指记忆库中内容相近但不完全相同的匹配项,以百分比表示。85% 是一个常见的阈值:高于此比例,系统会提供存储的译文作为参考起点;低于此比例,该句段则被视为全新内容。这个数值衡量的是文本相似度,而非旧译文质量的好坏。
完全匹配、100% 匹配与 101% 匹配
完全匹配或 100% 匹配是指原文句段与记忆库中已有的句段完全一致。101% 匹配(也称为上下文完全匹配,即 ICE)意味着该句段不仅内容一致,而且其前后的句段也匹配。由于语境相同,存储的译文直接沿用的可能性要大得多。
利用率
指记忆库覆盖新项目的百分比。利用率直接左右着开支:翻译公司通常会对高利用率的词数给予大幅折扣,因为 100% 匹配的内容只需审核,无需重译。当报价单里提到利用率时,它其实是在告诉你,有多少工作量可以被省掉。
机器翻译缩写词是什么意思?
机器翻译 (MT)
泛指任何形式的自动翻译,无论其底层技术如何。这是一个总称。
神经机器翻译 (NMT)
利用专为翻译任务训练的神经网络实现的机器翻译。DeepL 和 Google Translate 便是这一代引擎的代表。NMT 擅长生成通顺的句子,但完全无法听从指令:你没法要求它在翻译中途变得更正式。
LLM 翻译
指由通用大语言模型完成的翻译。它与 NMT 的实际区别在于你可以与其“对话”:为其提供术语表、风格指南、上下文文档以及关于语气的指令。Transept 基于前沿大语言模型运行,并将模型视为可灵活更换的后端。
MTPE(机器翻译译后编辑)
指由人工对机器输出的结果进行编辑,从而产出成品译文。有时也写作 PEMT。这是目前翻译行业的主流工作模式,也是受大语言模型(LLM)影响最大的领域:旧式的机器翻译效果通常比较粗糙,错误往往一眼就能看出来;而 LLM 的输出虽然读起来通顺流畅,却可能存在漏译分句的情况。
我们的 MTPE 指南 介绍了如何开展这项工作,从而让人的判断力在草稿生成之前、而非之后介入。
轻度译后编辑与深度译后编辑
这是两种不同的服务等级。轻度译后编辑旨在确保译文准确、易懂,允许措辞稍显平淡。深度译后编辑则追求出版级质量,力求使译文与人工从零开始翻译的成果毫无二致。账单上的用词至关重要:这两种表述对应的是截然不同的人工工时投入。
翻译工具是如何拆分文档的?
句段
翻译工具拆分文本的基本单位,几乎总是以句子为界。记忆库按句段存储,匹配度按句段评分,字数也按句段统计。
原文与译文
原文(Source)是指翻译的起始语言,译文(Target)是指翻译的目标语言。一个原文句段及其对应的译文句段共同构成一条记忆库条目。“原文词数”通常是计费的基准,我们的定价也是如此。
块
Transept 的基本单位,且有意设计得比“句段”更大:它可以是段落、标题、列表项或表格单元格。“块”将句子与其所属的上下文保留在一起,使模型能够识别出三句之后的代词指代的是开头的内容。在“块”的内部,句级控制依然有效。
对齐
将既有的译文与其原文按句段进行配对,从而将使用翻译工具之前完成的翻译成果转化为工具内的记忆库。对齐也是导入已完成译文时的一种检查机制:如果原文和译文无法一一对应,则说明内容存在增补或遗漏。
工具间常用的交换格式有哪些?
XLIFF
XML 本地化交换文件格式。这是在不同系统间传输可翻译内容的标准载体:每个单元都包含其原文、译文、状态,通常还附有翻译备注。如果客户发给你一个双语文件,那很可能就是 XLIFF 格式。我们提供免费的 XLIFF 转换器,方便你在电子表格中查看此类文件。
TMX
翻译记忆交换格式。它是翻译记忆库的通用便携格式,让在一个工具中建立的记忆库可以迁移到另一个工具中。正是有了 TMX,记忆库才成为了你拥有的资产,而不是被供应商掌控的资源。
TBX
TermBase eXchange。它在术语表和术语库领域的作用与 TMX 类似。但它的普及程度不及 TMX,因为术语表通常体量较小,人们往往直接通过邮件发送电子表格。
PO 和 gettext
这种字符串格式被大量的开源软件、WordPress 以及 Python 和 PHP 项目所采用。.po 文件将每个源字符串与其译文配对,并包含翻译备注;.pot 则是其空白模板。
SRT 和 VTT
字幕格式:包含时间轴与文本,逐条排列。翻译字幕意味着在确保原意的同时,还必须兼顾阅读速度和行长度,因为即便译文再忠实,如果内容过长,在屏幕上也会难以阅读。
资源文件
应用程序在各平台上存放界面字符串的容器:Apple 平台的 .strings、.NET 的 .resx、Flutter 的 .arb,以及几乎随处可见的纯 JSON 或 YAML 文件。软件翻译翻译的是这些文件而非普通文档,这也是为什么字符串表工作流与文档工作流大不相同。
质量与流程术语是什么意思?
区域设置
区域设置是指语言、地区以及随之而来的各种规范:日期顺序、小数点分隔符、货币、地址格式,有时还涉及不同的书写体系。pt-BR 和 pt-PT 虽然都是葡萄牙语,但在产品中并不能互换使用。选择特定的区域设置而非单纯的语言,是为了避免巴西读者看到欧洲风格的措辞。
i18n 与 l10n
这些是数字缩略语,通过计算首位和末位字母之间的字母数量得名。国际化 (i18n) 是指让产品具备可翻译性的工程工作:例如不在图片中硬编码文字、不使用碎片拼接句子、在布局上为德语预留空间。本地化 (l10n) 则是将产品适配到特定区域设置的过程。国际化只需进行一次,而本地化则需针对每种语言分别开展。
风格指南
指术语之外的规则:包括语体、语气、对读者的称呼、标点和引号规范,以及数字和单位的处理方式。风格指南的作用是,当翻译涉及多人协作或分批次完成时,确保译文的口吻始终如一。
LQA(语言质量保证)
结构化评审:评审员对照错误类别(准确性、术语、风格、区域设置规范)对样本进行打分,并标注每个错误的严重程度,从而得出量化的分值,而非凭主观印象。该流程用于交付成果的验收或拒收,以及供应商之间的横向对比。
创译
为了追求表达效果而非仅仅传达字面意思而进行的重写。英语中带有双关语的口号在日语中往往无法保留双关效果,因此任务的要求就从“确保准确”变成了“打动人心”。计费方式通常按工时或创意方案计算,绝不按字数计费。
回译
由另一位未接触过原文的译员将译文重新翻译回源语言,以核实原意是否完整保留。这种做法在临床试验和受监管行业中是标准流程,因为在这些领域,任何差错都代价不菲。回译检验的是语义,而非风格。
常见问题
哪些术语是我上手之初就必须掌握的?
只需掌握四个:术语表、翻译记忆库、句段和区域设置。它们描述了翻译工作的存储与拆分方式,掌握这些就足以看懂报价单。至于那些缩略语,大多是与供应商沟通或使用工具时才会涉及的词汇,等遇到时再查阅即可。
我可以将其他工具中的翻译记忆库导入 Transept 吗?
您可以直接导入已有的译文,且导入过程完全免费:由于翻译工作已经完成,系统不会运行模型,也不会产生字数计费。您可以采用导入现有翻译中介绍的字符串表导入方式,或者直接导入已翻译的文档进行预置。目前,系统尚不支持直接处理原始的 .tmx 文件。您可以使用我们免费的 TMX Cleaner 工具在浏览器中将其转换为 Excel 或 CSV 格式(无需上传任何数据),这通常是将旧记忆库转换为可用格式的最快途径。
术语表和翻译记忆库会产生冲突吗?
它们各司其职,通常配合使用。术语表规定了单个词汇的统一译法;记忆库则记录了上次整个句段的处理方式。同时使用这两者的工具会将术语表应用于特定词汇,并将记忆库应用于词汇周围的措辞,这样即使是调用的旧句子,也能确保使用的是当前的术语。
既然有了现代模型,译后编辑还有必要吗?
有必要,但原因已经变了。以前的机器翻译错误很明显,因此很容易发现并修正。而现代模型生成的文本虽然流畅,但仍可能出现漏译分句、语体平淡化或词义误选等问题。现在的编辑工作不再侧重于修复语法,而是更多地为了确保原意和口吻完整地保留了下来。
翻译和本地化有什么区别?
翻译针对的是文本。本地化则是为了让产品适应另一个市场而必须改变的所有其他要素:日期和货币、姓名和地址格式、图片和配色、法律声明,以及当译文长度增加 30% 时所需的排版调整。经过翻译的产品可能仍会有“外来感”,而经过本地化的产品则不会。
作者

Transept 联合创始人。拥有三个英语语言文学学位——曾求学于基辅、俄斯特拉发,并在萨尔茨堡度过了一年。作为乌克兰人,她的写作生涯却大多以英语进行。她最初作为提示词工程师进入 AI 领域,随后转向产品和生命周期营销。她撰写关于真实人物的半虚构故事,并不断探讨在语言转换中究竟丢失了什么。