AI 检测工具能识别出 AI 翻译吗?我们实测了 Pangram 和 GPTZero
我们用 AI 在乌克兰语、英语和中文之间互译了一部小说的部分章节,并将译文送入 Pangram 和 GPTZero 进行检测。结果所有样本都被判定为人工撰写,就连直接用 ChatGPT 翻译的文本也不例外。本文将为您解析其中的缘由,以及为何您仍应当主动披露 AI 翻译。



本页内容
在自主翻译小说的作家中,“我的书会被标记为 AI 生成吗?”是我们听到最多的疑问。这背后往往隐藏着这样一幅画面:读者、编辑或零售平台将某个章节复制粘贴到 AI 检测工具中,随即弹出了醒目的红色警告条。
因此在 10 月,我们用自己的作品做了一次实测。
我们测试了什么?
我们从 Vitalii 尚未定名的一部讽刺奇幻小说中截取了部分章节,利用 AI 在乌克兰语、英语和中文之间进行了双向互译。随后,我们将所有译文提交给作家们最常向我们问起的那两款检测工具(使用的是 2026 年 10 月时的最新版本):7 月发布的 Pangram 4 和 9 月上线的 GPTZero 4o。
| 测试内容 | 测试方式 |
|---|---|
| 源文本 | Vitalii 创作的一部未出版讽刺奇幻小说的部分章节 |
| 语言 | 乌克兰语、英语和中文,双向互译 |
| 篇幅 | 源文本 100 至 1,300 词(乌克兰语译成英语后篇幅有所增加,最高达 1,704 词) |
| 译文生成方式 | 使用 Transept,配合术语库、风格指南,并对照原文进行校对 |
| 对照组 | 相同章节直接由 ChatGPT 翻译,不使用术语库、风格指南,且未作任何编辑 |
| 检测工具 | Pangram 4 与 GPTZero 4o(2026 年 10 月版本) |
这两款检测工具都明确将乌克兰语和中文列入了支持语言名单(Pangram、GPTZero)。
检测工具给出了怎样的结果?
在两款检测工具中,无论哪种翻译方向,所有样本都被判定为人工撰写。对照组同样如此:直接由 ChatGPT 翻译的文本也拿到了 100% 人工撰写的判定。
| 目标语言 | 检测工具 | 检测结论 |
|---|---|---|
| 英语(源自乌克兰语) | GPTZero 4o | 人工撰写,97% 与 98% |
| 乌克兰语(源自英语) | Pangram 4 | 人工撰写,100% |
| 其余所有互译方向 | Pangram 4 与 GPTZero 4o | 人工撰写 |

GPTZero 4o 对乌克兰语译出文本(1,704 词)的检测结果:97% 人工撰写。

另一场景(1,593 词):98% 人工撰写。

Pangram 4 对英译乌克兰语文本(1,261 词)的检测结果:100% 人工撰写。
为什么它们会判定为“人工撰写”?
因为按照它们自己的规则,这本就是正确的答案。检测工具只回答一个问题:这段文本是由模型撰写的吗?而小说的译文保留了原作者的种种构思:情节走向、场景顺序、登场人物的对话、笑点的抖包袱时机,以及句子在何处停顿与断句。人类早已决定好要表达什么,模型不过是换了另一种语言来挑选字词而已。
Pangram 在文档中明确写下了这一点。Pangram 4 技术报告将“直译”与轻度文字润色、拼写修正并列,视作微不足道的 AI 辅助,因此文本仍算作人工撰写。这是一大转变:Pangram 的上一代模型此前仍将翻译归为轻度 AI 辅助。我们尚未发现 GPTZero 公开发布过针对译文的规则,而其给学生的建议则表明,它仍可能会标记出“受 AI 严重影响的段落”。不过在我们提供的测试样本中,它的判定结果与 Pangram 一致。
反之,同样的逻辑依然成立。翻译掩盖不了模型撰写的痕迹:Pangram 声称其能够识别经翻译后的 AI 文本(哪怕经过双重翻译),其报告还将多次反复翻译列为了红队测试时未能蒙混过关的花招之一。检测工具看重的是文本究竟是谁创作的。至于由谁翻译,则是另一个层面的问题了。
检测工具给出的评分究竟可不可信?
不妨把它当作某款工具在某一天给出的参考意见。
- **检测工具随时在变。**GPTZero 在 2023 年曾表示其模型每两周就会更新一次,而 Pangram 在版本 3 和 4 之间也改变了对待翻译文本的判定标准。
- **检测工具曾冤枉过不少人。**2023 年,检测工具将非英语母语者撰写的文章中有 61% 误标为 AI 撰写(Liang 等人)。同年一项针对 14 款检测工具的测试发现,它们既不准确也不可靠,而且对于经机器翻译的人工撰写文本,误判率甚至更高(Weber-Wulff 等人)。尽管更新的模型声称已解决了这一问题,但这依然提醒我们,绝不能把检测评分当作确凿证据。
- **最知名的那款已被下架。**OpenAI 在 2023 年 7 月因准确率过低,将其自家的 AI 文本分类器下线。
- **有些检测工具甚至根本不支持你的语言。**Turnitin 的 AI 检测报告仅支持英语、西班牙语、日语和阿拉伯语,因此乌克兰语或中文书稿根本无法获得任何评分。
况且,检测工具无法评判质量好坏。它给直接由 ChatGPT 翻译的文本和我们译出的文本判定了完全一样的结果,因此哪怕拿到“人工撰写”的评分,也丝毫说明不了译文读起来究竟好不好。
那么,您还需要向 Amazon 声明吗?
需要。检测工具关注的是文本由谁创作,而 Amazon 询问的则是文本是如何制作的。KDP 的内容准则将 AI 生成内容定义为由基于 AI 的工具创建的文本、图像或译文;并且 AI 译文“即使在此之后经过了实质性编辑”,仍旧属于 AI 生成内容。因此,如果您在 KDP 上发布借助 AI 翻译的书籍,无论检测工具对文本的判定结果如何,您都必须予以声明。

如果您与出版商或经纪人合作,关键在于合同中的约定,而非检测工具的判定。在动笔之前请先沟通确认;我们的小说翻译页面介绍了作者们通常如何处理这一问题。
这对您的作品意味着什么?
- **切勿用检测工具来评估译文。**它回答的是关于作者身份的问题,而对于翻译后的小说,原作者依然是您自己。
- **别花冤枉钱买所谓的“去 AI 味工具”(humanizer)。**它丝毫改变不了您需要如实申报的事实;而且由于翻译的是您自己的作品,它根本无处可修。
- **重点排查读者真正会注意到的问题:**中途拼写不一致的名称、遗漏的语句、变得平淡乏味的对话。使用专有名词术语表并对照原文进行校对,可以解决绝大部分问题;至于剩下的,唯有靠您亲自逐行通读来把关。
- 只要平台有所要求,务必如实申报 AI 翻译。
本次测试无法说明的问题
- 测试仅涉及一部小说、一种题材,选取的片段最长为一个场景。我们并未测试整本书。
- 测试仅选用了两款检测工具,时间为 2026 年 10 月。两款工具更新频繁,因此下个月重新测试可能会得出不同的结果。
- 我们并未测试 Originality.ai、Copyleaks 或 Turnitin(后者不支持乌克兰语或中文)。
- 我们的测试样本均为人工撰写文本的译文。而由模型从头撰写的文本才是检测工具针对的核心场景,且 Pangram 表示,即使将其翻译也不会改变判定结果。
等检测工具更新后,我们会再次进行复测。
作者

Transept 联合创始人。拥有三个英语语言文学学位——曾求学于基辅、俄斯特拉发,并在萨尔茨堡度过了一年。作为乌克兰人,她的写作生涯却大多以英语进行。她最初作为提示词工程师进入 AI 领域,随后转向产品和生命周期营销。她撰写关于真实人物的半虚构故事,并不断探讨在语言转换中究竟丢失了什么。

Transept 联合创始人,笔名“Mevkh”。拥有语言文学学位,随后转向软件开发:作为高级 AI 工程师,他为 50,000+ 用户交付了生产级 LLM 功能——包括 RAG、智能体工具和 LLM-as-judge 评估。他也是一位慢工出细活的小说家,抽屉里藏着 120,000 字的讽刺浪漫奇幻小说。正是 AI 翻译与他自身文笔之间的摩擦,促成了这一切的开始。


