WPML 的 Private Translation Cloud (PTC) 在独立翻译评审中获得了 90.0 分(满分 100 分)。而通常被认为是目前最强主流 AI 翻译引擎的 DeepL,在相同内容上的得分为 77.7 分。Private Translation Cloud 的整体表现比 DeepL 高出 12.3 分,在语言专家评分的九个质量维度中全部胜出,且每页的错误率降低了约 18 倍。
概览
| 指标 |
|
|
|---|---|---|
| 平均翻译质量得分 (0–100) | 77.7 | 90.0 |
| 每页翻译平均问题数 | 1.27 | 0.07 |
| Private Translation Cloud 得分高于 DeepL 的质量维度 | — | 9 / 9 |
| Private Translation Cloud 得分高于 DeepL 的测试语言 | — | 6 / 6(阿拉伯语、英语、法语、德语、意大利语、西班牙语) |
我们为何开展这项研究
DeepL 被大多数 WordPress 和软件行业视为 AI 翻译的金标准。当客户询问是否可以在不经过人工审核的情况下发布 AI 翻译内容时,DeepL 通常是默认的基准。
WPML 开发了自己的 AI 翻译引擎——Private Translation Cloud (PTC)——因为“足够好”还远远不够。Private Translation Cloud 是 WPML“全自动翻译”模式下的默认引擎,为运行 WPML 的 150 多万个网站提供了绝大部分自动翻译支持。
我们希望针对潜在客户每周都会问到的一个问题,给出一个可衡量的答案:Private Translation Cloud 与 DeepL 的实际对比情况如何? 这项研究就是答案。上面的数字是核心结论;本文的其余部分将解释这些数字是如何产生的,以及它们对真实的生产环境网站意味着什么。
我们的衡量指标与方法
我们使用基于 MQM(多维度质量指标) 的系统对翻译质量进行评分,这也是 WPML 语言团队在进行持续的 Private Translation Cloud 客户网站评审时所使用的框架。每个翻译页面都会从九个维度进行评分:
- 语法 —— 是否存在语法错误?
- 含义 —— 是否保留了原文的含义?
- 自然度 —— 对于母语使用者来说,听起来是否自然且地道?
- 语气 —— 是否捕捉到了原文的语气?
- 正式度 —— 无论是在称呼读者还是在语法称呼形式上,语域使用是否得当?
- 术语 —— 术语使用是否准确?
- 一致性 —— 页面内的术语应用是否一致?
- 大小写 —— 是否遵循了目标语言的规范?
- 数字、单位和日期本地化 —— 是否遵循了目标语言的规范?
每个维度由身为目标语言母语者的语言专家进行 1–10 分的评分。最终的每页得分是九个维度的平均值乘以 10,从而得出一个 1–100 分的量表,对应以下质量等级:
| 得分 | 含义 |
|---|---|
| 90–100 | 优秀至完美 —— 无需审核即可发布 |
| 80–89 | 良好 —— 在大多数语境下可直接发布 |
| 70–79 | 及格至平庸 —— 可用但错误明显 |
| 60–69 | 平庸 —— 发布前需要润色 |
| 50–59 | 非母语使用者也能发现明显错误 |
| 50 以下 | 缺陷严重,需要重做 |
补充参考:已发布的普通人工翻译平均得分约为 76 分。DeepL 的 77.7 分略高于该水平。而 Private Translation Cloud 的 90.0 分使其恰好处于“优秀 —— 无需审核即可发布”的等级边缘。
样本量与选择
为了评估 DeepL,我们从过去 12 个月内使用 DeepL 翻译的网站中随机抽取了 800 个网站,根据网站存续时间、内容量和翻译活跃度进行分类,并从各类中取样。随后,我们的语言专家手动评审了样本网站的主要页面 —— 共计 227 个网页,涵盖 阿拉伯语、英语、法语、德语、意大利语和西班牙语。
为了对 DeepL 和 Private Translation Cloud 进行直接对比,我们使用 Private Translation Cloud 重新翻译了其中的 73 个页面,并由同一批语言专家根据相同的源内容进行盲审评分。Private Translation Cloud 的样本量小于 DeepL,是因为每次 Private Translation Cloud 的测量都反映了一个特定的 Private Translation Cloud 版本,而该引擎仍在不断进化 —— 请参阅下文的“我们并未止步”章节。
分语言表现:Private Translation Cloud 在所有语对中胜出
总体得分固然引人注目,但分语言的表现更能告诉多语言内容团队可以期待什么。
各语言翻译质量 (TQ) 得分

在我们测试的每一个语言对中,Private Translation Cloud 的得分都高于 DeepL。差距最大的是 阿拉伯语(+22.4 分),DeepL 在该语言上的表现历来不佳,而 WPML 在从右向左 (RTL) 阅读语言质量上的投入在此得到了清晰体现。紧随其后的是 德语(+11.5 分)和 法语(+9.9 分)。差距最小的是 英语(+6.0 分)—— 即便如此,Private Translation Cloud 也将页面质量从“及格、有明显瑕疵”提升到了“可发布”级别。
得分的离散度同样重要。DeepL 的得分分布在阿拉伯语中有一个长长的低分尾部,部分页面的得分远低于平均水平 —— 德语或法语用户会认为这些页面是完全不合格的。Private Translation Cloud 的分布更集中且中心更高,因此内容团队可以围绕预期的质量等级进行规划,而无需为极端低分情况预留预算。
Private Translation Cloud 在我们评分的九个质量维度中的每一个也都优于 DeepL:语法、含义、自然度、语气、正式度、术语、一致性、大小写和地域规范。提升最明显的是那些对真实网站读者最重要的维度 —— 术语(+1.5)、语法(+1.4)、自然度(+1.4)以及 数字/单位/日期本地化(+1.4)。在任何维度上,DeepL 都无法与之并驾齐驱,Private Translation Cloud 并非险胜,而是全面领先。
错误率:运营视角
平均分很有参考价值,但对于运营真实网站的人来说,错误计数更有用。我们的评审员记录了他们在每个页面上发现的每一个具体问题 —— 语法、含义、术语等等。
每页平均问题数

DeepL 平均每页产生 1.27 个问题。Private Translation Cloud 仅产生 0.07 个 —— 在相同的源内容下,每页错误率降低了约 18 倍。
对于一个拥有 200 个页面的网站,这大致相当于:
- DeepL: 发布前需要发现、决策并修复约 254 个问题。
- Private Translation Cloud: 整个网站仅约 14 个问题。
这就是将 AI 翻译作为初稿与作为工作流之间的区别。DeepL 是一个强力的初稿 —— 每个页面在发布前仍需检查问题。而根据这项测量,Private Translation Cloud 是一个完整的工作流:错误率极低,以至于人工审核步骤对大多数内容来说变成了可选,而非强制。
“优质翻译”的真正含义
MQM 框架的等级描述是对 AI 翻译营销话术的一个有力补充。“9/10 分”的页面不是指 90% 的内容正确,而是指母语使用者在仔细阅读时,找不到任何想要修改的地方。“7/10 分”的页面虽然可以直接使用,但有明显的瑕疵。“5/10 分”的页面则是非母语使用者也能看出错误的地方。
DeepL 的平均得分处于 7 分段的高位 —— 及格,但对于细心的母语读者来说有明显瑕疵。Private Translation Cloud 的平均得分处于 90.0,恰好位于“优秀 —— 无需审核即可发布”的门槛上。这就是我们评审员测得的质量差异。它对应着一个本质的区别:DeepL 的输出是一个需要人工审核后才能发布的起点;而 Private Translation Cloud 的输出在大多数情况下本身就是最终发布的成品。
为什么 WPML 能提供这种质量
我们意识到,“我们构建了自己的 AI 引擎”是现在很多公司都在标榜的说法。Private Translation Cloud 的独特之处在于以下两个具体原因。
规模与持续评审。 WPML 为 150 多万个网站提供服务,且已深耕十余年。WPML 的语言专家团队会持续评审 Private Translation Cloud 的翻译质量 —— 抽取输出样本,使用本研究中相同的 MQM 框架进行评分,并观察引擎在特定术语、语言对或内容类型上是否持续产生较低质量的结果。
专注。 Private Translation Cloud 不是 WPML 的副业。它拥有专门的团队 —— 工程师、MLOps 和语言专家。当语言专家标记出重复出现的模式时,工程团队会将其视为 Bug:扩展词汇表、调整正式度模型、添加例外情况、发布修复。这个循环持续运行,这就是为什么 Private Translation Cloud 的质量在过去 12 个月里从“与普通人工翻译相当”提升到了本研究中的水平。
这种结合 —— 有意义规模下的持续人工评审,配合一个将每项发现都作为工程工单处理的团队 —— 共同造就了上述质量数据。这不仅仅是模型架构的功劳,更是运营模式的胜利。
我们并未止步
90.0 分使 Private Translation Cloud 处于“优秀 —— 无需审核即可发布”的边缘。我们对这一结果感到满意,但我们并不认为这就是天花板。
上述“QA → 工程”循环仍在运行。WPML 的语言专家团队继续分析客户在真实网站上对 Private Translation Cloud 输出所做的修改,识别这些修改揭示的模式,工程团队则发布修复方案 —— 包括词汇表扩展、正式度调整和特定语言对的优化。我们预计下一次测量的结果会更高。
这对您的工作流意味着什么
传统的多语言内容工作流是 翻译 → 审核 → 发布。审核步骤之所以存在,是因为每个 AI 引擎(以及大多数人工翻译)产出的作品在发布前都需要第二双眼睛的检查。这个审核步骤也是多语言内容成本最高、延迟最严重的地方。
使用 DeepL,审核步骤是必不可少的。每页 1.27 个问题必须在某个环节被发现;如果团队不发现,客户就会发现。而使用 Private Translation Cloud,审核步骤对大多数内容来说是 可选的。一些团队仍会进行审核 —— 针对高风险页面或受监管行业 —— 但默认工作流变成了 翻译 → 发布,审核仅保留给确实需要的特殊情况。
这就是数据所描述的运营差异。这绝非微小的改进。
这对您的成本意味着什么
翻译成本由两部分组成:翻译产出成本和审核成本。在内容上线前,这两部分都必须支付。
在大多数专业语境下,人工审核的成本为每词几欧分 —— 无论评审员是按词、按页还是按网站收费,计算结果大致如此。完整的人工翻译(翻译,然后由第二个人审核)对于主要语言对通常在 每词 0.10–0.20 欧元 左右,其中仅审核部分就在 0.04–0.08 欧元 范围内。
以下是按此标准计算的各工作流实际成本。
纯人工翻译 —— 基准。 每词约 0.10–0.20 欧元。两个步骤均由人工完成。
DeepL(或任何 AI 引擎)加人工审核。 AI 处理翻译步骤;人工仍需审核每个页面,因为在每页 1.27 个问题的情况下,如果没有人预先发现,这些问题就会传达到客户手中。翻译步骤基本免费;审核步骤仍需每词 0.04–0.08 欧元。 相比纯人工翻译的总节省:约 60%。 这是标准的“AI 帮您节省翻译费用”的宣传点 —— 这确实是真的 —— 但成本天花板卡在了 DeepL 的质量仍需的审核步骤上。
Private Translation Cloud,无需审核。 Private Translation Cloud 的成本为 每词 0.0012–0.003 欧元 —— 每词 4 个积分,乘以每 1,000 积分 0.30–0.75 欧元(取决于用量),每月前 2,000 个积分免费。(完整阶梯价格请参阅 WPML 自动翻译定价。)由于 Private Translation Cloud 的实测质量(90.0 TQ 得分,每页 0.07 个问题,在相同源内容上比 DeepL 高出 12.3 分)足以在大多数情况下跳过审核步骤,因此审核成本降为零。相比纯人工翻译的总节省:约 99%。
这不仅仅是对“AI 加审核”工作流的边际改进。这是一种完全不同的成本体系。
概览 —— 发布一个翻译单词的成本
| 工作流 | 翻译 | 审核 | 总计 | 相比人工节省 |
|---|---|---|---|---|
| 完整人工翻译 | €0.10–€0.20 | 已包含 | €0.10–€0.20 | — |
| DeepL + 人工审核 | ~€0 | €0.04–€0.08 | €0.04–€0.08 | ~60% |
| Private Translation Cloud,无需审核 | €0.0012–€0.003 | €0 | €0.0012–€0.003 | ~99% |
人工翻译费率为主要语言对的典型行业估算。Private Translation Cloud 定价源自 WPML 已公布的费率。
关于自行审核的说明:当企业主亲自进行审核而非付费给评审员时,成本并非为零 —— 只是不那么显性。花在审核上的时间就是没花在业务其他方面的时间,按任何合理的时薪计算,隐含成本通常比外包评审员的收费更高。无论目前由谁支付审核费用,Private Translation Cloud 的节省效果都同样适用。
这开启了什么可能。 当翻译成本超过每词 0.10 欧元时,您只能有选择地翻译 —— 首页、顶级产品分类、几篇高流量博客文章。其他内容都保留源语言,因为经济上不划算。当翻译成本仅为每词 0.002 欧元,且产出质量优于典型人工翻译时,以前不可行的内容现在在经济上变得可行了:
- 电子商务中的全目录翻译 —— 每一个长尾产品描述,每一个变体。
- 涵盖客户可能使用的每种语言的完整文档门户,而不仅仅是前三种语言。
- 知识库、支持常见问题解答、博客存档 —— 那些能驱动搜索但以前从未证明其翻译成本合理性的长尾内容。
- 为在特定市场运营的出版商提供本地化编辑内容,在这些市场中,单页广告收入无法覆盖人工翻译成本。
几十年来,多语言内容一直是一个“我们能负担得起翻译什么”的问题。有了 Private Translation Cloud,问题变成了“什么值得翻译” —— 这是一个更不同、更有趣的问题。
如何在您自己的网站上获得这种质量
Private Translation Cloud 是 WPML“全自动翻译”模式下的默认引擎。这是一种全局设置,可在后台自动翻译您网站上的每个页面。无需进行逐页配置管理。
要获得本研究中测得的质量,除了开启“全自动翻译”外,您唯一需要做的就是花大约一分钟在“全自动翻译”设置中描述您网站的受众和语气 —— 例如,“一家面向开发者的软件公司,语气正式,技术术语保留英文”。Private Translation Cloud 会利用该描述使翻译符合您的品牌声调。
这就是全部设置。结果就是本研究所测得的水平。
关于我们未做事项的说明
我们没有通过公开 API 将 Private Translation Cloud 与 Google Translate、Azure Translator 或基于 LLM 的服务进行对比。原因在于:这些引擎更新频繁,单次测量结果在几个月内就会过时。我们选择 DeepL 进行对比,是因为 DeepL 是生产级 AI 翻译最常被引用的基准,也因为 DeepL 是我们大多数竞争对手底层使用的引擎。
在本研究中,我们也没有衡量速度、成本或开发者体验 —— 仅衡量了质量。这些对比存在于我们的功能页面和对比页面中,它们有各自的参考价值。
立即尝试
如果您运营着一个多语言 WordPress 网站,并希望在您自己的内容上查看 Private Translation Cloud 的输出效果,请安装 WPML,启用“全自动翻译”,并将结果与您目前使用的任何工具进行对比。这里描述的质量差异,就是您应该期待看到的质量提升。
方法论问题或数据请求:请联系 WPML 团队。
研究由 WPML 语言专家团队于 2026 年 4 月开展。样本:227 个由母语语言专家评审的 DeepL 翻译网页;其中 73 个使用当前 Private Translation Cloud 版本重新翻译,并针对相同源内容进行盲审评分。语言:阿拉伯语、英语、法语、德语、意大利语、西班牙语。评分:基于 MQM 的翻译质量框架,9 个维度,每个维度 1–10 分,取平均值并换算为 0–100 分的结果。