跳到内容 跳到侧边栏

WPML 的 Private Translation Cloud (PTC) 在独立翻译评审中获得了 90.0 分(满分 100 分)。而通常被认为是目前最强主流 AI 翻译引擎的 DeepL,在相同内容上的得分为 77.7 分。Private Translation Cloud 的整体表现比 DeepL 高出 12.3 分,在语言专家评分的九个质量维度中全部胜出,且每页的错误率降低了约 18 倍。

概览

指标 DeepL 徽标 DeepL Private Translation Cloud 徽标 PTC
平均翻译质量得分 (0–100) 77.7 90.0
每页翻译平均问题数 1.27 0.07
Private Translation Cloud 得分高于 DeepL 的质量维度 9 / 9
Private Translation Cloud 得分高于 DeepL 的测试语言 6 / 6(阿拉伯语、英语、法语、德语、意大利语、西班牙语)

我们为何开展这项研究

DeepL 被大多数 WordPress 和软件行业视为 AI 翻译的金标准。当客户询问是否可以在不经过人工审核的情况下发布 AI 翻译内容时,DeepL 通常是默认的基准。

WPML 开发了自己的 AI 翻译引擎——Private Translation Cloud (PTC)——因为“足够好”还远远不够。Private Translation Cloud 是 WPML“全自动翻译”模式下的默认引擎,为运行 WPML 的 150 多万个网站提供了绝大部分自动翻译支持。

我们希望针对潜在客户每周都会问到的一个问题,给出一个可衡量的答案:Private Translation Cloud 与 DeepL 的实际对比情况如何? 这项研究就是答案。上面的数字是核心结论;本文的其余部分将解释这些数字是如何产生的,以及它们对真实的生产环境网站意味着什么。

我们的衡量指标与方法

我们使用基于 MQM(多维度质量指标) 的系统对翻译质量进行评分,这也是 WPML 语言团队在进行持续的 Private Translation Cloud 客户网站评审时所使用的框架。每个翻译页面都会从九个维度进行评分:

  • 语法 —— 是否存在语法错误?
  • 含义 —— 是否保留了原文的含义?
  • 自然度 —— 对于母语使用者来说,听起来是否自然且地道?
  • 语气 —— 是否捕捉到了原文的语气?
  • 正式度 —— 无论是在称呼读者还是在语法称呼形式上,语域使用是否得当?
  • 术语 —— 术语使用是否准确?
  • 一致性 —— 页面内的术语应用是否一致?
  • 大小写 —— 是否遵循了目标语言的规范?
  • 数字、单位和日期本地化 —— 是否遵循了目标语言的规范?

每个维度由身为目标语言母语者的语言专家进行 1–10 分的评分。最终的每页得分是九个维度的平均值乘以 10,从而得出一个 1–100 分的量表,对应以下质量等级:

得分 含义
90–100 优秀至完美 —— 无需审核即可发布
80–89 良好 —— 在大多数语境下可直接发布
70–79 及格至平庸 —— 可用但错误明显
60–69 平庸 —— 发布前需要润色
50–59 非母语使用者也能发现明显错误
50 以下 缺陷严重,需要重做

补充参考:已发布的普通人工翻译平均得分约为 76 分。DeepL 的 77.7 分略高于该水平。而 Private Translation Cloud 的 90.0 分使其恰好处于“优秀 —— 无需审核即可发布”的等级边缘。

样本量与选择

为了评估 DeepL,我们从过去 12 个月内使用 DeepL 翻译的网站中随机抽取了 800 个网站,根据网站存续时间、内容量和翻译活跃度进行分类,并从各类中取样。随后,我们的语言专家手动评审了样本网站的主要页面 —— 共计 227 个网页,涵盖 阿拉伯语、英语、法语、德语、意大利语和西班牙语

为了对 DeepL 和 Private Translation Cloud 进行直接对比,我们使用 Private Translation Cloud 重新翻译了其中的 73 个页面,并由同一批语言专家根据相同的源内容进行盲审评分。Private Translation Cloud 的样本量小于 DeepL,是因为每次 Private Translation Cloud 的测量都反映了一个特定的 Private Translation Cloud 版本,而该引擎仍在不断进化 —— 请参阅下文的“我们并未止步”章节。

分语言表现:Private Translation Cloud 在所有语对中胜出

总体得分固然引人注目,但分语言的表现更能告诉多语言内容团队可以期待什么。

各语言翻译质量 (TQ) 得分

箱线图对比了 Private Translation Cloud 和 DeepL 在阿拉伯语、德语、英语、西班牙语、法语和意大利语中的 TQ 得分。Private Translation Cloud 在所有语言中均显示出更高且更稳定的中位数得分,且得分分布更集中。
各语言 TQ 得分 —— Private Translation Cloud 与 DeepL(阿拉伯语、德语、英语、西班牙语、法语、意大利语)

在我们测试的每一个语言对中,Private Translation Cloud 的得分都高于 DeepL。差距最大的是 阿拉伯语(+22.4 分),DeepL 在该语言上的表现历来不佳,而 WPML 在从右向左 (RTL) 阅读语言质量上的投入在此得到了清晰体现。紧随其后的是 德语(+11.5 分)和 法语(+9.9 分)。差距最小的是 英语(+6.0 分)—— 即便如此,Private Translation Cloud 也将页面质量从“及格、有明显瑕疵”提升到了“可发布”级别。

得分的离散度同样重要。DeepL 的得分分布在阿拉伯语中有一个长长的低分尾部,部分页面的得分远低于平均水平 —— 德语或法语用户会认为这些页面是完全不合格的。Private Translation Cloud 的分布更集中且中心更高,因此内容团队可以围绕预期的质量等级进行规划,而无需为极端低分情况预留预算。

Private Translation Cloud 在我们评分的九个质量维度中的每一个也都优于 DeepL:语法、含义、自然度、语气、正式度、术语、一致性、大小写和地域规范。提升最明显的是那些对真实网站读者最重要的维度 —— 术语(+1.5)、语法(+1.4)、自然度(+1.4)以及 数字/单位/日期本地化(+1.4)。在任何维度上,DeepL 都无法与之并驾齐驱,Private Translation Cloud 并非险胜,而是全面领先。

错误率:运营视角

平均分很有参考价值,但对于运营真实网站的人来说,错误计数更有用。我们的评审员记录了他们在每个页面上发现的每一个具体问题 —— 语法、含义、术语等等。

每页平均问题数

条形图显示每页平均问题数:DeepL 约为 1.27,Private Translation Cloud 约为 0.07,Private Translation Cloud 显著低于 DeepL。
每页平均问题数 —— DeepL 约 1.27,Private Translation Cloud 约 0.07

DeepL 平均每页产生 1.27 个问题。Private Translation Cloud 仅产生 0.07 个 —— 在相同的源内容下,每页错误率降低了约 18 倍。

对于一个拥有 200 个页面的网站,这大致相当于:

  • DeepL: 发布前需要发现、决策并修复约 254 个问题。
  • Private Translation Cloud: 整个网站仅约 14 个问题。

这就是将 AI 翻译作为初稿与作为工作流之间的区别。DeepL 是一个强力的初稿 —— 每个页面在发布前仍需检查问题。而根据这项测量,Private Translation Cloud 是一个完整的工作流:错误率极低,以至于人工审核步骤对大多数内容来说变成了可选,而非强制。

“优质翻译”的真正含义

MQM 框架的等级描述是对 AI 翻译营销话术的一个有力补充。“9/10 分”的页面不是指 90% 的内容正确,而是指母语使用者在仔细阅读时,找不到任何想要修改的地方。“7/10 分”的页面虽然可以直接使用,但有明显的瑕疵。“5/10 分”的页面则是非母语使用者也能看出错误的地方。

DeepL 的平均得分处于 7 分段的高位 —— 及格,但对于细心的母语读者来说有明显瑕疵。Private Translation Cloud 的平均得分处于 90.0,恰好位于“优秀 —— 无需审核即可发布”的门槛上。这就是我们评审员测得的质量差异。它对应着一个本质的区别:DeepL 的输出是一个需要人工审核后才能发布的起点;而 Private Translation Cloud 的输出在大多数情况下本身就是最终发布的成品。

为什么 WPML 能提供这种质量

我们意识到,“我们构建了自己的 AI 引擎”是现在很多公司都在标榜的说法。Private Translation Cloud 的独特之处在于以下两个具体原因。

规模与持续评审。 WPML 为 150 多万个网站提供服务,且已深耕十余年。WPML 的语言专家团队会持续评审 Private Translation Cloud 的翻译质量 —— 抽取输出样本,使用本研究中相同的 MQM 框架进行评分,并观察引擎在特定术语、语言对或内容类型上是否持续产生较低质量的结果。

专注。 Private Translation Cloud 不是 WPML 的副业。它拥有专门的团队 —— 工程师、MLOps 和语言专家。当语言专家标记出重复出现的模式时,工程团队会将其视为 Bug:扩展词汇表、调整正式度模型、添加例外情况、发布修复。这个循环持续运行,这就是为什么 Private Translation Cloud 的质量在过去 12 个月里从“与普通人工翻译相当”提升到了本研究中的水平。

这种结合 —— 有意义规模下的持续人工评审,配合一个将每项发现都作为工程工单处理的团队 —— 共同造就了上述质量数据。这不仅仅是模型架构的功劳,更是运营模式的胜利。

我们并未止步

90.0 分使 Private Translation Cloud 处于“优秀 —— 无需审核即可发布”的边缘。我们对这一结果感到满意,但我们并不认为这就是天花板。

上述“QA → 工程”循环仍在运行。WPML 的语言专家团队继续分析客户在真实网站上对 Private Translation Cloud 输出所做的修改,识别这些修改揭示的模式,工程团队则发布修复方案 —— 包括词汇表扩展、正式度调整和特定语言对的优化。我们预计下一次测量的结果会更高。

这对您的工作流意味着什么

传统的多语言内容工作流是 翻译 → 审核 → 发布。审核步骤之所以存在,是因为每个 AI 引擎(以及大多数人工翻译)产出的作品在发布前都需要第二双眼睛的检查。这个审核步骤也是多语言内容成本最高、延迟最严重的地方。

使用 DeepL,审核步骤是必不可少的。每页 1.27 个问题必须在某个环节被发现;如果团队不发现,客户就会发现。而使用 Private Translation Cloud,审核步骤对大多数内容来说是 可选的。一些团队仍会进行审核 —— 针对高风险页面或受监管行业 —— 但默认工作流变成了 翻译 → 发布,审核仅保留给确实需要的特殊情况。

这就是数据所描述的运营差异。这绝非微小的改进。

这对您的成本意味着什么

翻译成本由两部分组成:翻译产出成本和审核成本。在内容上线前,这两部分都必须支付。

在大多数专业语境下,人工审核的成本为每词几欧分 —— 无论评审员是按词、按页还是按网站收费,计算结果大致如此。完整的人工翻译(翻译,然后由第二个人审核)对于主要语言对通常在 每词 0.10–0.20 欧元 左右,其中仅审核部分就在 0.04–0.08 欧元 范围内。

以下是按此标准计算的各工作流实际成本。

纯人工翻译 —— 基准。 每词约 0.10–0.20 欧元。两个步骤均由人工完成。

DeepL(或任何 AI 引擎)加人工审核。 AI 处理翻译步骤;人工仍需审核每个页面,因为在每页 1.27 个问题的情况下,如果没有人预先发现,这些问题就会传达到客户手中。翻译步骤基本免费;审核步骤仍需每词 0.04–0.08 欧元。 相比纯人工翻译的总节省:约 60%。 这是标准的“AI 帮您节省翻译费用”的宣传点 —— 这确实是真的 —— 但成本天花板卡在了 DeepL 的质量仍需的审核步骤上。

Private Translation Cloud,无需审核。 Private Translation Cloud 的成本为 每词 0.0012–0.003 欧元 —— 每词 4 个积分,乘以每 1,000 积分 0.30–0.75 欧元(取决于用量),每月前 2,000 个积分免费。(完整阶梯价格请参阅 WPML 自动翻译定价。)由于 Private Translation Cloud 的实测质量(90.0 TQ 得分,每页 0.07 个问题,在相同源内容上比 DeepL 高出 12.3 分)足以在大多数情况下跳过审核步骤,因此审核成本降为零。相比纯人工翻译的总节省:约 99%。

这不仅仅是对“AI 加审核”工作流的边际改进。这是一种完全不同的成本体系。

概览 —— 发布一个翻译单词的成本

工作流 翻译 审核 总计 相比人工节省
完整人工翻译 €0.10–€0.20 已包含 €0.10–€0.20
DeepL + 人工审核 ~€0 €0.04–€0.08 €0.04–€0.08 ~60%
Private Translation Cloud,无需审核 €0.0012–€0.003 €0 €0.0012–€0.003 ~99%

人工翻译费率为主要语言对的典型行业估算。Private Translation Cloud 定价源自 WPML 已公布的费率。


关于自行审核的说明:当企业主亲自进行审核而非付费给评审员时,成本并非为零 —— 只是不那么显性。花在审核上的时间就是没花在业务其他方面的时间,按任何合理的时薪计算,隐含成本通常比外包评审员的收费更高。无论目前由谁支付审核费用,Private Translation Cloud 的节省效果都同样适用。

这开启了什么可能。 当翻译成本超过每词 0.10 欧元时,您只能有选择地翻译 —— 首页、顶级产品分类、几篇高流量博客文章。其他内容都保留源语言,因为经济上不划算。当翻译成本仅为每词 0.002 欧元,且产出质量优于典型人工翻译时,以前不可行的内容现在在经济上变得可行了:

  • 电子商务中的全目录翻译 —— 每一个长尾产品描述,每一个变体。
  • 涵盖客户可能使用的每种语言的完整文档门户,而不仅仅是前三种语言。
  • 知识库、支持常见问题解答、博客存档 —— 那些能驱动搜索但以前从未证明其翻译成本合理性的长尾内容。
  • 为在特定市场运营的出版商提供本地化编辑内容,在这些市场中,单页广告收入无法覆盖人工翻译成本。

几十年来,多语言内容一直是一个“我们能负担得起翻译什么”的问题。有了 Private Translation Cloud,问题变成了“什么值得翻译” —— 这是一个更不同、更有趣的问题。

如何在您自己的网站上获得这种质量

Private Translation Cloud 是 WPML“全自动翻译”模式下的默认引擎。这是一种全局设置,可在后台自动翻译您网站上的每个页面。无需进行逐页配置管理。

要获得本研究中测得的质量,除了开启“全自动翻译”外,您唯一需要做的就是花大约一分钟在“全自动翻译”设置中描述您网站的受众和语气 —— 例如,“一家面向开发者的软件公司,语气正式,技术术语保留英文”。Private Translation Cloud 会利用该描述使翻译符合您的品牌声调。

这就是全部设置。结果就是本研究所测得的水平。

关于我们未做事项的说明

我们没有通过公开 API 将 Private Translation Cloud 与 Google Translate、Azure Translator 或基于 LLM 的服务进行对比。原因在于:这些引擎更新频繁,单次测量结果在几个月内就会过时。我们选择 DeepL 进行对比,是因为 DeepL 是生产级 AI 翻译最常被引用的基准,也因为 DeepL 是我们大多数竞争对手底层使用的引擎。

在本研究中,我们也没有衡量速度、成本或开发者体验 —— 仅衡量了质量。这些对比存在于我们的功能页面对比页面中,它们有各自的参考价值。

立即尝试

如果您运营着一个多语言 WordPress 网站,并希望在您自己的内容上查看 Private Translation Cloud 的输出效果,请安装 WPML,启用“全自动翻译”,并将结果与您目前使用的任何工具进行对比。这里描述的质量差异,就是您应该期待看到的质量提升。


方法论问题或数据请求:请联系 WPML 团队。

研究由 WPML 语言专家团队于 2026 年 4 月开展。样本:227 个由母语语言专家评审的 DeepL 翻译网页;其中 73 个使用当前 Private Translation Cloud 版本重新翻译,并针对相同源内容进行盲审评分。语言:阿拉伯语、英语、法语、德语、意大利语、西班牙语。评分:基于 MQM 的翻译质量框架,9 个维度,每个维度 1–10 分,取平均值并换算为 0–100 分的结果。