コンテンツへスキップ サイドバーへスキップ

WPMLのPrivate Translation Cloud(PTC)は、独立した翻訳レビューにおいて100点満点中90.0点を獲得しました。主流のAI翻訳エンジンとして最強と広く見なされているDeepLは、同じコンテンツで77.7点でした。PTCは全体でDeepLを12.3ポイント上回り、言語学者がスコア化した9つの品質次元すべてで勝利し、1ページあたりのミスを約18分の1に削減しました。

概要

指標 DeepL ロゴ DeepL Private Translation Cloud ロゴ PTC
平均翻訳品質スコア(0–100) 77.7 90.0
翻訳済みページあたりの平均問題数 1.27 0.07
Private Translation CloudがDeepLを上回った品質次元 9/9
Private Translation CloudがDeepLを上回ったテスト対象言語 6/6(アラビア語、英語、フランス語、ドイツ語、イタリア語、スペイン語)

本調査を実施した理由

DeepLは、WordPressおよびソフトウェア業界の大部分において、AI翻訳のゴールドスタンダードとして扱われています。AI翻訳されたコンテンツを人間によるレビューなしで公開できるかどうかを顧客が尋ねる際、通常、DeepLが暗黙のベンチマークとなります。

WPMLが独自のAI翻訳エンジンであるPrivate Translation Cloud(PTC)を構築したのは、「そこそこ良い」レベルでは不十分だったからです。PTCはWPMLの「すべて自動翻訳」モードのデフォルトエンジンであり、WPMLを実行している150万以上のサイトにおける自動翻訳の大部分を支えています。

私たちは、見込み客から毎週のように受ける質問に対して、測定可能な回答を出したいと考えました。それは、「Private Translation Cloudは実際にDeepLと比べてどうなのか?」という問いです。この調査がその答えです。上記の数字は主要な結果であり、この記事の残りの部分では、それらがどのように算出されたか、そして実際の運用サイトにとって何を意味するのかを説明します。

測定内容と方法

私たちは、WPMLの言語チームが継続的なPrivate Translation Cloudのクライアントサイトレビューで使用しているのと同じフレームワークであるMQM(Multidimensional Quality Metrics:多次元品質指標)に基づいたシステムを使用して、翻訳品質をスコア化しました。翻訳されたすべてのページは、9つの次元でスコア化されます。

  • 文法 — 文法的な間違いはないか?
  • 意味 — 原文の意味が保持されているか?
  • 自然さ — ネイティブスピーカーにとって自然で慣用的な響きか?
  • トーン — 原文のトーンが捉えられているか?
  • 丁寧さ — 読者への呼びかけや文法的な敬語表現において、適切なレジスター(言語使用域)が使用されているか?
  • 用語 — 適切な用語が使用されているか?
  • 一貫性 — ページ全体で用語が一貫して適用されているか?
  • 大文字・小文字の使用 — ターゲット言語の慣習に従っているか?
  • 数値、単位、日付のローカライズ — ターゲット言語の慣習に従っているか?

各次元は、ターゲット言語を母国語とする人間の言語学者によって1〜10点でスコア化されます。最終的なページごとのスコアは、9つの次元の平均に10を掛けたもので、以下の品質区分に対応する1〜100のスケールとなります。

スコア 意味するもの
90–100 非常に良い〜完璧 — レビューなしで公開可能
80–89 良い — ほとんどの文脈で公開可能
70–79 許容範囲〜平凡 — 使用可能だがミスが目立つ
60–69 平凡 — 公開前に修正が必要
50–59 非ネイティブスピーカーにもミスが明らか
50未満 大幅な手直しが必要な欠陥あり

参考までに、公開されている一般的な人間による翻訳の平均は約76です。DeepLの77.7は、そのラインをわずかに上回っています。Private Translation Cloudの90.0は、「非常に良い — レビューなしで公開可能」の区分の境界に位置しています。

サンプルサイズと選択

DeepLを評価するために、過去12ヶ月間にDeepLで翻訳された800のランダムなサイトを抽出し、サイトの運用期間、コンテンツ量、翻訳アクティビティによって分類し、各バケットからサンプリングしました。その後、言語学者がサンプリングされたサイトの主要ページ(合計227のウェブページ)を手動でレビューし、アラビア語、英語、フランス語、ドイツ語、イタリア語、スペイン語で評価しました。

DeepLとPrivate Translation Cloudを直接比較するために、同じページのうち73ページをPrivate Translation Cloudで再翻訳し、同じソースコンテンツから作業する同じ言語学者によってブラインド方式で再スコア化しました。Private Translation CloudのサンプルがDeepLのサンプルより小さいのは、Private Translation Cloudの各測定値が特定のバージョンを反映しており、エンジンが進化し続けているためです(下記の「まだ終わりではありません」セクションを参照)。

言語別:Private Translation Cloudがすべてのペアで勝利

集計スコアも興味深いものですが、多言語コンテンツチームが何を期待できるかを示すのは言語別の状況です。

言語別TQスコア

アラビア語、ドイツ語、英語、スペイン語、フランス語、イタリア語におけるPrivate Translation CloudとDeepLのTQスコアを比較した箱ひげ図。Private Translation Cloudは、すべての言語において一貫して高い中央値と、よりタイトなスコア分布を示しています。
言語別TQスコア — Private Translation Cloud vs DeepL(アラビア語、ドイツ語、英語、スペイン語、フランス語、イタリア語)

Private Translation Cloudは、テストしたすべての言語ペアでDeepLよりも高いスコアを獲得しました。最大の差はアラビア語(+22.4ポイント)で、DeepLが歴史的にパフォーマンス不足であり、WPMLのRTL(右から左に書く)言語の品質への投資が明確に示されています。次いでドイツ語(+11.5)、フランス語(+9.9)となっています。最も差が小さかったのは英語(+6.0ポイント)でしたが、そこでもPrivate Translation Cloudはページを「許容範囲だが不完全さが目立つ」から「公開可能な」区分へと引き上げました。

分散も重要です。DeepLの分布はアラビア語において下方に長い裾を引いており、個別のページでは平均を大幅に下回るスコアを記録しています。これらはドイツ語やフランス語のユーザーであれば「壊れている」と見なすレベルのページです。Private Translation Cloudの分布はよりタイトで、より高い位置に集中しているため、コンテンツチームは外れ値に備えるのではなく、期待される品質区分に基づいて計画を立てることができます。

Private Translation Cloudは、私たちがスコア化した9つの品質次元すべて(文法、意味、自然さ、トーン、丁寧さ、用語、一貫性、大文字の使用、ロケール慣習)においてもDeepLを上回っています。最大の向上は、実際のウェブサイトで人間がページを読む際に最も重要となる次元で見られました。すなわち、用語(+1.5)、文法(+1.4)、自然さ(+1.4)、および数値/単位/日付のローカライズ(+1.4)です。DeepLが追いついている次元はなく、Private Translation Cloudが辛うじて上回っているという次元もありません。

ミス率:運用の実態

平均スコアは有用ですが、実際のサイトを運営する人にとってはミスの数の方がより有用です。レビュー担当者は、文法、意味、用語など、各ページで特定したすべての個別の問題を記録しました。

1ページあたりの平均問題数

1ページあたりの平均問題数を示す棒グラフ:DeepLは約1.27、Private Translation Cloudは約0.07で、Private Translation CloudはDeepLよりも大幅に低くなっています。
1ページあたりの平均問題数 — DeepL 約1.27、Private Translation Cloud 約0.07

DeepLは1ページあたり平均1.27件の問題を発生させます。Private Translation Cloudは0.07件であり、同じソースコンテンツにおいて1ページあたりのミスが約18分の1に削減されています。

200ページのサイトの場合、これはおおよそ以下のように換算されます。

  • DeepL: 公開前に見つけ出し、判断し、修正すべき問題が約254件。
  • Private Translation Cloud: サイト全体で約14件の問題。

これが、「下書き」としてのAI翻訳と、「ワークフロー」としてのAI翻訳の違いです。DeepLは強力な下書きですが、公開前に問題をキャッチするためにすべてのページでレビューが必要です。今回の測定において、Private Translation Cloudはワークフローそのものです。ミスの数が十分に少ないため、人間によるレビュー工程は、すべてにおいて必須ではなく、ほとんどのコンテンツにおいてオプション(任意)となります。

「良い翻訳」の本当の意味

MQMフレームワークの評価説明は、AI翻訳を取り巻くマーケティング用語に対する有用な対抗軸となります。「9/10」のページは90%の出来のページではなく、ネイティブスピーカーが注意深く読んでも、変更したい箇所が見当たらないページです。「7/10」のページは、そのままの状態でも許容できますが、不完全さが目に見えるページです。「5/10」のページは、非ネイティブスピーカーでもミスを見つけられるページです。

DeepLの平均は7点台後半に位置しており、許容範囲ではありますが、注意深いネイティブの読者には不完全さが目に見えます。Private Translation Cloudの平均は90.0であり、「非常に良い — レビューなしで公開可能」の境界に位置しています。これが、私たちのレビュー担当者が測定した品質の差です。これは実質的な違いに結びつきます。DeepLの出力は公開前に人間によるレビューを必要とする出発点ですが、Private Translation Cloudの出力は、ほとんどの場合、それ自体が公開可能な成果物です。

なぜWPMLはこの品質を実現できるのか

「独自のAIエンジンを構築した」という主張は、現在多くの企業が行っていることは承知しています。Private Translation Cloudが特異である理由は、主に2つあります。

規模と継続的なレビュー。 WPMLは10年以上にわたり、150万以上のサイトにサービスを提供してきました。WPMLの言語チームは、Private Translation Cloudの翻訳品質を継続的にレビューしています。出力をサンプリングし、本調査で使用したのと同じMQMフレームワークでスコア化し、特定の用語、言語ペア、またはコンテンツタイプでエンジンが一貫して低品質な結果を出すパターンがないか監視しています。

フォーカス(集中)。 Private Translation CloudはWPMLにとってサイドプロジェクトではありません。エンジニア、MLOps、人間の言語学者からなる専任チームがあります。言語学者が繰り返されるパターンを指摘すると、エンジニアリングチームはそれをバグとして扱い、用語集の拡張、丁寧さモデルの調整、例外の追加を行い、修正をリリースします。このループが継続的に実行されているため、Private Translation Cloudの品質は過去12ヶ月間で「平均的な人間による翻訳と同等」から、本調査の数値まで向上したのです。

有意義な規模での継続的な人間によるレビューと、各発見事項をエンジニアリングチケットとして対応するチームの組み合わせが、上記の品質数値を生み出しています。それはモデルのアーキテクチャではなく、オペレーティングモデル(運用モデル)によるものです。

まだ終わりではありません

90.0という数値により、Private Translation Cloudは「非常に良い — レビューなしで公開可能」の境界に達しました。私たちはこの結果に満足していますが、これが限界だとは考えていません。

上述のQAからエンジニアリングへのループは現在も稼働しています。WPMLの言語チームは、実際のサイトで顧客がPrivate Translation Cloudの出力に加えた編集内容の分析を続けており、それらの編集が明らかにするパターンを特定しています。そしてエンジニアリングチームは、用語集の拡張、丁寧さの調整、言語ペア固有の微調整などの修正をリリースしています。次回の測定値は、今回よりも高くなることを期待しています。

ワークフローにとっての意味

従来の多言語コンテンツワークフローは、翻訳 → レビュー → 公開です。レビュー工程が存在するのは、すべてのAIエンジン(およびほとんどの人間の翻訳者)が、公開前に第三者の目による確認を必要とする成果物を生成するためです。このレビュー工程こそが、多言語コンテンツにおけるコストと遅延の大部分を占めています。

DeepLを使用する場合、レビュー工程は必須です。1ページあたり1.27件の問題はどこかでキャッチされなければなりません。チームがそれらをキャッチしなければ、顧客がキャッチすることになります。Private Translation Cloudを使用する場合、ほとんどのコンテンツにおいてレビュー工程はオプションとなります。リスクの高いページや規制の厳しい業界では依然としてレビューを行うチームもありますが、デフォルトのワークフローは翻訳 → 公開となり、レビューは実際にそれを必要とするケースのみに限定されます。

これが、数値が示す運用上の違いです。これは決して小さな違いではありません。

コストにとっての意味

翻訳コストは、翻訳を作成するコストと、それをレビューするコストの2つから成ります。コンテンツが公開される前に、両方を支払う必要があります。

ほとんどのプロフェッショナルな文脈において、人間によるレビューには1単語あたり数セントのコストがかかります。レビュー担当者が単語単位、ページ単位、あるいはサイト単位で請求するかにかかわらず、計算上はおおよそそのようになります。完全な人間による翻訳(翻訳後、別の人によるレビュー)は、主要な言語ペアで通常1単語あたり0.10〜0.20ユーロ程度であり、レビュー部分だけでも0.04〜0.08ユーロの範囲になります。

これらの条件において、各ワークフローの実際のコストは以下の通りです。

人間による翻訳のみ — ベースライン。 1単語あたり約0.10〜0.20ユーロ。両方の工程が人間によるものです。

DeepL(またはその他のAIエンジン)+人間によるレビュー。 AIが翻訳工程を担当しますが、1ページあたり1.27件の問題があるため、誰もキャッチしなければ問題が顧客に届いてしまいます。そのため、人間が依然としてすべてのページをレビューする必要があります。翻訳工程は実質的に無料ですが、レビュー工程には依然として1単語あたり0.04〜0.08ユーロのコストがかかります。 人間のみの場合と比較した総節約額:約60%。 これが標準的な「AIは翻訳コストを節約する」という宣伝文句であり、それは事実です。しかし、コストの天井は、DeepLの品質が依然として必要とするレビュー工程にあります。

Private Translation Cloud、レビュー不要。 Private Translation Cloudのコストは1単語あたり0.0012〜0.003ユーロです(1単語あたり4クレジット × 1,000クレジットあたり0.30〜0.75ユーロ、ボリュームにより異なる。毎月最初の2,000クレジットは無料。詳細はWPMLの自動翻訳料金のティア表を参照)。Private Translation Cloudの測定された品質(TQスコア90.0、1ページあたりの問題数0.07、同じソースコンテンツでDeepLを12.3ポイント上回る)は、ほとんどのケースでレビュー工程をスキップできるほど高いため、レビューコストはゼロになります。人間のみの場合と比較した総節約額:約99%。

これは、AI+レビューのワークフローに対するわずかな改善ではありません。全く異なるコスト体系です。

概要 — 翻訳された1単語を世に出すためのコスト

ワークフロー 翻訳 レビュー 合計 人間との比較による節約
完全な人間による翻訳 €0.10–€0.20 込み €0.10–€0.20
DeepL + 人間によるレビュー ~€0 €0.04–€0.08 €0.04–€0.08 ~60%
Private Translation Cloud、レビューなし €0.0012–€0.003 €0 €0.0012–€0.003 ~99%

人間による翻訳料金は、主要な言語ペアにおける一般的な業界推定値です。Private Translation Cloudの価格は、WPMLの公開料金に基づいています。


自分でレビューを行う場合についての注意:ビジネスオーナーがレビュー担当者に支払う代わりに自分でレビューを行う場合、コストはゼロではありません。単に見えにくくなっているだけです。レビューに費やされた時間は、ビジネスの他の部分に費やされなかった時間であり、妥当な時給で換算すれば、その暗黙のコストは通常、外部のレビュー担当者に依頼するよりも安くなることはなく、むしろ高くなります。Private Translation Cloudによる節約は、現在誰がレビュー工程のコストを負担しているかにかかわらず適用されます。

これにより広がる可能性 翻訳に1単語あたり0.10ユーロ以上のコストがかかる場合、ホームページ、主要な製品カテゴリー、少数の高トラフィックなブログ記事など、翻訳を限定的に行います。それ以外は、採算が合わないためソース言語のまま残されます。翻訳コストが1単語あたり0.002ユーロになり、一般的な人間による翻訳よりも優れた出力が得られるようになると、以前は実現不可能だったコンテンツでも採算が合うようになります。

  • eコマースにおける全カタログの翻訳 — すべてのロングテール製品の説明、すべてのバリエーション。
  • 上位3言語だけでなく、顧客が話す可能性のあるあらゆる言語での完全なドキュメントポータル。
  • ナレッジベース、サポートFAQ、ブログアーカイブ — 検索を促進するものの、翻訳コストを正当化できなかったロングテールコンテンツ。
  • 1ページあたりの収益では人間による翻訳コストをカバーできなかった市場で活動するパブリッシャー向けの、ローカライズされた編集コンテンツ。

多言語コンテンツは何十年もの間、「翻訳する余裕があるのはどれか」という問いでした。Private Translation Cloudにより、その問いは「翻訳する価値があるのはどれか」へと変わります。これは、より異なり、より興味深い問いです。

ご自身のサイトでこの品質を実現する方法

Private Translation Cloudは、WPMLの「すべて自動翻訳」モードのデフォルトエンジンです。これは、サイト上のすべてのページをバックグラウンドで自動的に翻訳する単一のグローバル設定です。ページごとの設定を管理する必要はありません。

本調査で測定された品質を得るために必要なセットアップは、「すべて自動翻訳」をオンにすること以外には、設定でサイトの対象読者とトーンを説明するために1分ほど費やすことだけです。例えば、「開発者を対象としたソフトウェア会社、フォーマルなトーン、技術用語は英語のまま保持」といった具合です。Private Translation Cloudはその説明を使用して、翻訳をブランドボイスに合わせます。

セットアップはこれですべてです。その結果が、本調査で測定されたものです。

実施しなかったことについての注意

今回の調査では、公開APIを介したGoogle翻訳、Azure Translator、またはLLMベースのサービスとPrivate Translation Cloudを比較しませんでした。その理由は、これらのエンジンは頻繁に変更され、一点での測定値は数ヶ月以内に時代遅れになってしまうためです。DeepLとの比較を行ったのは、DeepLが本番レベルのAI翻訳において最も引用されるベンチマークであり、また多くの競合他社がその裏側で使用しているのがDeepLだからです。

また、本調査ではスピード、コスト、開発者体験については測定せず、品質のみを測定しました。それらの比較は、当社の機能ページ比較ページに掲載されており、それぞれ独自のストーリーを物語っています。

お試しください

多言語WordPressサイトを運営しており、ご自身のコンテンツでPrivate Translation Cloudの出力を確認したい場合は、WPMLをインストールし、「すべて自動翻訳」を有効にして、現在お使いのものと結果を比較してみてください。ここで説明した品質の差は、お客様が実際に目にすることを期待できる品質の差です。


方法論に関する質問やデータのリクエストについては、WPMLチームにお問い合わせください。

本調査は、2026年4月にWPML言語チームによって実施されました。サンプル:ネイティブスピーカーの言語学者によってレビューされたDeepL翻訳済みのウェブページ227件。そのうち73件を最新バージョンのPrivate Translation Cloudで再翻訳し、同じソースコンテンツに対してブラインド方式で再評価。言語:アラビア語、英語、フランス語、ドイツ語、イタリア語、スペイン語。スコアリング:MQMベースの翻訳品質フレームワーク、9つの次元、各次元1〜10点、平均値を0〜100のスケールに換算。