Zum Inhalt springen Zur Seitenleiste springen

Die Private Translation Cloud (PTC) von WPML erreicht in einer unabhängigen Übersetzungsprüfung 90,0 von 100 Punkten. DeepL – weithin als die stärkste Mainstream-KI-Übersetzungs-Engine angesehen – erreicht bei denselben Inhalten 77,7 Punkte. PTC übertrifft DeepL insgesamt um 12,3 Punkte, gewinnt in jeder der neun von unseren Linguisten bewerteten Qualitätsdimensionen und erzielt eine etwa 18-fache Reduzierung der Fehler pro Seite.

Auf einen Blick

Metrik DeepL-Logo DeepL PTC-Logo PTC
Durchschn. Wert der Übersetzungsqualität (0–100) 77,7 90,0
Durchschn. Fehleranzahl pro übersetzter Seite 1,27 0,07
Qualitätsdimensionen, in denen PTC besser abschnitt als DeepL 9 von 9
Getestete Sprachen, in denen PTC besser abschnitt als DeepL 6 von 6 (Arabisch, Englisch, Französisch, Deutsch, Italienisch, Spanisch)

Warum wir diese Studie durchgeführt haben

DeepL wird von den meisten Unternehmen der WordPress- und Softwarebranche als Goldstandard für KI-Übersetzungen betrachtet. Wenn Kunden fragen, ob sie KI-übersetzte Inhalte ohne menschliche Überprüfung veröffentlichen können, ist DeepL meist der implizite Maßstab.

WPML hat seine eigene KI-Übersetzungs-Engine entwickelt – die Private Translation Cloud (PTC) –, weil „gut genug“ nicht ausreichte. PTC ist die Standard-Engine im Modus „Alles übersetzen“ von WPML und liefert den Großteil der automatischen Übersetzungen für die über 1,5 Millionen Websites, auf denen WPML läuft.

Wir wollten eine messbare Antwort auf eine Frage, die uns Interessenten jede Woche stellen: Wie schneidet PTC im Vergleich zu DeepL tatsächlich ab? Diese Studie ist die Antwort darauf. Die obigen Zahlen sind die Kernbotschaft; der Rest dieses Artikels erklärt, wie sie zustande kamen und was sie für eine echte Live-Website bedeuten.

Was wir gemessen haben und wie

Wir haben die Übersetzungsqualität anhand eines Systems bewertet, das auf MQM (Multidimensional Quality Metrics) basiert – demselben Framework, das das Linguistik-Team von WPML für die laufenden PTC-Überprüfungen von Kunden-Websites verwendet. Jede übersetzte Seite wird in neun Dimensionen bewertet:

  • Grammatik – gab es grammatikalische Fehler?
  • Bedeutung – wurde die Bedeutung des Ausgangstextes beibehalten?
  • Natürlichkeit – klingt es für einen Muttersprachler natürlich und idiomatisch?
  • Tonfall – wurde der Tonfall des Ausgangstextes getroffen?
  • Formalität – wurde das richtige Register verwendet, sowohl bei der Leseransprache als auch bei den grammatikalischen Anredeformen?
  • Terminologie – wurde die richtige Fachsprache verwendet?
  • Konsistenz – wurde die Terminologie auf der gesamten Seite einheitlich angewendet?
  • Groß- und Kleinschreibung – wurden die Konventionen der Zielsprache eingehalten?
  • Lokalisierung von Zahlen, Einheiten und Daten – wurden die Konventionen der Zielsprache eingehalten?

Jede Dimension wird von einem menschlichen Linguisten, der Muttersprachler der Zielsprache ist, mit 1–10 Punkten bewertet. Die endgültige Punktzahl pro Seite ist der Durchschnitt aus den neun Dimensionen, multipliziert mit zehn – was eine Skala von 1–100 ergibt, die sich in verständliche Qualitätsstufen unterteilen lässt:

Punktzahl Bedeutung
90–100 Sehr gut bis perfekt – bereit zur Veröffentlichung ohne Überprüfung
80–89 Gut – in den meisten Kontexten bereit zur Veröffentlichung
70–79 Akzeptabel bis mittelmäßig – brauchbar, aber Fehler sind sichtbar
60–69 Mittelmäßig – benötigt Nachbesserungen vor der Veröffentlichung
50–59 Fehler sind für Nicht-Muttersprachler offensichtlich
Unter 50 Mängel sind so erheblich, dass eine Überarbeitung erforderlich ist

Zum Kontext: Der veröffentlichte Durchschnitt für allgemeine menschliche Übersetzungen liegt bei etwa 76. DeepLs 77,7 liegt knapp darüber. Die 90,0 von PTC positionieren es genau an der Grenze zur Stufe „sehr gut – bereit zur Veröffentlichung ohne Überprüfung“.

Stichprobengröße und Auswahl

Um DeepL zu bewerten, haben wir 800 zufällige Websites herangezogen, die in den letzten 12 Monaten mit DeepL übersetzt wurden. Wir haben diese nach Website-Alter, Inhaltsvolumen und Übersetzungsaktivität gruppiert und Stichproben aus den Gruppen gezogen. Unsere Linguisten haben dann die Hauptseiten der ausgewählten Websites manuell überprüft – insgesamt 227 Webseiten, bewertet in Arabisch, Englisch, Französisch, Deutsch, Italienisch und Spanisch.

Um DeepL und PTC direkt zu vergleichen, haben wir 73 dieser Seiten mit PTC neu übersetzt und sie blind neu bewertet, wobei dieselben Linguisten mit demselben Ausgangsmaterial arbeiteten. Die PTC-Stichprobe ist kleiner als die DeepL-Stichprobe, da jede PTC-Messung eine spezifische PTC-Version widerspiegelt und die Engine sich ständig weiterentwickelt – siehe den Abschnitt Wir sind noch nicht fertig weiter unten.

Pro Sprache: PTC gewinnt in jedem Vergleich

Die Gesamtergebnisse sind interessant; das Bild pro Sprache ist jedoch das, was einem Team für mehrsprachige Inhalte sagt, was es zu erwarten hat.

TQ-Werte nach Sprache

Boxplot zum Vergleich der TQ-Werte für PTC und DeepL in den Sprachen Arabisch, Deutsch, Englisch, Spanisch, Französisch und Italienisch. PTC zeigt durchweg höhere Medianwerte und engere Punkteverteilungen über alle Sprachen hinweg.
TQ-Werte nach Sprache – PTC vs. DeepL in Arabisch, Deutsch, Englisch, Spanisch, Französisch, Italienisch

PTC schneidet in jedem von uns getesteten Sprachpaar besser ab als DeepL. Der größte Unterschied liegt im Arabischen (+22,4 Punkte), wo DeepL historisch gesehen schwächere Leistungen erbracht hat und wo sich die Investition von WPML in die Qualität von RTL-Sprachen deutlich zeigt. Deutsch (+11,5) und Französisch (+9,9) folgen darauf. Der geringste Unterschied liegt im Englischen (+6,0 Punkte) – und selbst dort hebt PTC die Seite von „akzeptabel, sichtbar unvollkommen“ in den Bereich der veröffentlichungsreifen Inhalte.

Auch die Varianz spielt eine Rolle. Die DeepL-Verteilung hat im Arabischen einen langen unteren Ausläufer mit einzelnen Seiten, die weit unter dem Durchschnitt liegen – Seiten, die ein deutscher oder französischer Nutzer als unbrauchbar betrachten würde. Die Verteilungen von PTC sind enger und höher konzentriert, sodass ein Content-Team mit einer erwarteten Qualitätsstufe planen kann, anstatt Puffer für Ausreißer einzuplanen.

PTC übertrifft DeepL zudem in jeder der neun Qualitätsdimensionen, die wir bewerten: Grammatik, Bedeutung, Natürlichkeit, Tonfall, Formalität, Terminologie, Konsistenz, Groß- und Kleinschreibung sowie lokale Konventionen. Die größten Zuwächse gibt es in den Dimensionen, die für einen Menschen, der eine Seite auf einer echten Website liest, am wichtigsten sind – Terminologie (+1,5), Grammatik (+1,4), Natürlichkeit (+1,4) und Lokalisierung von Zahlen/Einheiten/Daten (+1,4). Es gibt keine Dimension, in der DeepL mithalten kann, und keine Dimension, in der PTC nur knapp vorne liegt.

Fehlerrate: Das operative Bild

Durchschnittswerte sind nützlich; Fehlerzahlen sind für jeden, der eine echte Website betreibt, noch nützlicher. Unsere Prüfer haben jedes einzelne Problem protokolliert, das sie auf jeder Seite identifiziert haben – Grammatik, Bedeutung, Terminologie, alles.

Durchschnittliche Fehler pro Seite

Balkendiagramm mit der durchschnittlichen Anzahl der Fehler pro Seite: DeepL ~1,27, PTC ~0,07, wobei PTC deutlich niedriger liegt als DeepL.
Durchschnittliche Fehler pro Seite – DeepL ~1,27, PTC ~0,07

DeepL produziert durchschnittlich 1,27 Fehler pro Seite. PTC produziert 0,07 – was einer etwa 18-fachen Reduzierung der Fehler pro Seite bei demselben Ausgangsmaterial entspricht.

Für eine Website mit 200 Seiten bedeutet das in etwa:

  • DeepL: ~254 Fehler, die vor der Veröffentlichung gefunden, bewertet und behoben werden müssen.
  • PTC: ~14 Fehler auf der gesamten Website.

Das ist der Unterschied zwischen KI-Übersetzung als erstem Entwurf und KI-Übersetzung als Workflow. DeepL ist ein starker erster Entwurf – jede Seite weist noch Mängel auf, die vor dem Livegang behoben werden müssen. PTC ist nach dieser Messung ein Workflow: Die Fehlerzahl ist so niedrig, dass der Schritt der menschlichen Überprüfung für die meisten Inhalte optional wird, anstatt für alle obligatorisch zu sein.

Was „gute Übersetzung“ eigentlich bedeutet

Die Beschreibungen der Bewertungsstufen des MQM-Frameworks sind ein nützliches Gegengewicht zur Marketing-Sprache, die KI-Übersetzungen oft umgibt. Eine „9/10“-Seite ist keine 90-%-Seite; es ist eine Seite, auf der ein Muttersprachler bei sorgfältigem Lesen nichts findet, was er ändern möchte. Eine „7/10“-Seite ist im Ist-Zustand akzeptabel, aber sichtbar unvollkommen. Eine „5/10“-Seite ist eine Seite, auf der ein Nicht-Muttersprachler Fehler erkennen kann.

Der Durchschnitt von DeepL liegt im oberen 7er-Bereich – akzeptabel, aber für einen aufmerksamen muttersprachlichen Leser sichtbar unvollkommen. Der Durchschnitt von PTC liegt bei 90,0, genau an der Grenze zu „sehr gut – bereit zur Veröffentlichung ohne Überprüfung“. Das ist der Qualitätsunterschied, den unsere Prüfer gemessen haben. Er lässt sich auf eine reale Unterscheidung übertragen: DeepL-Ergebnisse sind ein Ausgangspunkt, der vor der Veröffentlichung eine menschliche Überprüfung erfordert; PTC-Ergebnisse sind in den meisten Fällen bereits die fertige Veröffentlichung.

Warum WPML diese Qualität liefern kann

Wir sind uns bewusst, dass „wir haben unsere eigene KI-Engine gebaut“ eine Behauptung ist, die derzeit viele Unternehmen aufstellen. PTC ist aus zwei spezifischen Gründen ungewöhnlich.

Skalierung und kontinuierliche Überprüfung. WPML bedient über 1,5 Millionen Websites und tut dies seit über einem Jahrzehnt. Das Linguistik-Team von WPML überprüft kontinuierlich die Übersetzungsqualität von PTC – zieht Stichproben, bewertet sie mit demselben MQM-Framework, das in dieser Studie verwendet wurde, und achtet auf Muster, bei denen die Engine für einen bestimmten Begriff, ein Sprachpaar oder einen Inhaltstyp durchweg minderwertige Ergebnisse liefert.

Fokus. PTC ist bei WPML kein Nebenprojekt. Es gibt ein engagiertes Team aus Ingenieuren, MLOps und menschlichen Linguisten. Wenn die Linguisten ein wiederkehrendes Muster feststellen, behandelt das Engineering-Team dies als Bug: Das Glossar wird erweitert, das Formalitätsmodell angepasst, eine Ausnahme hinzugefügt und der Fix eingespielt. Diese Schleife läuft kontinuierlich, weshalb sich die Qualität von PTC in den letzten 12 Monaten von „so gut wie eine durchschnittliche menschliche Übersetzung“ zu den Zahlen in dieser Studie verbessert hat.

Die Kombination aus kontinuierlicher menschlicher Überprüfung in nennenswertem Umfang gepaart mit einem Team, das auf jede Erkenntnis wie auf ein technisches Ticket reagiert, führt zu den oben genannten Qualitätszahlen. Es ist nicht die Modellarchitektur; es ist das Betriebsmodell.

Wir sind noch nicht fertig

90,0 positioniert PTC genau an der Grenze zu „sehr gut – veröffentlichungsreif ohne Überprüfung“. Wir sind mit diesem Ergebnis zufrieden. Wir glauben nicht, dass dies bereits das Maximum ist.

Die oben beschriebene QA-Engineering-Schleife läuft weiter. Das Linguistik-Team von WPML analysiert weiterhin die Bearbeitungen, die Kunden an den PTC-Ergebnissen auf echten Websites vornehmen, identifiziert die Muster, die diese Bearbeitungen offenbaren, und das Engineering-Team spielt die Korrekturen ein – Glossarerweiterungen, Formalitätsanpassungen, sprachpaarspezifische Optimierungen. Wir erwarten, dass die nächste Messung noch höher ausfallen wird.

Was das für Ihren Workflow bedeutet

Der herkömmliche Workflow für mehrsprachige Inhalte lautet übersetzen → prüfen → veröffentlichen. Der Prüfungsschritt ist notwendig, da jede KI-Engine – und die meisten menschlichen Übersetzer – Arbeiten abliefern, die ein zweites Paar Augen benötigen, bevor sie live gehen. Dieser Prüfungsschritt ist auch der Punkt, an dem der Großteil der Kosten und der Verzögerungen bei mehrsprachigen Inhalten entsteht.

Bei DeepL ist ein Prüfungsschritt unerlässlich. Die 1,27 Fehler pro Seite müssen irgendwo abgefangen werden; wenn das Team sie nicht findet, werden es die Kunden tun. Bei PTC ist der Prüfungsschritt für die meisten Inhalte optional. Einige Teams prüfen immer noch – bei besonders wichtigen Seiten oder in regulierten Branchen –, aber der Standard-Workflow wird zu übersetzen → veröffentlichen, wobei die Prüfung den Fällen vorbehalten bleibt, die sie tatsächlich benötigen.

Das ist der operative Unterschied, den die Zahlen beschreiben. Er ist nicht unbedeutend.

Was das für Ihre Kosten bedeutet

Übersetzungskosten setzen sich aus zwei Faktoren zusammen: den Kosten für die Erstellung der Übersetzung und den Kosten für deren Überprüfung. Beides muss bezahlt werden, bevor der Inhalt live geht.

In den meisten professionellen Kontexten kostet die menschliche Überprüfung einige Cent pro Wort – egal, ob die Prüfer pro Wort, pro Seite oder pro Website abrechnen, das ist in etwa der Wert, bei dem die Rechnung landet. Eine vollständige menschliche Übersetzung (Übersetzung, dann Überprüfung durch einen zweiten Menschen) liegt bei den gängigen Sprachpaaren normalerweise bei etwa 0,10 €–0,20 € pro Wort, wobei allein der Überprüfungsteil im Bereich von 0,04 €–0,08 € liegt.

Hier ist aufgeführt, was jeder Workflow in diesen Dimensionen tatsächlich kostet.

Nur menschliche Übersetzung – die Basislinie. Etwa 0,10 €–0,20 € pro Wort. Beide Schritte werden von Menschen durchgeführt.

DeepL (oder eine andere KI-Engine) plus menschliche Überprüfung. Die KI übernimmt den Übersetzungsschritt; ein Mensch muss dennoch jede Seite prüfen, da bei 1,27 Fehlern pro Seite die Mängel die Kunden erreichen, wenn sie niemand vorher abfängt. Der Übersetzungsschritt ist praktisch kostenlos; der Prüfungsschritt kostet weiterhin 0,04 €–0,08 € pro Wort. Gesamtersparnis gegenüber rein menschlicher Übersetzung: etwa 60 %. Dies ist das Standardversprechen „KI spart Ihnen Geld bei der Übersetzung“ – und es stimmt auch –, aber die Kostengrenze liegt bei dem Prüfungsschritt, den die Qualität von DeepL weiterhin erfordert.

PTC, keine Überprüfung erforderlich. PTC kostet 0,0012 €–0,003 € pro Wort – 4 Credits pro Wort multipliziert mit 0,30 €–0,75 € pro 1.000 Credits je nach Volumen, wobei die ersten 2.000 Credits pro Monat kostenlos sind. (Siehe WPMLs Preise für automatische Übersetzung für die vollständige Staffeltabelle.) Da die gemessene Qualität von PTC (90,0 TQ-Wert, 0,07 Fehler pro Seite, +12,3 Punkte Vorsprung gegenüber DeepL bei gleichem Ausgangsmaterial) hoch genug ist, um den Prüfungsschritt in den meisten Fällen zu überspringen, sinken die Prüfungskosten auf Null. Gesamtersparnis gegenüber rein menschlicher Übersetzung: etwa 99 %.

Das ist keine geringfügige Verbesserung des KI-plus-Prüfung-Workflows. Es ist ein völlig anderes Kostengefüge.

Auf einen Blick – Kosten für die Bereitstellung eines übersetzten Wortes

Workflow Übersetzung Prüfung Gesamt Ersparnis vs. Mensch
Vollständige menschliche Übersetzung 0,10 €–0,20 € inklusive 0,10 €–0,20 €
DeepL + menschliche Überprüfung ~0 € 0,04 €–0,08 € 0,04 €–0,08 € ~60 %
PTC, keine Prüfung 0,0012 €–0,003 € 0 € 0,0012 €–0,003 € ~99 %

Die Raten für menschliche Übersetzungen sind typische Branchenschätzungen für gängige Sprachpaare. Die PTC-Preise stammen aus den veröffentlichten Tarifen von WPML.


Ein Hinweis zur Eigenprüfung: Wenn ein Geschäftsinhaber die Prüfung selbst vornimmt, anstatt einen Prüfer zu bezahlen, sind die Kosten nicht Null – sie sind nur weniger sichtbar. Die für die Prüfung aufgewendeten Stunden sind Stunden, die nicht in den Rest des Unternehmens investiert werden, und bei jedem angemessenen Stundensatz sind die impliziten Kosten in der Regel höher als das, was ein externer Prüfer berechnen würde, nicht niedriger. Die Ersparnis durch PTC gilt unabhängig davon, wer heute für den Prüfungsschritt bezahlt.

Welche Möglichkeiten sich dadurch eröffnen. Wenn eine Übersetzung mehr als 0,10 € pro Wort kostet, übersetzt man selektiv – die Homepage, die wichtigsten Produktkategorien, eine Handvoll Blogbeiträge mit viel Traffic. Alles andere bleibt in der Ausgangssprache, weil die Rechnung nicht aufgeht. Wenn die Übersetzung 0,002 € pro Wort kostet und Ergebnisse liefert, die besser sind als eine typische menschliche Übersetzung, geht die Rechnung auch für Inhalte auf, die vorher nicht rentabel waren:

  • Vollständige Katalogübersetzung im E-Commerce – jede Long-Tail-Produktbeschreibung, jede Variante.
  • Vollständige Dokumentationsportale in jeder Sprache, die ein Kunde sprechen könnte, nicht nur in den drei wichtigsten.
  • Wissensdatenbanken, Support-FAQs, Blog-Archive – der Long-Tail, der die Suche vorantreibt, aber dessen Übersetzungskosten sich nie rechtfertigten.
  • Lokalisierte redaktionelle Inhalte für Publisher, die in Märkten tätig sind, in denen die Einnahmen pro Seite und Publikum die menschliche Übersetzung nicht decken konnten.

Mehrsprachige Inhalte waren jahrzehntelang eine Frage von „Was können wir uns leisten zu übersetzen?“. Mit PTC wird die Frage zu „Was ist es wert, übersetzt zu werden?“ – was eine ganz andere und viel interessantere Fragestellung ist.

So erhalten Sie diese Qualität auf Ihrer eigenen Website

PTC ist die Standard-Engine im Modus Alles übersetzen von WPML. Dies ist eine einzige globale Einstellung, die jede Seite Ihrer Website automatisch im Hintergrund übersetzt. Es gibt keine Konfiguration pro Seite, die verwaltet werden muss.

Um die in dieser Studie gemessene Qualität zu erhalten, müssen Sie lediglich „Alles übersetzen“ aktivieren und etwa eine Minute darauf verwenden, die Zielgruppe und den Tonfall Ihrer Website in den Einstellungen von „Alles übersetzen“ zu beschreiben – zum Beispiel: „Ein Softwareunternehmen, das sich an Entwickler richtet, formeller Tonfall, technische Terminologie in Englisch beibehalten“. PTC nutzt diese Beschreibung, um die Übersetzungen an Ihre Markenstimme anzupassen.

Das ist die gesamte Einrichtung. Das Ergebnis ist das, was in dieser Studie gemessen wurde.

Ein Hinweis zu dem, was wir nicht getan haben

Wir haben PTC nicht mit Google Translate, Azure Translator oder LLM-basierten Diensten über deren öffentliche APIs verglichen. Der Grund: Diese Engines ändern sich häufig, und eine punktuelle Messung wäre innerhalb weniger Monate veraltet. Der Vergleich mit DeepL wurde durchgeführt, weil DeepL der am häufigsten genannte Maßstab für KI-Übersetzungen in Produktionsqualität ist und weil DeepL das ist, was die meisten unserer Wettbewerber im Hintergrund verwenden.

Wir haben in dieser Studie auch nicht die Geschwindigkeit, die Kosten oder die Entwicklererfahrung gemessen – nur die Qualität. Diese Vergleiche finden Sie auf unserer Funktionsseite und unseren Vergleichsseiten, und sie erzählen ihre eigene Geschichte.

Probieren Sie es aus

Wenn Sie eine mehrsprachige WordPress-Website betreiben und die Ergebnisse von PTC für Ihre eigenen Inhalte sehen möchten, installieren Sie WPML, aktivieren Sie „Alles übersetzen“ und vergleichen Sie das Ergebnis mit dem, was Sie heute verwenden. Der hier beschriebene Qualitätsunterschied ist der Qualitätsunterschied, den Sie erwarten können.


Fragen zur Methodik oder Datenanfragen: Kontaktieren Sie das WPML-Team.

Studie durchgeführt vom WPML-Linguistik-Team, April 2026. Stichprobe: 227 mit DeepL übersetzte Webseiten, die von muttersprachlichen Linguisten überprüft wurden; 73 davon wurden mit der aktuellen PTC-Version neu übersetzt und blind gegen denselben Ausgangsinhalt neu bewertet. Sprachen: Arabisch, Englisch, Französisch, Deutsch, Italienisch, Spanisch. Bewertung: MQM-basiertes Framework für Übersetzungsqualität, 9 Dimensionen, 1–10 pro Dimension, gemittelt und auf ein Ergebnis von 0–100 skaliert.