Il Private Translation Cloud (PTC) di WPML ottiene un punteggio di 90,0 su 100 in una revisione linguistica indipendente. DeepL — ampiamente considerato il motore di traduzione AI mainstream più potente — ottiene 77,7 sullo stesso contenuto. PTC supera DeepL di 12,3 punti complessivi, vince in ognuna delle nove dimensioni qualitative valutate dai nostri linguisti e produce una riduzione di circa 18 volte degli errori per pagina.
In sintesi
| Metrica |
|
|
|---|---|---|
| Punteggio medio qualità della traduzione (0–100) | 77,7 | 90,0 |
| Media problemi per pagina tradotta | 1,27 | 0,07 |
| Dimensioni qualitative in cui PTC ha superato DeepL | — | 9 su 9 |
| Lingue testate in cui PTC ha superato DeepL | — | 6 su 6 (arabo, inglese, francese, tedesco, italiano, spagnolo) |
Perché abbiamo condotto questo studio
DeepL è considerato dalla maggior parte del settore del software e di WordPress come il gold standard per la traduzione AI. Quando i clienti chiedono se possono pubblicare contenuti tradotti dall’intelligenza artificiale senza revisione umana, DeepL è solitamente il punto di riferimento implicito.
WPML ha creato il proprio motore di traduzione AI — il Private Translation Cloud (PTC) — perché il concetto di “abbastanza buono” non era sufficiente. PTC è il motore predefinito all’interno della modalità Traduci Tutto di WPML e gestisce la maggior parte delle traduzioni automatiche negli oltre 1,5 milioni di siti che utilizzano WPML.
Volevamo una risposta misurabile a una domanda che i potenziali clienti ci pongono ogni settimana: come si confronta effettivamente PTC con DeepL? Questo studio è la risposta. I numeri sopra citati sono il titolo; il resto di questo articolo spiega come sono stati prodotti e cosa significano per un sito in produzione reale.
Cosa abbiamo misurato e come
Abbiamo valutato la qualità della traduzione utilizzando un sistema basato su MQM (Multidimensional Quality Metrics), lo stesso framework che il team linguistico di WPML utilizza per le revisioni continue dei siti dei clienti PTC. Ogni pagina tradotta viene valutata in base a nove dimensioni:
- Grammatica — c’erano errori grammaticali?
- Significato — il significato del testo originale è stato preservato?
- Naturalezza — suona naturale e idiomatico per un madrelingua?
- Tono — il tono dell’originale è stato catturato?
- Formalità — è stato usato il registro corretto, sia nel rivolgersi al lettore che nelle forme grammaticali?
- Terminologia — è stata usata la terminologia corretta?
- Coerenza — la terminologia è stata applicata in modo coerente in tutta la pagina?
- Uso delle maiuscole — sono state seguite le convenzioni della lingua di destinazione?
- Localizzazione di numeri, unità e date — sono state seguite le convenzioni della lingua di destinazione?
Ogni dimensione riceve un punteggio da 1 a 10 da parte di un linguista umano madrelingua della lingua di destinazione. Il punteggio finale per pagina è la media delle nove dimensioni, moltiplicata per dieci — ottenendo una scala da 1 a 100 che corrisponde a fasce di qualità descritte in linguaggio semplice:
| Punteggio | Cosa significa |
|---|---|
| 90–100 | Da ottimo a perfetto — pronto per la pubblicazione senza revisione |
| 80–89 | Buono — pronto per la pubblicazione nella maggior parte dei contesti |
| 70–79 | Da accettabile a mediocre — utilizzabile ma gli errori sono visibili |
| 60–69 | Mediocre — necessita di ritocchi prima della pubblicazione |
| 50–59 | Errori evidenti anche per i non madrelingua |
| Sotto 50 | Difetti abbastanza significativi da richiedere un rifacimento |
Per contestualizzare: la media pubblicata per la traduzione umana generica si aggira intorno a 76. Il 77,7 di DeepL lo colloca appena sopra quella linea. Il 90,0 di PTC lo posiziona proprio al limite della fascia “ottimo — pronto per la pubblicazione senza revisione”.
Dimensione del campione e selezione
Per valutare DeepL, abbiamo preso 800 siti casuali tradotti con DeepL negli ultimi 12 mesi, li abbiamo raggruppati per età del sito, volume di contenuti e attività di traduzione, e abbiamo campionato tra i vari gruppi. I nostri linguisti hanno poi revisionato manualmente le pagine principali dei siti campionati — 227 pagine web in totale, valutate in arabo, inglese, francese, tedesco, italiano e spagnolo.
Per confrontare DeepL e PTC testa a testa, abbiamo ri-tradotto 73 di quelle stesse pagine con PTC e le abbiamo valutate nuovamente in cieco, con gli stessi linguisti che hanno lavorato sullo stesso contenuto originale. Il campione PTC è più piccolo di quello DeepL perché ogni misurazione PTC riflette una versione specifica di PTC, e il motore continua a evolversi — vedi la sezione Non abbiamo ancora finito qui sotto.
Per lingua: PTC vince in ogni coppia
I punteggi aggregati sono interessanti; il quadro per lingua è ciò che dice a un team di contenuti multilingue cosa aspettarsi.
Punteggi TQ per lingua

PTC ottiene punteggi più alti di DeepL in ogni coppia linguistica testata. Il divario più ampio è in arabo (+22,4 punti), dove DeepL ha storicamente sottoperformato e dove l’investimento di WPML nella qualità delle lingue RTL si vede chiaramente. Seguono il tedesco (+11,5) e il francese (+9,9). Il divario più stretto è in inglese (+6,0 punti) — e anche lì, PTC sposta la pagina da “accettabile, visibilmente imperfetta” alla fascia pronta per la pubblicazione.
Anche la varianza conta. La distribuzione di DeepL ha una lunga coda inferiore in arabo, con singole pagine che ottengono punteggi ben al di sotto della media — pagine che un utente tedesco o francese considererebbe inutilizzabili. Le distribuzioni di PTC sono più strette e centrate più in alto, quindi un team di contenuti può pianificare in base a una fascia di qualità prevista invece di dover gestire casi anomali.
PTC supera DeepL anche in ognuna delle nove dimensioni qualitative che valutiamo: grammatica, significato, naturalezza, tono, formalità, terminologia, coerenza, uso delle maiuscole e convenzioni locali. I maggiori guadagni si registrano nelle dimensioni che contano di più per un essere umano che legge una pagina su un sito web reale — terminologia (+1,5), grammatica (+1,4), naturalezza (+1,4) e localizzazione di numeri/unità/date (+1,4). Non c’è nessuna dimensione in cui DeepL riesca a tenere il passo, e nessuna dimensione in cui PTC vinca solo di misura.
Tasso di errore: il quadro operativo
I punteggi medi sono utili; il conteggio degli errori è più utile per chiunque gestisca un sito reale. I nostri revisori hanno registrato ogni singolo problema identificato su ogni pagina — grammatica, significato, terminologia, tutto quanto.
Media problemi per pagina

DeepL produce una media di 1,27 problemi per pagina. PTC ne produce 0,07 — circa una riduzione di 18 volte degli errori per pagina sullo stesso contenuto originale.
Per un sito di 200 pagine, questo si traduce approssimativamente in:
- DeepL: ~254 problemi da trovare, valutare e correggere prima della pubblicazione.
- PTC: ~14 problemi in tutto il sito.
Questa è la differenza tra la traduzione AI come bozza iniziale e la traduzione AI come flusso di lavoro. DeepL è una bozza solida — ogni pagina ha ancora problemi da individuare prima di andare online. PTC, in questa misurazione, è un flusso di lavoro: il conteggio degli errori è così basso che la fase di revisione umana diventa opzionale per la maggior parte dei contenuti invece di essere obbligatoria per tutti.
Cosa significa effettivamente “buona traduzione”
Le descrizioni dei voti del framework MQM sono un utile contrappeso al linguaggio di marketing che circonda la traduzione AI. Una pagina “9/10” non è una pagina al 90%; è una pagina in cui un madrelingua, leggendo attentamente, non trova nulla che vorrebbe cambiare. Una pagina “7/10” è accettabile così com’è ma visibilmente imperfetta. Una pagina “5/10” è quella in cui un non madrelingua può individuare errori.
La media di DeepL si attesta nella fascia alta dei 7 — accettabile, ma visibilmente imperfetta per un lettore madrelingua attento. La media di PTC si attesta a 90,0, proprio al limite di “ottimo — pronto per la pubblicazione senza revisione”. Questa è la differenza di qualità misurata dai nostri revisori. Corrisponde a una distinzione reale: l’output di DeepL è un punto di partenza che richiede una revisione umana prima della pubblicazione; l’output di PTC è, nella maggior parte dei casi, la pubblicazione stessa.
Perché WPML può produrre questa qualità
Siamo consapevoli che “abbiamo costruito il nostro motore AI” è un’affermazione che molte aziende fanno in questo momento. PTC è insolito per due motivi specifici.
Scala e revisione continua. WPML serve oltre 1,5 milioni di siti e lo fa da più di un decennio. Il team linguistico di WPML revisiona continuamente la qualità della traduzione di PTC — campionando l’output, valutandolo con lo stesso framework MQM usato in questo studio e monitorando i pattern in cui il motore produce costantemente risultati di qualità inferiore per un particolare termine, coppia linguistica o tipo di contenuto.
Focus. PTC non è un progetto secondario per WPML. Ha un team dedicato — ingegneri, MLOps e linguisti umani. Quando i linguisti segnalano un pattern ricorrente, il team di ingegneri lo tratta come un bug: estende il glossario, regola il modello di formalità, aggiunge un’eccezione, rilascia la correzione. Questo ciclo gira continuamente, ed è per questo che la qualità di PTC è migliorata negli ultimi 12 mesi, passando da “buona quanto una traduzione umana media” ai numeri di questo studio.
La combinazione — revisione umana continua su scala significativa, abbinata a un team che risponde a ogni scoperta come a un ticket di ingegneria — è ciò che produce i numeri di qualità sopra citati. Non è l’architettura del modello; è il modello operativo.
Non abbiamo ancora finito
90,0 colloca PTC proprio al limite di “ottimo — pronto per la pubblicazione senza revisione”. Siamo soddisfatti di questo risultato. Non pensiamo che sia il massimo raggiungibile.
Il ciclo QA → ingegneria descritto sopra è ancora in funzione. Il team linguistico di WPML continua ad analizzare le modifiche apportate dai clienti all’output di PTC sui siti reali, identifica i pattern che tali modifiche rivelano e il team di ingegneri rilascia le correzioni — estensioni del glossario, regolazioni della formalità, ritocchi specifici per le coppie linguistiche. Ci aspettiamo che la prossima misurazione sia superiore a questa.
Cosa significa questo per il tuo flusso di lavoro
Il flusso di lavoro convenzionale per i contenuti multilingue è traduci → revisiona → pubblica. La fase di revisione esiste perché ogni motore AI — e la maggior parte dei traduttori umani — produce un lavoro che necessita di un secondo paio di occhi prima di essere pubblicato. Quella fase di revisione è anche quella in cui risiede la maggior parte dei costi e della latenza nei contenuti multilingue.
Con DeepL, una fase di revisione è necessaria. Gli 1,27 problemi per pagina devono essere individuati da qualche parte; se il team non li trova, lo faranno i clienti. Con PTC, la fase di revisione è opzionale per la maggior parte dei contenuti. Alcuni team continuano a revisionare — per pagine ad alto rischio o settori regolamentati — ma il flusso di lavoro predefinito diventa traduci → pubblica, con la revisione riservata ai casi che ne hanno effettivamente bisogno.
Questa è la differenza operativa descritta dai numeri. Non è una differenza da poco.
Cosa significa questo per i tuoi costi
Il costo della traduzione è composto da due elementi: il costo di produzione della traduzione e il costo della sua revisione. Entrambi devono essere pagati prima che il contenuto vada online.
Per la maggior parte dei contesti professionali, la revisione umana costa qualche centesimo a parola — sia che i revisori facciano pagare a parola, a pagina o a sito, il calcolo è all’incirca questo. Una traduzione umana completa (traduzione, poi revisione da parte di un secondo umano) costa tipicamente circa 0,10 €–0,20 € a parola per le principali coppie linguistiche, con la sola parte di revisione nell’ordine di 0,04 €–0,08 €.
Ecco quanto costa effettivamente ogni flusso di lavoro in questi termini.
Sola traduzione umana — il riferimento. Circa 0,10 €–0,20 € a parola. Entrambe le fasi sono umane.
DeepL (o qualsiasi motore AI) più revisione umana. L’IA gestisce la fase di traduzione; un essere umano deve comunque revisionare ogni pagina, perché con 1,27 problemi per pagina gli errori raggiungeranno i clienti se nessuno li intercetta prima. La fase di traduzione è essenzialmente gratuita; la fase di revisione costa comunque 0,04 €–0,08 € a parola. Risparmio totale rispetto alla sola traduzione umana: circa il 60%. Questa è la classica proposta “l’IA ti fa risparmiare sulla traduzione” — ed è vera — ma il tetto dei costi è fissato dalla fase di revisione che la qualità di DeepL richiede ancora.
PTC, nessuna revisione necessaria. PTC costa 0,0012 €–0,003 € a parola — 4 crediti a parola moltiplicati per 0,30 €–0,75 € per 1.000 crediti a seconda del volume, con i primi 2.000 crediti al mese gratuiti. (Vedi i prezzi della traduzione automatica di WPML per la tabella completa dei livelli.) Poiché la qualità misurata di PTC (punteggio TQ 90,0, 0,07 problemi per pagina, divario di +12,3 punti rispetto a DeepL sullo stesso contenuto originale) è sufficientemente alta da saltare la fase di revisione nella maggior parte dei casi, il costo della revisione scende a zero. Risparmio totale rispetto alla sola traduzione umana: circa il 99%.
Questo non è un miglioramento marginale rispetto al flusso di lavoro AI-più-revisione. È un regime di costi completamente diverso.
In sintesi — Costo per pubblicare una parola tradotta
| Flusso di lavoro | Traduzione | Revisione | Totale | Risparmio vs. umano |
|---|---|---|---|---|
| Traduzione umana completa | 0,10 €–0,20 € | inclusa | 0,10 €–0,20 € | — |
| DeepL + revisione umana | ~0 € | 0,04 €–0,08 € | 0,04 €–0,08 € | ~60% |
| PTC, nessuna revisione | 0,0012 €–0,003 € | 0 € | 0,0012 €–0,003 € | ~99% |
Le tariffe per la traduzione umana sono stime tipiche del settore per le principali coppie linguistiche. I prezzi di PTC derivano dalle tariffe pubblicate da WPML.
Una nota sulla revisione fatta in proprio: quando il proprietario di un’attività effettua la revisione personalmente invece di pagare un revisore, il costo non è zero — è solo meno visibile. Le ore dedicate alla revisione sono ore non dedicate al resto dell’attività e, a qualsiasi tariffa oraria ragionevole, il costo implicito è solitamente superiore a quello che farebbe pagare un revisore esterno, non inferiore. Il risparmio di PTC si applica indipendentemente da chi paga oggi per la fase di revisione.
Cosa rende possibile tutto questo. Quando la traduzione costa più di 0,10 € a parola, traduci in modo selettivo — la homepage, le categorie di prodotti principali, una manciata di post del blog ad alto traffico. Tutto il resto rimane nella lingua originale perché i conti non tornano. Quando la traduzione costa 0,002 € a parola e produce un output migliore della tipica traduzione umana, i conti tornano per contenuti che prima non erano sostenibili:
- Traduzione completa del catalogo nell’e-commerce — ogni descrizione di prodotto long-tail, ogni variante.
- Portali di documentazione completi in ogni lingua che un cliente potrebbe parlare, non solo nelle prime tre.
- Knowledge base, FAQ di supporto, archivi di blog — la coda lunga che genera traffico di ricerca ma che non ha mai giustificato il costo della traduzione.
- Contenuti editoriali localizzati per editori che operano in mercati in cui le entrate per spettatore per pagina non potrebbero coprire la traduzione umana.
I contenuti multilingue sono stati per decenni una questione di “cosa possiamo permetterci di tradurre”. Con PTC, la domanda diventa “cosa vale la pena tradurre” — che è una domanda diversa e molto più interessante.
Come ottenere questa qualità sul tuo sito
PTC è il motore predefinito nella modalità Traduci Tutto di WPML, che è un’unica impostazione globale che traduce ogni pagina del tuo sito, automaticamente, in background. Non c’è nessuna configurazione per pagina da gestire.
Per ottenere la qualità misurata in questo studio, l’unica configurazione necessaria oltre all’attivazione di Traduci Tutto è dedicare circa un minuto a descrivere il pubblico e il tono del tuo sito nelle impostazioni di Traduci Tutto — ad esempio, “una società di software che si rivolge agli sviluppatori, tono formale, terminologia tecnica preservata in inglese”. PTC utilizza quella descrizione per allineare le traduzioni alla voce del tuo brand.
Questa è tutta la configurazione necessaria. Il risultato è quello misurato in questo studio.
Una nota su cosa non abbiamo fatto
Non abbiamo confrontato PTC con Google Translate, Azure Translator o servizi basati su LLM tramite le loro API pubbliche. Il motivo: quei motori cambiano frequentemente e una misurazione puntuale diventerebbe obsoleta in pochi mesi. Il confronto con DeepL è quello che abbiamo condotto perché DeepL è il benchmark più citato per la traduzione AI di livello professionale, ed è ciò che la maggior parte dei nostri concorrenti usa internamente.
In questo studio non abbiamo misurato nemmeno la velocità, il costo o l’esperienza dello sviluppatore — solo la qualità. Questi confronti esistono sulla nostra pagina delle funzionalità e sulle nostre pagine di confronto, e raccontano la loro storia.
Provalo
Se gestisci un sito WordPress multilingue e vuoi vedere l’output di PTC sui tuoi contenuti, installa WPML, abilita Traduci Tutto e confronta il risultato con qualunque cosa tu stia usando oggi. La differenza di qualità descritta qui è la differenza di qualità che dovresti aspettarti di vedere.
Domande sulla metodologia o richieste di dati: contatta il team di WPML.
Studio condotto dal team linguistico di WPML, aprile 2026. Campione: 227 pagine web tradotte con DeepL revisionate da linguisti madrelingua; 73 di queste ri-tradotte con l’attuale versione di PTC e valutate nuovamente in cieco rispetto allo stesso contenuto originale. Lingue: arabo, inglese, francese, tedesco, italiano, spagnolo. Valutazione: framework di qualità della traduzione basato su MQM, 9 dimensioni, 1–10 per dimensione, media e scala per un risultato da 0 a 100.