O Private Translation Cloud (PTC) do WPML obteve 90,0 de 100 pontos em uma avaliação de tradução independente. O DeepL — amplamente considerado o mecanismo de tradução por IA convencional mais robusto — obteve 77,7 pontos sobre o mesmo conteúdo. O PTC supera o DeepL em 12,3 pontos no geral, vence em cada uma das nove dimensões de qualidade pontuadas por nossos linguistas e produz uma redução de aproximadamente 18 vezes nos erros por página.
Resumo
| Métrica |
|
|
|---|---|---|
| Pontuação média de qualidade de tradução (0–100) | 77,7 | 90,0 |
| Média de problemas por página traduzida | 1,27 | 0,07 |
| Dimensões de qualidade em que o PTC pontuou mais que o DeepL | — | 9 de 9 |
| Idiomas testados em que o PTC pontuou mais que o DeepL | — | 6 de 6 (árabe, inglês, francês, alemão, italiano, espanhol) |
Por que Realizamos Este Estudo
O DeepL é tratado pela maior parte das indústrias de software e do WordPress como o padrão ouro para tradução por IA. Quando os clientes perguntam se podem publicar conteúdo traduzido por IA sem revisão humana, o DeepL costuma ser a referência implícita.
O WPML construiu seu próprio mecanismo de tradução por IA — o Private Translation Cloud (PTC) — porque o “bom o suficiente” não era suficiente. O PTC é o mecanismo padrão no modo Traduzir Tudo do WPML e processa a maior parte da tradução automática nos mais de 1,5 milhão de sites que utilizam o WPML.
Queríamos uma resposta mensurável para uma pergunta que clientes em potencial nos fazem toda semana: como o PTC realmente se compara ao DeepL? Este estudo é essa resposta. Os números acima são o destaque; o restante deste artigo explica como eles foram produzidos e o que significam para um site em produção real.
O Que Medimos e Como
Pontuamos a qualidade da tradução usando um sistema baseado em MQM (Multidimensional Quality Metrics), a mesma estrutura que a equipe de linguística do WPML usa para as revisões contínuas de sites de clientes do PTC. Cada página traduzida é pontuada em nove dimensões:
- Gramática — houve erros gramaticais?
- Significado — o significado da fonte foi preservado?
- Naturalidade — soa natural e idiomático para um falante nativo?
- Tom — o tom da fonte foi capturado?
- Formalidade — o registro correto foi usado, tanto ao se dirigir ao leitor quanto nas formas de tratamento gramaticais?
- Terminologia — a terminologia correta foi utilizada?
- Consistência — a terminologia foi aplicada de forma consistente em toda a página?
- Capitalização — as convenções do idioma de destino foram seguidas?
- Localização de números, unidades e datas — as convenções do idioma de destino foram seguidas?
Cada dimensão é pontuada de 1 a 10 por um linguista humano que é falante nativo do idioma de destino. A pontuação final por página é a média das nove dimensões, multiplicada por dez — resultando em uma escala de 1 a 100 que mapeia faixas de qualidade claras:
| Pontuação | O que significa |
|---|---|
| 90–100 | Muito bom a perfeito — pronto para publicar sem revisão |
| 80–89 | Bom — pronto para publicação na maioria dos contextos |
| 70–79 | Aceitável a medíocre — utilizável, mas os erros são visíveis |
| 60–69 | Medíocre — precisa de retoques antes de publicar |
| 50–59 | Erros óbvios para falantes não nativos |
| Abaixo de 50 | Defeitos significativos o suficiente para exigir retrabalho |
Para contexto: a média publicada para tradução humana genérica gira em torno de 76. Os 77,7 do DeepL o colocam um pouco acima dessa linha. Os 90,0 do PTC o colocam exatamente no limite da faixa “muito bom — pronto para publicar sem revisão”.
Tamanho da Amostra e Seleção
Para avaliar o DeepL, selecionamos 800 sites aleatórios traduzidos com o DeepL nos últimos 12 meses, agrupando-os por idade do site, volume de conteúdo e atividade de tradução, e amostramos entre os grupos. Nossos linguistas revisaram manualmente as páginas principais dos sites amostrados — 227 páginas da web no total, avaliadas em árabe, inglês, francês, alemão, italiano e espanhol.
Para comparar o DeepL e o PTC diretamente, retraduzimos 73 dessas mesmas páginas com o PTC e as pontuamos novamente em um teste cego, com os mesmos linguistas trabalhando a partir do mesmo conteúdo de origem. A amostra do PTC é menor que a do DeepL porque cada medição do PTC reflete uma versão específica do PTC, e o mecanismo continua a evoluir — veja a seção Ainda não terminamos abaixo.
Por Idioma: PTC Vence em Todos os Pares
As pontuações agregadas são interessantes; o cenário por idioma é o que diz a uma equipe de conteúdo multilíngue o que esperar.
Pontuações de TQ por Idioma

O PTC pontua mais alto que o DeepL em todos os pares de idiomas que testamos. A maior diferença está no árabe (+22,4 pontos), onde o DeepL historicamente apresenta desempenho inferior e onde o investimento do WPML na qualidade de idiomas RTL (da direita para a esquerda) aparece claramente. Alemão (+11,5) e francês (+9,9) vêm em seguida. A menor diferença está no inglês (+6,0 pontos) — e mesmo lá, o PTC move a página de “aceitável, visivelmente imperfeita” para a faixa de pronta para publicação.
A variância também importa. A distribuição do DeepL tem uma cauda inferior longa no árabe, com páginas individuais pontuando bem abaixo da média — páginas que um usuário alemão ou francês consideraria defeituosas. As distribuições do PTC são mais estreitas e centradas em valores mais altos, de modo que uma equipe de conteúdo pode planejar com base em uma faixa de qualidade esperada, em vez de orçar para casos atípicos.
O PTC também supera o DeepL em cada uma das nove dimensões de qualidade que pontuamos: gramática, significado, naturalidade, tom, formalidade, terminologia, consistência, capitalização e convenções locais. Os maiores ganhos estão nas dimensões que mais importam para um humano lendo uma página em um site real — terminologia (+1,5), gramática (+1,4), naturalidade (+1,4) e localização de números/unidades/datas (+1,4). Não há dimensão em que o DeepL acompanhe o ritmo, e nenhuma dimensão em que o PTC apenas leve uma pequena vantagem.
Taxa de Erros: O Cenário Operacional
Pontuações médias são úteis; contagens de erros são mais úteis para quem gerencia um site real. Nossos revisores registraram cada problema distinto que identificaram em cada página — gramática, significado, terminologia, tudo.
Média de Problemas por Página

O DeepL produz uma média de 1,27 problemas por página. O PTC produz 0,07 — aproximadamente uma redução de 18 vezes nos erros por página sobre o mesmo conteúdo de origem.
Para um site de 200 páginas, isso se traduz aproximadamente em:
- DeepL: ~254 problemas para encontrar, decidir e corrigir antes de publicar.
- PTC: ~14 problemas em todo o site.
Essa é a diferença entre a tradução por IA como primeiro rascunho e a tradução por IA como fluxo de trabalho. O DeepL é um ótimo primeiro rascunho — ainda há problemas em todas as páginas para corrigir antes de publicar. O PTC, nessa métrica, é um fluxo de trabalho: a quantidade de erros é baixa o suficiente para que a etapa de revisão humana se torne opcional para a maior parte do conteúdo, em vez de obrigatória para tudo.
O Que Realmente Significa uma “Boa Tradução”
As descrições de notas da estrutura MQM são um contrapeso útil à linguagem de marketing que envolve a tradução por IA. Uma página “9/10” não é uma página 90%; é uma página onde um falante nativo, lendo com atenção, não encontra nada que queira mudar. Uma página “7/10” é aceitável como está, mas visivelmente imperfeita. Uma página “5/10” é aquela onde um falante não nativo consegue identificar erros.
A média do DeepL situa-se na faixa superior dos 7 — aceitável, mas visivelmente imperfeita para um leitor nativo atento. A média do PTC situa-se em 90,0, exatamente no limite de “muito bom — pronto para publicar sem revisão”. Essa é a diferença de qualidade que nossos revisores mediram. Ela mapeia para uma distinção real: o resultado do DeepL é um ponto de partida que exige revisão humana antes da publicação; o resultado do PTC é, na maioria dos casos, a própria publicação.
Por Que o WPML Pode Produzir Esta Qualidade
Estamos cientes de que “construímos nosso próprio mecanismo de IA” é uma afirmação que muitas empresas fazem no momento. O PTC é incomum por dois motivos específicos.
Escala e revisão contínua. O WPML atende a mais de 1,5 milhão de sites e o faz há mais de uma década. A equipe de linguística do WPML revisa continuamente a qualidade da tradução do PTC — amostrando resultados, pontuando-os com a mesma estrutura MQM usada neste estudo e observando padrões onde o mecanismo produz consistentemente resultados de menor qualidade para um termo, par de idiomas ou tipo de conteúdo específico.
Foco. O PTC não é um projeto paralelo no WPML. Ele possui uma equipe dedicada — engenheiros, MLOps e linguistas humanos. Quando os linguistas sinalizam um padrão recorrente, a equipe de engenharia o trata como um bug: estende o glossário, ajusta o modelo de formalidade, adiciona uma exceção, envia a correção. Esse ciclo funciona continuamente, e é por isso que a qualidade do PTC melhorou nos últimos 12 meses, passando de “tão boa quanto a tradução humana média” para os números deste estudo.
A combinação — revisão humana contínua em escala significativa, aliada a uma equipe que responde a cada descoberta como um ticket de engenharia — é o que produz os números de qualidade acima. Não é a arquitetura do modelo; é o modelo operacional.
Ainda Não Terminamos
90,0 coloca o PTC exatamente no limite de “muito bom — pronto para publicar sem revisão”. Estamos felizes com esse resultado. Não achamos que seja o teto.
O ciclo QA → engenharia descrito acima ainda está em execução. A equipe de linguística do WPML continua a analisar as edições que os clientes fazem nos resultados do PTC em sites reais, identifica os padrões que essas edições revelam, e a equipe de engenharia envia as correções — extensões de glossário, ajustes de formalidade, ajustes específicos para pares de idiomas. Esperamos que a próxima medição seja superior a esta.
O Que Isso Significa Para o Seu Fluxo de Trabalho
O fluxo de trabalho convencional de conteúdo multilíngue é traduzir → revisar → publicar. A etapa de revisão existe porque todo mecanismo de IA — e a maioria dos tradutores humanos — produz um trabalho que precisa de um segundo par de olhos antes de ser enviado. Essa etapa de revisão também é onde reside a maior parte do custo e da latência no conteúdo multilíngue.
Com o DeepL, uma etapa de revisão é necessária. Os 1,27 problemas por página precisam ser detectados em algum lugar; se a equipe não os detectar, os clientes o farão. Com o PTC, a etapa de revisão é opcional para a maior parte do conteúdo. Algumas equipes ainda revisam — para páginas de alto risco ou indústrias regulamentadas — mas o fluxo de trabalho padrão torna-se traduzir → publicar, com a revisão reservada para os casos que realmente precisam dela.
Esta é a diferença operacional que os números descrevem. Não é uma diferença pequena.
O Que Isso Significa Para os Seus Custos
O custo da tradução é composto por duas coisas: o custo de produzir a tradução e o custo de revisá-la. Ambos precisam ser pagos antes que o conteúdo vá ao ar.
Para a maioria dos contextos profissionais, a revisão humana custa alguns centavos por palavra — quer os revisores cobrem por palavra, por página ou por site, é mais ou menos onde a conta fecha. A tradução humana completa (traduzir e depois revisar por um segundo humano) normalmente custa em torno de € 0,10–€ 0,20 por palavra para os principais pares de idiomas, com a parte da revisão sozinha na faixa de € 0,04–€ 0,08.
Aqui está o que cada fluxo de trabalho realmente custa nesses termos.
Apenas tradução humana — a base de referência. Cerca de € 0,10–€ 0,20 por palavra. Ambas as etapas são humanas.
DeepL (ou qualquer mecanismo de IA) mais revisão humana. A IA cuida da etapa de tradução; um humano ainda precisa revisar cada página, porque com 1,27 problemas por página, os problemas chegarão aos clientes se ninguém os detectar primeiro. A etapa de tradução é essencialmente gratuita; a etapa de revisão ainda custa € 0,04–€ 0,08 por palavra. Economia total em relação à tradução apenas humana: cerca de 60%. Este é o argumento padrão de que “a IA economiza dinheiro na tradução” — e é verdade — mas o teto de custo reside na etapa de revisão que a qualidade do DeepL ainda exige.
PTC, sem necessidade de revisão. O PTC custa € 0,0012–€ 0,003 por palavra — 4 créditos por palavra multiplicados por € 0,30–€ 0,75 por 1.000 créditos, dependendo do volume, com os primeiros 2.000 créditos por mês gratuitos. (Consulte os preços de tradução automática do WPML para a tabela completa de níveis.) Como a qualidade medida do PTC (pontuação de TQ de 90,0, 0,07 problemas por página, diferença de +12,3 pontos sobre o DeepL no mesmo conteúdo de origem) é alta o suficiente para pular a etapa de revisão na maioria dos casos, o custo da revisão vai a zero. Economia total em relação à tradução apenas humana: aproximadamente 99%.
Isso não é uma melhoria marginal no fluxo de trabalho de IA mais revisão. É um regime de custos diferente.
Resumo — Custo para Enviar uma Palavra Traduzida
| Fluxo de trabalho | Tradução | Revisão | Total | Economia vs. humana |
|---|---|---|---|---|
| Tradução humana completa | € 0,10–€ 0,20 | incluída | € 0,10–€ 0,20 | — |
| DeepL + revisão humana | ~€ 0 | € 0,04–€ 0,08 | € 0,04–€ 0,08 | ~60% |
| PTC, sem revisão | € 0,0012–€ 0,003 | € 0 | € 0,0012–€ 0,003 | ~99% |
As taxas de tradução humana são estimativas típicas da indústria para os principais pares de idiomas. Os preços do PTC são baseados nas taxas publicadas pelo WPML.
Uma nota sobre fazer a revisão você mesmo: quando o proprietário de uma empresa faz a revisão ele mesmo em vez de pagar um revisor, o custo não é zero — apenas é menos visível. As horas gastas na revisão são horas não gastas no restante do negócio e, a qualquer taxa horária razoável, o custo implícito costuma ser maior do que o que um revisor terceirizado cobraria, não menor. A economia do PTC se aplica independentemente de quem está pagando pela etapa de revisão hoje.
O que isso possibilita. Quando a tradução custa € 0,10+ por palavra, você traduz seletivamente — a página inicial, as principais categorias de produtos, alguns posts de blog de alto tráfego. Todo o resto permanece no idioma de origem porque a conta não fecha. Quando a tradução custa € 0,002 por palavra e produz resultados melhores que a tradução humana típica, a conta fecha para conteúdos que antes não eram viáveis:
- Tradução completa de catálogo no eCommerce — cada descrição de produto de cauda longa, cada variante.
- Portais de documentação completos em todos os idiomas que um cliente possa falar, não apenas os três principais.
- Bases de conhecimento, FAQs de suporte, arquivos de blog — a cauda longa que impulsiona a busca, mas que nunca justificou seu custo de tradução.
- Conteúdo editorial localizado para editores que operam em mercados onde a receita de audiência por página não cobriria a tradução humana.
O conteúdo multilíngue tem sido uma questão de “o que podemos pagar para traduzir” por décadas. Com o PTC, a pergunta passa a ser “o que vale a pena traduzir” — que é uma questão diferente e muito mais interessante.
Como Obter Esta Qualidade em Seu Próprio Site
O PTC é o mecanismo padrão no modo Traduzir Tudo do WPML, que é uma configuração global única que traduz cada página do seu site, automaticamente, em segundo plano. Não há configuração por página para gerenciar.
Para obter a qualidade medida neste estudo, a única configuração necessária além de ativar o Traduzir Tudo é gastar cerca de um minuto descrevendo o público e o tom do seu site nas configurações do Traduzir Tudo — por exemplo, “uma empresa de software se dirigindo a desenvolvedores, tom formal, terminologia técnica preservada em inglês”. O PTC usa essa descrição para alinhar as traduções com a voz da sua marca.
Essa é toda a configuração. O resultado é o que este estudo mediu.
Uma Nota Sobre o Que Não Fizemos
Não comparamos o PTC ao Google Tradutor, Azure Translator ou serviços baseados em LLM através de suas APIs públicas. O motivo: esses mecanismos mudam com frequência e uma medição pontual ficaria obsoleta em meses. A comparação com o DeepL foi a que realizamos porque o DeepL é a referência mais citada para tradução por IA de nível de produção, e porque o DeepL é o que a maioria de nossos concorrentes usa internamente.
Também não medimos velocidade, custo ou experiência do desenvolvedor neste estudo — apenas qualidade. Essas comparações existem em nossa página de recursos e em nossas páginas de comparação, e elas contam sua própria história.
Experimente
Se você gerencia um site WordPress multilíngue e quer ver o resultado do PTC em seu próprio conteúdo, instale o WPML, ative o Traduzir Tudo e compare o resultado com o que você está usando hoje. A diferença de qualidade descrita aqui é a diferença de qualidade que você deve esperar ver.
Dúvidas sobre metodologia ou solicitações de dados: entre em contato com a equipe do WPML.
Estudo conduzido pela equipe de linguística do WPML, abril de 2026. Amostra: 227 páginas da web traduzidas pelo DeepL revisadas por linguistas nativos; 73 delas retraduzidas com a versão atual do PTC e pontuadas novamente em teste cego contra o mesmo conteúdo de origem. Idiomas: árabe, inglês, francês, alemão, italiano, espanhol. Pontuação: estrutura de Qualidade de Tradução baseada em MQM, 9 dimensões, 1–10 por dimensão, com média e escala para um resultado de 0–100.