Pular para o conteúdo Pular para a barra lateral

O Private Translation Cloud (PTC) do WPML obteve 90,0 de 100 pontos em uma avaliação de tradução independente. O DeepL — amplamente considerado o mecanismo de tradução por IA convencional mais robusto — obteve 77,7 pontos sobre o mesmo conteúdo. O PTC supera o DeepL em 12,3 pontos no geral, vence em cada uma das nove dimensões de qualidade pontuadas por nossos linguistas e produz uma redução de aproximadamente 18 vezes nos erros por página.

Resumo

Métrica Logotipo do DeepL DeepL Logotipo do PTC PTC
Pontuação média de qualidade de tradução (0–100) 77,7 90,0
Média de problemas por página traduzida 1,27 0,07
Dimensões de qualidade em que o PTC pontuou mais que o DeepL 9 de 9
Idiomas testados em que o PTC pontuou mais que o DeepL 6 de 6 (árabe, inglês, francês, alemão, italiano, espanhol)

Por que Realizamos Este Estudo

O DeepL é tratado pela maior parte das indústrias de software e do WordPress como o padrão ouro para tradução por IA. Quando os clientes perguntam se podem publicar conteúdo traduzido por IA sem revisão humana, o DeepL costuma ser a referência implícita.

O WPML construiu seu próprio mecanismo de tradução por IA — o Private Translation Cloud (PTC) — porque o “bom o suficiente” não era suficiente. O PTC é o mecanismo padrão no modo Traduzir Tudo do WPML e processa a maior parte da tradução automática nos mais de 1,5 milhão de sites que utilizam o WPML.

Queríamos uma resposta mensurável para uma pergunta que clientes em potencial nos fazem toda semana: como o PTC realmente se compara ao DeepL? Este estudo é essa resposta. Os números acima são o destaque; o restante deste artigo explica como eles foram produzidos e o que significam para um site em produção real.

O Que Medimos e Como

Pontuamos a qualidade da tradução usando um sistema baseado em MQM (Multidimensional Quality Metrics), a mesma estrutura que a equipe de linguística do WPML usa para as revisões contínuas de sites de clientes do PTC. Cada página traduzida é pontuada em nove dimensões:

  • Gramática — houve erros gramaticais?
  • Significado — o significado da fonte foi preservado?
  • Naturalidade — soa natural e idiomático para um falante nativo?
  • Tom — o tom da fonte foi capturado?
  • Formalidade — o registro correto foi usado, tanto ao se dirigir ao leitor quanto nas formas de tratamento gramaticais?
  • Terminologia — a terminologia correta foi utilizada?
  • Consistência — a terminologia foi aplicada de forma consistente em toda a página?
  • Capitalização — as convenções do idioma de destino foram seguidas?
  • Localização de números, unidades e datas — as convenções do idioma de destino foram seguidas?

Cada dimensão é pontuada de 1 a 10 por um linguista humano que é falante nativo do idioma de destino. A pontuação final por página é a média das nove dimensões, multiplicada por dez — resultando em uma escala de 1 a 100 que mapeia faixas de qualidade claras:

Pontuação O que significa
90–100 Muito bom a perfeito — pronto para publicar sem revisão
80–89 Bom — pronto para publicação na maioria dos contextos
70–79 Aceitável a medíocre — utilizável, mas os erros são visíveis
60–69 Medíocre — precisa de retoques antes de publicar
50–59 Erros óbvios para falantes não nativos
Abaixo de 50 Defeitos significativos o suficiente para exigir retrabalho

Para contexto: a média publicada para tradução humana genérica gira em torno de 76. Os 77,7 do DeepL o colocam um pouco acima dessa linha. Os 90,0 do PTC o colocam exatamente no limite da faixa “muito bom — pronto para publicar sem revisão”.

Tamanho da Amostra e Seleção

Para avaliar o DeepL, selecionamos 800 sites aleatórios traduzidos com o DeepL nos últimos 12 meses, agrupando-os por idade do site, volume de conteúdo e atividade de tradução, e amostramos entre os grupos. Nossos linguistas revisaram manualmente as páginas principais dos sites amostrados — 227 páginas da web no total, avaliadas em árabe, inglês, francês, alemão, italiano e espanhol.

Para comparar o DeepL e o PTC diretamente, retraduzimos 73 dessas mesmas páginas com o PTC e as pontuamos novamente em um teste cego, com os mesmos linguistas trabalhando a partir do mesmo conteúdo de origem. A amostra do PTC é menor que a do DeepL porque cada medição do PTC reflete uma versão específica do PTC, e o mecanismo continua a evoluir — veja a seção Ainda não terminamos abaixo.

Por Idioma: PTC Vence em Todos os Pares

As pontuações agregadas são interessantes; o cenário por idioma é o que diz a uma equipe de conteúdo multilíngue o que esperar.

Pontuações de TQ por Idioma

Gráfico box plot comparando as pontuações de TQ para PTC e DeepL em árabe, alemão, inglês, espanhol, francês e italiano. O PTC mostra consistentemente pontuações medianas mais altas e distribuições de pontuação mais estreitas em todos os idiomas.
Pontuações de TQ por idioma — PTC vs. DeepL em árabe, alemão, inglês, espanhol, francês, italiano

O PTC pontua mais alto que o DeepL em todos os pares de idiomas que testamos. A maior diferença está no árabe (+22,4 pontos), onde o DeepL historicamente apresenta desempenho inferior e onde o investimento do WPML na qualidade de idiomas RTL (da direita para a esquerda) aparece claramente. Alemão (+11,5) e francês (+9,9) vêm em seguida. A menor diferença está no inglês (+6,0 pontos) — e mesmo lá, o PTC move a página de “aceitável, visivelmente imperfeita” para a faixa de pronta para publicação.

A variância também importa. A distribuição do DeepL tem uma cauda inferior longa no árabe, com páginas individuais pontuando bem abaixo da média — páginas que um usuário alemão ou francês consideraria defeituosas. As distribuições do PTC são mais estreitas e centradas em valores mais altos, de modo que uma equipe de conteúdo pode planejar com base em uma faixa de qualidade esperada, em vez de orçar para casos atípicos.

O PTC também supera o DeepL em cada uma das nove dimensões de qualidade que pontuamos: gramática, significado, naturalidade, tom, formalidade, terminologia, consistência, capitalização e convenções locais. Os maiores ganhos estão nas dimensões que mais importam para um humano lendo uma página em um site real — terminologia (+1,5), gramática (+1,4), naturalidade (+1,4) e localização de números/unidades/datas (+1,4). Não há dimensão em que o DeepL acompanhe o ritmo, e nenhuma dimensão em que o PTC apenas leve uma pequena vantagem.

Taxa de Erros: O Cenário Operacional

Pontuações médias são úteis; contagens de erros são mais úteis para quem gerencia um site real. Nossos revisores registraram cada problema distinto que identificaram em cada página — gramática, significado, terminologia, tudo.

Média de Problemas por Página

Gráfico de barras mostrando a média de problemas por página: DeepL ~1,27, PTC ~0,07, com o PTC significativamente menor que o DeepL.
Média de problemas por página — DeepL ~1,27, PTC ~0,07

O DeepL produz uma média de 1,27 problemas por página. O PTC produz 0,07 — aproximadamente uma redução de 18 vezes nos erros por página sobre o mesmo conteúdo de origem.

Para um site de 200 páginas, isso se traduz aproximadamente em:

  • DeepL: ~254 problemas para encontrar, decidir e corrigir antes de publicar.
  • PTC: ~14 problemas em todo o site.

Essa é a diferença entre a tradução por IA como primeiro rascunho e a tradução por IA como fluxo de trabalho. O DeepL é um ótimo primeiro rascunho — ainda há problemas em todas as páginas para corrigir antes de publicar. O PTC, nessa métrica, é um fluxo de trabalho: a quantidade de erros é baixa o suficiente para que a etapa de revisão humana se torne opcional para a maior parte do conteúdo, em vez de obrigatória para tudo.

O Que Realmente Significa uma “Boa Tradução”

As descrições de notas da estrutura MQM são um contrapeso útil à linguagem de marketing que envolve a tradução por IA. Uma página “9/10” não é uma página 90%; é uma página onde um falante nativo, lendo com atenção, não encontra nada que queira mudar. Uma página “7/10” é aceitável como está, mas visivelmente imperfeita. Uma página “5/10” é aquela onde um falante não nativo consegue identificar erros.

A média do DeepL situa-se na faixa superior dos 7 — aceitável, mas visivelmente imperfeita para um leitor nativo atento. A média do PTC situa-se em 90,0, exatamente no limite de “muito bom — pronto para publicar sem revisão”. Essa é a diferença de qualidade que nossos revisores mediram. Ela mapeia para uma distinção real: o resultado do DeepL é um ponto de partida que exige revisão humana antes da publicação; o resultado do PTC é, na maioria dos casos, a própria publicação.

Por Que o WPML Pode Produzir Esta Qualidade

Estamos cientes de que “construímos nosso próprio mecanismo de IA” é uma afirmação que muitas empresas fazem no momento. O PTC é incomum por dois motivos específicos.

Escala e revisão contínua. O WPML atende a mais de 1,5 milhão de sites e o faz há mais de uma década. A equipe de linguística do WPML revisa continuamente a qualidade da tradução do PTC — amostrando resultados, pontuando-os com a mesma estrutura MQM usada neste estudo e observando padrões onde o mecanismo produz consistentemente resultados de menor qualidade para um termo, par de idiomas ou tipo de conteúdo específico.

Foco. O PTC não é um projeto paralelo no WPML. Ele possui uma equipe dedicada — engenheiros, MLOps e linguistas humanos. Quando os linguistas sinalizam um padrão recorrente, a equipe de engenharia o trata como um bug: estende o glossário, ajusta o modelo de formalidade, adiciona uma exceção, envia a correção. Esse ciclo funciona continuamente, e é por isso que a qualidade do PTC melhorou nos últimos 12 meses, passando de “tão boa quanto a tradução humana média” para os números deste estudo.

A combinação — revisão humana contínua em escala significativa, aliada a uma equipe que responde a cada descoberta como um ticket de engenharia — é o que produz os números de qualidade acima. Não é a arquitetura do modelo; é o modelo operacional.

Ainda Não Terminamos

90,0 coloca o PTC exatamente no limite de “muito bom — pronto para publicar sem revisão”. Estamos felizes com esse resultado. Não achamos que seja o teto.

O ciclo QA → engenharia descrito acima ainda está em execução. A equipe de linguística do WPML continua a analisar as edições que os clientes fazem nos resultados do PTC em sites reais, identifica os padrões que essas edições revelam, e a equipe de engenharia envia as correções — extensões de glossário, ajustes de formalidade, ajustes específicos para pares de idiomas. Esperamos que a próxima medição seja superior a esta.

O Que Isso Significa Para o Seu Fluxo de Trabalho

O fluxo de trabalho convencional de conteúdo multilíngue é traduzir → revisar → publicar. A etapa de revisão existe porque todo mecanismo de IA — e a maioria dos tradutores humanos — produz um trabalho que precisa de um segundo par de olhos antes de ser enviado. Essa etapa de revisão também é onde reside a maior parte do custo e da latência no conteúdo multilíngue.

Com o DeepL, uma etapa de revisão é necessária. Os 1,27 problemas por página precisam ser detectados em algum lugar; se a equipe não os detectar, os clientes o farão. Com o PTC, a etapa de revisão é opcional para a maior parte do conteúdo. Algumas equipes ainda revisam — para páginas de alto risco ou indústrias regulamentadas — mas o fluxo de trabalho padrão torna-se traduzir → publicar, com a revisão reservada para os casos que realmente precisam dela.

Esta é a diferença operacional que os números descrevem. Não é uma diferença pequena.

O Que Isso Significa Para os Seus Custos

O custo da tradução é composto por duas coisas: o custo de produzir a tradução e o custo de revisá-la. Ambos precisam ser pagos antes que o conteúdo vá ao ar.

Para a maioria dos contextos profissionais, a revisão humana custa alguns centavos por palavra — quer os revisores cobrem por palavra, por página ou por site, é mais ou menos onde a conta fecha. A tradução humana completa (traduzir e depois revisar por um segundo humano) normalmente custa em torno de € 0,10–€ 0,20 por palavra para os principais pares de idiomas, com a parte da revisão sozinha na faixa de € 0,04–€ 0,08.

Aqui está o que cada fluxo de trabalho realmente custa nesses termos.

Apenas tradução humana — a base de referência. Cerca de € 0,10–€ 0,20 por palavra. Ambas as etapas são humanas.

DeepL (ou qualquer mecanismo de IA) mais revisão humana. A IA cuida da etapa de tradução; um humano ainda precisa revisar cada página, porque com 1,27 problemas por página, os problemas chegarão aos clientes se ninguém os detectar primeiro. A etapa de tradução é essencialmente gratuita; a etapa de revisão ainda custa € 0,04–€ 0,08 por palavra. Economia total em relação à tradução apenas humana: cerca de 60%. Este é o argumento padrão de que “a IA economiza dinheiro na tradução” — e é verdade — mas o teto de custo reside na etapa de revisão que a qualidade do DeepL ainda exige.

PTC, sem necessidade de revisão. O PTC custa € 0,0012–€ 0,003 por palavra — 4 créditos por palavra multiplicados por € 0,30–€ 0,75 por 1.000 créditos, dependendo do volume, com os primeiros 2.000 créditos por mês gratuitos. (Consulte os preços de tradução automática do WPML para a tabela completa de níveis.) Como a qualidade medida do PTC (pontuação de TQ de 90,0, 0,07 problemas por página, diferença de +12,3 pontos sobre o DeepL no mesmo conteúdo de origem) é alta o suficiente para pular a etapa de revisão na maioria dos casos, o custo da revisão vai a zero. Economia total em relação à tradução apenas humana: aproximadamente 99%.

Isso não é uma melhoria marginal no fluxo de trabalho de IA mais revisão. É um regime de custos diferente.

Resumo — Custo para Enviar uma Palavra Traduzida

Fluxo de trabalho Tradução Revisão Total Economia vs. humana
Tradução humana completa € 0,10–€ 0,20 incluída € 0,10–€ 0,20
DeepL + revisão humana ~€ 0 € 0,04–€ 0,08 € 0,04–€ 0,08 ~60%
PTC, sem revisão € 0,0012–€ 0,003 € 0 € 0,0012–€ 0,003 ~99%

As taxas de tradução humana são estimativas típicas da indústria para os principais pares de idiomas. Os preços do PTC são baseados nas taxas publicadas pelo WPML.


Uma nota sobre fazer a revisão você mesmo: quando o proprietário de uma empresa faz a revisão ele mesmo em vez de pagar um revisor, o custo não é zero — apenas é menos visível. As horas gastas na revisão são horas não gastas no restante do negócio e, a qualquer taxa horária razoável, o custo implícito costuma ser maior do que o que um revisor terceirizado cobraria, não menor. A economia do PTC se aplica independentemente de quem está pagando pela etapa de revisão hoje.

O que isso possibilita. Quando a tradução custa € 0,10+ por palavra, você traduz seletivamente — a página inicial, as principais categorias de produtos, alguns posts de blog de alto tráfego. Todo o resto permanece no idioma de origem porque a conta não fecha. Quando a tradução custa € 0,002 por palavra e produz resultados melhores que a tradução humana típica, a conta fecha para conteúdos que antes não eram viáveis:

  • Tradução completa de catálogo no eCommerce — cada descrição de produto de cauda longa, cada variante.
  • Portais de documentação completos em todos os idiomas que um cliente possa falar, não apenas os três principais.
  • Bases de conhecimento, FAQs de suporte, arquivos de blog — a cauda longa que impulsiona a busca, mas que nunca justificou seu custo de tradução.
  • Conteúdo editorial localizado para editores que operam em mercados onde a receita de audiência por página não cobriria a tradução humana.

O conteúdo multilíngue tem sido uma questão de “o que podemos pagar para traduzir” por décadas. Com o PTC, a pergunta passa a ser “o que vale a pena traduzir” — que é uma questão diferente e muito mais interessante.

Como Obter Esta Qualidade em Seu Próprio Site

O PTC é o mecanismo padrão no modo Traduzir Tudo do WPML, que é uma configuração global única que traduz cada página do seu site, automaticamente, em segundo plano. Não há configuração por página para gerenciar.

Para obter a qualidade medida neste estudo, a única configuração necessária além de ativar o Traduzir Tudo é gastar cerca de um minuto descrevendo o público e o tom do seu site nas configurações do Traduzir Tudo — por exemplo, “uma empresa de software se dirigindo a desenvolvedores, tom formal, terminologia técnica preservada em inglês”. O PTC usa essa descrição para alinhar as traduções com a voz da sua marca.

Essa é toda a configuração. O resultado é o que este estudo mediu.

Uma Nota Sobre o Que Não Fizemos

Não comparamos o PTC ao Google Tradutor, Azure Translator ou serviços baseados em LLM através de suas APIs públicas. O motivo: esses mecanismos mudam com frequência e uma medição pontual ficaria obsoleta em meses. A comparação com o DeepL foi a que realizamos porque o DeepL é a referência mais citada para tradução por IA de nível de produção, e porque o DeepL é o que a maioria de nossos concorrentes usa internamente.

Também não medimos velocidade, custo ou experiência do desenvolvedor neste estudo — apenas qualidade. Essas comparações existem em nossa página de recursos e em nossas páginas de comparação, e elas contam sua própria história.

Experimente

Se você gerencia um site WordPress multilíngue e quer ver o resultado do PTC em seu próprio conteúdo, instale o WPML, ative o Traduzir Tudo e compare o resultado com o que você está usando hoje. A diferença de qualidade descrita aqui é a diferença de qualidade que você deve esperar ver.


Dúvidas sobre metodologia ou solicitações de dados: entre em contato com a equipe do WPML.

Estudo conduzido pela equipe de linguística do WPML, abril de 2026. Amostra: 227 páginas da web traduzidas pelo DeepL revisadas por linguistas nativos; 73 delas retraduzidas com a versão atual do PTC e pontuadas novamente em teste cego contra o mesmo conteúdo de origem. Idiomas: árabe, inglês, francês, alemão, italiano, espanhol. Pontuação: estrutura de Qualidade de Tradução baseada em MQM, 9 dimensões, 1–10 por dimensão, com média e escala para um resultado de 0–100.