La Private Translation Cloud (PTC) de WPML obtiene 90,0 sobre 100 en una revisión independiente de traducción. DeepL —ampliamente considerada como el motor de traducción con IA generalista más potente— obtiene 77,7 con el mismo contenido. PTC supera a DeepL en 12,3 puntos en total, gana en cada una de las nueve dimensiones de calidad que puntuaron nuestros lingüistas y produce aproximadamente una reducción de errores por página de 18×.
De un vistazo
| Métrica |
|
|
|---|---|---|
| Puntuación media de calidad de traducción (0–100) | 77.7 | 90.0 |
| Incidencias medias por página traducida | 1.27 | 0.07 |
| Dimensiones de calidad en las que PTC obtuvo una puntuación superior a DeepL | — | 9 de 9 |
| Idiomas probados en los que PTC obtuvo una puntuación superior a DeepL | — | 6 de 6 (árabe, inglés, francés, alemán, italiano, español) |
Por qué realizamos este estudio
La mayoría de las industrias de WordPress y del software tratan a DeepL como el estándar de referencia para la traducción con IA. Cuando los clientes preguntan si pueden publicar contenido traducido con IA sin revisión humana, DeepL suele ser el punto de referencia implícito.
WPML creó su propio motor de traducción con IA —la Private Translation Cloud (PTC)— porque “suficientemente bueno” no lo era. PTC es el motor predeterminado dentro del modo Traducir todo de WPML y impulsa la mayor parte de la traducción automática en los más de 1,5 millones de sitios que usan WPML.
Queríamos una respuesta medible a una pregunta que los posibles clientes nos hacen cada semana: ¿cómo se compara realmente PTC con DeepL? Este estudio es esa respuesta. Las cifras anteriores son el titular; el resto de este artículo explica cómo se obtuvieron y qué significan para un sitio real en producción.
Qué medimos y cómo
Puntuamos la calidad de la traducción con un sistema basado en MQM (Multidimensional Quality Metrics), el mismo marco que utiliza el equipo de lingüística de WPML para las revisiones continuas de PTC en sitios de clientes. Cada página traducida se puntúa en nueve dimensiones:
- Gramática — ¿había errores gramaticales?
- Significado — ¿se conservó el significado del original?
- Naturalidad — ¿suena natural e idiomático para un hablante nativo?
- Tono — ¿se captó el tono del original?
- Formalidad — ¿se utilizó el registro adecuado, tanto al dirigirse al lector como en las formas gramaticales de tratamiento?
- Terminología — ¿se utilizó la terminología correcta?
- Coherencia — ¿se aplicó la terminología de forma coherente en toda la página?
- Uso de mayúsculas — ¿se siguieron las convenciones del idioma de destino?
- Localización de números, unidades y fechas — ¿se siguieron las convenciones del idioma de destino?
Cada dimensión se puntúa de 1 a 10 por un lingüista humano que es hablante nativo del idioma de destino. La puntuación final por página es la media de las nueve dimensiones, multiplicada por diez, lo que da una escala de 1 a 100 que se corresponde con bandas de calidad en lenguaje sencillo:
| Puntuación | Qué significa |
|---|---|
| 90–100 | Muy buena a perfecta — lista para publicar sin revisión |
| 80–89 | Buena — lista para publicar en la mayoría de contextos |
| 70–79 | Aceptable a mediocre — utilizable, pero los errores son visibles |
| 60–69 | Mediocre — necesita retoques antes de publicar |
| 50–59 | Errores evidentes para hablantes no nativos |
| Por debajo de 50 | Defectos lo bastante importantes como para requerir retrabajo |
Como referencia: la media publicada para la traducción humana genérica se sitúa en torno a 76. El 77,7 de DeepL la coloca justo por encima de esa línea. El 90,0 de PTC la sitúa justo en el límite de la banda “muy buena — lista para publicar sin revisión”.
Tamaño y selección de la muestra
Para evaluar DeepL, tomamos 800 sitios aleatorios traducidos con DeepL en los últimos 12 meses, los agrupamos por antigüedad del sitio, volumen de contenido y actividad de traducción, y muestreamos entre los grupos. Después, nuestros lingüistas revisaron manualmente las páginas principales de los sitios muestreados: 227 páginas web en total, evaluadas en árabe, inglés, francés, alemán, italiano y español.
Para comparar DeepL y PTC cara a cara, volvimos a traducir 73 de esas mismas páginas con PTC y las volvimos a puntuar a ciegas, con los mismos lingüistas trabajando a partir del mismo contenido de origen. La muestra de PTC es más pequeña que la de DeepL porque cada medición de PTC refleja una versión específica de PTC, y el motor sigue evolucionando — consulte la sección Aún no hemos terminado más abajo.
Por idioma: PTC gana en cada comparación
Las puntuaciones agregadas son interesantes; la visión por idioma es la que indica a un equipo de contenido multilingüe qué puede esperar.
Puntuaciones de TQ por idioma

PTC obtiene una puntuación superior a DeepL en cada par de idiomas que probamos. La mayor diferencia se da en árabe (+22,4 puntos), donde DeepL históricamente ha rendido por debajo y donde la inversión de WPML en la calidad de idiomas RTL se aprecia claramente. Alemán (+11,5) y francés (+9,9) vienen después. La diferencia más estrecha es en inglés (+6,0 puntos) y, aun así, PTC mueve la página de “aceptable, visiblemente imperfecta” a la banda lista para publicar.
La variación también importa. La distribución de DeepL tiene una cola inferior larga en árabe, con páginas individuales que puntúan muy por debajo de la media: páginas que un usuario alemán o francés consideraría rotas. Las distribuciones de PTC son más estrechas y están centradas en valores más altos, de modo que un equipo de contenido puede planificar en torno a una banda de calidad esperada en lugar de presupuestar para valores atípicos.
PTC también supera a DeepL en cada una de las nueve dimensiones de calidad que puntuamos: gramática, significado, naturalidad, tono, formalidad, terminología, coherencia, uso de mayúsculas y convenciones regionales. Las mayores mejoras se dan en las dimensiones que más importan para una persona que lee una página en un sitio web real: terminología (+1,5), gramática (+1,4), naturalidad (+1,4) y localización de números/unidades/fechas (+1,4). No hay ninguna dimensión en la que DeepL se mantenga al nivel, ni ninguna en la que PTC solo se imponga por poco.
Tasa de errores: la visión operativa
Las puntuaciones medias son útiles; el recuento de errores es más útil para cualquiera que gestione un sitio real. Nuestros revisores registraron cada incidencia distinta que identificaron en cada página: gramática, significado, terminología, todo.
Incidencias medias por página

DeepL produce una media de 1,27 incidencias por página. PTC produce 0,07, aproximadamente una reducción de errores por página de 18× con el mismo contenido de origen.
En un sitio de 200 páginas, eso se traduce aproximadamente en:
- DeepL: ~254 incidencias que encontrar, decidir y corregir antes de publicar.
- PTC: ~14 incidencias en todo el sitio.
Esa es la diferencia entre la traducción con IA como primer borrador y la traducción con IA como flujo de trabajo. DeepL es un buen primer borrador: cada página sigue teniendo incidencias que detectar antes de publicarse. PTC, en esta medición, es un flujo de trabajo: el recuento de errores es lo bastante bajo como para que el paso de revisión humana pase a ser opcional para la mayor parte del contenido, en lugar de obligatorio para todo.
Qué significa realmente una “buena traducción”
Las descripciones de calificación del marco MQM son un contrapeso útil al lenguaje de marketing que rodea a la traducción con IA. Una página “9/10” no es una página del 90 %; es una página en la que un hablante nativo, leyendo con atención, no encuentra nada que quisiera cambiar. Una página “7/10” es aceptable tal cual, pero visiblemente imperfecta. Una página “5/10” es aquella en la que un hablante no nativo puede detectar errores.
La media de DeepL se sitúa en la parte alta de los 7: aceptable, pero visiblemente imperfecta para un nativo que lea con atención. La media de PTC se sitúa en 90,0, justo en el límite de “muy buena — lista para publicar sin revisión”. Esa es la diferencia de calidad que midieron nuestros revisores. Se traduce en una distinción real: la salida de DeepL es un punto de partida que requiere revisión humana antes de publicar; la salida de PTC es, en la mayoría de los casos, la propia publicación.
Por qué WPML puede ofrecer esta calidad
Somos conscientes de que “hemos creado nuestro propio motor de IA” es una afirmación que muchas empresas hacen ahora mismo. PTC es inusual por dos motivos concretos.
Escala y revisión continua. WPML da servicio a más de 1,5 millones de sitios desde hace más de una década. El equipo de lingüística de WPML revisa continuamente la calidad de traducción de PTC: muestrea la salida, la puntúa con el mismo marco MQM utilizado en este estudio y busca patrones en los que el motor produzca de forma sistemática resultados de menor calidad para un término, un par de idiomas o un tipo de contenido concretos.
Enfoque. PTC no es un proyecto secundario en WPML. Cuenta con un equipo dedicado: ingenieros, MLOps y lingüistas humanos. Cuando los lingüistas señalan un patrón recurrente, el equipo de ingeniería lo trata como un error: amplía el glosario, ajusta el modelo de formalidad, añade una excepción y publica la corrección. Este ciclo funciona de forma continua, y por eso la calidad de PTC ha mejorado en los últimos 12 meses, pasando de “tan buena como la traducción humana media” a las cifras de este estudio.
La combinación —revisión humana continua a una escala significativa, junto con un equipo que responde a cada hallazgo como un ticket de ingeniería— es lo que produce las cifras de calidad anteriores. No es la arquitectura del modelo; es el modelo operativo.
Aún no hemos terminado
El 90,0 sitúa a PTC justo en el límite de “muy buena — lista para publicar sin revisión”. Estamos satisfechos con ese resultado. No creemos que sea el techo.
El ciclo de QA → ingeniería descrito anteriormente sigue en marcha. El equipo de lingüística de WPML continúa analizando las ediciones que los clientes hacen a la salida de PTC en sitios reales, identifica los patrones que revelan esas ediciones y el equipo de ingeniería publica las correcciones: ampliaciones del glosario, ajustes de formalidad, retoques específicos por par de idiomas. Esperamos que la próxima medición sea superior a esta.
Qué significa esto para su flujo de trabajo
El flujo de trabajo convencional de contenido multilingüe es traducir → revisar → publicar. El paso de revisión existe porque todos los motores de IA —y la mayoría de los traductores humanos— producen trabajo que necesita una segunda revisión antes de publicarse. Ese paso de revisión es también donde se concentra la mayor parte del coste y de la latencia del contenido multilingüe.
Con DeepL, el paso de revisión es necesario. Las 1,27 incidencias por página tienen que detectarse en algún punto; si el equipo no las detecta, lo harán los clientes. Con PTC, el paso de revisión es opcional para la mayor parte del contenido. Algunos equipos siguen revisando —para páginas de alto impacto o sectores regulados—, pero el flujo de trabajo predeterminado pasa a ser traducir → publicar, reservando la revisión para los casos que realmente la necesitan.
Esa es la diferencia operativa que describen las cifras. No es pequeña.
Qué significa esto para sus costes
El coste de traducción son dos cosas: el coste de producir la traducción y el coste de revisarla. Ambos deben pagarse antes de que el contenido se publique.
En la mayoría de contextos profesionales, la revisión humana cuesta unos pocos céntimos por palabra; tanto si los revisores cobran por palabra, por página o por sitio, las cuentas suelen salir por ahí. La traducción humana completa (traducir y luego revisar por una segunda persona) suele situarse en torno a 0,10–0,20 € por palabra para los principales pares de idiomas, y la parte de revisión por sí sola en el rango de 0,04–0,08 €.
Esto es lo que cuesta realmente cada flujo de trabajo en esos términos.
Solo traducción humana — la referencia. En torno a 0,10–0,20 € por palabra. Ambos pasos son humanos.
DeepL (o cualquier motor de IA) más revisión humana. La IA se encarga del paso de traducción; una persona aún tiene que revisar cada página, porque con 1,27 incidencias por página, las incidencias llegarán a los clientes si nadie las detecta antes. El paso de traducción es esencialmente gratuito; el paso de revisión sigue costando 0,04–0,08 € por palabra. Ahorro total frente a solo humanos: alrededor del 60 %. Este es el argumento estándar de “la IA le ahorra dinero en traducción”, y es cierto, pero el techo de coste está en el paso de revisión que la calidad de DeepL sigue requiriendo.
PTC, sin necesidad de revisión. PTC cuesta 0,0012–0,003 € por palabra: 4 créditos por palabra multiplicados por 0,30–0,75 € por 1.000 créditos según el volumen, con los primeros 2.000 créditos al mes gratis. (Consulte los precios de traducción automática de WPML para ver la tabla completa de niveles). Como la calidad medida de PTC (puntuación TQ de 90,0, 0,07 incidencias por página, diferencia de +12,3 puntos sobre DeepL con el mismo contenido de origen) es lo bastante alta como para omitir el paso de revisión en la mayoría de los casos, el coste de revisión pasa a cero. Ahorro total frente a solo humanos: aproximadamente el 99 %.
No es una mejora marginal del flujo de trabajo de IA más revisión. Es un régimen de costes distinto.
De un vistazo — coste de publicar una palabra traducida
| Flujo de trabajo | Traducción | Revisión | Total | Ahorro vs. humano |
|---|---|---|---|---|
| Traducción humana completa | 0,10–0,20 € | incluida | 0,10–0,20 € | — |
| DeepL + revisión humana | ~0 € | 0,04–0,08 € | 0,04–0,08 € | ~60% |
| PTC, sin revisión | 0,0012–0,003 € | 0 € | 0,0012–0,003 € | ~99% |
Las tarifas de traducción humana son estimaciones típicas del sector para los principales pares de idiomas. Los precios de PTC proceden de las tarifas publicadas de WPML.
Una nota sobre hacer la revisión usted mismo: cuando el propietario de un negocio hace la revisión por su cuenta en lugar de pagar a un revisor, el coste no es cero; simplemente es menos visible. Las horas dedicadas a revisar son horas que no se dedican al resto del negocio y, con cualquier tarifa horaria razonable, el coste implícito suele ser mayor que lo que cobraría un revisor externo, no menor. El ahorro de PTC se aplica independientemente de quién esté pagando hoy el paso de revisión.
Lo que esto permite. Cuando traducir cuesta más de 0,10 € por palabra, se traduce de forma selectiva: la página de inicio, las principales categorías de productos, un puñado de entradas del blog con mucho tráfico. Todo lo demás se queda en el idioma de origen porque las cuentas no salen. Cuando traducir cuesta 0,002 € por palabra y produce una salida mejor que la traducción humana típica, las cuentas sí salen para contenido que antes no era viable:
- Traducción completa del catálogo en eCommerce: cada descripción de producto de cola larga, cada variante.
- Portales de documentación completos en todos los idiomas que un cliente pueda hablar, no solo en los tres principales.
- Bases de conocimiento, preguntas frecuentes de soporte, archivos del blog: la cola larga que impulsa la búsqueda, pero nunca justificó su coste de traducción.
- Contenido editorial localizado para editores que operan en mercados donde los ingresos por audiencia y página no podían cubrir la traducción humana.
Durante décadas, el contenido multilingüe ha sido una cuestión de “qué podemos permitirnos traducir”. Con PTC, la pregunta pasa a ser “qué merece la pena traducir”, que es distinta y más interesante.
Cómo obtener esta calidad en su propio sitio
PTC es el motor predeterminado en el modo Traducir todo de WPML, que es un único ajuste global que traduce todas las páginas de su sitio, automáticamente y en segundo plano. No hay ninguna configuración por página que gestionar.
Para obtener la calidad medida en este estudio, la única configuración que necesita, además de activar Traducir todo, es dedicar alrededor de un minuto a describir la audiencia y el tono de su sitio en los ajustes de Traducir todo; por ejemplo: “una empresa de software que se dirige a desarrolladores, tono formal, terminología técnica conservada en inglés”. PTC utiliza esa descripción para alinear las traducciones con la voz de su marca.
Eso es toda la configuración. El resultado es lo que midió este estudio.
Una nota sobre lo que no hicimos
No comparamos PTC con Google Translate, Azure Translator ni servicios basados en LLM a través de sus API públicas. El motivo: esos motores cambian con frecuencia y una medición puntual quedaría obsoleta en cuestión de meses. La comparación con DeepL es la que realizamos porque DeepL es el punto de referencia más citado para la traducción con IA de nivel de producción y porque DeepL es lo que la mayoría de nuestros competidores utiliza internamente.
Tampoco medimos la velocidad, el coste ni la experiencia para desarrolladores en este estudio: solo la calidad. Esas comparaciones existen en nuestra página de funcionalidades y en nuestras páginas de comparación, y cuentan su propia historia.
Pruébelo
Si gestiona un sitio WordPress multilingüe y quiere ver la salida de PTC con su propio contenido, instale WPML, active Traducir todo y compare el resultado con lo que esté usando hoy. La diferencia de calidad descrita aquí es la diferencia de calidad que debería esperar ver.
Preguntas sobre la metodología o solicitudes de datos: póngase en contacto con el equipo de WPML.
Estudio realizado por el equipo de lingüística de WPML, abril de 2026. Muestra: 227 páginas web traducidas con DeepL revisadas por lingüistas nativos; 73 de ellas se volvieron a traducir con la versión actual de PTC y se volvieron a puntuar a ciegas frente al mismo contenido de origen. Idiomas: árabe, inglés, francés, alemán, italiano, español. Puntuación: marco de calidad de traducción basado en MQM, 9 dimensiones, 1–10 por dimensión, promediado y escalado a un resultado de 0–100.