WPML의 Private Translation Cloud (PTC)는 독립적인 번역 검토에서 100점 만점에 90.0점을 기록했습니다. 가장 강력한 주류 AI 번역 엔진으로 널리 알려진 DeepL은 동일한 콘텐츠에서 77.7점을 기록했습니다. PTC는 DeepL을 전체적으로 12.3점 앞섰으며, 당사 언어학자들이 평가한 9가지 품질 차원 모두에서 우위를 차지했고, 페이지당 오류를 약 18배 감소시켰습니다.
한눈에 보기
| 측정 항목 |
|
|
|---|---|---|
| 평균 번역 품질 점수 (0–100) | 77.7 | 90.0 |
| 번역된 페이지당 평균 문제점 | 1.27 | 0.07 |
| PTC가 DeepL보다 높은 점수를 받은 품질 차원 | — | 9개 중 9개 |
| PTC가 DeepL보다 높은 점수를 받은 테스트 언어 | — | 6개 중 6개 (아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 스페인어) |
이 연구를 진행한 이유
DeepL은 대부분의 WordPress 및 소프트웨어 산업에서 AI 번역의 표준으로 여겨집니다. 고객들이 사람의 검토 없이 AI 번역 콘텐츠를 게시할 수 있는지 물을 때, DeepL은 대개 암묵적인 기준이 됩니다.
WPML은 ‘충분히 좋다’는 것으로는 만족할 수 없었기에 자체 AI 번역 엔진인 Private Translation Cloud (PTC)를 구축했습니다. PTC는 WPML의 ‘모든 항목 번역’ 모드의 기본 엔진이며, WPML을 실행하는 150만 개 이상의 사이트에서 자동 번역의 대부분을 담당합니다.
저희는 잠재 고객들이 매주 묻는 질문에 대한 측정 가능한 답변을 원했습니다. 즉, PTC가 DeepL과 실제로 어떻게 비교되는가? 이 연구가 바로 그 답변입니다. 위의 수치들은 헤드라인이며, 이 글의 나머지 부분에서는 이 수치들이 어떻게 도출되었고 실제 운영 사이트에 어떤 의미를 가지는지 설명합니다.
측정 대상 및 방법
저희는 WPML의 언어학 팀이 현재 진행 중인 PTC 클라이언트 사이트 검토에 사용하는 것과 동일한 프레임워크인 MQM(다차원 품질 측정)을 기반으로 한 시스템을 사용하여 번역 품질을 평가했습니다. 모든 번역된 페이지는 9가지 차원에서 평가됩니다.
- 문법 — 문법적 오류가 있었습니까?
- 의미 — 원문의 의미가 보존되었습니까?
- 자연스러움 — 원어민에게 자연스럽고 관용적인 표현입니까?
- 어조 — 원문의 어조가 잘 반영되었습니까?
- 격식 — 독자를 대하는 방식과 문법적 경어체 모두에서 올바른 격식이 사용되었습니까?
- 용어 — 올바른 용어가 사용되었습니까?
- 일관성 — 페이지 전체에 용어가 일관되게 적용되었습니까?
- 대소문자 — 대상 언어의 규칙이 준수되었습니까?
- 숫자, 단위 및 날짜 현지화 — 대상 언어의 규칙이 준수되었습니까?
각 차원은 대상 언어의 원어민인 언어학자가 1-10점으로 평가합니다. 최종 페이지당 점수는 9가지 차원의 평균에 10을 곱하여 1-100점 척도로 변환되며, 이는 일반적인 품질 등급에 매핑됩니다.
| 점수 | 의미 |
|---|---|
| 90–100 | 매우 좋음에서 완벽함 — 검토 없이 게시 가능 |
| 80–89 | 좋음 — 대부분의 상황에서 게시 가능 |
| 70–79 | 허용 가능에서 보통 — 사용 가능하지만 오류가 눈에 띔 |
| 60–69 | 보통 — 게시 전 수정 필요 |
| 50–59 | 비원어민에게도 명백한 오류 |
| 50 미만 | 재작업이 필요할 정도로 심각한 결함 |
참고로, 일반적인 사람 번역의 공개된 평균은 약 76점입니다. DeepL의 77.7점은 그 선을 약간 웃돕니다. PTC의 90.0점은 ‘매우 좋음 — 검토 없이 게시 가능’ 등급의 경계에 있습니다.
표본 크기 및 선정
DeepL을 평가하기 위해 지난 12개월 동안 DeepL로 번역된 800개의 무작위 사이트를 선정하여 사이트 연령, 콘텐츠 양, 번역 활동별로 분류하고 각 분류에서 표본을 추출했습니다. 그런 다음 언어학자들이 샘플링된 사이트의 주요 페이지를 수동으로 검토했습니다. 총 227개의 웹페이지가 아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 스페인어로 평가되었습니다.
DeepL과 PTC를 직접 비교하기 위해, 이 페이지들 중 73개를 PTC로 재번역하고 동일한 언어학자들이 동일한 원문 콘텐츠를 사용하여 블라인드 방식으로 재평가했습니다. PTC 샘플이 DeepL 샘플보다 작은 이유는 각 PTC 측정값이 특정 PTC 버전을 반영하며, 엔진이 계속 발전하고 있기 때문입니다. 아래 ‘아직 끝나지 않았습니다’ 섹션을 참조하십시오.
언어별: PTC가 모든 쌍에서 승리
총점도 흥미롭지만, 언어별 결과는 다국어 콘텐츠 팀이 무엇을 기대해야 하는지를 알려줍니다.
언어별 TQ 점수

PTC는 테스트한 모든 언어 쌍에서 DeepL보다 높은 점수를 기록했습니다. 가장 큰 격차는 아랍어(+22.4점)에서 나타났는데, DeepL이 역사적으로 저조한 성과를 보였고 WPML의 RTL 언어 품질 투자가 명확하게 드러나는 부분입니다. 다음으로는 독일어(+11.5점)와 프랑스어(+9.9점)가 뒤를 이었습니다. 가장 좁은 격차는 영어(+6.0점)였지만, 이 경우에도 PTC는 페이지를 ‘허용 가능하지만 눈에 띄게 불완전한’ 상태에서 게시 가능한 수준으로 끌어올렸습니다.
분산 또한 중요합니다. DeepL의 분포는 아랍어에서 긴 하위 꼬리를 가지며, 개별 페이지는 평균보다 훨씬 낮은 점수를 기록했습니다. 이는 독일어나 프랑스어 사용자가 ‘엉망’이라고 생각할 만한 페이지들입니다. PTC의 분포는 더 좁고 더 높은 곳에 집중되어 있어, 콘텐츠 팀이 예상되는 품질 범위 내에서 계획을 세울 수 있으며, 예외적인 상황에 대한 예산을 책정할 필요가 없습니다.
PTC는 또한 문법, 의미, 자연스러움, 어조, 격식, 용어, 일관성, 대소문자, 지역 규칙 등 저희가 평가하는 9가지 품질 차원 모두에서 DeepL을 능가합니다. 가장 큰 개선은 실제 웹사이트에서 사람이 페이지를 읽을 때 가장 중요한 차원인 용어(+1.5), 문법(+1.4), 자연스러움(+1.4), 그리고 숫자/단위/날짜 현지화(+1.4)에서 나타났습니다. DeepL이 따라잡는 차원도, PTC가 겨우 앞서는 차원도 없습니다.
오류율: 운영적 관점
평균 점수도 유용하지만, 실제 사이트를 운영하는 사람에게는 오류 수가 더 유용합니다. 저희 검토자들은 각 페이지에서 발견한 모든 명확한 문제점(문법, 의미, 용어 등)을 기록했습니다.
페이지당 평균 문제점

DeepL은 평균 페이지당 1.27개의 문제점을 생성합니다. PTC는 0.07개를 생성하여 동일한 원문 콘텐츠에서 페이지당 오류를 약 18배 감소시킵니다.
200페이지 사이트의 경우, 이는 대략 다음과 같이 해석됩니다.
- DeepL: 게시 전 찾아내고 결정하고 수정해야 할 약 254개의 문제점.
- PTC: 전체 사이트에 걸쳐 약 14개의 문제점.
이는 AI 번역이 초안으로서의 역할과 워크플로우로서의 역할 간의 차이입니다. DeepL은 강력한 초안이지만, 모든 페이지에는 게시 전에 발견해야 할 문제점이 여전히 존재합니다. 이 측정에서 PTC는 워크플로우입니다. 오류 수가 충분히 낮아서 대부분의 콘텐츠에 대해 사람의 검토 단계가 필수가 아닌 선택 사항이 됩니다.
‘좋은 번역’의 실제 의미
MQM 프레임워크의 등급 설명은 AI 번역을 둘러싼 마케팅 용어에 대한 유용한 균형추 역할을 합니다. ‘9/10’ 페이지는 90% 페이지가 아닙니다. 원어민이 주의 깊게 읽었을 때 변경하고 싶은 것이 없는 페이지입니다. ‘7/10’ 페이지는 있는 그대로 허용 가능하지만 눈에 띄게 불완전합니다. ‘5/10’ 페이지는 비원어민도 오류를 발견할 수 있는 페이지입니다.
DeepL의 평균은 70점대 후반에 머물러 있습니다. 이는 허용 가능하지만, 주의 깊은 원어민 독자에게는 눈에 띄게 불완전합니다. PTC의 평균은 90.0점으로, ‘매우 좋음 — 검토 없이 게시 가능’의 경계에 있습니다. 이것이 저희 검토자들이 측정한 품질 차이입니다. 이는 실제적인 차이로 이어집니다. DeepL의 결과물은 게시 전에 사람의 검토가 필요한 시작점인 반면, PTC의 결과물은 대부분의 경우 그 자체가 게시물입니다.
WPML이 이러한 품질을 생산할 수 있는 이유
‘우리가 자체 AI 엔진을 구축했다’는 주장은 현재 많은 기업들이 하고 있다는 것을 알고 있습니다. PTC는 두 가지 특정 이유로 인해 특별합니다.
규모와 지속적인 검토. WPML은 10년 이상 150만 개 이상의 사이트를 지원해 왔습니다. WPML의 언어학 팀은 PTC의 번역 품질을 지속적으로 검토합니다. 결과물을 샘플링하고, 이 연구에서 사용된 것과 동일한 MQM 프레임워크로 평가하며, 특정 용어, 언어 쌍 또는 콘텐츠 유형에 대해 엔진이 지속적으로 낮은 품질의 결과를 생성하는 패턴을 주시합니다.
집중. PTC는 WPML의 부수적인 프로젝트가 아닙니다. 전담 팀(엔지니어, MLOps, 인간 언어학자)이 있습니다. 언어학자들이 반복되는 패턴을 발견하면, 엔지니어링 팀은 이를 버그로 처리합니다. 용어집 확장, 격식 모델 조정, 예외 추가, 수정 배포 등입니다. 이 루프는 지속적으로 실행되며, 이것이 PTC의 품질이 지난 12개월 동안 ‘평균적인 사람 번역만큼 좋음’에서 이 연구의 수치로 개선된 이유입니다.
의미 있는 규모의 지속적인 사람 검토와 각 발견 사항을 엔지니어링 티켓으로 처리하는 팀의 조합이 위와 같은 품질 수치를 만들어냅니다. 이는 모델 아키텍처가 아니라 운영 모델입니다.
아직 끝나지 않았습니다
90.0점은 PTC를 ‘매우 좋음 — 검토 없이 게시 가능’의 경계에 놓습니다. 이 결과에 만족하지만, 이것이 한계라고 생각하지 않습니다.
위에 설명된 QA → 엔지니어링 루프는 여전히 실행 중입니다. WPML의 언어학 팀은 고객이 실제 사이트에서 PTC의 결과물에 적용하는 편집 내용을 계속 분석하고, 이러한 편집이 드러내는 패턴을 식별하며, 엔지니어링 팀은 수정 사항(용어집 확장, 격식 조정, 언어 쌍별 미세 조정)을 배포합니다. 다음 측정에서는 이보다 더 높은 수치를 기대합니다.
이것이 귀하의 워크플로우에 미치는 영향
기존의 다국어 콘텐츠 워크플로우는 번역 → 검토 → 게시입니다. 검토 단계는 모든 AI 엔진과 대부분의 인간 번역가가 게시 전에 두 번째 눈이 필요한 작업을 생성하기 때문에 존재합니다. 이 검토 단계는 또한 다국어 콘텐츠에서 대부분의 비용과 지연이 발생하는 지점입니다.
DeepL의 경우 검토 단계가 필수적입니다. 페이지당 1.27개의 문제점은 어딘가에서 발견되어야 합니다. 팀이 발견하지 못하면 고객이 발견할 것입니다. PTC의 경우 대부분의 콘텐츠에 대해 검토 단계가 선택 사항입니다. 일부 팀은 여전히 중요한 페이지나 규제 산업을 위해 검토하지만, 기본 워크플로우는 번역 → 게시가 되며, 검토는 실제로 필요한 경우에만 예약됩니다.
이것이 수치들이 설명하는 운영상의 차이입니다. 결코 작은 차이가 아닙니다.
이것이 귀하의 비용에 미치는 영향
번역 비용은 두 가지입니다. 번역을 생성하는 비용과 이를 검토하는 비용입니다. 콘텐츠가 게시되기 전에 둘 다 지불해야 합니다.
대부분의 전문적인 맥락에서 사람 검토 비용은 단어당 몇 센트입니다. 검토자가 단어당, 페이지당 또는 사이트당 요금을 청구하든 대략 이 정도의 비용이 발생합니다. 완전한 사람 번역(번역 후 두 번째 사람이 검토)은 주요 언어 쌍의 경우 일반적으로 단어당 €0.10–€0.20 정도이며, 검토 부분만 €0.04–€0.08 범위에 있습니다.
각 워크플로우의 실제 비용은 다음과 같습니다.
사람 번역만 — 기준선. 단어당 약 €0.10–€0.20. 두 단계 모두 사람이 수행합니다.
DeepL (또는 모든 AI 엔진) + 사람 검토. AI가 번역 단계를 처리하지만, 페이지당 1.27개의 문제점이 아무도 발견하지 못하면 고객에게 도달할 것이므로 사람이 모든 페이지를 검토해야 합니다. 번역 단계는 본질적으로 무료이며, 검토 단계는 여전히 단어당 €0.04–€0.08의 비용이 듭니다. 사람 번역만 사용하는 경우 대비 총 절감액: 약 60%. 이것이 표준적인 ‘AI가 번역 비용을 절감해 준다’는 주장이며, 사실입니다. 하지만 DeepL의 품질이 여전히 요구하는 검토 단계에서 비용 상한선이 발생합니다.
PTC, 검토 불필요. PTC는 단어당 €0.0012–€0.003의 비용이 듭니다. 이는 볼륨에 따라 1,000크레딧당 €0.30–€0.75에 4크레딧을 곱한 것이며, 매월 첫 2,000크레딧은 무료입니다. (전체 요금표는 WPML의 자동 번역 가격을 참조하십시오.) PTC의 측정된 품질(90.0 TQ 점수, 페이지당 0.07개 문제점, 동일한 원문 콘텐츠에서 DeepL보다 12.3점 높은 격차)이 대부분의 경우 검토 단계를 건너뛸 수 있을 만큼 충분히 높기 때문에 검토 비용은 0이 됩니다. 사람 번역만 사용하는 경우 대비 총 절감액: 약 99%.
이는 AI+검토 워크플로우에 대한 미미한 개선이 아닙니다. 이는 다른 비용 체계입니다.
한눈에 보기 — 번역된 단어 게시 비용
| 워크플로우 | 번역 | 검토 | 총계 | 사람 번역 대비 절감액 |
|---|---|---|---|---|
| 완전한 사람 번역 | €0.10–€0.20 | 포함 | €0.10–€0.20 | — |
| DeepL + 사람 검토 | ~€0 | €0.04–€0.08 | €0.04–€0.08 | ~60% |
| PTC, 검토 불필요 | €0.0012–€0.003 | €0 | €0.0012–€0.003 | ~99% |
사람 번역 요율은 주요 언어 쌍에 대한 일반적인 업계 추정치입니다. PTC 가격은 WPML의 공개 요율을 기준으로 합니다.
직접 검토하는 것에 대한 참고 사항: 사업주가 검토자를 고용하는 대신 직접 검토할 경우 비용이 0이 되는 것은 아닙니다. 단지 덜 눈에 띌 뿐입니다. 검토에 소요된 시간은 다른 사업에 소요되지 않은 시간이며, 합리적인 시간당 요율을 적용하면 암묵적인 비용은 대개 외부 검토자가 청구하는 비용보다 낮지 않고 더 높습니다. PTC의 절감 효과는 오늘날 누가 검토 비용을 지불하는지와 관계없이 적용됩니다.
이것이 열어주는 가능성. 번역 비용이 단어당 €0.10 이상일 때는 선택적으로 번역합니다. 홈페이지, 주요 제품 카테고리, 소수의 인기 블로그 게시물 등입니다. 다른 모든 것은 비용이 맞지 않기 때문에 원문 언어로 유지됩니다. 번역 비용이 단어당 €0.002이고 일반적인 사람 번역보다 더 나은 결과물을 생성할 때는 이전에는 불가능했던 콘텐츠에 대해서도 비용이 맞습니다.
- 전자상거래의 전체 카탈로그 번역 — 모든 롱테일 제품 설명, 모든 변형.
- 고객이 사용할 수 있는 모든 언어로 된 완전한 문서 포털, 상위 3개 언어뿐만 아니라.
- 지식 기반, 지원 FAQ, 블로그 아카이브 — 검색을 유도하지만 번역 비용을 정당화하지 못했던 롱테일 콘텐츠.
- 페이지당 독자 수익이 사람 번역 비용을 감당할 수 없는 시장에서 운영되는 출판사를 위한 현지화된 편집 콘텐츠.
다국어 콘텐츠는 수십 년 동안 ‘무엇을 번역할 여유가 있는가’라는 질문이었습니다. PTC를 사용하면 질문은 ‘무엇을 번역할 가치가 있는가’로 바뀌는데, 이는 다르고 더 흥미로운 질문입니다.
귀하의 사이트에서 이 품질을 얻는 방법
PTC는 WPML의 모든 항목 번역 모드의 기본 엔진이며, 이는 사이트의 모든 페이지를 자동으로 백그라운드에서 번역하는 단일 전역 설정입니다. 페이지별로 구성할 필요가 없습니다.
이 연구에서 측정된 품질을 얻으려면, ‘모든 항목 번역’을 켜는 것 외에 필요한 설정은 ‘모든 항목 번역’ 설정에서 사이트의 대상 고객과 어조를 설명하는 데 약 1분 정도를 할애하는 것입니다. 예를 들어, “개발자를 대상으로 하는 소프트웨어 회사, 격식 있는 어조, 기술 용어는 영어로 보존”과 같이 설명할 수 있습니다. PTC는 이 설명을 사용하여 번역을 귀하의 브랜드 보이스에 맞춥니다.
이것이 모든 설정입니다. 그 결과가 이 연구에서 측정된 것입니다.
저희가 하지 않은 것에 대한 참고 사항
저희는 PTC를 Google 번역, Azure Translator 또는 공개 API를 통한 LLM 기반 서비스와 비교하지 않았습니다. 그 이유는 이러한 엔진은 자주 변경되며 단일 시점 측정은 몇 달 내에 구식이 될 것이기 때문입니다. DeepL 비교를 수행한 이유는 DeepL이 상용 AI 번역의 가장 많이 인용되는 벤치마크이며, 대부분의 경쟁사들이 내부적으로 DeepL을 사용하기 때문입니다.
또한 이 연구에서는 속도, 비용 또는 개발자 경험은 측정하지 않았습니다. 오직 품질만 측정했습니다. 이러한 비교는 저희 기능 페이지와 비교 페이지에 있으며, 그 자체로 이야기를 들려줍니다.
지금 사용해 보세요
다국어 WordPress 사이트를 운영하고 있고 귀하의 콘텐츠에 대한 PTC의 결과물을 보고 싶다면, WPML을 설치하고 ‘모든 항목 번역’을 활성화한 다음, 현재 사용 중인 것과 결과를 비교해 보십시오. 여기에 설명된 품질 차이가 귀하가 기대해야 할 품질 차이입니다.
방법론 질문 또는 데이터 요청: WPML 팀에 문의하십시오.
WPML 언어학 팀이 2026년 4월에 수행한 연구. 샘플: 원어민 언어학자가 검토한 DeepL 번역 웹페이지 227개; 이 중 73개는 현재 PTC 버전으로 재번역되어 동일한 원문 콘텐츠에 대해 블라인드 방식으로 재평가됨. 언어: 아랍어, 영어, 프랑스어, 독일어, 이탈리아어, 스페인어. 평가: MQM 기반 번역 품질 프레임워크, 9가지 차원, 차원당 1–10점, 평균 및 0–100점 결과로 스케일링.