Chuyển đến nội dung Chuyển đến thanh bên

Private Translation Cloud (PTC) của WPML đạt 90,0 trên 100 điểm trong đánh giá dịch thuật độc lập. DeepL — vốn được coi là công cụ dịch thuật AI phổ biến mạnh mẽ nhất — đạt 77,7 điểm trên cùng một nội dung. PTC vượt trội hơn DeepL tổng cộng 12,3 điểm, giành chiến thắng ở mọi khía cạnh trong số chín khía cạnh chất lượng mà các chuyên gia ngôn ngữ của chúng tôi đã chấm điểm, và giúp giảm khoảng 18 lần số lỗi trên mỗi trang.

Cái nhìn tổng quan

Chỉ số Logo DeepL DeepL Logo PTC PTC
Điểm Chất lượng Dịch thuật trung bình (0–100) 77,7 90,0
Số lỗi trung bình trên mỗi trang đã dịch 1,27 0,07
Các khía cạnh chất lượng mà PTC đạt điểm cao hơn DeepL 9 trên 9
Các ngôn ngữ được thử nghiệm mà PTC đạt điểm cao hơn DeepL 6 trên 6 (tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Tây Ban Nha)

Tại sao chúng tôi thực hiện nghiên cứu này

DeepL được hầu hết các ngành công nghiệp phần mềm và WordPress coi là tiêu chuẩn vàng cho dịch thuật AI. Khi khách hàng hỏi liệu họ có thể xuất bản nội dung do AI dịch mà không cần con người kiểm tra hay không, DeepL thường là tiêu chuẩn ngầm định.

WPML đã xây dựng công cụ dịch thuật AI của riêng mình — Private Translation Cloud (PTC) — bởi vì mức độ “đủ tốt” là chưa đủ. PTC là công cụ mặc định trong chế độ Translate Everything của WPML và cung cấp sức mạnh cho phần lớn các bản dịch tự động trên hơn 1,5 triệu trang web đang chạy WPML.

Chúng tôi muốn có một câu trả lời có thể đo lường được cho câu hỏi mà các khách hàng tiềm năng hỏi chúng tôi hàng tuần: PTC thực sự so với DeepL như thế nào? Nghiên cứu này chính là câu trả lời đó. Những con số ở trên là tiêu đề chính; phần còn lại của bài viết này giải thích cách chúng được tạo ra và ý nghĩa của chúng đối với một trang web thực tế.

Chúng tôi đã đo lường những gì và bằng cách nào

Chúng tôi đã chấm điểm chất lượng dịch thuật bằng hệ thống dựa trên MQM (Multidimensional Quality Metrics), cùng một khung làm việc mà đội ngũ ngôn ngữ của WPML sử dụng cho các bài đánh giá trang web khách hàng của PTC đang diễn ra. Mỗi trang đã dịch được chấm điểm qua chín khía cạnh:

  • Ngữ pháp — có lỗi ngữ pháp nào không?
  • Ý nghĩa — ý nghĩa của nguồn có được bảo toàn không?
  • Sự tự nhiên — bản dịch nghe có tự nhiên và đúng phong cách của người bản xứ không?
  • Tông giọng — tông giọng của nguồn có được nắm bắt không?
  • Sự trang trọng — văn phong phù hợp đã được sử dụng chưa, cả trong cách xưng hô với người đọc và trong các hình thức ngữ pháp?
  • Thuật ngữ — thuật ngữ chính xác đã được sử dụng chưa?
  • Sự nhất quán — thuật ngữ có được áp dụng nhất quán trên toàn bộ trang không?
  • Viết hoa — các quy ước của ngôn ngữ đích có được tuân thủ không?
  • Bản địa hóa số, đơn vị và ngày tháng — các quy ước của ngôn ngữ đích có được tuân thủ không?

Mỗi khía cạnh được chấm điểm từ 1–10 bởi một chuyên gia ngôn ngữ là người bản xứ của ngôn ngữ đích. Điểm cuối cùng trên mỗi trang là điểm trung bình của chín khía cạnh, nhân với mười — tạo ra thang điểm 1–100 tương ứng với các mức chất lượng bằng tiếng Anh thông thường:

Điểm số Ý nghĩa
90–100 Rất tốt đến hoàn hảo — sẵn sàng xuất bản mà không cần kiểm tra
80–89 Tốt — sẵn sàng xuất bản trong hầu hết các ngữ cảnh
70–79 Chấp nhận được đến trung bình — có thể sử dụng nhưng vẫn thấy lỗi
60–69 Trung bình — cần chỉnh sửa trước khi xuất bản
50–59 Lỗi hiển nhiên đối với người không phải bản xứ
Dưới 50 Các khiếm khuyết đủ nghiêm trọng để yêu cầu làm lại

Để so sánh: mức trung bình được công bố cho dịch thuật bởi con người thông thường nằm ở khoảng 76. Điểm 77,7 của DeepL đưa nó lên ngay trên mức đó. Điểm 90,0 của PTC đưa nó vào ngay ranh giới của mức “rất tốt — sẵn sàng xuất bản mà không cần kiểm tra”.

Kích thước mẫu và Lựa chọn

Để đánh giá DeepL, chúng tôi đã lấy 800 trang web ngẫu nhiên được dịch bằng DeepL trong 12 tháng qua, phân loại chúng theo độ tuổi trang web, khối lượng nội dung và hoạt động dịch thuật, sau đó lấy mẫu trên các nhóm. Các chuyên gia ngôn ngữ của chúng tôi sau đó đã kiểm tra thủ công các trang chính của các trang web được lấy mẫu — tổng cộng 227 trang web, được đánh giá bằng tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý và tiếng Tây Ban Nha.

Để so sánh trực tiếp DeepL và PTC, chúng tôi đã dịch lại 73 trang trong số đó bằng PTC và chấm điểm lại một cách khách quan (blind test), với cùng các chuyên gia ngôn ngữ làm việc trên cùng một nội dung nguồn. Mẫu PTC nhỏ hơn mẫu DeepL vì mỗi phép đo PTC phản ánh một phiên bản PTC cụ thể và công cụ này vẫn tiếp tục phát triển — xem phần Chúng tôi vẫn chưa dừng lại bên dưới.

Theo từng ngôn ngữ: PTC chiến thắng trong mọi cặp

Các điểm số tổng hợp rất thú vị; nhưng bức tranh theo từng ngôn ngữ mới là thứ cho một đội ngũ nội dung đa ngôn ngữ biết những gì cần mong đợi.

Điểm TQ theo ngôn ngữ

Biểu đồ hộp so sánh điểm TQ cho PTC và DeepL trên các tiếng Ả Rập, Đức, Anh, Tây Ban Nha, Pháp và Ý. PTC cho thấy điểm trung vị cao hơn một cách nhất quán và phân phối điểm chặt chẽ hơn trên tất cả các ngôn ngữ.
Điểm TQ theo ngôn ngữ — PTC so với DeepL trên các tiếng Ả Rập, Đức, Anh, Tây Ban Nha, Pháp, Ý

PTC đạt điểm cao hơn DeepL trong mọi cặp ngôn ngữ mà chúng tôi đã thử nghiệm. Khoảng cách rộng nhất là ở tiếng Ả Rập (+22,4 điểm), nơi DeepL trước đây có hiệu suất kém và là nơi sự đầu tư của WPML vào chất lượng ngôn ngữ viết từ phải sang trái (RTL) được thể hiện rõ ràng. Tiếp theo là tiếng Đức (+11,5) và tiếng Pháp (+9,9). Khoảng cách hẹp nhất là ở tiếng Anh (+6,0 điểm) — và ngay cả ở đó, PTC cũng đưa trang web từ mức “chấp nhận được, có khiếm khuyết rõ rệt” vào nhóm sẵn sàng xuất bản.

Sự biến thiên cũng rất quan trọng. Phân phối của DeepL có một phần đuôi dưới dài ở tiếng Ả Rập, với các trang riêng lẻ đạt điểm thấp hơn nhiều so với mức trung bình — những trang mà người dùng tiếng Đức hoặc tiếng Pháp sẽ coi là bị hỏng. Phân phối của PTC chặt chẽ hơn và tập trung ở mức cao hơn, vì vậy một đội ngũ nội dung có thể lập kế hoạch dựa trên một dải chất lượng dự kiến thay vì phải dự trù ngân sách cho các trường hợp ngoại lệ.

PTC cũng vượt trội hơn DeepL ở mọi khía cạnh trong số chín khía cạnh chất lượng mà chúng tôi chấm điểm: ngữ pháp, ý nghĩa, sự tự nhiên, tông giọng, sự trang trọng, thuật ngữ, sự nhất quán, viết hoa và các quy ước địa phương. Những cải thiện lớn nhất nằm ở các khía cạnh quan trọng nhất đối với một người đang đọc một trang trên một trang web thực tế — thuật ngữ (+1,5), ngữ pháp (+1,4), sự tự nhiên (+1,4) và định dạng số/đơn vị/ngày tháng (+1,4). Không có khía cạnh nào mà DeepL theo kịp, và không có khía cạnh nào mà PTC chỉ nhỉnh hơn một chút.

Tỷ lệ lỗi: Bức tranh vận hành

Điểm trung bình rất hữu ích; nhưng số lượng lỗi còn hữu ích hơn đối với bất kỳ ai đang vận hành một trang web thực tế. Những người đánh giá của chúng tôi đã ghi lại mọi vấn đề riêng biệt mà họ xác định được trên mỗi trang — ngữ pháp, ý nghĩa, thuật ngữ, tất cả mọi thứ.

Số lỗi trung bình trên mỗi trang

Biểu đồ thanh hiển thị số lỗi trung bình trên mỗi trang: DeepL ~1,27, PTC ~0,07, với PTC thấp hơn đáng kể so với DeepL.
Số lỗi trung bình trên mỗi trang — DeepL ~1,27, PTC ~0,07

DeepL tạo ra trung bình 1,27 lỗi trên mỗi trang. PTC tạo ra 0,07 — giảm khoảng 18 lần số lỗi trên mỗi trang trên cùng một nội dung nguồn.

Đối với một trang web 200 trang, điều đó tương đương với khoảng:

  • DeepL: ~254 lỗi cần tìm, quyết định và sửa trước khi xuất bản.
  • PTC: ~14 lỗi trên toàn bộ trang web.

Đó là sự khác biệt giữa dịch thuật AI như một bản nháp đầu tiên và dịch thuật AI như một quy trình làm việc. DeepL là một bản nháp đầu tiên mạnh mẽ — mỗi trang vẫn có những vấn đề cần khắc phục trước khi xuất bản. PTC, theo phép đo này, là một quy trình làm việc: số lượng lỗi đủ thấp để bước kiểm tra bởi con người trở thành tùy chọn cho hầu hết nội dung thay vì bắt buộc đối với tất cả.

Thế nào thực sự là “Dịch thuật tốt”

Các mô tả cấp độ của khung MQM là một đối trọng hữu ích cho ngôn ngữ tiếp thị xung quanh dịch thuật AI. Một trang đạt điểm “9/10” không phải là một trang tốt 90%; đó là một trang mà một người bản xứ, khi đọc kỹ, không tìm thấy gì họ muốn thay đổi. Một trang “7/10” là có thể chấp nhận được nhưng vẫn thấy khiếm khuyết rõ rệt. Một trang “5/10” là trang mà một người không phải bản xứ cũng có thể phát hiện ra lỗi.

Mức trung bình của DeepL nằm ở mức 7 cao — chấp nhận được, nhưng vẫn thấy khiếm khuyết đối với một người đọc bản xứ kỹ tính. Mức trung bình của PTC nằm ở 90,0, ngay tại ranh giới của “rất tốt — sẵn sàng xuất bản mà không cần kiểm tra”. Đó là sự khác biệt về chất lượng mà những người đánh giá của chúng tôi đã đo lường được. Nó tương ứng với một sự phân biệt thực tế: kết quả của DeepL là một điểm khởi đầu cần con người kiểm tra trước khi xuất bản; kết quả của PTC trong hầu hết các trường hợp chính là bản xuất bản.

Tại sao WPML có thể tạo ra chất lượng này

Chúng tôi biết rằng “chúng tôi đã xây dựng công cụ AI của riêng mình” là một tuyên bố mà rất nhiều công ty đang đưa ra hiện nay. PTC đặc biệt vì hai lý do cụ thể.

Quy mô và đánh giá liên tục. WPML phục vụ hơn 1,5 triệu trang web và đã làm như vậy trong hơn một thập kỷ. Đội ngũ ngôn ngữ của WPML liên tục đánh giá chất lượng dịch thuật của PTC — lấy mẫu kết quả, chấm điểm bằng cùng khung MQM được sử dụng trong nghiên cứu này và theo dõi các mẫu mà công cụ này liên tục tạo ra kết quả chất lượng thấp hơn cho một thuật ngữ, cặp ngôn ngữ hoặc loại nội dung cụ thể.

Sự tập trung. PTC không phải là một dự án phụ tại WPML. Nó có một đội ngũ chuyên trách — các kỹ sư, chuyên gia MLOps và các chuyên gia ngôn ngữ. Khi các chuyên gia ngôn ngữ gắn cờ một mẫu lỗi lặp lại, đội ngũ kỹ thuật sẽ xử lý nó như một lỗi phần mềm: mở rộng bảng thuật ngữ, điều chỉnh mô hình mức độ trang trọng, thêm một ngoại lệ, triển khai bản sửa lỗi. Vòng lặp này chạy liên tục, đó là lý do tại sao chất lượng của PTC đã được cải thiện trong 12 tháng qua từ mức “tốt như dịch thuật bởi con người thông thường” lên những con số trong nghiên cứu này.

Sự kết hợp — đánh giá liên tục bởi con người ở quy mô có ý nghĩa, kết hợp với một đội ngũ phản hồi cho mỗi phát hiện như một phiếu yêu cầu kỹ thuật — là thứ tạo ra các con số chất lượng ở trên. Đó không phải là kiến trúc mô hình; đó là mô hình vận hành.

Chúng tôi vẫn chưa dừng lại

90,0 đưa PTC vào ngay ranh giới của “rất tốt — sẵn sàng xuất bản mà không cần kiểm tra”. Chúng tôi hài lòng với kết quả đó. Nhưng chúng tôi không nghĩ đó là giới hạn cuối cùng.

Vòng lặp QA → kỹ thuật được mô tả ở trên vẫn đang chạy. Đội ngũ ngôn ngữ của WPML tiếp tục phân tích các chỉnh sửa mà khách hàng thực hiện đối với kết quả của PTC trên các trang web thực tế, xác định các mẫu mà những chỉnh sửa đó tiết lộ, và đội ngũ kỹ thuật triển khai các bản sửa lỗi — mở rộng bảng thuật ngữ, điều chỉnh mức độ trang trọng, tinh chỉnh cho từng cặp ngôn ngữ cụ thể. Chúng tôi kỳ vọng phép đo tiếp theo sẽ cao hơn phép đo này.

Điều này có ý nghĩa gì đối với quy trình làm việc của quý vị

Quy trình nội dung đa ngôn ngữ thông thường là dịch → kiểm tra → xuất bản. Bước kiểm tra tồn tại vì mọi công cụ AI — và hầu hết các biên dịch viên là con người — đều tạo ra những bản dịch cần một người thứ hai xem xét trước khi xuất bản. Bước kiểm tra đó cũng là nơi chiếm phần lớn chi phí và độ trễ trong quy trình nội dung đa ngôn ngữ.

Với DeepL, bước kiểm tra là cần thiết. 1,27 lỗi trên mỗi trang phải được phát hiện ở đâu đó; nếu đội ngũ không phát hiện ra chúng, khách hàng sẽ thấy. Với PTC, bước kiểm tra là tùy chọn cho hầu hết nội dung. Một số đội ngũ vẫn kiểm tra — đối với các trang quan trọng hoặc các ngành có quy định khắt khe — nhưng quy trình làm việc mặc định trở thành dịch → xuất bản, với việc kiểm tra chỉ dành riêng cho những trường hợp thực sự cần thiết.

Đó là sự khác biệt về vận hành mà các con số mô tả. Nó không hề nhỏ.

Điều này có ý nghĩa gì đối với chi phí của quý vị

Chi phí dịch thuật bao gồm hai thứ: chi phí tạo ra bản dịch và chi phí kiểm tra bản dịch đó. Cả hai đều phải được thanh toán trước khi nội dung được đưa lên mạng.

Trong hầu hết các ngữ cảnh chuyên nghiệp, chi phí kiểm tra bởi con người tốn vài xu cho mỗi từ — cho dù người kiểm tra tính phí theo từ, theo trang hay theo trang web, thì đó là mức tính toán chung. Dịch thuật hoàn toàn bởi con người (dịch, sau đó được một người thứ hai kiểm tra) thường tốn khoảng 0,10 €–0,20 € mỗi từ cho các cặp ngôn ngữ chính, với riêng phần kiểm tra nằm trong khoảng 0,04 €–0,08 €.

Dưới đây là chi phí thực tế của mỗi quy trình làm việc theo các điều khoản đó.

Chỉ dịch thuật bởi con người — mức cơ sở. Khoảng 0,10 €–0,20 € mỗi từ. Cả hai bước đều do con người thực hiện.

DeepL (hoặc bất kỳ công cụ AI nào) cộng với kiểm tra bởi con người. AI xử lý bước dịch; con người vẫn phải kiểm tra mọi trang, vì với 1,27 lỗi trên mỗi trang, các vấn đề sẽ đến tay khách hàng nếu không có ai phát hiện ra chúng trước. Bước dịch về cơ bản là miễn phí; bước kiểm tra vẫn tốn 0,04 €–0,08 € mỗi từ. Tổng tiết kiệm so với chỉ dùng con người: khoảng 60%. Đây là lời chào hàng tiêu chuẩn “AI giúp quý vị tiết kiệm tiền dịch thuật” — và nó đúng — nhưng mức trần chi phí nằm ở bước kiểm tra mà chất lượng của DeepL vẫn yêu cầu.

PTC, không cần kiểm tra. PTC tốn 0,0012 €–0,003 € mỗi từ — 4 credit mỗi từ nhân với 0,30 €–0,75 € cho mỗi 1.000 credit tùy theo khối lượng, với 2.000 credit đầu tiên mỗi tháng miễn phí. (Xem bảng giá dịch thuật tự động của WPML để biết bảng giá đầy đủ.) Vì chất lượng đo lường được của PTC (điểm TQ 90,0, 0,07 lỗi trên mỗi trang, khoảng cách +12,3 điểm so với DeepL trên cùng một nội dung nguồn) đủ cao để bỏ qua bước kiểm tra trong hầu hết các trường hợp, chi phí kiểm tra sẽ về không. Tổng tiết kiệm so với chỉ dùng con người: khoảng 99%.

Đó không phải là một sự cải thiện nhỏ so với quy trình AI cộng với kiểm tra. Đó là một chế độ chi phí hoàn toàn khác.

Cái nhìn tổng quan — Chi phí để xuất bản một từ đã dịch

Quy trình làm việc Dịch thuật Kiểm tra Tổng cộng Tiết kiệm so với con người
Dịch thuật hoàn toàn bởi con người 0,10 €–0,20 € đã bao gồm 0,10 €–0,20 €
DeepL + kiểm tra bởi con người ~0 € 0,04 €–0,08 € 0,04 €–0,08 € ~60%
PTC, không cần kiểm tra 0,0012 €–0,003 € 0 € 0,0012 €–0,003 € ~99%

Giá dịch thuật bởi con người là các ước tính điển hình của ngành cho các cặp ngôn ngữ chính. Giá PTC được lấy từ các mức giá đã công bố của WPML.


Lưu ý về việc tự thực hiện kiểm tra: khi chủ doanh nghiệp tự thực hiện kiểm tra thay vì trả tiền cho người kiểm tra, chi phí không phải là bằng không — nó chỉ ít hiển thị hơn. Những giờ dành cho việc kiểm tra là những giờ không dành cho các công việc khác của doanh nghiệp, và với bất kỳ mức thù lao theo giờ hợp lý nào, chi phí ngầm định thường cao hơn mức mà một người kiểm tra thuê ngoài sẽ tính, chứ không thấp hơn. Sự tiết kiệm của PTC được áp dụng bất kể ai là người đang chi trả cho bước kiểm tra hiện nay.

Những gì điều này mở ra. Khi dịch thuật tốn hơn 0,10 € mỗi từ, quý vị sẽ dịch một cách chọn lọc — trang chủ, các danh mục sản phẩm hàng đầu, một vài bài đăng blog có lưu lượng truy cập cao. Mọi thứ khác vẫn giữ nguyên ngôn ngữ nguồn vì bài toán kinh tế không khả thi. Khi dịch thuật tốn 0,002 € mỗi từ và tạo ra kết quả tốt hơn dịch thuật bởi con người thông thường, bài toán kinh tế sẽ khả thi cho những nội dung mà trước đây không thể thực hiện được:

  • Dịch toàn bộ danh mục trong Thương mại điện tử — mọi mô tả sản phẩm ngách, mọi biến thể.
  • Các cổng tài liệu hoàn chỉnh bằng mọi ngôn ngữ mà khách hàng có thể nói, không chỉ ba ngôn ngữ hàng đầu.
  • Cơ sở kiến thức, câu hỏi thường gặp về hỗ trợ, kho lưu trữ blog — những nội dung ngách thúc đẩy tìm kiếm nhưng chưa bao giờ xứng đáng với chi phí dịch thuật.
  • Nội dung biên tập được bản địa hóa cho các nhà xuất bản hoạt động trong các thị trường nơi doanh thu trên mỗi trang từ khán giả không thể bù đắp chi phí dịch thuật bởi con người.

Nội dung đa ngôn ngữ đã là một câu hỏi “chúng ta có thể đủ khả năng dịch những gì” trong nhiều thập kỷ. Với PTC, câu hỏi trở thành “những gì đáng để dịch” — một câu hỏi khác biệt và thú vị hơn nhiều.

Làm thế nào để có được chất lượng này trên trang web của riêng quý vị

PTC là công cụ mặc định trong chế độ Translate Everything của WPML, đây là một cài đặt toàn cầu duy nhất giúp dịch mọi trang trên trang web của quý vị, một cách tự động, trong nền. Không cần quản lý cấu hình cho từng trang.

Để có được chất lượng được đo lường trong nghiên cứu này, thiết lập duy nhất quý vị cần ngoài việc bật Translate Everything là dành khoảng một phút để mô tả đối tượng và tông giọng của trang web trong cài đặt Translate Everything — ví dụ: “một công ty phần mềm hướng đến các nhà phát triển, tông giọng trang trọng, thuật ngữ kỹ thuật được giữ nguyên bằng tiếng Anh”. PTC sử dụng mô tả đó để điều chỉnh các bản dịch phù hợp với tiếng nói thương hiệu của quý vị.

Đó là tất cả các thiết lập. Kết quả chính là những gì nghiên cứu này đã đo lường.

Lưu ý về những gì chúng tôi đã không thực hiện

Chúng tôi đã không so sánh PTC với Google Translate, Azure Translator hoặc các dịch vụ dựa trên LLM thông qua các API công khai của họ. Lý do: các công cụ đó thay đổi thường xuyên và một phép đo tại một thời điểm duy nhất sẽ trở nên lỗi thời trong vòng vài tháng. Việc so sánh với DeepL là việc chúng tôi đã thực hiện vì DeepL là tiêu chuẩn được trích dẫn nhiều nhất cho dịch thuật AI cấp độ sản xuất, và vì DeepL là thứ mà hầu hết các đối thủ cạnh tranh của chúng tôi sử dụng bên dưới hệ thống.

Chúng tôi cũng không đo lường tốc độ, chi phí hoặc trải nghiệm của nhà phát triển trong nghiên cứu này — mà chỉ đo lường chất lượng. Những so sánh đó tồn tại trên trang tính năngtrang so sánh của chúng tôi, và chúng kể câu chuyện của riêng mình.

Hãy thử ngay

Nếu quý vị vận hành một trang web WordPress đa ngôn ngữ và muốn xem kết quả của PTC trên nội dung của chính mình, hãy cài đặt WPML, bật Translate Everything và so sánh kết quả với bất kỳ thứ gì quý vị đang sử dụng hiện nay. Sự khác biệt về chất lượng được mô tả ở đây chính là sự khác biệt về chất lượng mà quý vị nên mong đợi được thấy.


Câu hỏi về phương pháp luận hoặc yêu cầu dữ liệu: liên hệ với đội ngũ WPML.

Nghiên cứu được thực hiện bởi đội ngũ ngôn ngữ WPML, tháng 4 năm 2026. Mẫu: 227 trang web được dịch bằng DeepL được kiểm tra bởi các chuyên gia ngôn ngữ bản xứ; 73 trang trong số đó được dịch lại bằng phiên bản PTC hiện tại và được chấm điểm lại một cách khách quan so với cùng một nội dung nguồn. Ngôn ngữ: tiếng Ả Rập, tiếng Anh, tiếng Pháp, tiếng Đức, tiếng Ý, tiếng Tây Ban Nha. Chấm điểm: Khung Chất lượng Dịch thuật dựa trên MQM, 9 khía cạnh, 1–10 điểm mỗi khía cạnh, được tính trung bình và quy đổi sang kết quả 0–100.