حققت Private Translation Cloud (PTC) التابعة لـ WPML نتيجة 90.0 من أصل 100 في مراجعة مستقلة للترجمة. بينما سجلت DeepL — التي تُعتبر على نطاق واسع أقوى محرك ترجمة بالذكاء الاصطناعي — 77.7 درجة على المحتوى نفسه. وتفوقت PTC على DeepL بفارق 12.3 نقطة إجمالاً، وفازت في كل بُعد من أبعاد الجودة التسعة التي قيمها لغويونا، كما حققت انخفاضاً في الأخطاء لكل صفحة بنحو 18 ضعفاً.
نظرة سريعة
| المقياس |
|
|
|---|---|---|
| متوسط درجة جودة الترجمة (0–100) | 77.7 | 90.0 |
| متوسط المشكلات في كل صفحة مترجمة | 1.27 | 0.07 |
| أبعاد الجودة التي تفوقت فيها PTC على DeepL | — | 9 من أصل 9 |
| اللغات المختبرة التي تفوقت فيها PTC على DeepL | — | 6 من أصل 6 (العربية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، والإسبانية) |
لماذا أجرينا هذه الدراسة؟
تتعامل معظم قطاعات البرمجيات ووردبريس مع DeepL كمعيار ذهبي للترجمة بالذكاء الاصطناعي. وعندما يتساءل العملاء عما إذا كان بإمكانهم نشر محتوى مترجم آلياً دون مراجعة بشرية، فعادةً ما يكون DeepL هو المرجع الضمني للمقارنة.
قامت WPML ببناء محرك الترجمة الخاص بها بالذكاء الاصطناعي — Private Translation Cloud (PTC) — لأن مجرد كونه “جيداً بما يكفي” لم يكن كافياً. وتعد PTC المحرك الافتراضي في وضع “ترجمة كل شيء” داخل WPML، وهي التي تدعم الجزء الأكبر من الترجمة التلقائية عبر أكثر من 1.5 مليون موقع يعمل بنظام WPML.
أردنا إجابة قابلة للقياس على سؤال يطرحه علينا العملاء المحتملون كل أسبوع: كيف تقارن PTC فعلياً بـ DeepL؟ هذه الدراسة هي تلك الإجابة. الأرقام المذكورة أعلاه هي العناوين الرئيسية؛ وبقية هذا المقال يشرح كيفية التوصل إليها وما تعنيه لموقع إنتاجي حقيقي.
ماذا قمنا بقياسه وكيف؟
قمنا بتقييم جودة الترجمة باستخدام نظام يعتمد على MQM (مقاييس الجودة متعددة الأبعاد)، وهو نفس الإطار الذي يستخدمه الفريق اللغوي في WPML للمراجعات المستمرة لمواقع عملاء PTC. يتم تقييم كل صفحة مترجمة عبر تسعة أبعاد:
- القواعد — هل وجدت أخطاء نحوية؟
- المعنى — هل تم الحفاظ على معنى النص الأصلي؟
- الطبيعية — هل تبدو الترجمة طبيعية واصطلاحية لمتحدث أصلي؟
- النبرة — هل تم تجسيد نبرة النص الأصلي؟
- الرسمية — هل تم استخدام مستوى اللغة الصحيح، سواء في مخاطبة القارئ أو في صيغ المخاطبة النحوية؟
- المصطلحات — هل تم استخدام المصطلحات الصحيحة؟
- الاتساق — هل تم تطبيق المصطلحات بشكل متسق عبر الصفحة؟
- استخدام الحروف الكبيرة — هل تم اتباع قواعد اللغة المستهدفة؟
- توطين الأرقام والوحدات والتاريخ — هل تم اتباع قواعد اللغة المستهدفة؟
يتم تقييم كل بُعد من 1 إلى 10 من قِبل لغوي بشري يتحدث اللغة المستهدفة كأمه. والدرجة النهائية لكل صفحة هي متوسط الأبعاد التسعة، مضروباً في عشرة — مما يعطي مقياساً من 1 إلى 100 يحدد مستويات الجودة بوضوح:
| الدرجة | ماذا تعني |
|---|---|
| 90–100 | جيد جداً إلى مثالي — جاهز للنشر دون مراجعة |
| 80–89 | جيد — جاهز للنشر في معظم السياقات |
| 70–79 | مقبول إلى متوسط — قابل للاستخدام ولكن الأخطاء واضحة |
| 60–69 | متوسط — يحتاج إلى تحسينات قبل النشر |
| 50–59 | أخطاء واضحة لغير المتحدثين الأصليين |
| أقل من 50 | عيوب جسيمة تتطلب إعادة العمل عليها |
للتوضيح: يبلغ المتوسط المنشور لـ الترجمة البشرية العامة حوالي 76 درجة. وتضع درجة DeepL البالغة 77.7 المحرك فوق هذا الخط مباشرة. أما درجة PTC البالغة 90.0 فتضعها تماماً عند حدود فئة “جيد جداً — جاهز للنشر دون مراجعة”.
حجم العينة واختيارها
لتقييم DeepL، اخترنا 800 موقع عشوائي تمت ترجمتها باستخدام DeepL في آخر 12 شهراً، وصنفناها حسب عمر الموقع، وحجم المحتوى، ونشاط الترجمة، ثم أخذنا عينات من هذه الفئات. بعد ذلك، قام لغويونا بمراجعة الصفحات الرئيسية للمواقع المختارة يدوياً — 227 صفحة ويب إجمالاً، تم تقييمها باللغات العربية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، والإسبانية.
ولمقارنة DeepL وPTC وجهاً لوجه، أعدنا ترجمة 73 صفحة من تلك الصفحات نفسها باستخدام PTC وأعدنا تقييمها دون الكشف عن هوية المحرك، مع استعانة اللغويين أنفسهم بالمحتوى الأصلي نفسه. عينة PTC أصغر من عينة DeepL لأن كل قياس لـ PTC يعكس إصداراً محدداً منها، والمحرك مستمر في التطور — انظر قسم لم ننتهِ بعد أدناه.
حسب اللغة: PTC تتفوق في كل زوج لغوي
النتائج الإجمالية مثيرة للاهتمام؛ لكن الصورة التفصيلية لكل لغة هي ما يوضح لفريق المحتوى متعدد اللغات ما يمكن توقعه.
درجات جودة الترجمة حسب اللغة

سجلت PTC درجات أعلى من DeepL في كل زوج لغوي اختبرناه. الفجوة الأوسع تظهر في اللغة العربية (+22.4 نقطة)، حيث كان أداء DeepL ضعيفاً تاريخياً، وحيث يظهر بوضوح استثمار WPML في جودة اللغات التي تُكتب من اليمين إلى اليسار. تليها الألمانية (+11.5) ثم الفرنسية (+9.9). أما أضيق فجوة فكانت في الإنجليزية (+6.0 نقاط) — وحتى هناك، تنقل PTC الصفحة من فئة “مقبولة وبها عيوب ظاهرة” إلى فئة الجاهزية للنشر.
التباين مهم أيضاً. توزيع درجات DeepL له ذيل طويل منخفض في اللغة العربية، مع وجود صفحات فردية سجلت درجات أقل بكثير من المتوسط — وهي صفحات قد يعتبرها المستخدم الألماني أو الفرنسي غير صالحة. أما توزيعات PTC فهي أكثر تقارباً ومركزة في مستويات أعلى، لذا يمكن لفريق المحتوى التخطيط بناءً على فئة جودة متوقعة بدلاً من تخصيص ميزانية للحالات الشاذة.
تتفوق PTC أيضاً على DeepL في كل بُعد من أبعاد الجودة التسعة التي نقيمها: القواعد، والمعنى، والطبيعية، والنبرة، والرسمية، والمصطلحات، والاتساق، واستخدام الحروف الكبيرة، وقواعد التوطين. وتتحقق أكبر المكاسب في الأبعاد الأكثر أهمية للقارئ البشري الذي يتصفح صفحة على موقع حقيقي — المصطلحات (+1.5)، والقواعد (+1.4)، والطبيعية (+1.4)، وتوطين الأرقام والوحدات والتاريخ (+1.4). لا يوجد أي بُعد استطاعت فيه DeepL المواكبة، ولا يوجد بُعد تفوقت فيه PTC بفارق ضئيل فحسب.
معدل الخطأ: الصورة التشغيلية
متوسط الدرجات مفيد؛ لكن عدد الأخطاء أكثر فائدة لأي شخص يدير موقعاً حقيقياً. سجل مراجعونا كل مشكلة محددة رصدوها في كل صفحة — القواعد، والمعنى، والمصطلحات، وكل شيء.
متوسط المشكلات في كل صفحة

تنتج DeepL متوسط 1.27 مشكلة في كل صفحة. بينما تنتج PTC 0.07 — أي انخفاض بنحو 18 ضعفاً في الأخطاء لكل صفحة على نفس المحتوى الأصلي.
بالنسبة لموقع يتكون من 200 صفحة، يترجم ذلك تقريباً إلى:
- DeepL: حوالي 254 مشكلة يجب العثور عليها، واتخاذ قرار بشأنها، وإصلاحها قبل النشر.
- PTC: حوالي 14 مشكلة في الموقع بأكمله.
هذا هو الفرق بين الترجمة بالذكاء الاصطناعي كـ مسودة أولى والترجمة بالذكاء الاصطناعي كـ سير عمل. DeepL مسودة أولى قوية — فكل صفحة لا تزال بها مشكلات يجب رصدها قبل الإطلاق. أما PTC، وفقاً لهذا القياس، فهي سير عمل: فعدد الأخطاء منخفض بما يكفي لجعل خطوة المراجعة البشرية اختيارية لمعظم المحتوى بدلاً من كونها إلزامية للجميع.
ماذا تعني “الترجمة الجيدة” فعلياً
تعد أوصاف الدرجات في إطار MQM ثقلاً موازناً مفيداً للغة التسويقية التي تحيط بالترجمة بالذكاء الاصطناعي. الصفحة التي تحصل على “9/10” ليست صفحة بنسبة 90%؛ بل هي صفحة لا يجد فيها المتحدث الأصلي، عند القراءة المتأنية، أي شيء يود تغييره. أما الصفحة التي تحصل على “7/10” فهي مقبولة كما هي ولكن بها عيوب ظاهرة. والصفحة التي تحصل على “5/10” هي التي يمكن لغير المتحدث الأصلي رصد أخطاء فيها.
يستقر متوسط DeepL في أواخر السبعينيات — وهو مقبول، ولكنه معيب بشكل ظاهر للقارئ الأصلي المتأني. أما متوسط PTC فيستقر عند 90.0، تماماً عند حدود “جيد جداً — جاهز للنشر دون مراجعة”. هذا هو فرق الجودة الذي قاسه مراجعونا. وهو يترجم إلى تمييز حقيقي: مخرجات DeepL هي نقطة انطلاق تتطلب مراجعة بشرية قبل النشر؛ أما مخرجات PTC فهي في معظم الحالات صالحة للنشر مباشرة.
لماذا تستطيع WPML تقديم هذه الجودة
نحن ندرك أن ادعاء “بناء محرك ذكاء اصطناعي خاص بنا” هو ادعاء تطلقه الكثير من الشركات حالياً. لكن PTC استثنائية لسببين محددين.
النطاق الواسع والمراجعة المستمرة. تخدم WPML أكثر من 1.5 مليون موقع منذ أكثر من عقد من الزمان. ويقوم الفريق اللغوي في WPML بمراجعة جودة ترجمة PTC باستمرار — عبر أخذ عينات من المخرجات، وتقييمها باستخدام نفس إطار MQM المستخدم في هذه الدراسة، ومراقبة الأنماط التي ينتج فيها المحرك باستمرار نتائج أقل جودة لمصطلح معين، أو زوج لغوي، أو نوع محتوى محدد.
التركيز. PTC ليست مشروعاً جانبياً في WPML. فلديها فريق مخصص — يضم مهندسين، وخبراء عمليات تعلم الآلة (MLOps)، ولغويين بشريين. عندما يرصد اللغويون نمطاً متكرراً، يتعامل معه الفريق الهندسي كخلل برمجى: توسيع قاموس المصطلحات، تعديل نموذج الرسمية، إضافة استثناء، وإطلاق الإصلاح. تعمل هذه الحلقة باستمرار، ولهذا السبب تحسنت جودة PTC خلال الـ 12 شهراً الماضية من “بجودة متوسط الترجمة البشرية” إلى الأرقام الواردة في هذه الدراسة.
هذا المزيج — المراجعة البشرية المستمرة على نطاق واسع، مقترنة بفريق يستجيب لكل نتيجة كتذكرة هندسية — هو ما ينتج أرقام الجودة المذكورة أعلاه. الأمر لا يتعلق بهيكلية النموذج فحسب؛ بل بنموذج التشغيل.
لم ننتهِ بعد
درجة 90.0 تضع PTC تماماً عند حدود “جيد جداً — جاهز للنشر دون مراجعة”. نحن سعداء بهذه النتيجة، لكننا لا نعتقد أنها السقف النهائي.
حلقة (ضمان الجودة ← الهندسة) الموصوفة أعلاه لا تزال تعمل. ويواصل الفريق اللغوي في WPML تحليل التعديلات التي يجريها العملاء على مخرجات PTC في المواقع الحقيقية، ويحدد الأنماط التي تكشفها تلك التعديلات، ويقوم الفريق الهندسي بإطلاق الإصلاحات — توسيع قواميس المصطلحات، تعديلات الرسمية، وتحسينات خاصة بكل زوج لغوي. نتوقع أن يكون القياس القادم أعلى من هذا.
ماذا يعني هذا لسير عملك
سير العمل التقليدي للمحتوى متعدد اللغات هو الترجمة ← المراجعة ← النشر. خطوة المراجعة موجودة لأن كل محرك ذكاء اصطناعي — ومعظم المترجمين البشريين — ينتجون عملاً يحتاج إلى عين ثانية قبل إطلاقه. خطوة المراجعة هذه هي أيضاً مصدر معظم التكلفة ومعظم التأخير في إنتاج المحتوى متعدد اللغات.
مع DeepL، تعد خطوة المراجعة ضرورية. فالمشكلات البالغة 1.27 لكل صفحة يجب رصدها في مكان ما؛ وإذا لم يرصدها الفريق، فسيرصدها العملاء. أما مع PTC، فتصبح خطوة المراجعة اختيارية لمعظم المحتوى. لا تزال بعض الفرق تراجع — للصفحات ذات الأهمية العالية أو القطاعات الخاضعة للوائح — ولكن سير العمل الافتراضي يصبح الترجمة ← النشر، مع حجز المراجعة للحالات التي تحتاج إليها فعلياً.
هذا هو الفرق التشغيلي الذي تصفه الأرقام. وهو ليس فرقاً صغيراً.
ماذا يعني هذا لتكاليفك
تكلفة الترجمة تتكون من أمرين: تكلفة إنتاج الترجمة وتكلفة مراجعتها. ويجب دفع كليهما قبل أن يصبح المحتوى متاحاً.
في معظم السياقات المهنية، تكلف المراجعة البشرية بضعة سنتات لكل كلمة — سواء كان المراجعون يتقاضون أجرهم بالكلمة، أو بالصفحة، أو بالموقع، فهذا هو المكان الذي تستقر فيه الحسابات تقريباً. الترجمة البشرية الكاملة (الترجمة، ثم المراجعة من قِبل إنسان ثانٍ) تتراوح عادةً بين 0.10 يورو و0.20 يورو لكل كلمة للأزواج اللغوية الرئيسية، مع بقاء جزء المراجعة وحده في نطاق 0.04 يورو إلى 0.08 يورو.
إليك ما يكلفه كل سير عمل فعلياً بهذه المعايير.
الترجمة البشرية وحدها — المعيار المرجعي. حوالي 0.10 يورو إلى 0.20 يورو لكل كلمة. كلتا الخطوتين بشريتان.
DeepL (أو أي محرك ذكاء اصطناعي) بالإضافة إلى المراجعة البشرية. يتولى الذكاء الاصطناعي خطوة الترجمة؛ ولا يزال يتعين على الإنسان مراجعة كل صفحة، لأنه بمعدل 1.27 مشكلة لكل صفحة، ستصل المشكلات إلى العملاء إذا لم يرصدها أحد أولاً. خطوة الترجمة مجانية أساساً؛ أما خطوة المراجعة فلا تزال تكلف 0.04 يورو إلى 0.08 يورو لكل كلمة. إجمالي التوفير مقابل الترجمة البشرية فقط: حوالي 60%. هذا هو الطرح القياسي لـ “الذكاء الاصطناعي يوفر لك المال في الترجمة” — وهو صحيح — ولكن سقف التكلفة يكمن في خطوة المراجعة التي لا تزال جودة DeepL تتطلبها.
PTC، لا حاجة للمراجعة. تكلف PTC ما بين 0.0012 يورو و0.003 يورو لكل كلمة — 4 أرصدة لكل كلمة مضروبة في 0.30 يورو إلى 0.75 يورو لكل 1,000 رصيد حسب الحجم، مع أول 2,000 رصيد شهرياً مجاناً. (انظر أسعار الترجمة التلقائية في WPML لجدول الفئات الكامل.) ولأن جودة PTC المقاسة (درجة جودة ترجمة 90.0، و0.07 مشكلة لكل صفحة، وفجوة +12.3 نقطة عن DeepL على نفس المحتوى الأصلي) عالية بما يكفي لتجاوز خطوة المراجعة في معظم الحالات، فإن تكلفة المراجعة تنخفض إلى الصفر. إجمالي التوفير مقابل الترجمة البشرية فقط: حوالي 99%.
هذا ليس مجرد تحسين هامشي على سير عمل (الذكاء الاصطناعي زائد المراجعة). إنه نظام تكلفة مختلف تماماً.
نظرة سريعة — تكلفة إرسال كلمة مترجمة
| سير العمل | الترجمة | المراجعة | الإجمالي | التوفير مقابل البشرية |
|---|---|---|---|---|
| ترجمة بشرية كاملة | 0.10–0.20 يورو | مشمولة | 0.10–0.20 يورو | — |
| DeepL + مراجعة بشرية | ~0 يورو | 0.04–0.08 يورو | 0.04–0.08 يورو | ~60% |
| PTC، بدون مراجعة | 0.0012–0.003 يورو | 0 يورو | 0.0012–0.003 يورو | ~99% |
أسعار الترجمة البشرية هي تقديرات نموذجية للصناعة للأزواج اللغوية الرئيسية. أسعار PTC مأخوذة من أسعار WPML المنشورة.
ملاحظة حول إجراء المراجعة بنفسك: عندما يقوم صاحب العمل بالمراجعة بنفسه بدلاً من الدفع لمراجع، فإن التكلفة ليست صفراً — بل هي فقط أقل وضوحاً. فالساعات التي تقضيها في المراجعة هي ساعات لا تقضيها في بقية أعمالك، وبأي معدل ساعة معقول، تكون التكلفة الضمنية عادةً أعلى مما يتقاضاه مراجع خارجي، وليست أقل. توفير PTC ينطبق بغض النظر عمن يدفع ثمن خطوة المراجعة اليوم.
ما يفتحه هذا من آفاق. عندما تكلف الترجمة 0.10 يورو فأكثر لكل كلمة، فإنك تترجم بشكل انتقائي — الصفحة الرئيسية، فئات المنتجات الرئيسية، وعدد قليل من تدوينات المدونة ذات الزيارات العالية. كل شيء آخر يبقى بلغة المصدر لأن الحسابات لا تنجح. عندما تكلف الترجمة 0.002 يورو لكل كلمة وتنتج مخرجات أفضل من الترجمة البشرية النموذجية، تنجح الحسابات لمحتوى لم يكن من الممكن ترجمته من قبل:
- ترجمة الكتالوج بالكامل في التجارة الإلكترونية — كل وصف منتج فرعي، وكل متغير.
- بوابات توثيق كاملة بكل لغة قد يتحدث بها العميل، وليس فقط اللغات الثلاث الأولى.
- قواعد المعرفة، والأسئلة الشائعة للدعم، وأرشيفات المدونات — المحتوى الفرعي الذي يدفع البحث ولكنه لم يبرر أبداً تكلفة ترجمته.
- محتوى تحريري محلي للناشرين العاملين في أسواق لا يمكن فيها لإيرادات الجمهور لكل صفحة تغطية تكلفة الترجمة البشرية.
لطالما كان المحتوى متعدد اللغات سؤالاً حول “ما الذي يمكننا تحمل تكلفة ترجمته” لعقود. مع PTC، يصبح السؤال “ما الذي يستحق الترجمة” — وهو سؤال مختلف وأكثر إثارة للاهتمام.
كيف تحصل على هذه الجودة في موقعك الخاص
تعد PTC المحرك الافتراضي في وضع ترجمة كل شيء في WPML، وهو إعداد عالمي واحد يترجم كل صفحة في موقعك، تلقائياً، في الخلفية. لا يوجد تكوين لكل صفحة لإدارته.
للحصول على الجودة المقاسة في هذه الدراسة، فإن الإعداد الوحيد الذي تحتاجه بخلاف تشغيل “ترجمة كل شيء” هو قضاء حوالي دقيقة في وصف جمهور موقعك ونبرته في إعدادات “ترجمة كل شيء” — على سبيل المثال، “شركة برمجيات تخاطب المطورين، نبرة رسمية، الحفاظ على المصطلحات التقنية باللغة الإنجليزية”. تستخدم PTC هذا الوصف لمواءمة الترجمات مع صوت علامتك التجارية.
هذا هو كل الإعداد المطلوب. والنتيجة هي ما قاسته هذه الدراسة.
ملاحظة حول ما لم نفعله
لم نقارن PTC بـ Google Translate أو Azure Translator أو الخدمات القائمة على النماذج اللغوية الكبيرة (LLM) عبر واجهات برمجة التطبيقات العامة الخاصة بها. السبب: تتغير هذه المحركات بشكل متكرر، وسيكون قياس نقطة واحدة قديماً في غضون أشهر. مقارنة DeepL هي التي أجريناها لأن DeepL هو المعيار الأكثر استشهاداً به للترجمة بالذكاء الاصطناعي من الدرجة الإنتاجية، ولأن DeepL هو ما يستخدمه معظم منافسينا في أنظمتهم.
كما لم نقس السرعة أو التكلفة أو تجربة المطور في هذه الدراسة — الجودة فقط. هذه المقارنات موجودة في صفحة المميزات وصفحات المقارنة الخاصة بنا، وهي تروي قصتها الخاصة.
جربها
إذا كنت تدير موقع ووردبريس متعدد اللغات وتريد رؤية مخرجات PTC على محتواك الخاص، فقم بتثبيت WPML، وفعل وضع “ترجمة كل شيء”، وقارن النتيجة بأي شيء تستخدمه اليوم. فرق الجودة الموصوف هنا هو فرق الجودة الذي يجب أن تتوقع رؤيته.
لأسئلة المنهجية أو طلبات البيانات: اتصل بفريق WPML.
أجريت الدراسة من قِبل الفريق اللغوي في WPML، أبريل 2026. العينة: 227 صفحة ويب مترجمة بواسطة DeepL تمت مراجعتها من قِبل لغويين ناطقين باللغة الأم؛ 73 منها أُعيدت ترجمتها باستخدام إصدار PTC الحالي وأُعيد تقييمها دون الكشف عن الهوية مقابل نفس محتوى المصدر. اللغات: العربية، والإنجليزية، والفرنسية، والألمانية، والإيطالية، والإسبانية. التقييم: إطار جودة الترجمة القائم على MQM، 9 أبعاد، 1–10 لكل بُعد، تم حساب المتوسط وتحويله إلى نتيجة من 0–100.