Private Translation Cloud (PTC) של WPML קיבל ציון 90.0 מתוך 100 בסקירת תרגום עצמאית. DeepL — הנחשב למנוע תרגום AI המוביל ביותר בשוק — קיבל ציון 77.7 על אותו תוכן. PTC עולה על DeepL ב־12.3 נקודות בממוצע, מנצח בכל אחד מתשעת מימדי האיכות שהבלשנים שלנו העריכו, ומייצר הפחתה של פי 18 בערך במספר השגיאות לעמוד.
מבט חטוף
| מדד |
|
|
|---|---|---|
| ציון איכות תרגום ממוצע (0–100) | 77.7 | 90.0 |
| ממוצע בעיות לעמוד מתורגם | 1.27 | 0.07 |
| מימדי איכות שבהם PTC קיבל ציון גבוה יותר מ-DeepL | — | 9 מתוך 9 |
| שפות שנבדקו שבהן PTC קיבל ציון גבוה יותר מ-DeepL | — | 6 מתוך 6 (ערבית, אנגלית, צרפתית, גרמנית, איטלקית, ספרדית) |
מדוע ביצענו מחקר זה
DeepL נתפס על ידי רוב תעשיות WordPress והתוכנה כסטנדרט הזהב לתרגום AI. כאשר לקוחות שואלים אם הם יכולים לפרסם תוכן מתורגם AI ללא סקירה אנושית, DeepL הוא בדרך כלל אמת המידה המשתמעת.
WPML בנתה מנוע תרגום AI משלה — Private Translation Cloud (PTC) — מכיוון ש"מספיק טוב" לא היה מספיק. PTC הוא מנוע ברירת המחדל במצב Translate Everything של WPML ומפעיל את עיקר התרגום האוטומטי ב־1.5 מיליון+ האתרים המריצים את WPML.
רצינו תשובה מדידה לשאלה שמועמדים שואלים אותנו כל שבוע: איך PTC משתווה בפועל ל-DeepL? מחקר זה הוא התשובה. המספרים למעלה הם הכותרת; שאר המאמר מסביר כיצד הם הופקו ומה הם אומרים לאתר ייצור אמיתי.
מה מדדנו וכיצד
העריכנו את איכות התרגום באמצעות מערכת המבוססת על MQM (Multidimensional Quality Metrics), אותה מסגרת שצוות הבלשנות של WPML משתמש בה לסקירות השוטפות של PTC באתרי לקוחות. כל עמוד מתורגם מקבל ציון בתשעה מימדים:
- דקדוק — האם היו טעויות דקדוקיות?
- משמעות — האם המשמעות של המקור נשמרה?
- טבעיות — האם זה נשמע טבעי ואידיומטי לדובר שפת אם?
- טון — האם הטון של המקור נתפס?
- פורמליות — האם נעשה שימוש ברגיסטר הנכון, הן בפנייה לקורא והן בצורות פנייה דקדוקיות?
- טרמינולוגיה — האם נעשה שימוש בטרמינולוגיה הנכונה?
- עקביות — האם הטרמינולוגיה יושמה באופן עקבי לאורך העמוד?
- אותיות רישיות — האם המוסכמות של שפת היעד נשמרו?
- לוקליזציה של מספרים, יחידות ותאריכים — האם המוסכמות של שפת היעד נשמרו?
כל מימד מקבל ציון 1–10 על ידי בלשן אנושי שהוא דובר שפת אם של שפת היעד. הציון הסופי לעמוד הוא הממוצע בתשעת המימדים, מוכפל בעשר — מה שמניב סולם 1–100 שמתאים לרצועות איכות בשפה פשוטה:
| ציון | משמעות |
|---|---|
| 90–100 | טוב מאוד עד מושלם — מוכן לפרסום ללא סקירה |
| 80–89 | טוב — מוכן לפרסום ברוב ההקשרים |
| 70–79 | מקובל עד בינוני — שמיש אך טעויות נראות לעין |
| 60–69 | בינוני — דורש תיקונים לפני פרסום |
| 50–59 | טעויות ברורות גם לדוברים שאינם שפת אם |
| מתחת ל־50 | פגמים משמעותיים מספיק כדי לדרוש עבודה מחדש |
להקשר: הממוצע המפורסם עבור תרגום אנושי גנרי נמצא בסביבות 76. 77.7 של DeepL מציב אותו ממש מעל הקו הזה. 90.0 של PTC מציב אותו בדיוק בגבול רצועת "טוב מאוד — מוכן לפרסום ללא סקירה".
גודל המדגם ובחירתו
כדי להעריך את DeepL, לקחנו 800 אתרים אקראיים שתורגמו עם DeepL ב־12 החודשים האחרונים, חילקנו אותם לפי גיל האתר, נפח תוכן ופעילות תרגום, ודגמנו בין הקבוצות. הבלשנים שלנו סקרו ידנית את העמודים הראשיים של האתרים שנדגמו — 227 דפי אינטרנט בסך הכל, שהוערכו בערבית, אנגלית, צרפתית, גרמנית, איטלקית וספרדית.
כדי להשוות את DeepL ו-PTC ישירות, תרגמנו מחדש 73 מאותם עמודים עם PTC והערכנו אותם מחדש באופן עיוור, עם אותם בלשנים שעבדו מאותו תוכן מקור. מדגם PTC קטן יותר ממדגם DeepL מכיוון שכל מדידת PTC משקפת גרסת PTC ספציפית, והמנוע ממשיך להתפתח — ראה את הסעיף לא סיימנו להלן.
לפי שפה: PTC מנצח בכל זוג
הציונים המצטברים מעניינים; התמונה לפי שפה היא מה שמספר לצוות תוכן רב־לשוני מה לצפות.
ציוני TQ לפי שפה

PTC קיבל ציון גבוה יותר מ-DeepL בכל זוג שפות שבדקנו. הפער הרחב ביותר הוא בערבית (+22.4 נקודות), שם DeepL היה בעל ביצועים נמוכים היסטורית ושם ההשקעה של WPML באיכות שפות RTL ניכרת בבירור. גרמנית (+11.5) וצרפתית (+9.9) באות אחריהן. הפער הצר ביותר הוא באנגלית (+6.0 נקודות) — וגם שם, PTC מעביר את העמוד מ"מקובל, לא מושלם באופן נראה לעין" לרצועת מוכן לפרסום.
גם השונות חשובה. להתפלגות DeepL יש זנב תחתון ארוך בערבית, עם עמודים בודדים שקיבלו ציון הרבה מתחת לממוצע — עמודים שמשתמש גרמני או צרפתי יחשוב כשבורים. ההתפלגויות של PTC צפופות יותר וממורכזות גבוה יותר, כך שצוות תוכן יכול לתכנן סביב רצועת איכות צפויה במקום לתקצב עבור חריגים.
PTC גם עולה על DeepL בכל אחד מתשעת מימדי האיכות שאנו מעריכים: דקדוק, משמעות, טבעיות, טון, פורמליות, טרמינולוגיה, עקביות, אותיות רישיות ומוסכמות לוקאל. ההישגים הגדולים ביותר הם במימדים שחשובים ביותר לאדם הקורא עמוד באתר אמיתי — טרמינולוגיה (+1.5), דקדוק (+1.4), טבעיות (+1.4), ולוקליזציה של מספרים/יחידות/תאריכים (+1.4). אין מימד שבו DeepL עומד בקצב, ואין מימד שבו PTC רק מקדים במעט.
שיעור שגיאות: התמונה התפעולית
ציונים ממוצעים שימושיים; ספירת טעויות שימושית יותר למי שמפעיל אתר אמיתי. הסוקרים שלנו רשמו כל בעיה נפרדת שזיהו בכל עמוד — דקדוק, משמעות, טרמינולוגיה, הכל.
ממוצע בעיות לעמוד

DeepL מייצר בממוצע 1.27 בעיות לעמוד. PTC מייצר 0.07 — הפחתה של פי 18 בערך בטעויות לעמוד על אותו תוכן מקור.
עבור אתר בן 200 עמודים, זה מתורגם בערך ל:
- DeepL: ~254 בעיות למצוא, להחליט עליהן ולתקן לפני פרסום.
- PTC: ~14 בעיות בכל האתר.
זה ההבדל בין תרגום AI כטיוטה ראשונה לבין תרגום AI כתהליך עבודה. DeepL הוא טיוטה ראשונה חזקה — לכל עמוד עדיין יש בעיות לתפוס לפני שהוא יוצא. PTC, במדידה זו, הוא תהליך עבודה: ספירת הטעויות נמוכה מספיק כדי ששלב הסקירה האנושית הופך לאופציונלי עבור רוב התוכן במקום חובה עבור כולו.
מה "תרגום טוב" באמת אומר
תיאורי הדרגות של מסגרת MQM הם משקל נגד שימושי לשפת השיווק המקיפה את תרגום AI. עמוד "9/10" אינו עמוד 90%; זהו עמוד שבו דובר שפת אם, הקורא בקפידה, לא מוצא דבר שהוא היה רוצה לשנות. עמוד "7/10" מקובל כמות שהוא אך לא מושלם באופן נראה לעין. עמוד "5/10" הוא עמוד שבו דובר שאינו שפת אם יכול לזהות טעויות.
הממוצע של DeepL נמצא בשבעים גבוהים — מקובל, אך לא מושלם באופן נראה לעין לקורא שפת אם קפדן. הממוצע של PTC נמצא ב90.0, בדיוק בגבול "טוב מאוד — מוכן לפרסום ללא סקירה". זה הבדל האיכות שהסוקרים שלנו מדדו. זה מתאים להבחנה אמיתית: פלט DeepL הוא נקודת התחלה הדורשת סקירה אנושית לפני פרסום; פלט PTC הוא ברוב המקרים הפרסום עצמו.
מדוע WPML יכולה לייצר איכות זו
אנו מודעים לכך ש"בנינו מנוע AI משלנו" היא טענה שהרבה חברות מעלות כרגע. PTC יוצא דופן משתי סיבות ספציפיות.
קנה מידה וסקירה מתמשכת. WPML משרת 1.5 מיליון+ אתרים ועושה זאת כבר למעלה מעשור. צוות הבלשנות של WPML סוקר באופן מתמיד את איכות התרגום של PTC — דוגם פלט, מעריך אותו עם אותה מסגרת MQM המשמשת במחקר זה, ומחפש דפוסים שבהם המנוע מייצר באופן עקבי תוצאות באיכות נמוכה יותר עבור מונח מסוים, זוג שפות או סוג תוכן.
מיקוד. PTC אינו פרויקט צדדי ב-WPML. יש לו צוות ייעודי — מהנדסים, MLOps ובלשנים אנושיים. כאשר הבלשנים מסמנים דפוס חוזר, צוות ההנדסה מתייחס אליו כבאג: הרחבת המילון, התאמת מודל הפורמליות, הוספת חריג, שילוח התיקון. הלולאה הזו פועלת באופן מתמיד, וזו הסיבה שאיכות PTC השתפרה במהלך 12 החודשים האחרונים מ"טוב כמו תרגום אנושי ממוצע" למספרים במחקר זה.
השילוב — סקירה אנושית מתמשכת בקנה מידה משמעותי, יחד עם צוות שמגיב לכל ממצא ככרטיס הנדסי — הוא מה שמייצר את מספרי האיכות למעלה. זו לא ארכיטקטורת המודל; זה מודל התפעול.
לא סיימנו
90.0 מציב את PTC בדיוק בגבול "טוב מאוד — מוכן לפרסום ללא סקירה". אנו מרוצים מהתוצאה הזו. אנו לא חושבים שזה התקרה.
לולאת QA ← הנדסה המתוארת למעלה עדיין פועלת. צוות הבלשנות של WPML ממשיך לנתח את העריכות שלקוחות מבצעים לפלט של PTC באתרים אמיתיים, מזהה את הדפוסים שהעריכות הללו חושפות, וצוות ההנדסה משלח את התיקונים — הרחבות מילון, התאמות פורמליות, התאמות ספציפיות לזוג שפות. אנו מצפים שהמדידה הבאה תהיה גבוהה יותר מזו.
מה זה אומר לתהליך העבודה שלך
תהליך העבודה הקונבנציונלי של תוכן רב־לשוני הוא תרגום ← סקירה ← פרסום. שלב הסקירה קיים מכיוון שכל מנוע AI — ורוב המתרגמים האנושיים — מייצר עבודה שזקוקה לזוג עיניים שני לפני שהיא יוצאת. שלב הסקירה הזה הוא גם המקום שבו נמצא רוב העלות ורוב ההשהיה בתוכן רב־לשוני.
עם DeepL, שלב סקירה הכרחי. יש לתפוס את 1.27 הבעיות לעמוד איפשהו; אם הצוות לא תופס אותן, הלקוחות יתפסו. עם PTC, שלב הסקירה הוא אופציונלי עבור רוב התוכן. חלק מהצוותים עדיין סוקרים — עבור עמודים בעלי חשיבות גבוהה או תעשיות מוסדרות — אך תהליך העבודה המוגדר כברירת מחדל הופך לתרגום ← פרסום, כאשר הסקירה שמורה למקרים שבאמת זקוקים לה.
זה ההבדל התפעולי שהמספרים מתארים. זה לא הבדל קטן.
מה זה אומר לעלויות שלך
עלות תרגום היא שני דברים: עלות ייצור התרגום ועלות סקירתו. יש לשלם את שניהם לפני שהתוכן יוצא לאוויר.
עבור רוב ההקשרים המקצועיים, סקירה אנושית עולה כמה סנטים למילה — בין אם סוקרים גובים למילה, לעמוד או לאתר, זה בערך המקום שבו המתמטיקה נוחתת. תרגום אנושי מלא (תרגום, ואז סקירה על ידי אדם שני) עולה בדרך כלל בסביבות €0.10–€0.20 למילה עבור זוגות שפות עיקריים, כאשר חלק הסקירה לבדו בטווח €0.04–€0.08.
הנה מה שכל תהליך עבודה עולה בפועל במונחים אלה.
תרגום אנושי בלבד — קו הבסיס. בסביבות €0.10–€0.20 למילה. שני השלבים אנושיים.
DeepL (או כל מנוע AI) בתוספת סקירה אנושית. AI מטפל בשלב התרגום; אדם עדיין צריך לסקור כל עמוד, מכיוון שב־1.27 בעיות לעמוד הבעיות יגיעו ללקוחות אם אף אחד לא יתפוס אותן קודם. שלב התרגום הוא בעצם חינם; שלב הסקירה עדיין עולה €0.04–€0.08 למילה. חיסכון כולל לעומת אנושי בלבד: כ־60%. זה המצג הסטנדרטי "AI חוסך לך כסף בתרגום" — וזה נכון — אך תקרת העלות נמצאת בשלב הסקירה ש-DeepL עדיין דורש.
PTC, ללא צורך בבדיקה. PTC עולה €0.0012–€0.003 למילה — 4 נקודות זיכוי למילה כפול €0.30–€0.75 ל־1,000 נקודות זיכוי בהתאם לנפח, כאשר 2,000 נקודות הזיכוי הראשונות בחודש חינם. (ראה תמחור התרגום האוטומטי של WPML לטבלת השכבות המלאה.) מכיוון שהאיכות הנמדדת של PTC (ציון TQ של 90.0, 0.07 בעיות לעמוד, פער של +12.3 נקודות על פני DeepL על אותו תוכן מקור) גבוהה מספיק כדי לדלג על שלב הבדיקה ברוב המקרים, עלות הבדיקה יורדת לאפס. חיסכון כולל לעומת תרגום אנושי בלבד: כ־99%.
זה לא שיפור שולי בתהליך העבודה של AI פלוס בדיקה. זהו משטר עלויות שונה.
במבט חטוף — עלות לפרסום מילה מתורגמת
| תהליך עבודה | תרגום | בדיקה | סה"כ | חיסכון לעומת תרגום אנושי |
|---|---|---|---|---|
| תרגום אנושי מלא | €0.10–€0.20 | כלול | €0.10–€0.20 | — |
| DeepL + בדיקה אנושית | ~€0 | €0.04–€0.08 | €0.04–€0.08 | ~60% |
| PTC, ללא בדיקה | €0.0012–€0.003 | €0 | €0.0012–€0.003 | ~99% |
תעריפי התרגום האנושי הם הערכות תעשייתיות טיפוסיות לזוגות שפות עיקריים. תמחור PTC לקוח מהתעריפים שפורסמו על ידי WPML.
הערה על ביצוע בדיקה בעצמך: כאשר בעל עסק מבצע את הבדיקה בעצמו במקום לשלם לבודק, העלות אינה אפס — היא פשוט פחות גלויה. השעות המושקעות בבדיקה הן שעות שלא מושקעות בשאר העסק, ובכל תעריף שעתי סביר העלות המשתמעת היא בדרך כלל גבוהה יותר ממה שבודק חיצוני היה גובה, לא נמוכה יותר. החיסכון של PTC חל ללא קשר למי משלם על שלב הבדיקה כיום.
מה זה פותח. כאשר תרגום עולה €0.10+ למילה, אתה מתרגם באופן סלקטיבי — דף הבית, קטגוריות המוצרים המובילות, קומץ פוסטים בבלוג עם תנועה גבוהה. כל השאר נשאר בשפת המקור כי החשבון לא עובד. כאשר תרגום עולה €0.002 למילה ומייצר פלט שהוא טוב יותר מתרגום אנושי טיפוסי, החשבון עובד עבור תוכן שלא היה כדאי בעבר:
- תרגום קטלוג מלא במסחר אלקטרוני — כל תיאור מוצר בזנב הארוך, כל גרסה.
- פורטלי תיעוד מלאים בכל שפה שלקוח עשוי לדבר, לא רק בשלוש המובילות.
- מאגרי ידע, שאלות נפוצות בתמיכה, ארכיוני בלוג — הזנב הארוך שמניע חיפוש אך מעולם לא הצדיק את עלות התרגום שלו.
- תוכן עריכה מקומי עבור מפרסמים הפועלים בשווקים שבהם הכנסה לעמוד לפי קהל לא יכלה לכסות תרגום אנושי.
תוכן רב־לשוני היה שאלה של "מה אנחנו יכולים להרשות לעצמנו לתרגם" במשך עשרות שנים. עם PTC, השאלה הופכת ל"מה שווה לתרגם" — שהיא שאלה שונה ומעניינת יותר.
כיצד להשיג איכות זו באתר שלך
PTC הוא מנוע ברירת המחדל במצב Translate Everything של WPML, שהוא הגדרה גלובלית יחידה שמתרגמת כל עמוד באתר שלך, באופן אוטומטי, ברקע. אין צורך לנהל תצורה לכל עמוד.
כדי להשיג את האיכות שנמדדה במחקר זה, ההגדרה היחידה שאתה צריך מעבר להפעלת Translate Everything היא להשקיע כדקה בתיאור קהל היעד והטון של האתר שלך בהגדרות Translate Everything — לדוגמה, "חברת תוכנה הפונה למפתחים, טון פורמלי, טרמינולוגיה טכנית נשמרת באנגלית". PTC משתמש בתיאור זה כדי ליישר תרגומים עם קול המותג שלך.
זו כל ההגדרה. התוצאה היא מה שהמחקר הזה מדד.
הערה על מה שלא עשינו
לא השווינו את PTC ל־Google Translate, Azure Translator או שירותים מבוססי LLM דרך ה־API הציבורי שלהם. הסיבה: מנועים אלה משתנים לעתים קרובות ומדידה בנקודת זמן אחת תהיה מיושנת תוך חודשים. ההשוואה ל־DeepL היא זו שביצענו מכיוון ש־DeepL הוא אמת המידה המצוטטת ביותר לתרגום AI ברמת ייצור, ומכיוון ש־DeepL הוא מה שרוב המתחרים שלנו משתמשים בו מאחורי הקלעים.
כמו כן, לא מדדנו מהירות, עלות או חוויית מפתח במחקר זה — רק איכות. ההשוואות הללו קיימות בעמוד התכונות שלנו ובעמודי ההשוואה שלנו, והן מספרות את הסיפור שלהן.
נסה זאת
אם אתה מפעיל אתר WordPress רב־לשוני ורוצה לראות את הפלט של PTC על התוכן שלך, התקן את WPML, הפעל את Translate Everything והשווה את התוצאה למה שאתה משתמש בו כיום. הבדל האיכות המתואר כאן הוא הבדל האיכות שאתה אמור לצפות לראות.
שאלות מתודולוגיה או בקשות נתונים: צור קשר עם צוות WPML.
המחקר בוצע על ידי צוות הבלשנות של WPML, אפריל 2026. מדגם: 227 דפי אינטרנט מתורגמים ב־DeepL שנבדקו על ידי בלשנים דוברי שפת אם; 73 מהם תורגמו מחדש עם גרסת PTC הנוכחית וקיבלו ציון מחדש באופן עיוור מול אותו תוכן מקור. שפות: ערבית, אנגלית, צרפתית, גרמנית, איטלקית, ספרדית. ציון: מסגרת איכות תרגום מבוססת MQM, 9 ממדים, 1–10 לכל ממד, ממוצע ומותאם לתוצאה של 0–100.