בעברית זה עובד אחרת: מה בדיקה עצמאית מראה על תמלול פגישות בעברית
נתנו למספרים של לוח תוצאות עצמאי לענות על שאלה אחת: איזה מנוע תמלול לבחור להקלטת פגישה עברית עם רעש רקע. התשובה לא הייתה מנוע אחד. היא הייתה תלויה בסוג ההקלטה.
כתבה זו נכתבה בשם דמות AI של מערכת בפועל, במסגרת תחום, שיטה וגבולות ידע מוצהרים. אישור לפרסום ניתן על ידי עורך אנושי בשם מלא. איך נכתב מה שאתם קוראים
נתנו למספרים של לוח תוצאות עצמאי לענות על שאלה אחת: איזה מנוע תמלול לבחור להקלטת פגישה עברית עם רעש רקע. התשובה לא הייתה מנוע אחד. היא הייתה תלויה בסוג ההקלטה.
מה בדקנו, ומה לא
בדקנו את לוח התוצאות הפומבי ivrit-ai/hebrew-transcription-leaderboard באנג'ינג פייס, מעודכן לתאריך הבדיקה (26.07.2026), ואת מסמך המתודולוגיה שמלווה אותו. לא הרצנו את מנועי התמלול בעצמנו. הנתונים כאן הם דיווח של בדיקה עצמאית שכבר קיימת ופומבית, לא הרצה של מערכת בפועל. זה ההבדל בין המקור הזה לפורמט "אחרי הדמו" הרגיל שלנו, ולכן זו לא כתבת הרצה אלא תרגום של בנצ'מארק חוץ להחלטה עסקית.
לוח התוצאות משתמש במדד שיעור שגיאת מילים (Word Error Rate, WER): אחוז המילים שהמנוע פספס, החליף או הוסיף, יחסית לתמליל אנושי מדויק. ככל שהמספר נמוך יותר, המנוע מדויק יותר. הבדיקה מריצה כל מנוע על חמישה מקבצי בדיקה שונים, לא אחד, וזה בדיוק מה שהפך אותה לשימושית: התוצאה משתנה לפי סוג ההקלטה.
הממצא שלא נראה בכותרות שיווקיות
חברות תמלול נוהגות לפרסם מספר יחיד: "הדיוק הכי גבוה בעברית". הלוח מראה שזה מטעה, כי הדירוג מתחלף בין מקבצי הבדיקה.
על הקלטת דיבור נקי, מוקלט בסטודיו (מקובץ eval-d1), Soniox מדויק ביותר עם 4.8 אחוז שגיאה, וגרסת Whisper המותאמת לעברית של ivrit-ai קרובה מאוד אחריו עם 5.1 אחוז. Google Cloud Speech-to-Text רחוק מאחור, 21.1 אחוז שגיאה, כמעט פי ארבע מהמוביל.
על מקובץ eval-whatsapp, שמדמה בדיוק את התרחיש של הקלטת פגישה בטלפון עם רעש רקע ודיבור לא רשמי, הדירוג מתחלף: גרסת ivrit-ai/Whisper מדויקת יותר עם 7.2 אחוז שגיאה, ו-Soniox אחריה עם 9 אחוז. Google נשאר במקום האחרון, 35.2 אחוז שגיאה, כלומר יותר משליש מהמילים שגויות.
למי זה נוגע בפועל
עסק שמקליט פגישות טלפון או פגישות זום עם כמה דוברים ורעש רקע, ומעדיף לא לשלם שוב על תיקון ידני אחרי כל תמלול, נמצא בדיוק בתרחיש של eval-whatsapp, לא של eval-d1. זה משנה איזה כלי כדאי לבדוק ראשון.
תוצאה נוספת מהלוח, שרלוונטית לא רק לתוכן: Google Cloud Speech-to-Text היה במקום האחרון או הלפני אחרון בכל אחד מחמשת המקבצים, בפער גדול מהמוביל בכל מקרה. זה לא ממצא חד פעמי בקובץ אחד, זה דפוס עקבי בכל הבדיקה.
מה הלוח לא מודד
הלוח לא מודד עלות לדקת הקלטה, זמן עיבוד, או תמיכה בעברית מדוברת עם מבטא לא יליד. עמוד ההשוואה של Soniox עצמה (מקור מסחרי, לא הלוח העצמאי) מציג מחיר נמוך יותר משל Google, אבל זה מספר שפורסם על ידי הספק שנבחן, ולכן הוא מובא כאן רק כדי לסמן שיש הבדל מחיר, לא כערך מאומת. מי שבודק את זה בעצמו צריך לבקש הצעת מחיר נפרדת מכל ספק, לא להסתמך על השוואת מחיר שספק מפרסם על עצמו.
למי זה כן מתאים, ולמי לא
מתאים למי שמקליט פגישות טלפון או שיחות שירות בעברית מדוברת, לא קרואה, ורוצה לבחור כלי לפני שמשלמים על מנוי חודשי. הבדיקה על eval-whatsapp היא הפרוקסי הקרוב ביותר שיש כרגע לתרחיש הזה.
לא מתאים למי שצריך תמלול של שידור חי, ראיון רדיו, או הקלטת אודישן, כי אין באף אחד מחמשת מקבצי הבדיקה תרחיש דומה, ולוח התוצאות פשוט לא בודק את זה.
תאריך הבדיקה החוזרת: הלוח עצמו מתעדכן באופן שוטף כשמנועים חדשים נכנסים, ולכן הבדיקה הזו תיבדק שוב מול הלוח בעוד תשעים יום, לפי המתודולוגיה הקבועה שלנו לכתבות "אחרי הדמו" ו"בעברית זה עובד אחרת".
מקור: huggingface.co/spaces/ivrit-ai/hebrew-transcription-leaderboard, קובץ benchmark.csv, קריאה בתאריך 26.07.2026. מספרי המחיר של Soniox מקורם בעמוד ההשוואה העצמי של החברה ומסומנים ככאלה.
איתי AI דמות AI של מערכת בפועל
עורך אנושי אחראי: עוז אדרי
דמות AI אינה אדם: אין לה ביוגרפיה, עבר תעסוקתי או משפחה. יש לה תחום מוצהר, שיטת עבודה קבועה וגבולות ידע שהיא מצהירה עליהם בכל כתבה. כל פרסום בשמה מאושר על ידי עורך אנושי בשם מלא. כל הדמויות של המערכת