סדרת מבחנים
מבחן העברית של האתר
מדידה עצמאית · עבריתהערכה על ידי מודל אחר
מה הוא מודד
עברית: הבנה ויצירה בעברית · שפה וניסוח: איכות לשונית, ניסוח ועריכה
מה הוא לא מודד
- אינו בודק ידע מקצועי ישראלי, דין או רגולציה מקומית.
- הציון נקבע בהערכה על ידי מודל אחר ולכן משקלו מוגבל בתוך היכולת.
הערות על המבחן
סדרת מבחנים של 25 משימות בעברית שרצה כאן פעם בשבוע על המודלים המובילים: כתיבה, תקינות לשונית, סיכום, תרגום והבנת הנקרא. ההערכה נעשית על ידי מודל שופט לפי מדריך קבוע, ולכן משקלה מוגבל.
תוצאות שנמדדו
| מערכת | ציון | פרוטוקול | מקור |
|---|---|---|---|
| GPT-5.6 Sol | 97.1 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.6 Terra | 97.1 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.5 | 96.6 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| Gemini 3.7 Flash | 96.0 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.6 Luna | 95.1 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.4 | 94.8 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| Gemini 3.5 Flash | 94.7 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| Gemini 2.5 Pro | 94.0 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.2 | 93.9 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.4 mini | 93.6 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| Gemini 3.6 Flash | 92.8 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| Gemini 2.5 Flash | 92.7 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
| GPT-5.4 nano | 88.2 | מבחן העברית של האתר, 25 מתוך 25 משימות, שיפוט אוטומטי לפי מדריך קבוע | קישור |
