GLM-5
מודל פתוח של Z.AI עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 66.1.
כל רשומות המדד (23)
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| IFEval | מדד משניזיקה מסחרית מוצהרת לפי דיווח היצרן | 92.6 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFBench · MAXIFE
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-ProX | מדד משני · עברית לפי דיווח היצרן | 83.1 | 0.32 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · Global-MMLU (GMMLU) · INCLUDE
עברית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-ProX | מדד משני · עברית לפי דיווח היצרן | 83.1 | 0.32 | קישור למקור |
לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MAXIFE
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 87.8 | 0.85 | קישור למקור |
| SuperGPQA | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 66.8 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · CritPt
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 87.8 | 0.85 | קישור למקור |
| MMLU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 85.7 | 0.59 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 50.4 | 0.59 | קישור למקור |
| SuperGPQA | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 66.8 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Redux
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| AIME 2026 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 95.8 | 0.59 | קישור למקור |
| HMMT Feb 2026 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 86.4 | 0.59 | קישור למקור |
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 16.4 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| WideResearch | מדד משניהערכה על ידי מודל אחר לפי דיווח היצרן | 69.8 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · Agents' Last Exam · BrowseComp · DeepSearchQA
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 72.8 | 1.00 | קישור למקור |
| SWE-rebench | מדידה עצמאית · מתעדכן לוח עצמאי | 62.8 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 55.1 | 0.59 | קישור למקור |
| SWE-bench Multilingual | מדד משני לוח עצמאי | 69.7 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
מסמכים ארוכים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LongBench v2 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 60.8 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: MRCR 1M
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 56.2 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 56.2 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 55.1 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 56.2 | 0.85 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 31.1 | 0.35 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 38.0 | 0.35 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 51.0 | 0.33 | קישור למקור |
| WideResearch | מדד משניהערכה על ידי מודל אחר לפי דיווח היצרן | 69.8 | 0.28 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לפי דיווח היצרן | 57.7 | 0.28 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · AndroidWorld · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 51.0 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 50.4 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MCP Atlas | מדד משני לפי דיווח היצרן | 31.1 | 0.35 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 38.0 | 0.35 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לפי דיווח היצרן | 57.7 | 0.28 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 4.9 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench
