מערכת שנבדקה

GLM-5

נבדק כמודל APIמודל פתוחZ.AI

מודל פתוח של Z.AI עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 66.1.

ציונים לפי יכולת
עמידה בהוראות
כיסוי 9%
92.6
שפה וניסוח
כיסוי 9%
83.1
עברית
כיסוי 18%
83.1
חשיבה מדעית
כיסוי 47%
79.2
ידע וחשיבה
כיסוי 45%
74.1
מתמטיקה
כיסוי 29%
72.3
מחקר ברשת
כיסוי 15%
69.8
קוד ופיתוח תוכנה
כיסוי 23%
65.7
מסמכים ארוכים
כיסוי 35%
60.8
עבודה בשורת פקודה
כיסוי 43%
56.2
כתיבת קוד עצמאית
כיסוי 22%
55.7
ביצוע משימות מרובות שלבים
כיסוי 29%
51.1
תוצרים מקצועיים
כיסוי 44%
51.0
טקסט ותמונה
כיסוי 27%
50.4
שימוש בכלים
כיסוי 41%
41.2
חשיבה מופשטת
כיסוי 18%
4.9
מדדים

כל רשומות המדד (23)

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
IFEval
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
92.60.35קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFBench · MAXIFE

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-ProX
מדד משני · עברית
לפי דיווח היצרן
83.10.32קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · Global-MMLU (GMMLU) · INCLUDE

עברית

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-ProX
מדד משני · עברית
לפי דיווח היצרן
83.10.32קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MAXIFE

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.80.85קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
66.80.59קישור למקור

לא נמצאו תוצאות עבור: SciCode · CritPt

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.80.85קישור למקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.70.59קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
50.40.59קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
66.80.59קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Redux

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
95.80.59קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
86.40.59קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
16.40.40קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
WideResearch
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
69.80.35קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · Agents' Last Exam · BrowseComp · DeepSearchQA

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.81.00קישור למקור
SWE-rebench
מדידה עצמאית · מתעדכן
לוח עצמאי
62.81.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
55.10.59קישור למקור
SWE-bench Multilingual
מדד משני
לוח עצמאי
69.70.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

מסמכים ארוכים

מבחן הערכהסטטוסציוןמשקלמקור
LongBench v2
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
60.80.59קישור למקור

לא נמצאו תוצאות עבור: MRCR 1M

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
56.20.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
56.20.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
55.10.59קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
56.20.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
31.10.35קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
38.00.35קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
51.00.33קישור למקור
WideResearch
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
69.80.28קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לפי דיווח היצרן
57.70.28קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · AndroidWorld · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
51.00.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
50.40.59קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
31.10.35קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
38.00.35קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לפי דיווח היצרן
57.70.28קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
4.90.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

מערכות נוספות

להשוואה