מערכת שנבדקה

GLM-5.1

נבדק כמודל APIמודל פתוחZ.AI

מודל פתוח של Z.AI עם חלון הקשר של 203K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.2.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 28%
89.9
ידע וחשיבה
כיסוי 27%
80.5
מתמטיקה
כיסוי 34%
76.9
מחקר ברשת
כיסוי 15%
68.0
שימוש בכלים
כיסוי 34%
67.2
ביצוע משימות מרובות שלבים
כיסוי 23%
64.3
עבודה בשורת פקודה
כיסוי 43%
63.5
תוצרים מקצועיים
כיסוי 44%
60.1
קוד ופיתוח תוכנה
כיסוי 27%
58.4
כתיבת קוד עצמאית
כיסוי 32%
54.0
טקסט ותמונה
כיסוי 33%
52.3
דיוק עובדתי
כיסוי 33%
34.0
מדדים

כל רשומות המדד (18)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
89.90.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
89.90.85קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
52.30.28קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
95.30.72קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
82.60.72קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
33.50.40קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
68.00.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
71.80.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
62.30.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
63.50.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
71.80.42קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
60.10.40קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
62.30.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
63.50.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
60.10.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.21.00קישור למקור
SWE-rebench
מדידה עצמאית · מתעדכן
לוח עצמאי
62.71.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
58.40.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
31.50.50קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
42.70.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · DeepSWE · FrontierCode 1.1 · ProgramBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
63.50.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
58.40.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
31.50.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
52.30.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
34.00.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

מערכות נוספות

להשוואה