מערכת שנבדקה

GLM-5.3

נבדק כמודל APIמודל פתוחZ.AI

מודל פתוח של Z.AI עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 63.3.

ציונים לפי יכולת
שימוש בכלים
כיסוי 18%
73.0
ידע וחשיבה
כיסוי 17%
63.3
עמידה בהוראות
כיסוי 26%
63.3
ניתוח נתונים
כיסוי 35%
63.3
מתמטיקה
כיסוי 18%
63.3
שפה וניסוח
כיסוי 30%
63.3
קוד ופיתוח תוכנה
כיסוי 17%
54.7
כתיבת קוד עצמאית
כיסוי 35%
50.9
תהליכי עבודה בארגון
כיסוי 43%
48.2
ביצוע משימות מרובות שלבים
כיסוי 24%
41.3
מחקר ברשת
כיסוי 18%
28.5
עבודה בשורת פקודה
כיסוי 43%
28.3
מדדים

כל רשומות המדד (10)

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.00.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
58.00.42קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
66.90.42קישור למקור
ProgramBench
מדד משני
לפי דיווח היצרן
19.00.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · FrontierCode 1.1

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.31.00קישור למקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
28.30.85קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
66.90.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · Vibe Code Bench

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
AutomationBench
מדד משני
לפי דיווח היצרן
48.20.42קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
28.30.85קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.00.42קישור למקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
28.50.42קישור למקור
AutomationBench
מדד משני
לפי דיווח היצרן
48.20.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · OSWorld · MCP Atlas · AndroidWorld · WideResearch · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
28.50.42קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · BrowseComp · DeepSearchQA

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
28.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0

מערכות נוספות

להשוואה