GLM-5.3
מודל פתוח של Z.AI עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 63.3.
כל רשומות המדד (10)
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Toolathlon | מדד משני לפי דיווח היצרן | 73.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
| NL2Repo | מדד משני לפי דיווח היצרן | 58.0 | 0.42 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 66.9 | 0.42 | קישור למקור |
| ProgramBench | מדד משני לפי דיווח היצרן | 19.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · FrontierCode 1.1
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 63.3 | 1.00 | קישור למקור |
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 28.3 | 0.85 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 66.9 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · Vibe Code Bench
תהליכי עבודה בארגון
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| AutomationBench | מדד משני לפי דיווח היצרן | 48.2 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: OfficeQA Pro
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 28.3 | 0.85 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 73.0 | 0.42 | קישור למקור |
| Agents' Last Exam | מדד משני לפי דיווח היצרן | 28.5 | 0.42 | קישור למקור |
| AutomationBench | מדד משני לפי דיווח היצרן | 48.2 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · OSWorld · MCP Atlas · AndroidWorld · WideResearch · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Agents' Last Exam | מדד משני לפי דיווח היצרן | 28.5 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · BrowseComp · DeepSearchQA
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 28.3 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 2.0
