GLM-5.2
מודל פתוח של Z.AI עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 63.6.
כל רשומות המדד (23)
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| LiveBench Mathematics | מדידה עצמאית · מתעדכן לוח עצמאי | 89.8 | 1.00 | קישור למקור |
| AIME 2026 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 99.2 | 0.72 | קישור למקור |
| HMMT Feb 2026 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 92.5 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MATH Level 5 · MathVision · FrontierMath v2
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| LiveBench Language | מדידה עצמאית · מתעדכן לוח עצמאי | 76.2 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| LiveBench Reasoning | מדידה עצמאית · מתעדכן לוח עצמאי | 78.6 | 1.00 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 91.2 | 0.72 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 54.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMLU-Pro · SuperGPQA · MMLU-Redux
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| LiveBench Data Analysis | מדידה עצמאית · מתעדכן לוח עצמאי | 73.7 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: CharXiv
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| LiveBench Instruction Following | מדידה עצמאית · מתעדכן לוח עצמאי | 62.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 91.2 | 0.72 | קישור למקור |
| CritPt | מדד משני לפי דיווח היצרן | 20.9 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| LiveBench Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 79.7 | 1.00 | קישור למקור |
| LiveBench Agentic Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 51.9 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 62.1 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 55.0 | 0.70 | קישור למקור |
| NL2Repo | מדד משני לפי דיווח היצרן | 48.9 | 0.42 | קישור למקור |
| ProgramBench | מדד משני לפי דיווח היצרן | 63.7 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SciCode · SWE-bench Multilingual · Vibe Code Bench · DeepSWE · FrontierCode 1.1
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MCP Atlas | מדד משני לפי דיווח היצרן | 76.8 | 0.42 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 48.2 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench Reasoning | מדידה עצמאית · מתעדכן לוח עצמאי | 78.6 | 1.00 | קישור למקור |
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 22.8 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: ARC-AGI-3 · ZeroBench
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 54.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 73.2 | 1.00 | קישור למקור |
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 4.6 | 1.00 | קישור למקור |
| LiveBench Agentic Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 51.9 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 81.0 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 62.1 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 55.0 | 0.70 | קישור למקור |
לא נמצאו תוצאות עבור: Vibe Code Bench · DeepSWE
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 4.6 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 81.0 | 0.85 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 76.8 | 0.42 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 48.2 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · OSWorld · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 4.6 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 81.0 | 0.85 | קישור למקור |
מחקר מדעי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CritPt | מדד משני לפי דיווח היצרן | 20.9 | 0.42 | קישור למקור |
