מערכת שנבדקה
GLM-5-Turbo
נבדק כמודל APIמודל סגורZ.AI
מודל סגור של Z.AI עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 66.5.
ציונים לפי יכולת
שימוש בכלים
כיסוי 17%
55.8
ביצוע משימות מרובות שלבים
כיסוי 4%
55.8
מדדים
כל רשומות המדד (2)
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Claw-Eval | מדד משני · בהסתייגות לוח עצמאי | 55.8 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Claw-Eval | מדד משני · בהסתייגות לוח עצמאי | 55.8 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs
מערכות נוספות
להשוואה
Apodex 1.1Claude Fable 5Claude Opus 4.6Claude Opus 4.7Claude Opus 4.7 (Adaptive)Claude Opus 4.8Claude Opus 5Claude Sonnet 5Command A+DeepSeek V3.2DeepSeek V4 Flash Vision ExpDeepSeek V4 Pro 0813Gemini 3.1 Flash LiteGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.7 FlashGemini 3 ProGemma 4 31BGLM-5GLM-5.1GLM-5.2GLM-5.3GLM 5.3 FlashGLM-5V-TurboGPT-5.4GPT-5.4 nanoGPT-5.5GPT-5.6 LunaGPT-5.6 SolGPT-5.6 TerraGrok 4Grok 4.1 Fast (Reasoning)Grok 4.3Grok 4.5Grok 4.6Grok 4 Fast (Reasoning)Grok Build 0.1Hy3InklingInkling-SmallKimi K2.6Kimi K2.5Kimi K2.5 (Reasoning)Kimi K2.7 CodeKimi K3Ling 3.0 FlashMiMo-V2.5-ProMiMo-V2-OmniMiMo-V2-ProMiniMax M2.5MiniMax M2.7MiniMax M3Ministral 3 14B (Reasoning)Mistral Medium 3.5Muse Glimmer 30BMuse SparkMuse Spark 1.1Muse Spark 1.2Nemotron 3.5 LightningNemotron 3 Nano 30BNemotron 3 UltraNova ProPhi-4Qwen3.5 397B (Reasoning)Qwen3.6 27BQwen3.6 PlusQwen3.7 FlashQwen3.7 MaxQwen3.7 PlusQwen3.8 2.4T A95BQwen3.8-27BQwen3.8 FlashQwen3.8-Flash-NextQwen3.8 MaxStep 3.5 FlashTrinity-Large-Preview
