מערכת שנבדקה

GLM-5-Turbo

נבדק כמודל APIמודל סגורZ.AI

מודל סגור של Z.AI עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 66.5.

ציונים לפי יכולת
שימוש בכלים
כיסוי 17%
55.8
ביצוע משימות מרובות שלבים
כיסוי 4%
55.8
מדדים

כל רשומות המדד (2)

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
55.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
55.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs

מערכות נוספות

להשוואה