מערכת שנבדקה

GLM-5V-Turbo

נבדק כמודל APIמודל סגורZ.AI

מודל סגור של Z.AI עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 62.7.

ציונים לפי יכולת
שימוש בכלים
כיסוי 17%
53.8
ביצוע משימות מרובות שלבים
כיסוי 9%
48.0
תוצרים מקצועיים
כיסוי 44%
30.8
מדדים

כל רשומות המדד (3)

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
53.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
53.80.40קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
30.80.13קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
30.80.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

מערכות נוספות

להשוואה