מערכת שנבדקה

MiMo-V2-Pro

נבדק כמודל APIמודל סגורXiaomi

מודל סגור של Xiaomi עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.3.

ציונים לפי יכולת
קוד ופיתוח תוכנה
כיסוי 5%
78.0
שימוש בכלים
כיסוי 17%
57.8
ביצוע משימות מרובות שלבים
כיסוי 9%
52.5
תוצרים מקצועיים
כיסוי 44%
36.7
מדדים

כל רשומות המדד (4)

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
78.00.70קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
57.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
57.80.40קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
36.70.13קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
36.70.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

מערכות נוספות

להשוואה