מערכת שנבדקה

MiMo-V2-Omni

נבדק כמודל APIמודל סגורXiaomi

מודל סגור של Xiaomi עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 62.8.

ציונים לפי יכולת
קוד ופיתוח תוכנה
כיסוי 5%
74.8
שימוש בכלים
כיסוי 17%
45.2
ביצוע משימות מרובות שלבים
כיסוי 4%
45.2
מדדים

כל רשומות המדד (3)

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
74.80.70קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
45.20.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
45.20.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs

מערכות נוספות

להשוואה