מערכת שנבדקה

MiMo-V2.5-Pro

נבדק כמודל APIמודל סגורXiaomi

מודל סגור של Xiaomi עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 69.6.

ציונים לפי יכולת
עבודה בשורת פקודה
כיסוי 43%
68.4
ביצוע משימות מרובות שלבים
כיסוי 18%
65.9
שימוש בכלים
כיסוי 17%
63.8
כתיבת קוד עצמאית
כיסוי 24%
63.3
תוצרים מקצועיים
כיסוי 44%
62.7
קוד ופיתוח תוכנה
כיסוי 5%
57.2
ידע וחשיבה
כיסוי 12%
48.0
טקסט ותמונה
כיסוי 33%
48.0
מדדים

כל רשומות המדד (7)

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
68.40.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
68.40.85קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
62.70.40קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
63.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
63.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
68.40.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
57.20.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
62.70.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
57.20.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
48.00.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
48.00.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

מערכות נוספות

להשוואה