מערכת שנבדקה

MiniMax M2.5

נבדק כמודל APIמודל סגורMiniMax

מודל סגור של MiniMax עם חלון הקשר של 128K טוקנים. מדד האיכות המרוכז של המקור עומד על 59.1.

ציונים לפי יכולת
קוד ופיתוח תוכנה
כיסוי 15%
58.7
ביצוע משימות מרובות שלבים
כיסוי 10%
25.6
תוצרים מקצועיים
כיסוי 100%
25.6
כתיבת קוד עצמאית
כיסוי 8%
14.8
חשיבה מופשטת
כיסוי 18%
4.9
מדדים

כל רשומות המדד (7)

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
75.81.00קישור למקור
SWE-bench Multilingual
מדד משני
לוח עצמאי
68.30.50קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
14.80.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
14.80.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
39.10.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Claw-Eval

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
14.80.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
39.10.40קישור למקור

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Vibe Code Bench
מדד משני
לוח עצמאי
14.80.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
4.90.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

מערכות נוספות

להשוואה