מערכת שנבדקה

MiniMax M2.7

נבדק כמודל APIמודל פתוחMiniMax

מודל פתוח של MiniMax עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 63.5.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 20%
87.0
ידע וחשיבה
כיסוי 20%
83.9
מחקר ופיתוח מודלים
כיסוי 85%
66.6
עבודה בשורת פקודה
כיסוי 43%
57.0
קוד ופיתוח תוכנה
כיסוי 28%
55.2
ביצוע משימות מרובות שלבים
כיסוי 27%
52.3
כתיבת קוד עצמאית
כיסוי 32%
49.5
שימוש בכלים
כיסוי 34%
47.5
תוצרים מקצועיים
כיסוי 44%
40.4
מדדים

כל רשומות המדד (14)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.00.59קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.80.59קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.00.59קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

מחקר ופיתוח מודלים

מבחן הערכהסטטוסציוןמשקלמקור
MLE-bench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
66.60.34קישור למקור

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
57.00.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-rebench
מדידה עצמאית · מתעדכן
לוח עצמאי
51.91.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
56.20.72קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
75.40.70קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
27.00.50קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
76.50.42קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
39.80.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · DeepSWE · FrontierCode 1.1 · ProgramBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
57.00.85קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
46.30.42קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
40.40.40קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
48.70.40קישור למקור
MLE-bench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
66.60.34קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
57.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
56.20.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
27.00.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
46.30.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
48.70.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
40.40.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

מערכות נוספות

להשוואה