MiniMax M2.7
מודל פתוח של MiniMax עם חלון הקשר של 200K טוקנים. מדד האיכות המרוכז של המקור עומד על 63.5.
כל רשומות המדד (14)
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 87.0 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 80.8 | 0.59 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 87.0 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
מחקר ופיתוח מודלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MLE-bench | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 66.6 | 0.34 | קישור למקור |
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 57.0 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-rebench | מדידה עצמאית · מתעדכן לוח עצמאי | 51.9 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.2 | 0.72 | קישור למקור |
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לפי דיווח היצרן | 75.4 | 0.70 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 27.0 | 0.50 | קישור למקור |
| SWE-bench Multilingual | מדד משני לפי דיווח היצרן | 76.5 | 0.42 | קישור למקור |
| NL2Repo | מדד משני לפי דיווח היצרן | 39.8 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · DeepSWE · FrontierCode 1.1 · ProgramBench
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 57.0 | 0.85 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 46.3 | 0.42 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 40.4 | 0.40 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לוח עצמאי | 48.7 | 0.40 | קישור למקור |
| MLE-bench | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 66.6 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 57.0 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.2 | 0.72 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 27.0 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Toolathlon | מדד משני לפי דיווח היצרן | 46.3 | 0.42 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לוח עצמאי | 48.7 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 40.4 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
