Muse Spark
מודל סגור של מטא עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 71.2.
כל רשומות המדד (19)
שירות לקוחות אוטומטי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| τ²-bench | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 91.5 | 0.34 | קישור למקור |
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 89.8 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 86.4 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ScreenSpot Pro | מדד משני לפי דיווח היצרן | 84.1 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: OSWorld · AndroidWorld · WebArena-Verified
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 89.8 | 0.85 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 50.4 | 0.28 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux
דיוק עובדתי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 74.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: SimpleQA · SimpleQA Verified
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 74.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · BrowseComp
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMMU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 80.4 | 0.72 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 50.4 | 0.24 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU
הבנה חזותית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 86.4 | 0.72 | קישור למקור |
| ScreenSpot Pro | מדד משני לפי דיווח היצרן | 84.1 | 0.42 | קישור למקור |
| ERQA | מדד משני לפי דיווח היצרן | 64.7 | 0.42 | קישור למקור |
| ZeroBench | מדד משני לפי דיווח היצרן | 33.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: OfficeQA Pro · MathVision · VideoMMMU
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Claw-Eval | מדד משני · בהסתייגות לוח עצמאי | 63.8 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 59.0 | 0.85 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לוח עצמאי | 63.8 | 0.40 | קישור למקור |
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 74.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · MLE-bench · Gert Labs
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 59.0 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לפי דיווח היצרן | 77.4 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 52.4 | 0.72 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 19.7 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
בריאות ורפואה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MedXpertQA | מדידה בתחום לפי דיווח היצרן | 52.6 | 0.72 | קישור למקור |
| HealthBench | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 42.8 | 0.34 | קישור למקור |
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 59.0 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 52.4 | 0.72 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 19.7 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 39.0 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לפי דיווח היצרן | 42.5 | 0.42 | קישור למקור |
| ZeroBench | מדד משני לפי דיווח היצרן | 33.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3
