מערכת שנבדקה

Muse Spark

נבדק כמודל APIמודל סגורמטא

מודל סגור של מטא עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 71.2.

ציונים לפי יכולת
שירות לקוחות אוטומטי
כיסוי 85%
91.5
חשיבה מדעית
כיסוי 28%
89.8
ניתוח נתונים
כיסוי 25%
86.4
הפעלת מחשב
כיסוי 18%
84.1
ידע וחשיבה
כיסוי 27%
80.0
דיוק עובדתי
כיסוי 28%
74.8
מחקר ברשת
כיסוי 15%
74.8
טקסט ותמונה
כיסוי 66%
72.9
הבנה חזותית
כיסוי 52%
69.9
שימוש בכלים
כיסוי 17%
63.8
ביצוע משימות מרובות שלבים
כיסוי 18%
63.6
עבודה בשורת פקודה
כיסוי 43%
59.0
קוד ופיתוח תוכנה
כיסוי 15%
54.8
בריאות ורפואה
כיסוי 85%
49.5
כתיבת קוד עצמאית
כיסוי 32%
47.2
מתמטיקה
כיסוי 7%
39.0
חשיבה מופשטת
כיסוי 30%
37.8
מדדים

כל רשומות המדד (19)

שירות לקוחות אוטומטי

מבחן הערכהסטטוסציוןמשקלמקור
τ²-bench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
91.50.34קישור למקור

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
89.80.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
86.40.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
84.10.42קישור למקור

לא נמצאו תוצאות עבור: OSWorld · AndroidWorld · WebArena-Verified

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
89.80.85קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
50.40.28קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
74.80.34קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · SimpleQA Verified

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
74.80.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · BrowseComp

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.40.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
50.40.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
86.40.72קישור למקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
84.10.42קישור למקור
ERQA
מדד משני
לפי דיווח היצרן
64.70.42קישור למקור
ZeroBench
מדד משני
לפי דיווח היצרן
33.00.42קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro · MathVision · VideoMMMU

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
63.80.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
59.00.85קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
63.80.40קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
74.80.34קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · MLE-bench · Gert Labs

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
59.00.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.40.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
52.40.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
19.70.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

בריאות ורפואה

מבחן הערכהסטטוסציוןמשקלמקור
MedXpertQA
מדידה בתחום
לפי דיווח היצרן
52.60.72קישור למקור
HealthBench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
42.80.34קישור למקור

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
59.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
52.40.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
19.70.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
39.00.40קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
42.50.42קישור למקור
ZeroBench
מדד משני
לפי דיווח היצרן
33.00.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3

מערכות נוספות

להשוואה