מערכת שנבדקה

Muse Spark 1.1

נבדק כמודל APIמודל סגורמטא

מודל סגור של מטא עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 77.3.

ציונים לפי יכולת
הבנה חזותית
כיסוי 19%
88.4
ניתוח נתונים
כיסוי 60%
82.0
שימוש בכלים
כיסוי 35%
81.8
עבודה בשורת פקודה
כיסוי 43%
80.0
ביצוע משימות מרובות שלבים
כיסוי 36%
77.8
עמידה בהוראות
כיסוי 26%
77.3
מתמטיקה
כיסוי 18%
77.3
שפה וניסוח
כיסוי 30%
77.3
הפעלת מחשב
כיסוי 49%
76.4
מחקר ברשת
כיסוי 33%
76.1
ידע וחשיבה
כיסוי 29%
73.5
כתיבת קוד עצמאית
כיסוי 46%
70.9
דיוק עובדתי
כיסוי 62%
70.2
קוד ופיתוח תוכנה
כיסוי 16%
67.2
טקסט ותמונה
כיסוי 33%
62.1
בריאות ורפואה
כיסוי 27%
59.3
חשיבה פיננסית
כיסוי 85%
57.2
תהליכים פיננסיים
כיסוי 85%
57.2
תוצרים מקצועיים
כיסוי 47%
54.7
מסמכים ארוכים
כיסוי 43%
54.1
מדדים

כל רשומות המדד (17)

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
88.40.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · MathVision · ERQA · ZeroBench · VideoMMMU

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
88.40.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
88.10.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
75.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.80.72קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
88.10.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
75.60.42קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
54.70.42קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
84.90.34קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · MLE-bench · Gert Labs · Claw-Eval

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.80.72קישור למקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
69.00.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
69.00.42קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
84.90.34קישור למקור

לא נמצאו תוצאות עבור: WideResearch · Agents' Last Exam · BrowseComp

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
62.10.33קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.50.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
53.30.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
57.80.40קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
84.90.34קישור למקור

לא נמצאו תוצאות עבור: SimpleQA

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.31.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.50.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
53.30.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · FrontierCode 1.1 · ProgramBench

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
62.10.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

בריאות ורפואה

מבחן הערכהסטטוסציוןמשקלמקור
HealthBench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
59.30.34קישור למקור

לא נמצאו תוצאות עבור: MedXpertQA

חשיבה פיננסית

מבחן הערכהסטטוסציוןמשקלמקור
Finance Agent v2
מדידה בתחום · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
57.20.59קישור למקור

תהליכים פיננסיים

מבחן הערכהסטטוסציוןמשקלמקור
Finance Agent v2
מדידה בתחום · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
57.20.59קישור למקור

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
54.70.42קישור למקור

לא נמצאו תוצאות עבור: Gert Labs

מסמכים ארוכים

מבחן הערכהסטטוסציוןמשקלמקור
MRCR 1M
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
54.10.72קישור למקור

לא נמצאו תוצאות עבור: LongBench v2

מערכות נוספות

להשוואה