מערכת שנבדקה

Claude Fable 5

נבדק כמודל APIמודל סגורAnthropic

מודל סגור של Anthropic עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 83.3.

ציונים לפי יכולת
חשיבה מופשטת
כיסוי 53%
88.2
מתמטיקה
כיסוי 37%
87.6
חשיבה מדעית
כיסוי 28%
85.9
הפעלת מחשב
כיסוי 31%
85.0
שפה וניסוח
כיסוי 60%
84.5
ידע וחשיבה
כיסוי 48%
84.3
ניתוח נתונים
כיסוי 70%
79.1
עמידה בהוראות
כיסוי 53%
75.8
קוד ופיתוח תוכנה
כיסוי 51%
72.5
דיוק עובדתי
כיסוי 33%
70.7
כתיבת קוד עצמאית
כיסוי 80%
65.1
ביצוע משימות מרובות שלבים
כיסוי 29%
65.0
תהליכי עבודה בארגון
כיסוי 43%
57.9
הבנה חזותית
כיסוי 11%
57.9
עבודה בשורת פקודה
כיסוי 93%
57.1
מדדים

כל רשומות המדד (21)

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
87.71.00קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
89.20.50קישור למקור

לא נמצאו תוצאות עבור: ARC-AGI-3 · ZeroBench

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Mathematics
מדידה עצמאית · מתעדכן
לוח עצמאי
95.71.00קישור למקור

לא נמצאו תוצאות עבור: AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
85.90.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.00.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Language
מדידה עצמאית · מתעדכן
לוח עצמאי
89.51.00קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
87.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
85.90.85קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Data Analysis
מדידה עצמאית · מתעדכן
לוח עצמאי
78.71.00קישור למקור

לא נמצאו תוצאות עבור: CharXiv

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
72.01.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
82.51.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
50.71.00קישור למקור
MirrorCode
מדידה עצמאית · מתעדכן
לוח עצמאי
63.91.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
95.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.00.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.50.70קישור למקור
FrontierCode 1.1
מדד משני
לוח עצמאי
53.50.50קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · ProgramBench

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.70.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.01.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
50.71.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.30.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.00.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.50.70קישור למקור

לא נמצאו תוצאות עבור: Vibe Code Bench · DeepSWE

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.01.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.30.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.00.72קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
57.90.42קישור למקור

לא נמצאו תוצאות עבור: AutomationBench

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
57.90.42קישור למקור

לא נמצאו תוצאות עבור: CharXiv · ScreenSpot Pro · MathVision · ERQA · ZeroBench · VideoMMMU

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.01.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.30.85קישור למקור
מערכות נוספות

להשוואה