מערכת שנבדקה

Claude Fable 5.1

נבדק כמודל APIמודל סגורAnthropic

מודל סגור של Anthropic עם חלון הקשר של 1,000K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 83.0.

ציונים לפי יכולת
חשיבה מופשטת
כיסוי 18%
90.0
ניתוח נתונים
כיסוי 35%
83.0
עמידה בהוראות
כיסוי 26%
83.0
שפה וניסוח
כיסוי 19%
83.0
מתמטיקה
כיסוי 18%
83.0
קוד ופיתוח תוכנה
כיסוי 26%
80.3
ידע וחשיבה
כיסוי 29%
78.5
כתיבת קוד עצמאית
כיסוי 43%
77.8
שימוש בכלים
כיסוי 18%
77.8
דיוק עובדתי
כיסוי 33%
70.8
הבנת תמונות ומסמכים חזותיים
כיסוי 33%
65.0
ביצוע משימות מרובות שלבים
כיסוי 18%
48.7
הפעלת מחשב
כיסוי 31%
41.7
תהליכי עבודה בארגון
כיסוי 43%
31.4
תוצאות

כל תוצאות המבחנים (13)

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
90.00.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Hebrew LLM Leaderboard · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.20.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
73.40.70קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
89.10.42קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.40.42קישור למקור
ProgramBench
מדד משני
לפי דיווח היצרן
87.60.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Lite · Vibe Code Bench · NL2Repo · FrontierCode 1.1

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
65.00.33קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.01.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.20.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
73.40.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.40.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · Vibe Code Bench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
77.80.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.80.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

הבנת תמונות ומסמכים חזותיים

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
65.00.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
41.70.72קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
77.80.42קישור למקור
AutomationBench
מדד משני
לפי דיווח היצרן
31.40.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
41.70.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
AutomationBench
מדד משני
לפי דיווח היצרן
31.40.42קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro

מערכות נוספות

להשוואה

Apodex 1.1Claude Fable 5Claude Opus 4.5Claude Opus 4.5 ThinkingClaude Opus 4.6Claude Opus 4.6 (Adaptive)Claude Opus 4.7Claude Opus 4.7 (Adaptive)Claude Opus 4.8Claude Opus 5Claude Sonnet 4.6Claude Sonnet 5Command A+DeepSeek-R1DeepSeek R1 Distill Qwen 32BDeepSeek V3DeepSeek V3.1DeepSeek V3.1 (Reasoning)DeepSeek V3.2DeepSeek V4.1 FlashDeepSeek V4 Flash 0423DeepSeek V4 Flash Vision ExpDeepSeek V4 Pro 0423DeepSeek V4 Pro 0813Exaone 4.0 1.2BExaone 4.0 32BGemini 2.5 FlashGemini 2.5 ProGemini 3.1 Flash LiteGemini 3.1 ProGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.7 FlashGemini 3.8 FlashGemini 3 FlashGemini 3 ProGemma 4 26B A4BGemma 4 31BGLM-4.5-AirGLM-4.6GLM-4.7GLM-4.7-FlashGLM-5GLM-5.1GLM-5.2GLM-5.3GLM-5.3-FlashGLM-5-TurboGLM-5V-TurboGPT-5.1GPT-5.2GPT-5.3 CodexGPT-5.4GPT-5.4 miniGPT-5.4 nanoGPT-5.5GPT-5.6 LunaGPT-5.6 SolGPT-5.6 TerraGPT-5 (high)GPT-6 AstraGranite-4.0-1BGranite-4.0-350MGranite-4.0-H-1BGranite-4.0-H-350MGranite 4.2 8BGrok 4Grok 4.1 FastGrok 4.1 Fast (Reasoning)Grok 4.3Grok 4.5Grok 4.6Grok 4 Fast (Reasoning)Grok Build 0.1Grok Code Fast 1Hy3Hy3 PreviewInklingInkling-SmallK-ExaoneKimi K2.6Kimi K2Kimi K2.5Kimi K2.5 (Reasoning)Kimi K2.7 CodeKimi K3LFM2.5-2.6BLFM2.5-8B-A1BLing 2.6 FlashLing 3.0 FlashLlama 3.1 405BLlama 4 MaverickLlama 4 ScoutMercury 2MiMo-V2.5-ProMiMo-V2-FlashMiMo-V2-OmniMiMo-V2-ProMiniMax M1 80kMiniMax M2.5MiniMax M2.7MiniMax M3Ministral 3 14BMinistral 3 14B (Reasoning)Ministral 3 3B (Reasoning)Ministral 3 8BMinistral 3 8B (Reasoning)Mistral Large 2Mistral Large 3Mistral Medium 3Mistral Medium 3.5 128BMistral Small 4Muse Glimmer 30BMuse SparkMuse Spark 1.1Muse Spark 1.2Nemotron 3.5 Content SafetyNemotron 3.5 LightningNemotron 3.5 Lightning 30B A3B NVFP4Nemotron 3 Nano 30BNemotron 3 Nano Omni 30B A3BNemotron 3 Super 100BNemotron 3 Super 120B A12BNemotron 3 UltraNemotron Ultra 253BNova ProPhi-4Qwen3.5-122B-A10BQwen3.5-27BQwen3.5-35B-A3BQwen3.5 397BQwen3.5 397B (Reasoning)Qwen3.5 Plus 2026-04-20Qwen3.6-27BQwen3.6 35B A3BQwen3.6 FlashQwen 3.6 Max (preview)Qwen3.6 PlusQwen3.7 FlashQwen3.7 MaxQwen3.7 PlusQwen3.8 2.4T A95BQwen3.8-27BQwen3.8 FlashQwen3.8-Flash-NextSarvam 105BSarvam 30BSolar Pro 2Step 3.5 FlashStep 3.7 FlashTrinity-Large-PreviewTrinity-Large-Thinking