Claude Fable 5.1
מודל סגור של Anthropic עם חלון הקשר של 1,000K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 83.0.
כל תוצאות המבחנים (13)
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 90.0 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Language · Hebrew LLM Leaderboard · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 81.2 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 73.4 | 0.70 | קישור למקור |
| SWE-bench Multilingual | מדד משני לפי דיווח היצרן | 89.1 | 0.42 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 67.4 | 0.42 | קישור למקור |
| ProgramBench | מדד משני לפי דיווח היצרן | 87.6 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Lite · Vibe Code Bench · NL2Repo · FrontierCode 1.1
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 65.0 | 0.33 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.0 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 81.2 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 73.4 | 0.70 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 67.4 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · Vibe Code Bench
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Toolathlon | מדד משני לפי דיווח היצרן | 77.8 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval
דיוק עובדתי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SimpleQA Verified | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 70.8 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA
הבנת תמונות ומסמכים חזותיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 65.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 41.7 | 0.72 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 77.8 | 0.42 | קישור למקור |
| AutomationBench | מדד משני לפי דיווח היצרן | 31.4 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 41.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
תהליכי עבודה בארגון
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| AutomationBench | מדד משני לפי דיווח היצרן | 31.4 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: OfficeQA Pro
