Claude Opus 5
נבדק כמודל APIמצב חשיבה/היסק · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט
- חזק במיוחד בקוד ופיתוח תוכנה ובידע וחשיבה.
- הדירוג מבוסס על 35% מהמדדים שהוגדרו למקצוע.
- היתרון נשען בעיקר על LiveBench, SWE-bench Verified.
- אין מספיק נתונים בקוד ופיתוח תוכנה.
- אין מספיק נתונים בשימוש בכלים.
- קוד ופיתוח תוכנהמשקל 61%80.6 · 8 מדדים
- ידע וחשיבהמשקל 11%82.3 · 3 מדדים
- שימוש בכליםמשקל 9%83.2 · 2 מדדים
- ביצוע משימות מרובות שלביםמשקל 8%62.3 · 6 מדדים
- עמידה בהוראותמשקל 6%83.2 · 1 מדדים
- מסמכים ארוכיםמשקל 6%אין נתון
- כיסוי המדדים
- 35%
- איכות המקורות
- 82%
- ודאות סטטיסטית
- 100%
- השוואתיות התנאים
- 70%
קוד ופיתוח תוכנה משקל 61%
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.2 | 1.00 | קישור למקור |
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לפי דיווח היצרן | 96.0 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 79.2 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 70.0 | 0.70 | קישור למקור |
| SWE-bench Multilingual | מדד משני לפי דיווח היצרן | 89.5 | 0.42 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 68.8 | 0.42 | קישור למקור |
| FrontierCode 1.1 | מדד משני לפי דיווח היצרן | 53.4 | 0.42 | קישור למקור |
| ProgramBench | מדד משני לפי דיווח היצרן | 93.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · Vibe Code Bench · NL2Repo
ידע וחשיבה משקל 11%
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.2 | 1.00 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 93.9 | 0.85 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 64.7 | 0.62 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux
שימוש בכלים משקל 9%
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MCP Atlas | מדד משני לפי דיווח היצרן | 85.8 | 0.42 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 80.6 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval
ביצוע משימות מרובות שלבים משקל 8%
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 42.7 | 1.00 | קישור למקור |
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 70.6 | 0.72 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 85.8 | 0.42 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 80.6 | 0.42 | קישור למקור |
| AutomationBench | מדד משני לפי דיווח היצרן | 26.0 | 0.42 | קישור למקור |
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 95.0 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · AndroidWorld · WideResearch · Agents' Last Exam · JobBench · MLE-bench · Gert Labs · Claw-Eval
עמידה בהוראות משקל 6%
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 83.2 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE
