Claude Opus 4.7 (Adaptive)
מודל סגור של Anthropic עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 72.7.
כל רשומות המדד (14)
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 94.2 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 91.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 94.2 | 0.72 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 54.7 | 0.24 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 79.3 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 78.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MCP Atlas | מדד משני לפי דיווח היצרן | 77.3 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Toolathlon · Claw-Eval
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לפי דיווח היצרן | 87.6 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 64.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
הבנה חזותית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 91.0 | 0.72 | קישור למקור |
| OfficeQA Pro | מדד משני לפי דיווח היצרן | 43.6 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · MathVision · ERQA · ZeroBench · VideoMMMU
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 69.4 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 69.4 | 0.85 | קישור למקור |
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 78.0 | 0.72 | קישור למקור |
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 45.9 | 0.50 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 77.3 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 69.4 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 64.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 54.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 45.9 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: Gert Labs
תהליכי עבודה בארגון
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OfficeQA Pro | מדד משני לפי דיווח היצרן | 43.6 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: AutomationBench
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-3 | מדידה עצמאית · לוח השוואה לוח עצמאי | 0.2 | 0.85 | קישור למקור |
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לפי דיווח היצרן | 75.8 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench
