מערכת שנבדקה

Claude Opus 4.7 (Adaptive)

נבדק כמודל APIמודל סגורAnthropic

מודל סגור של Anthropic עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 72.7.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 24%
94.2
ניתוח נתונים
כיסוי 25%
91.0
ידע וחשיבה
כיסוי 24%
84.3
מחקר ברשת
כיסוי 15%
79.3
הפעלת מחשב
כיסוי 31%
78.0
שימוש בכלים
כיסוי 18%
77.3
קוד ופיתוח תוכנה
כיסוי 12%
76.9
הבנה חזותית
כיסוי 28%
75.5
עבודה בשורת פקודה
כיסוי 43%
69.4
ביצוע משימות מרובות שלבים
כיסוי 28%
68.5
כתיבת קוד עצמאית
כיסוי 24%
67.1
טקסט ותמונה
כיסוי 33%
54.7
תוצרים מקצועיים
כיסוי 56%
45.9
תהליכי עבודה בארגון
כיסוי 35%
43.6
חשיבה מופשטת
כיסוי 42%
22.2
מדדים

כל רשומות המדד (14)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
94.20.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
91.00.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
94.20.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
54.70.24קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
79.30.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.00.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
77.30.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Toolathlon · Claw-Eval

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
87.60.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
64.30.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
91.00.72קישור למקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
43.60.35קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · MathVision · ERQA · ZeroBench · VideoMMMU

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
69.40.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
69.40.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.00.72קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
45.90.50קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
77.30.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
69.40.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
64.30.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
54.70.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
45.90.50קישור למקור

לא נמצאו תוצאות עבור: Gert Labs

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
43.60.35קישור למקור

לא נמצאו תוצאות עבור: AutomationBench

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-3
מדידה עצמאית · לוח השוואה
לוח עצמאי
0.20.85קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
75.80.35קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench

מערכות נוספות

להשוואה