מערכת שנבדקה

Claude Opus 4.5

נבדק כמודל APIמודל סגורAnthropic

מודל סגור של Anthropic עם חלון הקשר של 200K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 60.2.

ציונים לפי יכולת
עברית
כיסוי 8%
85.7
חשיבה מופשטת
כיסוי 35%
80.1
חשיבה מדעית
כיסוי 47%
79.7
שפה וניסוח
כיסוי 43%
78.1
מתמטיקה
כיסוי 72%
77.3
מחקר ברשת
כיסוי 15%
76.4
ידע וחשיבה
כיסוי 84%
74.9
ניתוח נתונים
כיסוי 91%
72.4
עמידה בהוראות
כיסוי 77%
68.4
הבנה חזותית
כיסוי 43%
68.3
קוד ופיתוח תוכנה
כיסוי 42%
67.4
מסמכים ארוכים
כיסוי 35%
64.4
הבנת תמונות ומסמכים חזותיים
כיסוי 54%
60.7
הפעלת מחשב
כיסוי 46%
59.6
עבודה בשורת פקודה
כיסוי 43%
59.3
כתיבת קוד עצמאית
כיסוי 53%
57.1
ביצוע משימות מרובות שלבים
כיסוי 42%
56.3
שימוש בכלים
כיסוי 41%
47.7
תוצרים מקצועיים
כיסוי 100%
46.5
דיוק עובדתי
כיסוי 33%
45.7
תוצאות

כל תוצאות המבחנים (41)

עברית

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-ProX
מדד משני · עברית
מקור לא מאומת
85.70.32קישור למקור

לא נמצאו תוצאות עבור: Hebrew LLM Leaderboard · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE · MAXIFE

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
80.11.00קישור למקור

לא נמצאו תוצאות עבור: ARC-AGI-3 · ARC-AGI-2 · ZeroBench

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
86.00.85קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
מקור לא מאומת
70.60.59קישור למקור

לא נמצאו תוצאות עבור: SciCode · CritPt

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
LiveBench Language
מדידה עצמאית · מתעדכן
לוח עצמאי
81.31.00קישור למקור
MMLU-ProX
מדד משני · עברית
מקור לא מאומת
85.70.32קישור למקור

לא נמצאו תוצאות עבור: Hebrew LLM Leaderboard · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
LiveBench Mathematics
מדידה עצמאית · מתעדכן
לוח עצמאי
90.41.00קישור למקור
AIME 2026
מדידה עצמאית · לוח השוואה
מקור לא מאומת
95.10.59קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
מקור לא מאומת
85.30.59קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
20.70.40קישור למקור
MathVision
מדד משני
מקור לא מאומת
74.30.35קישור למקור

לא נמצאו תוצאות עבור: MATH Level 5

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
WideResearch
מדד משניהערכה על ידי מודל אחר
מקור לא מאומת
76.40.35קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · Agents' Last Exam · BrowseComp · DeepSearchQA

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
80.11.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
86.00.85קישור למקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
מקור לא מאומת
89.50.59קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
מקור לא מאומת
30.80.59קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
מקור לא מאומת
70.60.59קישור למקור
MMLU-Redux
מדד משני
מקור לא מאומת
96.60.35קישור למקור

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
LiveBench Data Analysis
מדידה עצמאית · מתעדכן
לוח עצמאי
74.41.00קישור למקור
CharXiv
מדידה עצמאית · לוח השוואה
מקור לא מאומת
68.50.59קישור למקור

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
62.51.00קישור למקור
IFBench
מדידה עצמאית · לוח השוואה
מקור לא מאומת
58.00.59קישור למקור
IFEval
מדד משניזיקה מסחרית מוצהרת
מקור לא מאומת
90.90.35קישור למקור

לא נמצאו תוצאות עבור: MAXIFE

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
מקור לא מאומת
68.50.59קישור למקור
ScreenSpot Pro
מדד משני
מקור לא מאומת
45.70.35קישור למקור
MathVision
מדד משני
מקור לא מאומת
74.30.35קישור למקור
VideoMMMU
מדד משני
מקור לא מאומת
84.40.35קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro · ERQA · ZeroBench

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
76.71.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
79.71.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
39.71.00קישור למקור
LiveCodeBench
מדידה עצמאית · מתעדכן
מקור לא מאומת
84.80.70קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
מקור לא מאומת
57.10.59קישור למקור
SWE-bench Multilingual
מדד משני
מקור לא מאומת
77.50.35קישור למקור
NL2Repo
מדד משני
מקור לא מאומת
43.20.35קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · Aider Polyglot · MirrorCode · SciCode · SWE-bench Lite · CursorBench · Vibe Code Bench · DeepSWE · FrontierCode 1.1 · ProgramBench

מסמכים ארוכים

מבחן הערכהסטטוסציוןמשקלמקור
LongBench v2
מדידה עצמאית · לוח השוואה
מקור לא מאומת
64.40.59קישור למקור

לא נמצאו תוצאות עבור: MRCR 1M

הבנת תמונות ומסמכים חזותיים

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
מקור לא מאומת
70.60.59קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
מקור לא מאומת
30.80.20קישור למקור

לא נמצאו תוצאות עבור: MMMU

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
66.30.72קישור למקור
ScreenSpot Pro
מדד משני
מקור לא מאומת
45.70.35קישור למקור

לא נמצאו תוצאות עבור: AndroidWorld · WebArena-Verified

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
59.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.61.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
39.71.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
59.30.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
מקור לא מאומת
57.10.59קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · CursorBench · Vibe Code Bench · DeepSWE

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
59.30.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
66.30.72קישור למקור
MCP Atlas
מדד משני
מקור לא מאומת
42.30.35קישור למקור
Toolathlon
מדד משני
מקור לא מאומת
43.50.35קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
32.30.34קישור למקור
Claw-Eval
מדד משני · בהסתייגות
מקור לא מאומת
59.60.28קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
64.20.27קישור למקור
WideResearch
מדד משניהערכה על ידי מודל אחר
מקור לא מאומת
76.40.24קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · AndroidWorld · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
מקור לא מאומת
42.30.35קישור למקור
Toolathlon
מדד משני
מקור לא מאומת
43.50.35קישור למקור
Claw-Eval
מדד משני · בהסתייגות
מקור לא מאומת
59.60.28קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
32.30.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
64.20.40קישור למקור

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
45.70.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

מערכות נוספות

להשוואה

Apodex 1.1Claude Fable 5Claude Fable 5.1Claude Opus 4.5 ThinkingClaude Opus 4.6Claude Opus 4.6 (Adaptive)Claude Opus 4.7Claude Opus 4.7 (Adaptive)Claude Opus 4.8Claude Opus 5Claude Sonnet 4.6Claude Sonnet 5Command A+DeepSeek-R1DeepSeek R1 Distill Qwen 32BDeepSeek V3DeepSeek V3.1DeepSeek V3.1 (Reasoning)DeepSeek V3.2DeepSeek V4.1 FlashDeepSeek V4 Flash 0423DeepSeek V4 Flash Vision ExpDeepSeek V4 Pro 0423DeepSeek V4 Pro 0813Exaone 4.0 1.2BExaone 4.0 32BGemini 2.5 FlashGemini 2.5 ProGemini 3.1 Flash LiteGemini 3.1 ProGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.7 FlashGemini 3.8 FlashGemini 3 FlashGemini 3 ProGemma 4 26B A4BGemma 4 31BGLM-4.5-AirGLM-4.6GLM-4.7GLM-4.7-FlashGLM-5GLM-5.1GLM-5.2GLM-5.3GLM-5.3-FlashGLM-5-TurboGLM-5V-TurboGPT-5.1GPT-5.2GPT-5.3 CodexGPT-5.4GPT-5.4 miniGPT-5.4 nanoGPT-5.5GPT-5.6 LunaGPT-5.6 SolGPT-5.6 TerraGPT-5 (high)GPT-6 AstraGranite-4.0-1BGranite-4.0-350MGranite-4.0-H-1BGranite-4.0-H-350MGranite 4.2 8BGrok 4Grok 4.1 FastGrok 4.1 Fast (Reasoning)Grok 4.3Grok 4.5Grok 4.6Grok 4 Fast (Reasoning)Grok Build 0.1Grok Code Fast 1Hy3Hy3 PreviewInklingInkling-SmallK-ExaoneKimi K2.6Kimi K2Kimi K2.5Kimi K2.5 (Reasoning)Kimi K2.7 CodeKimi K3LFM2.5-2.6BLFM2.5-8B-A1BLing 2.6 FlashLing 3.0 FlashLlama 3.1 405BLlama 4 MaverickLlama 4 ScoutMercury 2MiMo-V2.5-ProMiMo-V2-FlashMiMo-V2-OmniMiMo-V2-ProMiniMax M1 80kMiniMax M2.5MiniMax M2.7MiniMax M3Ministral 3 14BMinistral 3 14B (Reasoning)Ministral 3 3B (Reasoning)Ministral 3 8BMinistral 3 8B (Reasoning)Mistral Large 2Mistral Large 3Mistral Medium 3Mistral Medium 3.5 128BMistral Small 4Muse Glimmer 30BMuse SparkMuse Spark 1.1Muse Spark 1.2Nemotron 3.5 Content SafetyNemotron 3.5 LightningNemotron 3.5 Lightning 30B A3B NVFP4Nemotron 3 Nano 30BNemotron 3 Nano Omni 30B A3BNemotron 3 Super 100BNemotron 3 Super 120B A12BNemotron 3 UltraNemotron Ultra 253BNova ProPhi-4Qwen3.5-122B-A10BQwen3.5-27BQwen3.5-35B-A3BQwen3.5 397BQwen3.5 397B (Reasoning)Qwen3.5 Plus 2026-04-20Qwen3.6-27BQwen3.6 35B A3BQwen3.6 FlashQwen 3.6 Max (preview)Qwen3.6 PlusQwen3.7 FlashQwen3.7 MaxQwen3.7 PlusQwen3.8 2.4T A95BQwen3.8-27BQwen3.8 FlashQwen3.8-Flash-NextSarvam 105BSarvam 30BSolar Pro 2Step 3.5 FlashStep 3.7 FlashTrinity-Large-PreviewTrinity-Large-Thinking