מערכת שנבדקה

GPT-5.5

נבדק כמודל APIמודל סגורOpenAI

מודל סגור של OpenAI עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 73.5.

ציונים לפי יכולת
שירות לקוחות אוטומטי
כיסוי 85%
98.0
חשיבה מדעית
כיסוי 24%
93.6
מחקר ברשת
כיסוי 15%
84.4
שפה וניסוח
כיסוי 60%
83.3
עבודה בשורת פקודה
כיסוי 50%
82.0
מתמטיקה
כיסוי 44%
81.1
ניתוח נתונים
כיסוי 70%
79.6
ידע וחשיבה
כיסוי 58%
79.5
הפעלת מחשב
כיסוי 31%
78.7
עמידה בהוראות
כיסוי 53%
75.1
טקסט ותמונה
כיסוי 66%
73.9
ביצוע משימות מרובות שלבים
כיסוי 39%
70.7
כתיבת קוד עצמאית
כיסוי 75%
66.2
שימוש בכלים
כיסוי 35%
65.4
קוד ופיתוח תוכנה
כיסוי 40%
63.7
חשיבה מופשטת
כיסוי 82%
56.4
תוצרים מקצועיים
כיסוי 100%
56.1
תהליכי עבודה בארגון
כיסוי 43%
54.1
הבנה חזותית
כיסוי 11%
54.1
מדדים

כל רשומות המדד (28)

שירות לקוחות אוטומטי

מבחן הערכהסטטוסציוןמשקלמקור
τ²-bench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
98.00.34קישור למקור

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.60.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
84.40.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Language
מדידה עצמאית · מתעדכן
לוח עצמאי
87.81.00קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Mathematics
מדידה עצמאית · מתעדכן
לוח עצמאי
95.21.00קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
51.70.40קישור למקור

לא נמצאו תוצאות עבור: AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Data Analysis
מדידה עצמאית · מתעדכן
לוח עצמאי
80.41.00קישור למקור

לא נמצאו תוצאות עבור: CharXiv

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
89.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.60.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
52.20.72קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · SuperGPQA · MMLU-Redux

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.70.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
71.41.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.20.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
52.20.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.70.72קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
42.70.48קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
75.30.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
55.60.42קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
72.90.38קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Claw-Eval

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
46.81.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
58.60.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
58.40.70קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
69.80.50קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · DeepSWE

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
75.30.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
55.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
80.01.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
46.81.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
58.60.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
58.40.70קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
69.80.50קישור למקור
FrontierCode 1.1
מדד משני
לוח עצמאי
43.00.50קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SciCode · SWE-bench Multilingual · NL2Repo · DeepSWE · ProgramBench

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
89.71.00קישור למקור
ARC-AGI-3
מדידה עצמאית · לוח השוואה
לוח עצמאי
0.40.85קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
85.00.50קישור למקור

לא נמצאו תוצאות עבור: ZeroBench

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
42.70.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
72.90.40קישור למקור

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
54.10.42קישור למקור

לא נמצאו תוצאות עבור: AutomationBench

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
54.10.42קישור למקור

לא נמצאו תוצאות עבור: CharXiv · ScreenSpot Pro · MathVision · ERQA · ZeroBench · VideoMMMU

מערכות נוספות

להשוואה