מערכת שנבדקה

GPT-5.6 Sol

נבדק כמודל APIמודל סגורOpenAI

מודל סגור של OpenAI עם חלון הקשר של 1,050K טוקנים. מדד האיכות המרוכז של המקור עומד על 82.4.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 28%
93.5
מחקר ברשת
כיסוי 15%
92.2
ידע וחשיבה
כיסוי 31%
87.5
מתמטיקה
כיסוי 25%
84.1
טקסט ותמונה
כיסוי 33%
83.0
עמידה בהוראות
כיסוי 26%
82.4
ניתוח נתונים
כיסוי 35%
82.4
שפה וניסוח
כיסוי 30%
82.4
דיוק עובדתי
כיסוי 33%
69.7
כתיבת קוד עצמאית
כיסוי 72%
68.1
הפעלת מחשב
כיסוי 31%
62.6
עבודה בשורת פקודה
כיסוי 93%
60.9
ביצוע משימות מרובות שלבים
כיסוי 33%
60.9
בריאות ורפואה
כיסוי 27%
60.5
קוד ופיתוח תוכנה
כיסוי 32%
59.2
שימוש בכלים
כיסוי 18%
58.0
חשיבה מופשטת
כיסוי 47%
39.2
מדדים

כל רשומות המדד (19)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
93.50.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
92.20.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
93.50.85קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
89.00.34קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
83.00.72קישור למקור

לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
69.70.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.61.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
91.90.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
64.60.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
67.20.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
72.70.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Agentic Coding · Vibe Code Bench

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
62.60.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.61.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
91.90.85קישור למקור

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.61.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
91.90.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
62.60.72קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
58.00.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

בריאות ורפואה

מבחן הערכהסטטוסציוןמשקלמקור
HealthBench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
60.50.34קישור למקור

לא נמצאו תוצאות עבור: MedXpertQA

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
82.41.00קישור למקור
MirrorCode
מדידה עצמאית · מתעדכן
לוח עצמאי
20.01.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
64.60.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
67.20.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
72.70.42קישור למקור
FrontierCode 1.1
מדד משני
לפי דיווח היצרן
60.60.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · ProgramBench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
58.00.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-3
מדידה עצמאית · לוח השוואה
לוח עצמאי
7.80.85קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
92.50.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench

מערכות נוספות

להשוואה