GPT-5.6 Sol
מודל סגור של OpenAI עם חלון הקשר של 1,050K טוקנים. מדד האיכות המרוכז של המקור עומד על 82.4.
כל רשומות המדד (19)
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 93.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 92.2 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 93.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 89.0 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMMU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 83.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
דיוק עובדתי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SimpleQA Verified | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 69.7 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 34.6 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 91.9 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 64.6 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 67.2 | 0.70 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 72.7 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Agentic Coding · Vibe Code Bench
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 62.6 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 34.6 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 91.9 | 0.85 | קישור למקור |
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 3.0 | מדידה עצמאית · מתעדכן לוח עצמאי | 34.6 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 91.9 | 0.85 | קישור למקור |
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 62.6 | 0.72 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 58.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
בריאות ורפואה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| HealthBench | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 60.5 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: MedXpertQA
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 82.4 | 1.00 | קישור למקור |
| MirrorCode | מדידה עצמאית · מתעדכן לוח עצמאי | 20.0 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 64.6 | 0.72 | קישור למקור |
| CursorBench | מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 67.2 | 0.70 | קישור למקור |
| DeepSWE | מדד משני לפי דיווח היצרן | 72.7 | 0.42 | קישור למקור |
| FrontierCode 1.1 | מדד משני לפי דיווח היצרן | 60.6 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · ProgramBench
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Toolathlon | מדד משני לפי דיווח היצרן | 58.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-3 | מדידה עצמאית · לוח השוואה לוח עצמאי | 7.8 | 0.85 | קישור למקור |
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 92.5 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench
