מערכת שנבדקה

GPT-5.6 Terra

נבדק כמודל APIמודל סגורOpenAI

מודל סגור של OpenAI עם חלון הקשר של 1,050K טוקנים. מדד האיכות המרוכז של המקור עומד על 73.2.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 28%
93.3
מחקר ברשת
כיסוי 15%
87.5
ידע וחשיבה
כיסוי 31%
82.4
טקסט ותמונה
כיסוי 33%
80.7
מתמטיקה
כיסוי 25%
76.2
עמידה בהוראות
כיסוי 26%
73.2
ניתוח נתונים
כיסוי 35%
73.2
שפה וניסוח
כיסוי 30%
73.2
קוד ופיתוח תוכנה
כיסוי 24%
66.5
כתיבת קוד עצמאית
כיסוי 72%
61.5
בריאות ורפואה
כיסוי 27%
57.7
שימוש בכלים
כיסוי 18%
53.1
עבודה בשורת פקודה
כיסוי 93%
51.4
ביצוע משימות מרובות שלבים
כיסוי 33%
51.4
הפעלת מחשב
כיסוי 31%
50.2
דיוק עובדתי
כיסוי 33%
43.2
חשיבה מופשטת
כיסוי 47%
31.6
מדדים

כל רשומות המדד (18)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
93.30.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
87.50.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
93.30.85קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.70.72קישור למקור

לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
84.90.34קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
63.40.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
64.90.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
69.60.42קישור למקור
FrontierCode 1.1
מדד משני
לפי דיווח היצרן
55.80.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · ProgramBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.21.00קישור למקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
20.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
87.40.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
63.40.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
64.90.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
69.60.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Agentic Coding · Vibe Code Bench

בריאות ורפואה

מבחן הערכהסטטוסציוןמשקלמקור
HealthBench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
57.70.34קישור למקור

לא נמצאו תוצאות עבור: MedXpertQA

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
53.10.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
20.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
87.40.85קישור למקור

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
20.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
87.40.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
50.20.72קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
53.10.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
50.20.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
43.20.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-3
מדידה עצמאית · לוח השוואה
לוח עצמאי
0.80.85קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
83.90.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench

מערכות נוספות

להשוואה