מערכת שנבדקה

GPT-5.6 Luna

נבדק כמודל APIמודל סגורOpenAI

מודל סגור של OpenAI עם חלון הקשר של 1,050K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.6.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 28%
91.6
מחקר ברשת
כיסוי 15%
83.3
ידע וחשיבה
כיסוי 31%
78.6
טקסט ותמונה
כיסוי 33%
78.4
מתמטיקה
כיסוי 25%
70.4
עמידה בהוראות
כיסוי 26%
67.6
ניתוח נתונים
כיסוי 35%
67.6
שפה וניסוח
כיסוי 30%
67.6
קוד ופיתוח תוכנה
כיסוי 24%
63.5
כתיבת קוד עצמאית
כיסוי 72%
57.6
בריאות ורפואה
כיסוי 27%
55.7
שימוש בכלים
כיסוי 18%
53.4
ביצוע משימות מרובות שלבים
כיסוי 33%
47.4
עבודה בשורת פקודה
כיסוי 93%
46.7
הפעלת מחשב
כיסוי 31%
45.6
דיוק עובדתי
כיסוי 33%
41.0
חשיבה מופשטת
כיסוי 47%
22.2
מדדים

כל רשומות המדד (18)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
91.60.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
83.30.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
91.60.85קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.40.72קישור למקור

לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
78.60.34קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
62.70.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
61.10.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.20.42קישור למקור
FrontierCode 1.1
מדד משני
לפי דיווח היצרן
55.10.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · ProgramBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.61.00קישור למקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
14.31.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.70.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
62.70.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
61.10.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.20.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Agentic Coding · Vibe Code Bench

בריאות ורפואה

מבחן הערכהסטטוסציוןמשקלמקור
HealthBench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
55.70.34קישור למקור

לא נמצאו תוצאות עבור: MedXpertQA

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
53.40.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
14.31.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.70.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
45.60.72קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
53.40.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
14.31.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.70.85קישור למקור

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
45.60.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
41.00.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-3
מדידה עצמאית · לוח השוואה
לוח עצמאי
0.20.85קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
59.60.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench

מערכות נוספות

להשוואה