GPT-5.4 nano
מודל סגור של OpenAI עם חלון הקשר של 400K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.0.
כל רשומות המדד (21)
שירות לקוחות אוטומטי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| τ²-bench | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 92.5 | 0.34 | קישור למקור |
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 78.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Mathematics | מדידה עצמאית · מתעדכן לוח עצמאי | 91.0 | 1.00 | קישור למקור |
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 25.9 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Data Analysis | מדידה עצמאית · מתעדכן לוח עצמאי | 67.6 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: CharXiv
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Reasoning | מדידה עצמאית · מתעדכן לוח עצמאי | 81.1 | 1.00 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 78.5 | 0.85 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 37.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMLU-Pro · SuperGPQA · MMLU-Redux
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Instruction Following | מדידה עצמאית · מתעדכן לוח עצמאי | 67.2 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Language | מדידה עצמאית · מתעדכן לוח עצמאי | 62.5 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMMU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 66.1 | 0.72 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 37.7 | 0.24 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 70.8 | 1.00 | קישור למקור |
| LiveBench Agentic Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 46.8 | 1.00 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 26.1 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench Reasoning | מדידה עצמאית · מתעדכן לוח עצמאי | 81.1 | 1.00 | קישור למקור |
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 5.7 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: ARC-AGI-3 · ZeroBench
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 69.6 | 1.00 | קישור למקור |
| LiveBench Agentic Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 46.8 | 1.00 | קישור למקור |
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 46.3 | 0.85 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 26.1 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · SWE-bench Pro · CursorBench · DeepSWE
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 46.3 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MCP Atlas | מדד משני לפי דיווח היצרן | 56.1 | 0.42 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 35.5 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 46.3 | 0.85 | קישור למקור |
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 39.0 | 0.72 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 56.1 | 0.42 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 35.5 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 39.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
דיוק עובדתי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SimpleQA Verified | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 11.7 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA
