GPT-5.3 Codex
מודל סגור של OpenAI עם חלון הקשר של 400K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 65.2.
כל תוצאות המבחנים (9)
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 77.3 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 77.3 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.8 | 0.72 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 61.8 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 64.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 77.3 | 0.85 | קישור למקור |
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 64.7 | 0.72 | קישור למקור |
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 33.7 | 0.29 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 57.5 | 0.23 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Claw-Eval
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 74.8 | 1.00 | קישור למקור |
| SWE-rebench | מדידה עצמאית · מתעדכן לוח עצמאי | 58.2 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.8 | 0.72 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 61.8 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Lite · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 33.7 | 0.50 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 57.5 | 0.40 | קישור למקור |
