GPT-5 (high)
מודל סגור של OpenAI עם חלון הקשר של 400K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 58.0.
כל תוצאות המבחנים (6)
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 74.4 | 1.00 | קישור למקור |
| Aider Polyglot | מדידה עצמאית · מתעדכן לוח עצמאי | 88.0 | 1.00 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 20.1 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Lite · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Vibe Code Bench | מדד משני לוח עצמאי | 20.1 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 9.9 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 8.5 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 8.5 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: Gert Labs
