GPT-5.2
מודל סגור של OpenAI עם חלון הקשר של 400K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 65.5.
כל תוצאות המבחנים (17)
עברית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| מבחן העברית של האתר | מדידה עצמאית · עבריתהערכה על ידי מודל אחר לוח עצמאי | 93.9 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: Hebrew LLM Leaderboard · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX · MAXIFE
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה מקור לא מאומת | 92.4 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
הבנה חזותית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה מקור לא מאומת | 82.1 | 0.59 | קישור למקור |
| MathVision | מדד משני מקור לא מאומת | 83.0 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · ERQA · ZeroBench · VideoMMMU
הבנת תמונות ומסמכים חזותיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMMU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 79.5 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה מקור לא מאומת | 92.4 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 72.9 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
| מבחן העברית של האתר | מדידה עצמאית · עבריתהערכה על ידי מודל אחר לוח עצמאי | 93.9 | 0.33 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Language · Hebrew LLM Leaderboard · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
| CharXiv | מדידה עצמאית · לוח השוואה מקור לא מאומת | 82.1 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Data Analysis
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 65.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 72.8 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 55.6 | 0.72 | קישור למקור |
| SWE-bench Multilingual | מדד משני לוח עצמאי | 66.7 | 0.50 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 53.5 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Lite · CursorBench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 40.7 | 0.40 | קישור למקור |
| MathVision | מדד משני מקור לא מאומת | 83.0 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 65.5 | 1.00 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 55.6 | 0.72 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 53.5 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · DeepSWE
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 47.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 47.3 | 0.72 | קישור למקור |
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 34.3 | 0.13 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 46.5 | 0.11 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Claw-Eval
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 34.3 | 0.50 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 46.5 | 0.40 | קישור למקור |
