Grok 4.3
מודל סגור של xAI עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 64.4.
כל רשומות המדד (10)
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Mathematics | מדידה עצמאית · מתעדכן לוח עצמאי | 84.3 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench Reasoning | מדידה עצמאית · מתעדכן לוח עצמאי | 70.8 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: ARC-AGI-3 · ARC-AGI-2 · ZeroBench
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Language | מדידה עצמאית · מתעדכן לוח עצמאי | 73.6 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Reasoning | מדידה עצמאית · מתעדכן לוח עצמאי | 70.8 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: MMLU-Pro · GPQA / GPQA Diamond · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Instruction Following | מדידה עצמאית · מתעדכן לוח עצמאי | 62.8 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Data Analysis | מדידה עצמאית · מתעדכן לוח עצמאי | 55.8 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: CharXiv
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 69.9 | 1.00 | קישור למקור |
| LiveBench Agentic Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 18.5 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 43.9 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 43.9 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LiveBench | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 62.3 | 1.00 | קישור למקור |
| LiveBench Agentic Coding | מדידה עצמאית · מתעדכן לוח עצמאי | 18.5 | 1.00 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · SWE-bench Pro · CursorBench · Vibe Code Bench · DeepSWE
