מערכת שנבדקה

Grok 4.6

נבדק כמודל APIמודל סגורxAI

מודל סגור של xAI עם חלון הקשר של 500K טוקנים. מדד האיכות המרוכז של המקור עומד על 63.9.

ציונים לפי יכולת
קוד ופיתוח תוכנה
כיסוי 19%
65.7
ידע וחשיבה
כיסוי 17%
63.9
עמידה בהוראות
כיסוי 26%
63.9
ניתוח נתונים
כיסוי 35%
63.9
מתמטיקה
כיסוי 18%
63.9
שפה וניסוח
כיסוי 30%
63.9
כתיבת קוד עצמאית
כיסוי 48%
53.7
ביצוע משימות מרובות שלבים
כיסוי 11%
26.5
עבודה בשורת פקודה
כיסוי 50%
26.5
חשיבה מופשטת
כיסוי 47%
26.2
מדדים

כל רשומות המדד (8)

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.80.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
65.90.42קישור למקור
FrontierCode 1.1
מדד משני
לפי דיווח היצרן
61.30.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · ProgramBench

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
63.91.00קישור למקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
26.51.00קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.80.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
65.90.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · LiveBench Agentic Coding · SWE-bench Pro · Vibe Code Bench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
26.51.00קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
26.51.00קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-3
מדידה עצמאית · לוח השוואה
לוח עצמאי
2.10.85קישור למקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
67.10.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ZeroBench

מערכות נוספות

להשוואה