מערכת שנבדקה

Grok 4.3

נבדק כמודל APIמודל סגורxAI

מודל סגור של xAI עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 64.4.

ציונים לפי יכולת
מתמטיקה
כיסוי 37%
73.3
חשיבה מופשטת
כיסוי 35%
70.8
שפה וניסוח
כיסוי 60%
67.9
ידע וחשיבה
כיסוי 34%
66.5
עמידה בהוראות
כיסוי 53%
62.5
ניתוח נתונים
כיסוי 70%
59.0
קוד ופיתוח תוכנה
כיסוי 22%
50.2
ביצוע משימות מרובות שלבים
כיסוי 4%
43.9
תוצרים מקצועיים
כיסוי 44%
43.9
כתיבת קוד עצמאית
כיסוי 31%
40.4
מדדים

כל רשומות המדד (10)

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Mathematics
מדידה עצמאית · מתעדכן
לוח עצמאי
84.31.00קישור למקור

לא נמצאו תוצאות עבור: AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
70.81.00קישור למקור

לא נמצאו תוצאות עבור: ARC-AGI-3 · ARC-AGI-2 · ZeroBench

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Language
מדידה עצמאית · מתעדכן
לוח עצמאי
73.61.00קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
70.81.00קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · GPQA / GPQA Diamond · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
62.81.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Data Analysis
מדידה עצמאית · מתעדכן
לוח עצמאי
55.81.00קישור למקור

לא נמצאו תוצאות עבור: CharXiv

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
69.91.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
18.51.00קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
43.90.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
43.90.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
62.31.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
18.51.00קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · SWE-bench Pro · CursorBench · Vibe Code Bench · DeepSWE

מערכות נוספות

להשוואה