מערכת שנבדקה

Grok 4

נבדק כמודל APIמודל סגורxAI

מודל סגור של xAI עם חלון הקשר של 128K טוקנים. מדד האיכות המרוכז של המקור עומד על 60.0.

ציונים לפי יכולת
קוד ופיתוח תוכנה
כיסוי 7%
79.6
ביצוע משימות מרובות שלבים
כיסוי 4%
42.3
תוצרים מקצועיים
כיסוי 44%
42.3
חשיבה מופשטת
כיסוי 18%
29.4
מתמטיקה
כיסוי 7%
19.7
מדדים

כל רשומות המדד (5)

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
Aider Polyglot
מדידה עצמאית · מתעדכן
לוח עצמאי
79.61.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-bench Verified · SWE-rebench · LiveCodeBench · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
42.30.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
42.30.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
29.40.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
19.70.40קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

מערכות נוספות

להשוואה