מערכת שנבדקה

Inkling

נבדק כמודל APIמודל פתוחThinking Machines Lab

מודל פתוח של Thinking Machines Lab עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.2.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 24%
87.9
הבנה חזותית
כיסוי 19%
82.0
מתמטיקה
כיסוי 32%
79.7
מחקר ברשת
כיסוי 15%
77.1
שימוש בכלים
כיסוי 18%
74.1
ניתוח נתונים
כיסוי 60%
73.4
עמידה בהוראות
כיסוי 45%
72.5
ידע וחשיבה
כיסוי 41%
68.4
ביצוע משימות מרובות שלבים
כיסוי 14%
67.2
שפה וניסוח
כיסוי 30%
67.2
קוד ופיתוח תוכנה
כיסוי 19%
67.0
טקסט ותמונה
כיסוי 66%
66.6
עבודה בשורת פקודה
כיסוי 43%
63.8
כתיבת קוד עצמאית
כיסוי 39%
62.5
חשיבה מופשטת
כיסוי 18%
36.5
מדדים

כל רשומות המדד (14)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.90.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
82.00.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · MathVision · ERQA · ZeroBench · VideoMMMU

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
97.10.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.10.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
74.10.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Toolathlon · Claw-Eval

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
82.00.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.80.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFEval · MAXIFE

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.90.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
46.00.57קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
63.80.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
74.10.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.60.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
54.30.72קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
73.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
46.00.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
63.80.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
67.21.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
63.80.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
54.30.72קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
36.50.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

מערכות נוספות

להשוואה