מערכת שנבדקה

Inkling-Small

נבדק כמודל APIמודל פתוחThinking Machines Lab

מודל פתוח של Thinking Machines Lab עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 64.2.

ציונים לפי יכולת
מתמטיקה
כיסוי 27%
92.9
עמידה בהוראות
כיסוי 19%
82.2
ניתוח נתונים
כיסוי 25%
81.3
הבנה חזותית
כיסוי 19%
81.3
ידע וחשיבה
כיסוי 27%
78.3
מחקר ברשת
כיסוי 15%
77.4
טקסט ותמונה
כיסוי 66%
67.5
שימוש בכלים
כיסוי 35%
67.0
ביצוע משימות מרובות שלבים
כיסוי 19%
65.8
עבודה בשורת פקודה
כיסוי 43%
64.7
קוד ופיתוח תוכנה
כיסוי 17%
62.6
כתיבת קוד עצמאית
כיסוי 24%
60.7
חשיבה מדעית
כיסוי 65%
57.0
חשיבה מופשטת
כיסוי 18%
40.1
דיוק עובדתי
כיסוי 33%
19.1
מחקר מדעי
כיסוי 85%
8.3
מדדים

כל רשומות המדד (18)

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
95.50.72קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
90.20.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision · FrontierMath v2

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
82.20.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.30.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.30.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · MathVision · ERQA · ZeroBench · VideoMMMU

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
88.50.85קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
47.80.28קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.40.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
74.00.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
47.80.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
79.60.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
54.40.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
64.70.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
79.60.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
54.40.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
64.70.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
80.20.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
55.90.72קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
48.70.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
64.70.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
55.90.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
88.50.85קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
48.70.72קישור למקור
CritPt
מדד משני
לפי דיווח היצרן
8.30.42קישור למקור

לא נמצאו תוצאות עבור: SuperGPQA

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
40.10.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
19.10.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

מחקר מדעי

מבחן הערכהסטטוסציוןמשקלמקור
CritPt
מדד משני
לפי דיווח היצרן
8.30.42קישור למקור
מערכות נוספות

להשוואה