מערכת שנבדקה

Ling 3.0 Flash

נבדק כמודל APIמודל פתוחInclusionAI

מודל פתוח של InclusionAI עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 54.3.

ציונים לפי יכולת
מתמטיקה
כיסוי 27%
90.1
עמידה בהוראות
כיסוי 19%
74.5
מחקר ברשת
כיסוי 33%
72.6
ביצוע משימות מרובות שלבים
כיסוי 19%
71.3
שימוש בכלים
כיסוי 53%
70.5
ידע וחשיבה
כיסוי 24%
69.4
חשיבה מדעית
כיסוי 47%
63.1
כתיבת קוד עצמאית
כיסוי 11%
56.6
קוד ופיתוח תוכנה
כיסוי 14%
54.3
טקסט ותמונה
כיסוי 33%
22.7
מדדים

כל רשומות המדד (14)

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.20.72קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.00.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision · FrontierMath v2

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
74.50.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFEval · MAXIFE

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
72.20.34קישור למקור
WideResearch
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
73.60.11קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · Agents' Last Exam · DeepSearchQA

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
73.00.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
65.50.42קישור למקור
WideResearch
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
73.60.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · Toolathlon · AndroidWorld · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
73.00.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
65.50.42קישור למקור

לא נמצאו תוצאות עבור: Toolathlon · Claw-Eval

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.00.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
22.70.24קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.00.72קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
41.20.72קישור למקור

לא נמצאו תוצאות עבור: SuperGPQA · CritPt

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
56.60.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
56.60.72קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
41.20.72קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
72.40.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · CursorBench · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
22.70.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

מערכות נוספות

להשוואה