מערכת שנבדקה

Qwen3.8-Flash-Next

נבדק כמודל APIמודל פתוחעליבאבא

מודל פתוח של עליבאבא עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 61.8.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 24%
91.7
הבנה חזותית
כיסוי 41%
85.7
ניתוח נתונים
כיסוי 60%
73.9
שימוש בכלים
כיסוי 18%
73.5
מתמטיקה
כיסוי 26%
70.4
עמידה בהוראות
כיסוי 45%
70.0
קוד ופיתוח תוכנה
כיסוי 29%
68.8
ידע וחשיבה
כיסוי 41%
64.7
שפה וניסוח
כיסוי 30%
61.8
כתיבת קוד עצמאית
כיסוי 33%
61.4
תוצרים מקצועיים
כיסוי 47%
55.7
ביצוע משימות מרובות שלבים
כיסוי 27%
52.3
מחקר ברשת
כיסוי 18%
51.2
הפעלת מחשב
כיסוי 49%
43.5
טקסט ותמונה
כיסוי 33%
35.9
מדדים

כל רשומות המדד (18)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
91.70.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
90.60.72קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
90.60.42קישור למקור
ERQA
מדד משני
לפי דיווח היצרן
72.30.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · ZeroBench · VideoMMMU

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
90.60.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.50.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Claw-Eval

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
90.60.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · FrontierMath v2

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.30.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFEval · MAXIFE

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
LiveCodeBench
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
91.90.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
62.50.72קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
81.00.42קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
48.10.42קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
58.70.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · Vibe Code Bench · FrontierCode 1.1 · ProgramBench

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
91.70.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
35.90.57קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
62.50.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
58.70.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
55.70.42קישור למקור

לא נמצאו תוצאות עבור: Gert Labs

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
19.40.72קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.50.42קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
84.50.42קישור למקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
51.20.42קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
55.70.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · MCP Atlas · WideResearch · AutomationBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
51.20.42קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · BrowseComp · DeepSearchQA

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
19.40.72קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
84.50.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · WebArena-Verified

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
35.90.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

מערכות נוספות

להשוואה