מערכת שנבדקה

Qwen3.8-27B

נבדק כמודל APIמודל פתוחעליבאבא

מודל פתוח של עליבאבא עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 72.7.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 24%
89.2
הבנה חזותית
כיסוי 41%
83.5
ניתוח נתונים
כיסוי 60%
80.0
הפעלת מחשב
כיסוי 67%
78.4
מתמטיקה
כיסוי 26%
77.9
עמידה בהוראות
כיסוי 45%
75.6
שפה וניסוח
כיסוי 30%
72.7
ידע וחשיבה
כיסוי 41%
67.4
קוד ופיתוח תוכנה
כיסוי 26%
67.2
ביצוע משימות מרובות שלבים
כיסוי 22%
64.2
כתיבת קוד עצמאית
כיסוי 33%
63.0
מחקר ברשת
כיסוי 37%
53.8
תוצרים מקצועיים
כיסוי 47%
33.4
טקסט ותמונה
כיסוי 33%
30.8
מדדים

כל רשומות המדד (18)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
89.20.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
90.20.72קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
90.00.42קישור למקור
ERQA
מדד משני
לפי דיווח היצרן
65.50.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · ZeroBench · VideoMMMU

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
90.20.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
84.30.72קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
81.90.42קישור למקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
64.80.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
90.00.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · FrontierMath v2

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.50.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFEval · MAXIFE

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
89.20.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
30.80.57קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור
LiveCodeBench
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
90.30.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.70.72קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
42.30.42קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
42.20.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · FrontierCode 1.1 · ProgramBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
84.30.72קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
81.90.42קישור למקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
42.90.42קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
33.40.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · MCP Atlas · Toolathlon · WideResearch · AutomationBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
72.71.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.70.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
42.20.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
64.80.42קישור למקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
42.90.42קישור למקור

לא נמצאו תוצאות עבור: WideResearch · BrowseComp · DeepSearchQA

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
33.40.42קישור למקור

לא נמצאו תוצאות עבור: Gert Labs

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
30.80.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

מערכות נוספות

להשוואה