מערכת שנבדקה

Qwen3.7 Plus

נבדק כמודל APIמודל סגורעליבאבא

מודל סגור של עליבאבא עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 66.1.

ציונים לפי יכולת
מתמטיקה
כיסוי 21%
91.9
ניתוח נתונים
כיסוי 25%
85.9
עמידה בהוראות
כיסוי 40%
85.8
עברית
כיסוי 64%
85.7
שפה וניסוח
כיסוי 23%
84.2
הבנה חזותית
כיסוי 63%
82.5
הפעלת מחשב
כיסוי 67%
76.9
ידע וחשיבה
כיסוי 58%
74.2
ביצוע משימות מרובות שלבים
כיסוי 40%
72.4
בריאות ורפואה
כיסוי 58%
71.0
שימוש בכלים
כיסוי 67%
70.8
עבודה בשורת פקודה
כיסוי 43%
70.3
טקסט ותמונה
כיסוי 66%
67.9
קוד ופיתוח תוכנה
כיסוי 30%
67.7
כתיבת קוד עצמאית
כיסוי 24%
64.5
חשיבה מדעית
כיסוי 89%
61.5
מחקר מדעי
כיסוי 85%
9.1
מדדים

כל רשומות המדד (32)

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
92.90.72קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
90.30.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · MATH Level 5 · FrontierMath v2

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.90.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.10.72קישור למקור
IFEval
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
94.60.42קישור למקור
MAXIFE
מדד משני · עברית
לפי דיווח היצרן
88.80.38קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following

עברית

מבחן הערכהסטטוסציוןמשקלמקור
INCLUDE
מדד משני · עברית
לפי דיווח היצרן
83.00.38קישור למקור
MMLU-ProX
מדד משני · עברית
לפי דיווח היצרן
85.40.38קישור למקור
MAXIFE
מדד משני · עברית
לפי דיווח היצרן
88.80.38קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU)

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
INCLUDE
מדד משני · עברית
לפי דיווח היצרן
83.00.38קישור למקור
MMLU-ProX
מדד משני · עברית
לפי דיווח היצרן
85.40.38קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · Global-MMLU (GMMLU)

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.90.72קישור למקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
79.00.42קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
90.30.42קישור למקור
ERQA
מדד משני
לפי דיווח היצרן
69.80.42קישור למקור
VideoMMMU
מדד משני
לפי דיווח היצרן
85.40.42קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro · ZeroBench

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
73.30.72קישור למקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
79.00.42קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
81.00.42קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.90.85קישור למקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
88.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
34.70.72קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
71.40.72קישור למקור
MMLU-Redux
מדד משני
לפי דיווח היצרן
94.50.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
72.90.85קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
73.30.72קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
81.00.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לפי דיווח היצרן
62.70.34קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · Toolathlon · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs

בריאות ורפואה

מבחן הערכהסטטוסציוןמשקלמקור
MedXpertQA
מדידה בתחום
לפי דיווח היצרן
71.00.72קישור למקור

לא נמצאו תוצאות עבור: HealthBench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
72.90.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לפי דיווח היצרן
62.70.34קישור למקור

לא נמצאו תוצאות עבור: Toolathlon

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.00.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
34.70.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.70.85קישור למקור
LiveCodeBench
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
89.60.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
57.60.72קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
51.30.72קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
75.80.42קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
41.10.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · CursorBench · Vibe Code Bench · DeepSWE · FrontierCode 1.1 · ProgramBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
57.60.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.90.85קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
51.30.72קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
71.40.72קישור למקור
CritPt
מדד משני
לפי דיווח היצרן
9.10.42קישור למקור

מחקר מדעי

מבחן הערכהסטטוסציוןמשקלמקור
CritPt
מדד משני
לפי דיווח היצרן
9.10.42קישור למקור
מערכות נוספות

להשוואה