Qwen3.5-27B
מודל פתוח של עליבאבא עם חלון הקשר של 262K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 58.3.
כל תוצאות המבחנים (15)
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| IFEval | מדד משניזיקה מסחרית מוצהרת לפי דיווח היצרן | 95.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFBench · MAXIFE
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MathVision | מדד משני לפי דיווח היצרן | 86.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · FrontierMath v2
הבנה חזותית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MathVision | מדד משני לפי דיווח היצרן | 86.0 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: CharXiv · ScreenSpot Pro · OfficeQA Pro · ERQA · ZeroBench · VideoMMMU
הבנת תמונות ומסמכים חזותיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMMU | מדד משני מקור לא מאומת | 82.3 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU-Pro
עברית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-ProX | מדד משני · עברית לפי דיווח היצרן | 82.2 | 0.38 | קישור למקור |
לא נמצאו תוצאות עבור: Hebrew LLM Leaderboard · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE · MAXIFE
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-ProX | מדד משני · עברית לפי דיווח היצרן | 82.2 | 0.38 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · Hebrew LLM Leaderboard · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 86.1 | 0.72 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 85.5 | 0.72 | קישור למקור |
| SuperGPQA | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 65.6 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · Humanity's Last Exam (HLE) · MMLU-Redux
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 85.5 | 0.72 | קישור למקור |
| SuperGPQA | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 65.6 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · CritPt
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-rebench | מדידה עצמאית · מתעדכן לוח עצמאי | 58.9 | 1.00 | קישור למקור |
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לפי דיווח היצרן | 72.4 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Lite · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 61.0 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA
מסמכים ארוכים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| LongBench v2 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 60.6 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MRCR 1M
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.2 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 41.6 | 0.85 | קישור למקור |
| OSWorld | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.2 | 0.72 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 39.4 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 41.6 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · Vibe Code Bench · DeepSWE
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 41.6 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 39.4 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
