Ling 3.0 Flash
מודל פתוח של InclusionAI עם חלון הקשר של 262K טוקנים. מדד האיכות המרוכז של המקור עומד על 54.3.
כל רשומות המדד (14)
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| AIME 2026 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 93.2 | 0.72 | קישור למקור |
| HMMT Feb 2026 | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 87.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision · FrontierMath v2
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| IFBench | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 74.5 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFEval · MAXIFE
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 72.2 | 0.34 | קישור למקור |
| WideResearch | מדד משניהערכה על ידי מודל אחר לפי דיווח היצרן | 73.6 | 0.11 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · Agents' Last Exam · DeepSearchQA
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Berkeley Function Calling Leaderboard (BFCL) V4 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 73.0 | 0.85 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 65.5 | 0.42 | קישור למקור |
| WideResearch | מדד משניהערכה על ידי מודל אחר לפי דיווח היצרן | 73.6 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · Toolathlon · AndroidWorld · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Berkeley Function Calling Leaderboard (BFCL) V4 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 73.0 | 0.85 | קישור למקור |
| MCP Atlas | מדד משני לפי דיווח היצרן | 65.5 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: Toolathlon · Claw-Eval
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 85.0 | 0.72 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 22.7 | 0.24 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 85.0 | 0.72 | קישור למקור |
| SciCode | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 41.2 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: SuperGPQA · CritPt
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.6 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.6 | 0.72 | קישור למקור |
| SciCode | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 41.2 | 0.72 | קישור למקור |
| SWE-bench Multilingual | מדד משני לפי דיווח היצרן | 72.4 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · CursorBench · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 22.7 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
