Nemotron 3.5 Lightning 30B A3B NVFP4
מודל פתוח של אנבידיה עם חלון הקשר של 1,000K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 21.3.
כל תוצאות המבחנים (11)
עמידה בהוראות
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| IFBench | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 72.9 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFEval · MAXIFE
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 81.6 | 0.72 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 75.6 | 0.72 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 10.5 | 0.48 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · SuperGPQA · MMLU-Redux
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 75.6 | 0.72 | קישור למקור |
| SciCode | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 31.4 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: SuperGPQA · CritPt
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לפי דיווח היצרן | 52.8 | 0.85 | קישור למקור |
| SciCode | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 31.4 | 0.72 | קישור למקור |
| SWE-bench Multilingual | מדד משני לפי דיווח היצרן | 36.5 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SWE-bench Lite · CursorBench · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 36.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 23.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · Vibe Code Bench · DeepSWE
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 23.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 23.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
הבנת תמונות ומסמכים חזותיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 10.5 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
