Step 3.7 Flash
מודל פתוח של StepFun עם חלון הקשר של 256K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 53.2.
כל תוצאות המבחנים (8)
דיוק עובדתי
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 92.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: SimpleQA · SimpleQA Verified
מחקר ברשת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| BrowseComp | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 75.8 | 0.34 | קישור למקור |
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 92.8 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 59.5 | 0.85 | קישור למקור |
| Toolathlon | מדד משני לפי דיווח היצרן | 49.5 | 0.42 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 51.6 | 0.40 | קישור למקור |
| DeepSearchQA | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לפי דיווח היצרן | 92.8 | 0.34 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לפי דיווח היצרן | 67.1 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · MLE-bench
עבודה בשורת פקודה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 59.5 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: Terminal-Bench 3.0
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Terminal-Bench 2.0 | מדידה עצמאית · מתעדכן לפי דיווח היצרן | 59.5 | 0.85 | קישור למקור |
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE
שימוש בכלים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Toolathlon | מדד משני לפי דיווח היצרן | 49.5 | 0.42 | קישור למקור |
| Claw-Eval | מדד משני · בהסתייגות לפי דיווח היצרן | 67.1 | 0.34 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 56.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · SWE-bench Lite · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 51.6 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
