מערכת שנבדקה

DeepSeek V4 Pro 0813

נבדק כמודל APIמודל סגורDeepSeek

מודל סגור של DeepSeek עם חלון הקשר של 1,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 61.8.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 28%
91.7
מסמכים ארוכים
כיסוי 43%
83.5
מתמטיקה
כיסוי 32%
75.8
שימוש בכלים
כיסוי 35%
73.8
ידע וחשיבה
כיסוי 56%
71.0
קוד ופיתוח תוכנה
כיסוי 39%
69.3
עבודה בשורת פקודה
כיסוי 43%
67.9
עמידה בהוראות
כיסוי 26%
61.8
ניתוח נתונים
כיסוי 35%
61.8
שפה וניסוח
כיסוי 30%
61.8
חשיבה מופשטת
כיסוי 18%
61.3
כתיבת קוד עצמאית
כיסוי 53%
60.4
ביצוע משימות מרובות שלבים
כיסוי 28%
56.8
דיוק עובדתי
כיסוי 62%
54.2
מחקר ברשת
כיסוי 33%
51.3
טקסט ותמונה
כיסוי 33%
42.7
תהליכי עבודה בארגון
כיסוי 43%
31.8
מדדים

כל רשומות המדד (24)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
91.70.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

מסמכים ארוכים

מבחן הערכהסטטוסציוןמשקלמקור
MRCR 1M
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
83.50.72קישור למקור

לא נמצאו תוצאות עבור: LongBench v2

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
95.20.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · MATH Level 5 · MathVision · FrontierMath v2

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
73.60.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
74.10.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
91.70.85קישור למקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
42.70.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · SuperGPQA · MMLU-Redux

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
80.60.85קישור למקור
LiveCodeBench
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
93.50.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
55.40.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
49.90.50קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
76.20.42קישור למקור
NL2Repo
מדד משני
לפי דיווח היצרן
61.50.42קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
62.70.42קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · CursorBench · FrontierCode 1.1 · ProgramBench

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
67.90.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis · CharXiv

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
61.30.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
61.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
67.90.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
55.40.72קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
49.90.50קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
62.70.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
67.90.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
73.60.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
74.10.42קישור למקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
25.70.42קישור למקור
AutomationBench
מדד משני
לפי דיווח היצרן
31.80.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · AndroidWorld · WideResearch · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
52.90.40קישור למקור
SimpleQA
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
57.90.13קישור למקור

לא נמצאו תוצאות עבור: DeepSearchQA

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
Agents' Last Exam
מדד משני
לפי דיווח היצרן
25.70.42קישור למקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
83.40.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · DeepSearchQA

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
42.70.72קישור למקור

לא נמצאו תוצאות עבור: MMMU-Pro · MMMU

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
AutomationBench
מדד משני
לפי דיווח היצרן
31.80.42קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro

מערכות נוספות

להשוואה