מערכת שנבדקה

Kimi K2.5

נבדק כמודל APIמודל פתוחMoonshot AI

מודל פתוח של Moonshot AI עם חלון הקשר של 256K טוקנים. מדד האיכות המרוכז של המקור עומד על 59.3.

ציונים לפי יכולת
עמידה בהוראות
כיסוי 9%
93.9
הבנה חזותית
כיסוי 9%
86.6
שפה וניסוח
כיסוי 9%
82.3
עברית
כיסוי 18%
82.3
מתמטיקה
כיסוי 34%
77.7
מחקר ברשת
כיסוי 48%
69.8
ידע וחשיבה
כיסוי 47%
69.1
חשיבה מדעית
כיסוי 67%
68.5
טקסט ותמונה
כיסוי 66%
66.4
קוד ופיתוח תוכנה
כיסוי 36%
64.6
מסמכים ארוכים
כיסוי 43%
61.0
דיוק עובדתי
כיסוי 62%
54.0
עבודה בשורת פקודה
כיסוי 43%
50.8
כתיבת קוד עצמאית
כיסוי 24%
50.8
ביצוע משימות מרובות שלבים
כיסוי 42%
45.4
שימוש בכלים
כיסוי 52%
36.2
תוצרים מקצועיים
כיסוי 100%
25.2
חשיבה מופשטת
כיסוי 18%
11.8
מדדים

כל רשומות המדד (31)

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
IFEval
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
93.90.35קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · IFBench · MAXIFE

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
VideoMMMU
מדד משני
לפי דיווח היצרן
86.60.35קישור למקור

לא נמצאו תוצאות עבור: CharXiv · ScreenSpot Pro · OfficeQA Pro · MathVision · ERQA · ZeroBench

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-ProX
מדד משני · עברית
לפי דיווח היצרן
82.30.32קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · Global-MMLU (GMMLU) · INCLUDE

עברית

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-ProX
מדד משני · עברית
לפי דיווח היצרן
82.30.32קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MAXIFE

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
95.80.72קישור למקור
HMMT Feb 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.10.72קישור למקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
27.90.40קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · MATH Level 5 · MathVision

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
60.60.34קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.10.34קישור למקור
WideResearch
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
72.70.23קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · Agents' Last Exam

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.10.72קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.60.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
30.10.68קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
69.20.59קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Redux

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.60.72קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
48.70.72קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
69.20.59קישור למקור

לא נמצאו תוצאות עבור: CritPt

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
30.10.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
73.81.00קישור למקור
SWE-rebench
מדידה עצמאית · מתעדכן
לוח עצמאי
58.51.00קישור למקור
LiveCodeBench
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
85.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
50.70.72קישור למקור
SciCode
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
48.70.72קישור למקור
SWE-bench Multilingual
מדד משני
לוח עצמאי
67.30.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · CursorBench · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

מסמכים ארוכים

מבחן הערכהסטטוסציוןמשקלמקור
LongBench v2
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.00.72קישור למקור

לא נמצאו תוצאות עבור: MRCR 1M

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
34.30.40קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.10.34קישור למקור

לא נמצאו תוצאות עבור: SimpleQA

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
50.80.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
50.80.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
50.70.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
50.80.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
29.50.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
27.80.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
52.30.40קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
77.10.34קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
8.70.31קישור למקור
WideResearch
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
72.70.26קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
45.90.25קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · AndroidWorld · Agents' Last Exam · AutomationBench · MLE-bench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
29.50.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
27.80.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
52.30.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
8.70.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
45.90.40קישור למקור

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
11.80.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

מערכות נוספות

להשוואה