מערכת שנבדקה

Kimi K2.5 (Reasoning)

נבדק כמודל APIמודל סגורMoonshot AI

מודל סגור של Moonshot AI עם חלון הקשר של 256K טוקנים. מדד האיכות המרוכז של המקור עומד על 60.6.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 24%
87.6
ידע וחשיבה
כיסוי 24%
87.3
טקסט ותמונה
כיסוי 33%
78.5
מחקר ברשת
כיסוי 15%
60.6
קוד ופיתוח תוכנה
כיסוי 10%
54.9
עבודה בשורת פקודה
כיסוי 43%
50.8
ביצוע משימות מרובות שלבים
כיסוי 14%
46.2
כתיבת קוד עצמאית
כיסוי 21%
38.5
תוצרים מקצועיים
כיסוי 44%
32.6
מדדים

כל רשומות המדד (9)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.60.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.10.72קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
87.60.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.50.72קישור למקור

לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
60.60.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam · DeepSearchQA

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
76.80.85קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
17.50.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
50.80.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
50.80.85קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
32.60.28קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
50.80.85קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
17.50.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
32.60.40קישור למקור

לא נמצאו תוצאות עבור: JobBench

מערכות נוספות

להשוואה