מערכת שנבדקה

Kimi K2.7 Code

נבדק כמודל APIמודל פתוחMoonshot AI

מודל פתוח של Moonshot AI עם חלון הקשר של 256K טוקנים. מדד האיכות המרוכז של המקור עומד על 54.7.

ציונים לפי יכולת
חשיבה מדעית
כיסוי 28%
87.9
חשיבה מופשטת
כיסוי 35%
82.8
ידע וחשיבה
כיסוי 48%
79.3
שימוש בכלים
כיסוי 18%
76.0
ביצוע משימות מרובות שלבים
כיסוי 5%
76.0
מתמטיקה
כיסוי 37%
74.0
שפה וניסוח
כיסוי 60%
73.2
ניתוח נתונים
כיסוי 70%
65.5
עמידה בהוראות
כיסוי 53%
62.3
קוד ופיתוח תוכנה
כיסוי 31%
59.5
כתיבת קוד עצמאית
כיסוי 41%
55.1
דיוק עובדתי
כיסוי 33%
36.5
מדדים

כל רשומות המדד (14)

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.90.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
82.81.00קישור למקור

לא נמצאו תוצאות עבור: ARC-AGI-3 · ARC-AGI-2 · ZeroBench

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
82.81.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.90.85קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
76.00.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Toolathlon · Claw-Eval

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
76.00.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Mathematics
מדידה עצמאית · מתעדכן
לוח עצמאי
79.61.00קישור למקור

לא נמצאו תוצאות עבור: AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Language
מדידה עצמאית · מתעדכן
לוח עצמאי
77.91.00קישור למקור

לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Data Analysis
מדידה עצמאית · מתעדכן
לוח עצמאי
62.71.00קישור למקור

לא נמצאו תוצאות עבור: CharXiv

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
56.31.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
74.01.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
45.71.00קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
49.70.70קישור למקור
ProgramBench
מדד משני
לפי דיווח היצרן
53.60.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
68.41.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
45.71.00קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
49.70.70קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · SWE-bench Pro · Vibe Code Bench · DeepSWE

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
36.50.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

מערכות נוספות

להשוואה