מערכת שנבדקה

Kimi K3

נבדק כמודל APIמודל סגורMoonshot AI

מודל סגור של Moonshot AI עם חלון הקשר של 1,050K טוקנים. מדד האיכות המרוכז של המקור עומד על 80.8.

ציונים לפי יכולת
דיוק עובדתי
כיסוי 28%
95.0
חשיבה מדעית
כיסוי 24%
93.5
מחקר ברשת
כיסוי 30%
93.1
עבודה בשורת פקודה
כיסוי 43%
88.3
ניתוח נתונים
כיסוי 60%
85.2
מתמטיקה
כיסוי 26%
84.8
עמידה בהוראות
כיסוי 26%
80.8
שפה וניסוח
כיסוי 30%
80.8
שימוש בכלים
כיסוי 35%
78.7
ידע וחשיבה
כיסוי 41%
78.6
כתיבת קוד עצמאית
כיסוי 45%
76.3
טקסט ותמונה
כיסוי 66%
75.2
ביצוע משימות מרובות שלבים
כיסוי 32%
72.6
קוד ופיתוח תוכנה
כיסוי 19%
72.6
הבנה חזותית
כיסוי 52%
71.4
תוצרים מקצועיים
כיסוי 47%
52.9
תהליכי עבודה בארגון
כיסוי 85%
47.1
חשיבה מופשטת
כיסוי 32%
43.2
מדדים

כל רשומות המדד (21)

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
95.00.34קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · SimpleQA Verified

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.50.72קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

מחקר ברשת

מבחן הערכהסטטוסציוןמשקלמקור
BrowseComp
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
91.20.34קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
95.00.34קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified · WideResearch · Agents' Last Exam

עבודה בשורת פקודה

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
91.30.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench Data Analysis

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
94.30.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · FrontierMath v2

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
84.20.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
56.00.57קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
60.80.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.50.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · Vibe Code Bench

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.60.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
56.00.24קישור למקור

לא נמצאו תוצאות עבור: MMMU

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
84.20.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור
AutomationBench
מדד משני
לפי דיווח היצרן
30.80.42קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
52.90.42קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
95.00.34קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 3.0 · OSWorld · AndroidWorld · WideResearch · Agents' Last Exam · MLE-bench · Gert Labs · Claw-Eval

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
80.81.00קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
60.80.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.50.42קישור למקור
ProgramBench
מדד משני
לפי דיווח היצרן
77.80.42קישור למקור

לא נמצאו תוצאות עבור: SWE-bench Verified · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · FrontierCode 1.1

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
91.30.72קישור למקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
63.30.42קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
94.30.42קישור למקור
ZeroBench
מדד משני
לפי דיווח היצרן
23.00.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · ERQA · VideoMMMU

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לפי דיווח היצרן
52.90.42קישור למקור

לא נמצאו תוצאות עבור: Gert Labs

תהליכי עבודה בארגון

מבחן הערכהסטטוסציוןמשקלמקור
AutomationBench
מדד משני
לפי דיווח היצרן
30.80.42קישור למקור
OfficeQA Pro
מדד משני
לפי דיווח היצרן
63.30.42קישור למקור

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
60.40.50קישור למקור
ZeroBench
מדד משני
לפי דיווח היצרן
23.00.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3

מערכות נוספות

להשוואה