מערכת שנבדקה

Command A+

נבדק כמודל APIמודל פתוחCohere

מודל פתוח של Cohere עם חלון הקשר של 128K טוקנים. מדד האיכות המרוכז של המקור עומד על 48.2.

ציונים לפי יכולת
שירות לקוחות אוטומטי
כיסוי 85%
85.0
טקסט ותמונה
כיסוי 52%
67.5
ניתוח נתונים
כיסוי 25%
52.7
הבנה חזותית
כיסוי 19%
52.7
קוד ופיתוח תוכנה
כיסוי 7%
12.0
מדדים

כל רשומות המדד (6)

שירות לקוחות אוטומטי

מבחן הערכהסטטוסציוןמשקלמקור
τ²-bench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
85.00.34קישור למקור

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
63.00.72קישור למקור
MMMU
מדד משני
לפי דיווח היצרן
75.10.42קישור למקור

לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE)

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
52.70.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
52.70.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · OfficeQA Pro · MathVision · ERQA · ZeroBench · VideoMMMU

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
Aider Polyglot
מדידה עצמאית · מתעדכן
לוח עצמאי
12.01.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-bench Verified · SWE-rebench · LiveCodeBench · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

מערכות נוספות

להשוואה