אוטומציה וסוכני AI · הפעלת יישומים במחשב

דירוג לפי איכות

1

Muse Spark 1.1

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

ציון התאמה
71.8
כיסוי נתונים 41%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

  • התוצאות הגבוהות ביותר שלו הן בכתיבת קוד עצמאית.
  • היתרון נשען בעיקר על LiveBench, Terminal-Bench 2.0.
  • כיסוי נתונים: 41% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • כתיבת קוד עצמאיתמשקל 23%
    69.0 · 4 מבחנים
  • הפעלת מחשבמשקל 21%
    76.4 · 2 מבחנים
  • עבודה בשורת פקודהמשקל 19%
    80.0 · מבחן אחד
  • שימוש בכליםמשקל 19%
    81.8 · 2 מבחנים
  • עמידה בהוראותמשקל 9%
    71.8 · מבחן אחד
  • ידע וחשיבהמשקל 9%
    69.4 · 2 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
43%
איכות המקורות
87%
יציבות התוצאה
67%
השוואה הוגנת
68%

כתיבת קוד עצמאית משקל 23%

כיסוי 46%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.50.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
53.30.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench

הפעלת מחשב משקל 21%

כיסוי 49%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.80.72קישור למקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
69.00.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld

עבודה בשורת פקודה משקל 19%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

שימוש בכלים משקל 19%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
88.10.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
75.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

עמידה בהוראות משקל 9%

כיסוי 26%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 29%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
62.10.33קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux

2

Qwen3.7 Plus

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

ציון התאמה
70.7
עברית
85.7
מבוסס על מבחנים רב לשוניים, לא על מבחן עברית ייעודי. מוצג בנפרד ואינו משפיע על הציון.
כיסוי נתונים 49%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

  • התוצאות הגבוהות ביותר שלו הן בשימוש בכלים.
  • היתרון נשען בעיקר על Berkeley Function Calling Leaderboard (BFCL) V4, MCP Atlas.
  • כיסוי נתונים: 49% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • כתיבת קוד עצמאיתמשקל 23%
    64.5 · 2 מבחנים
  • הפעלת מחשבמשקל 21%
    76.9 · 3 מבחנים
  • עבודה בשורת פקודהמשקל 19%
    70.3 · מבחן אחד
  • שימוש בכליםמשקל 19%
    70.8 · 3 מבחנים
  • עמידה בהוראותמשקל 9%
    85.8 · 3 מבחנים
  • ידע וחשיבהמשקל 9%
    74.2 · 5 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
49%
איכות המקורות
87%
יציבות התוצאה
94%
השוואה הוגנת
54%

כתיבת קוד עצמאית משקל 23%

כיסוי 24%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
57.60.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

הפעלת מחשב משקל 21%

כיסוי 67%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
73.30.72קישור למקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
79.00.42קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
81.00.42קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified

עבודה בשורת פקודה משקל 19%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

שימוש בכלים משקל 19%

כיסוי 67%
מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
72.90.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לפי דיווח היצרן
62.70.34קישור למקור

לא נמצאו תוצאות עבור: Toolathlon

עמידה בהוראות משקל 9%

כיסוי 40%
מבחן הערכהסטטוסציוןמשקלמקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.10.72קישור למקור
IFEval
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
94.60.42קישור למקור
MAXIFE
מדד משני · עברית
לפי דיווח היצרן
88.80.38קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following

ידע וחשיבה משקל 9%

כיסוי 58%
מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.90.85קישור למקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
88.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
34.70.72קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
71.40.72קישור למקור
MMLU-Redux
מדד משני
לפי דיווח היצרן
94.50.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning

3

GPT-5.5

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

תצורות נוספות:מצב מאמץ נמוךמצב מאמץ בינונימצב מאמץ גבוהמצב מאמץ גבוה מאודמצב אצווה במחיר מופחתלא נכללות בציון
ציון התאמה
70.4
עברית
96.6
מוצג בנפרד ואינו משפיע על ציון ההתאמה.
כיסוי נתונים 50%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

עלות שימוש: קלט $5 · פלט $30 למיליון טוקנים

  • התוצאות הגבוהות ביותר שלו הן בכתיבת קוד עצמאית ועבודה בשורת פקודה.
  • היתרון נשען בעיקר על LiveBench, Terminal-Bench 2.0.
  • כיסוי נתונים: 50% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • כתיבת קוד עצמאיתמשקל 23%
    66.2 · 6 מבחנים
  • הפעלת מחשבמשקל 21%
    78.7 · מבחן אחד
  • עבודה בשורת פקודהמשקל 19%
    82.0 · מבחן אחד
  • שימוש בכליםמשקל 19%
    65.4 · 2 מבחנים
  • עמידה בהוראותמשקל 9%
    75.1 · 2 מבחנים
  • ידע וחשיבהמשקל 9%
    79.5 · 4 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
50%
איכות המקורות
92%
יציבות התוצאה
89%
השוואה הוגנת
86%

כתיבת קוד עצמאית משקל 23%

כיסוי 75%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
46.81.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
58.60.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
58.40.70קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
69.80.50קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · DeepSWE

הפעלת מחשב משקל 21%

כיסוי 31%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.70.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

עבודה בשורת פקודה משקל 19%

כיסוי 50%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

שימוש בכלים משקל 19%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
75.30.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
55.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

עמידה בהוראות משקל 9%

כיסוי 53%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
71.41.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 58%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
89.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.60.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
52.20.72קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · SuperGPQA · MMLU-Redux

דירוג מלא

כל המודלים שנבדקו

הכיסוי מחושב על היכולות שנושאות את עיקר המשקל במשימה שנבחרה. מודל שנמדד בפחות מדדים מוצג עם הציון שלו ומסומן ככיסוי חלקי, ואינו נכנס לדירוג.

מודלציון התאמהכיסוי נתוניםעבריתרמת ביסוס
Muse Spark 1.171.843%בינונית
Qwen3.7 Plus70.749%85.7מבוסס על מבחנים רב לשונייםבינונית
GPT-5.570.449%96.6בינונית
GPT-5.468.447%94.8בינונית
Gemini 3.5 Flash67.647%94.7בינונית
Claude Opus 4.667.442%בינונית
Claude Opus 565.244%91.1מבוסס על מבחנים רב לשונייםבינונית
MiniMax M364.440%בינונית
GPT-5.6 Sol64.254%97.1בינונית
Claude Sonnet 4.663.540%בינונית
Claude Opus 4.863.265%87.6מבוסס על מבחנים רב לשונייםגבוהה
Kimi K2.661.750%בינונית
Qwen3.6-27B60.633%בינונית
Claude Opus 4.560.246%85.7מבוסס על מבחנים רב לשונייםבינונית
Qwen3.6 Plus60.044%84.7מבוסס על מבחנים רב לשונייםבינונית
GPT-5.4 mini59.640%93.6בינונית
GPT-5.6 Terra57.454%97.1בינונית
Qwen3.5 397B56.633%70.8בינונית
GPT-5.6 Luna53.954%95.1בינונית
GPT-5.4 nano52.640%88.2בינונית
Claude Fable 5כיסוי חלקי, אינו מדורג66.052%בינונית
Qwen3.7 Maxכיסוי חלקי, אינו מדורג69.241%87.5מבוסס על מבחנים רב לשונייםבינונית
Kimi K3כיסוי חלקי, אינו מדורג73.931%בינונית
Claude Sonnet 5כיסוי חלקי, אינו מדורג58.952%גבוהה
Claude Opus 4.7 (Adaptive)כיסוי חלקי, אינו מדורג69.029%נמוכה
DeepSeek V4 Pro 0813כיסוי חלקי, אינו מדורג65.133%בינונית
Qwen3.8-27Bכיסוי חלקי, אינו מדורג68.027%בינונית
GPT-5.3 Codexכיסוי חלקי, אינו מדורג66.027%נמוכה
GLM-5.2כיסוי חלקי, אינו מדורג54.152%בינונית
Claude Fable 5.1כיסוי חלקי, אינו מדורג65.824%בינונית
GPT-6 Astraכיסוי חלקי, אינו מדורג70.914%נמוכה
Inkling-Smallכיסוי חלקי, אינו מדורג64.225%נמוכה
Inklingכיסוי חלקי, אינו מדורג63.225%בינונית
Gemini 3.6 Flashכיסוי חלקי, אינו מדורג67.317%92.8נמוכה
GLM-5.1כיסוי חלקי, אינו מדורג61.527%58.5נמוכה
Gemini 3.5 Flash-Liteכיסוי חלקי, אינו מדורג60.429%בינונית
Gemini 3.1 Proכיסוי חלקי, אינו מדורג65.319%בינונית
Muse Glimmer 30Bכיסוי חלקי, אינו מדורג64.620%נמוכה
Grok 4.5כיסוי חלקי, אינו מדורג54.542%בינונית
Muse Sparkכיסוי חלקי, אינו מדורג60.627%נמוכה
Gemini 3.8 Flashכיסוי חלקי, אינו מדורג65.518%נמוכה
MiMo-V2.5-Proכיסוי חלקי, אינו מדורג62.020%נמוכה
Ling 3.0 Flashכיסוי חלקי, אינו מדורג64.415%נמוכה
Qwen 3.6 Max (preview)כיסוי חלקי, אינו מדורג63.017%נמוכה
Qwen3.8-Flash-Nextכיסוי חלקי, אינו מדורג57.426%בינונית
Kimi K2.7 Codeכיסוי חלקי, אינו מדורג62.416%בינונית
GLM-5.3-Flashכיסוי חלקי, אינו מדורג65.310%61.3נמוכה
Step 3.7 Flashכיסוי חלקי, אינו מדורג58.024%נמוכה
Qwen3.5-122B-A10Bכיסוי חלקי, אינו מדורג58.321%67.2נמוכה
GLM-5כיסוי חלקי, אינו מדורג56.125%83.1מבוסס על מבחנים רב לשונייםנמוכה
MiniMax M2.7כיסוי חלקי, אינו מדורג55.027%53.6נמוכה
GPT-5.2כיסוי חלקי, אינו מדורג57.918%93.9נמוכה
Muse Spark 1.2כיסוי חלקי, אינו מדורג63.36%נמוכה
Qwen3.5-27Bכיסוי חלקי, אינו מדורג55.121%82.2מבוסס על מבחנים רב לשונייםנמוכה
Claude Opus 4.7כיסוי חלקי, אינו מדורג55.320%בינונית
Kimi K2.5כיסוי חלקי, אינו מדורג51.728%82.3מבוסס על מבחנים רב לשונייםנמוכה
Qwen3.5-35B-A3Bכיסוי חלקי, אינו מדורג54.321%81.0מבוסס על מבחנים רב לשונייםנמוכה
Nemotron 3 Ultraכיסוי חלקי, אינו מדורג55.518%83.0מבוסס על מבחנים רב לשונייםבינונית
Hy3 Previewכיסוי חלקי, אינו מדורג57.313%נמוכה
GLM-5.3כיסוי חלקי, אינו מדורג52.224%נמוכה
LFM2.5-2.6Bכיסוי חלקי, אינו מדורג57.911%נמוכה
Nemotron 3 Nano Omni 30B A3Bכיסוי חלקי, אינו מדורג61.35%נמוכה
Gemini 3 Proכיסוי חלקי, אינו מדורג58.97%74.7נמוכה
Kimi K2.5 (Reasoning)כיסוי חלקי, אינו מדורג54.216%נמוכה
Grok 4.6כיסוי חלקי, אינו מדורג49.825%בינונית
DeepSeek V3כיסוי חלקי, אינו מדורג61.50%נמוכה
MiMo-V2-Flashכיסוי חלקי, אינו מדורג61.50%נמוכה
LFM2.5-8B-A1Bכיסוי חלקי, אינו מדורג56.48%נמוכה
Trinity-Large-Thinkingכיסוי חלקי, אינו מדורג60.80%נמוכה
Mercury 2כיסוי חלקי, אינו מדורג60.60%נמוכה
Gemini 3.7 Flashכיסוי חלקי, אינו מדורג47.528%96.0בינונית
Granite 4.2 8Bכיסוי חלקי, אינו מדורג54.311%נמוכה
Gemma 4 31Bכיסוי חלקי, אינו מדורג59.70%59.9נמוכה
Exaone 4.0 32Bכיסוי חלקי, אינו מדורג59.70%נמוכה
DeepSeek-R1כיסוי חלקי, אינו מדורג59.40%נמוכה
Trinity-Large-Previewכיסוי חלקי, אינו מדורג59.40%נמוכה
MiMo-V2-Proכיסוי חלקי, אינו מדורג57.24%נמוכה
Grok 4.3כיסוי חלקי, אינו מדורג54.59%נמוכה
GLM-5-Turboכיסוי חלקי, אינו מדורג56.74%נמוכה
Gemma 4 26B A4Bכיסוי חלקי, אינו מדורג58.50%52.8נמוכה
GLM-5V-Turboכיסוי חלקי, אינו מדורג56.24%נמוכה
GLM-4.7כיסוי חלקי, אינו מדורג51.413%נמוכה
Llama 4 Maverickכיסוי חלקי, אינו מדורג58.30%נמוכה
DeepSeek R1 Distill Qwen 32Bכיסוי חלקי, אינו מדורג57.90%נמוכה
Claude Opus 4.6 (Adaptive)כיסוי חלקי, אינו מדורג56.52%נמוכה
GLM-4.7-Flashכיסוי חלקי, אינו מדורג57.50%נמוכה
Gemini 3 Flashכיסוי חלקי, אינו מדורג54.16%74.0נמוכה
Apodex 1.1כיסוי חלקי, אינו מדורג56.90%נמוכה
Phi-4כיסוי חלקי, אינו מדורג56.90%נמוכה
Llama 4 Scoutכיסוי חלקי, אינו מדורג56.40%נמוכה
Mistral Large 2כיסוי חלקי, אינו מדורג56.30%נמוכה
Llama 3.1 405Bכיסוי חלקי, אינו מדורג56.30%נמוכה
MiMo-V2-Omniכיסוי חלקי, אינו מדורג54.14%נמוכה
DeepSeek V3.2כיסוי חלקי, אינו מדורג52.94%נמוכה
GPT-5.1כיסוי חלקי, אינו מדורג51.92%72.7נמוכה
Gemini 2.5 Proכיסוי חלקי, אינו מדורג51.82%77.4נמוכה
Granite-4.0-1Bכיסוי חלקי, אינו מדורג52.90%נמוכה
Claude Opus 4.5 Thinkingכיסוי חלקי, אינו מדורג51.32%נמוכה
GPT-5 (high)כיסוי חלקי, אינו מדורג51.22%נמוכה
MiniMax M2.5כיסוי חלקי, אינו מדורג50.42%50.4נמוכה
Granite-4.0-350Mכיסוי חלקי, אינו מדורג51.40%נמוכה
Nemotron 3.5 Lightning 30B A3B NVFP4כיסוי חלקי, אינו מדורג44.413%נמוכה
GLM-4.6כיסוי חלקי, אינו מדורג48.52%54.2נמוכה
Grok 4.1 Fast (Reasoning)כיסוי חלקי, אינו מדורג48.22%נמוכה
Grok 4 Fast (Reasoning)כיסוי חלקי, אינו מדורג48.02%נמוכה
Nemotron 3 Super 100Bכיסוי חלקי, אינו מדורג44.34%נמוכה
Command A+אין נתון0%נמוכה
DeepSeek V3.1אין נתון0%נמוכה
DeepSeek V3.1 (Reasoning)אין נתון0%נמוכה
Exaone 4.0 1.2Bאין נתון0%נמוכה
Gemini 2.5 Flashאין נתון0%71.8נמוכה
GLM-4.5-Airאין נתון0%נמוכה
Granite-4.0-H-1Bאין נתון0%נמוכה
Granite-4.0-H-350Mאין נתון0%נמוכה
Grok 4אין נתון0%נמוכה
Grok 4.1 Fastאין נתון0%נמוכה
Grok Code Fast 1אין נתון0%נמוכה
Hy3אין נתון0%נמוכה
K-Exaoneאין נתון0%נמוכה
Kimi K2אין נתון0%נמוכה
Ling 2.6 Flashאין נתון0%נמוכה
MiniMax M1 80kאין נתון0%נמוכה
Ministral 3 14Bאין נתון0%נמוכה
Ministral 3 14B (Reasoning)אין נתון0%נמוכה
Ministral 3 3B (Reasoning)אין נתון0%נמוכה
Ministral 3 8Bאין נתון0%נמוכה
Ministral 3 8B (Reasoning)אין נתון0%נמוכה
Mistral Large 3אין נתון0%נמוכה
Mistral Medium 3אין נתון0%נמוכה
Mistral Medium 3.5 128Bאין נתון0%נמוכה
Mistral Small 4אין נתון0%נמוכה
Nemotron 3 Nano 30Bאין נתון0%נמוכה
Nemotron 3 Super 120B A12Bאין נתון0%נמוכה
Nemotron Ultra 253Bאין נתון0%נמוכה
Nova Proאין נתון0%נמוכה
Qwen3.5 397B (Reasoning)אין נתון0%נמוכה
Sarvam 105Bאין נתון0%נמוכה
Sarvam 30Bאין נתון0%נמוכה
Solar Pro 2אין נתון0%נמוכה
Step 3.5 Flashאין נתון0%נמוכה

ציון העברית מוצג בנפרד ואינו משפיע על ציון ההתאמה או על סדר הדירוג. ערך חסר נשאר חסר במכוון, אנחנו לא מנחשים ולא ממלאים אותו בממוצע. ציון עברית שמבוסס על מבחנים רב לשוניים אינו תחליף למבחן עברית ייעודי.