אוטומציה וסוכני AI · משימות בשורת פקודה

דירוג לפי איכות

1

Kimi K3

נבדק כמודל

מצב חשיבה · חלון הקשר 1,050K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

תצורות נוספות:מצב מאמץ מרבימצב מאמץ גבוהמצב מאמץ נמוךמצב אצווה במחיר מופחתלא נכללות בציון
ציון התאמה
74.4
כיסוי נתונים 35%

כיסוי אפקטיבי: 87% ממשקל היכולות במקצוע נמדד בפועל.

עלות שימוש: קלט $3 · פלט $15 למיליון טוקנים

  • התוצאות הגבוהות ביותר שלו הן בעבודה בשורת פקודה וכתיבת קוד עצמאית.
  • היתרון נשען על Terminal-Bench 2.0, לפי מקור מדידה אחד.
  • כיסוי נתונים: 35% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • כתיבת קוד עצמאיתמשקל 28%
    74.3 · 4 מבחנים
  • עבודה בשורת פקודהמשקל 26%
    88.3 · מבחן אחד
  • שימוש בכליםמשקל 17%
    78.7 · 2 מבחנים
  • הפעלת מחשבמשקל 13%
    לא נמדד במודל הזה
  • עמידה בהוראותמשקל 9%
    74.9 · מבחן אחד
  • ידע וחשיבהמשקל 9%
    76.0 · 3 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
35%
איכות המקורות
87%
יציבות התוצאה
61%
השוואה הוגנת
73%

כתיבת קוד עצמאית משקל 28%

כיסוי 45%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.91.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
60.80.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.50.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · Vibe Code Bench

עבודה בשורת פקודה משקל 26%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

שימוש בכלים משקל 17%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
84.20.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

עמידה בהוראות משקל 9%

כיסוי 26%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 41%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.91.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
56.00.57קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

2

Muse Spark 1.1

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

ציון התאמה
71.4
כיסוי נתונים 40%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

  • התוצאות הגבוהות ביותר שלו הן בעבודה בשורת פקודה וכתיבת קוד עצמאית.
  • היתרון נשען על Terminal-Bench 2.0, לפי מקור מדידה אחד.
  • כיסוי נתונים: 40% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • כתיבת קוד עצמאיתמשקל 28%
    69.0 · 4 מבחנים
  • עבודה בשורת פקודהמשקל 26%
    80.0 · מבחן אחד
  • שימוש בכליםמשקל 17%
    81.8 · 2 מבחנים
  • הפעלת מחשבמשקל 13%
    76.4 · 2 מבחנים
  • עמידה בהוראותמשקל 9%
    71.8 · מבחן אחד
  • ידע וחשיבהמשקל 9%
    69.4 · 2 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
43%
איכות המקורות
87%
יציבות התוצאה
67%
השוואה הוגנת
68%

כתיבת קוד עצמאית משקל 28%

כיסוי 46%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.50.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
53.30.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench

עבודה בשורת פקודה משקל 26%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

שימוש בכלים משקל 17%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
88.10.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
75.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

הפעלת מחשב משקל 13%

כיסוי 49%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.80.72קישור למקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
69.00.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld

עמידה בהוראות משקל 9%

כיסוי 26%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 29%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
62.10.33קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux

3

GPT-5.5

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

תצורות נוספות:מצב מאמץ נמוךמצב מאמץ בינונימצב מאמץ גבוהמצב מאמץ גבוה מאודמצב אצווה במחיר מופחתלא נכללות בציון
ציון התאמה
70.2
עברית
96.6
מוצג בנפרד ואינו משפיע על ציון ההתאמה.
כיסוי נתונים 53%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

עלות שימוש: קלט $5 · פלט $30 למיליון טוקנים

  • התוצאות הגבוהות ביותר שלו הן בעבודה בשורת פקודה וכתיבת קוד עצמאית.
  • היתרון נשען על Terminal-Bench 2.0, לפי מקור מדידה אחד.
  • כיסוי נתונים: 53% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • כתיבת קוד עצמאיתמשקל 28%
    66.2 · 6 מבחנים
  • עבודה בשורת פקודהמשקל 26%
    82.0 · מבחן אחד
  • שימוש בכליםמשקל 17%
    65.4 · 2 מבחנים
  • הפעלת מחשבמשקל 13%
    78.7 · מבחן אחד
  • עמידה בהוראותמשקל 9%
    75.1 · 2 מבחנים
  • ידע וחשיבהמשקל 9%
    79.5 · 4 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
53%
איכות המקורות
92%
יציבות התוצאה
89%
השוואה הוגנת
86%

כתיבת קוד עצמאית משקל 28%

כיסוי 75%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
46.81.00קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
58.60.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
58.40.70קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
69.80.50קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · DeepSWE

עבודה בשורת פקודה משקל 26%

כיסוי 50%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לוח עצמאי
82.01.00קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

שימוש בכלים משקל 17%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
75.30.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
55.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

הפעלת מחשב משקל 13%

כיסוי 31%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
78.70.72קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld · WebArena-Verified

עמידה בהוראות משקל 9%

כיסוי 53%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
71.41.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 58%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.81.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
89.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.60.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
52.20.72קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · SuperGPQA · MMLU-Redux

דירוג מלא

כל המודלים שנבדקו

הכיסוי מחושב על היכולות שנושאות את עיקר המשקל במשימה שנבחרה. מודל שנמדד בפחות מדדים מוצג עם הציון שלו ומסומן ככיסוי חלקי, ואינו נכנס לדירוג.

מודלציון התאמהכיסוי נתוניםעבריתרמת ביסוס
Kimi K374.435%בינונית
Muse Spark 1.171.443%בינונית
GPT-5.570.252%96.6בינונית
Qwen3.7 Plus69.545%85.7מבוסס על מבחנים רב לשונייםבינונית
Qwen3.7 Max68.445%87.5מבוסס על מבחנים רב לשונייםבינונית
GPT-5.467.846%94.8בינונית
Gemini 3.5 Flash66.849%94.7בינונית
Claude Opus 4.666.044%בינונית
DeepSeek V4 Pro 081364.738%בינונית
GPT-5.6 Sol63.861%97.1גבוהה
MiniMax M363.643%בינונית
Claude Opus 563.047%91.1מבוסס על מבחנים רב לשונייםבינונית
Claude Sonnet 4.662.143%בינונית
Kimi K2.661.053%גבוהה
Claude Opus 4.860.170%87.6מבוסס על מבחנים רב לשונייםגבוהה
Claude Opus 4.559.846%85.7מבוסס על מבחנים רב לשונייםבינונית
Qwen3.6-27B59.637%בינונית
Qwen3.6 Plus59.347%84.7מבוסס על מבחנים רב לשונייםבינונית
GPT-5.4 mini58.742%93.6בינונית
GPT-5.6 Terra57.161%97.1גבוהה
GPT-5.6 Luna53.561%95.1גבוהה
GPT-5.4 nano52.542%88.2בינונית
GLM-5.252.563%גבוהה
Claude Fable 5כיסוי חלקי, אינו מדורג64.060%גבוהה
Claude Sonnet 5כיסוי חלקי, אינו מדורג56.460%גבוהה
Claude Opus 4.7 (Adaptive)כיסוי חלקי, אינו מדורג67.829%נמוכה
GPT-5.3 Codexכיסוי חלקי, אינו מדורג66.728%נמוכה
Claude Fable 5.1כיסוי חלקי, אינו מדורג67.623%בינונית
Grok 4.5כיסוי חלקי, אינו מדורג53.752%בינונית
Inkling-Smallכיסוי חלקי, אינו מדורג63.728%נמוכה
Inklingכיסוי חלקי, אינו מדורג62.830%בינונית
GLM-5.1כיסוי חלקי, אינו מדורג61.031%58.5בינונית
Qwen3.8-27Bכיסוי חלקי, אינו מדורג65.721%בינונית
MiMo-V2.5-Proכיסוי חלקי, אינו מדורג62.424%נמוכה
Gemini 3.5 Flash-Liteכיסוי חלקי, אינו מדורג58.731%בינונית
Gemini 3.8 Flashכיסוי חלקי, אינו מדורג66.016%נמוכה
Muse Sparkכיסוי חלקי, אינו מדורג58.730%בינונית
Qwen 3.6 Max (preview)כיסוי חלקי, אינו מדורג62.721%נמוכה
Gemini 3.1 Proכיסוי חלקי, אינו מדורג63.618%בינונית
Qwen3.5 397Bכיסוי חלקי, אינו מדורג55.835%70.8בינונית
Gemini 3.6 Flashכיסוי חלקי, אינו מדורג64.916%92.8נמוכה
GPT-6 Astraכיסוי חלקי, אינו מדורג68.110%נמוכה
Step 3.7 Flashכיסוי חלקי, אינו מדורג57.928%נמוכה
Ling 3.0 Flashכיסוי חלקי, אינו מדורג63.515%נמוכה
Muse Glimmer 30Bכיסוי חלקי, אינו מדורג62.915%נמוכה
GLM-5כיסוי חלקי, אינו מדורג56.029%83.1מבוסס על מבחנים רב לשונייםבינונית
Kimi K2.7 Codeכיסוי חלקי, אינו מדורג61.417%בינונית
MiniMax M2.7כיסוי חלקי, אינו מדורג54.831%53.6נמוכה
GLM-5.3-Flashכיסוי חלקי, אינו מדורג64.611%61.3נמוכה
Qwen3.8-Flash-Nextכיסוי חלקי, אינו מדורג58.622%בינונית
Claude Opus 4.7כיסוי חלקי, אינו מדורג58.718%בינונית
Qwen3.5-122B-A10Bכיסוי חלקי, אינו מדורג56.922%67.2נמוכה
Kimi K2.5כיסוי חלקי, אינו מדורג51.632%82.3מבוסס על מבחנים רב לשונייםבינונית
GPT-5.2כיסוי חלקי, אינו מדורג58.516%93.9נמוכה
Nemotron 3 Ultraכיסוי חלקי, אינו מדורג55.122%83.0מבוסס על מבחנים רב לשונייםבינונית
Muse Spark 1.2כיסוי חלקי, אינו מדורג62.87%נמוכה
Hy3 Previewכיסוי חלקי, אינו מדורג56.517%נמוכה
Qwen3.5-27Bכיסוי חלקי, אינו מדורג53.122%82.2מבוסס על מבחנים רב לשונייםנמוכה
GLM-5.3כיסוי חלקי, אינו מדורג49.928%בינונית
Qwen3.5-35B-A3Bכיסוי חלקי, אינו מדורג52.422%81.0מבוסס על מבחנים רב לשונייםנמוכה
Kimi K2.5 (Reasoning)כיסוי חלקי, אינו מדורג53.020%נמוכה
LFM2.5-2.6Bכיסוי חלקי, אינו מדורג57.510%נמוכה
Grok 4.6כיסוי חלקי, אינו מדורג47.931%בינונית
Nemotron 3 Nano Omni 30B A3Bכיסוי חלקי, אינו מדורג60.83%נמוכה
DeepSeek V3כיסוי חלקי, אינו מדורג60.50%נמוכה
MiMo-V2-Flashכיסוי חלקי, אינו מדורג60.40%נמוכה
LFM2.5-8B-A1Bכיסוי חלקי, אינו מדורג56.17%נמוכה
Trinity-Large-Thinkingכיסוי חלקי, אינו מדורג59.80%נמוכה
Mercury 2כיסוי חלקי, אינו מדורג59.70%נמוכה
Granite 4.2 8Bכיסוי חלקי, אינו מדורג53.211%נמוכה
Gemini 3 Proכיסוי חלקי, אינו מדורג56.05%74.7נמוכה
Gemma 4 31Bכיסוי חלקי, אינו מדורג58.90%59.9נמוכה
Grok 4.3כיסוי חלקי, אינו מדורג53.410%נמוכה
Exaone 4.0 32Bכיסוי חלקי, אינו מדורג58.80%נמוכה
MiMo-V2-Proכיסוי חלקי, אינו מדורג56.73%נמוכה
Trinity-Large-Previewכיסוי חלקי, אינו מדורג58.60%נמוכה
DeepSeek-R1כיסוי חלקי, אינו מדורג58.50%נמוכה
GLM-4.7כיסוי חלקי, אינו מדורג49.817%נמוכה
GLM-5-Turboכיסוי חלקי, אינו מדורג56.33%נמוכה
Gemma 4 26B A4Bכיסוי חלקי, אינו מדורג57.90%52.8נמוכה
Gemini 3.7 Flashכיסוי חלקי, אינו מדורג44.729%96.0בינונית
GLM-5V-Turboכיסוי חלקי, אינו מדורג55.83%נמוכה
Llama 4 Maverickכיסוי חלקי, אינו מדורג57.50%נמוכה
Claude Opus 4.6 (Adaptive)כיסוי חלקי, אינו מדורג55.93%נמוכה
DeepSeek R1 Distill Qwen 32Bכיסוי חלקי, אינו מדורג57.20%נמוכה
GLM-4.7-Flashכיסוי חלקי, אינו מדורג56.90%נמוכה
Apodex 1.1כיסוי חלקי, אינו מדורג56.40%נמוכה
Phi-4כיסוי חלקי, אינו מדורג56.40%נמוכה
Gemini 3 Flashכיסוי חלקי, אינו מדורג53.06%74.0נמוכה
Llama 4 Scoutכיסוי חלקי, אינו מדורג55.90%נמוכה
Mistral Large 2כיסוי חלקי, אינו מדורג55.90%נמוכה
Llama 3.1 405Bכיסוי חלקי, אינו מדורג55.80%נמוכה
MiMo-V2-Omniכיסוי חלקי, אינו מדורג54.03%נמוכה
DeepSeek V3.2כיסוי חלקי, אינו מדורג52.93%נמוכה
Granite-4.0-1Bכיסוי חלקי, אינו מדורג52.90%נמוכה
GPT-5.1כיסוי חלקי, אינו מדורג50.93%72.7נמוכה
Granite-4.0-350Mכיסוי חלקי, אינו מדורג51.50%נמוכה
Claude Opus 4.5 Thinkingכיסוי חלקי, אינו מדורג50.33%נמוכה
Gemini 2.5 Proכיסוי חלקי, אינו מדורג50.23%77.4נמוכה
GPT-5 (high)כיסוי חלקי, אינו מדורג50.23%נמוכה
MiniMax M2.5כיסוי חלקי, אינו מדורג49.33%50.4נמוכה
Nemotron 3.5 Lightning 30B A3B NVFP4כיסוי חלקי, אינו מדורג41.717%נמוכה
GLM-4.6כיסוי חלקי, אינו מדורג47.23%54.2נמוכה
Grok 4.1 Fast (Reasoning)כיסוי חלקי, אינו מדורג46.93%נמוכה
Grok 4 Fast (Reasoning)כיסוי חלקי, אינו מדורג46.73%נמוכה
Nemotron 3 Super 100Bכיסוי חלקי, אינו מדורג45.33%נמוכה
Command A+אין נתון0%נמוכה
DeepSeek V3.1אין נתון0%נמוכה
DeepSeek V3.1 (Reasoning)אין נתון0%נמוכה
Exaone 4.0 1.2Bאין נתון0%נמוכה
Gemini 2.5 Flashאין נתון0%71.8נמוכה
GLM-4.5-Airאין נתון0%נמוכה
Granite-4.0-H-1Bאין נתון0%נמוכה
Granite-4.0-H-350Mאין נתון0%נמוכה
Grok 4אין נתון0%נמוכה
Grok 4.1 Fastאין נתון0%נמוכה
Grok Code Fast 1אין נתון0%נמוכה
Hy3אין נתון0%נמוכה
K-Exaoneאין נתון0%נמוכה
Kimi K2אין נתון0%נמוכה
Ling 2.6 Flashאין נתון0%נמוכה
MiniMax M1 80kאין נתון0%נמוכה
Ministral 3 14Bאין נתון0%נמוכה
Ministral 3 14B (Reasoning)אין נתון0%נמוכה
Ministral 3 3B (Reasoning)אין נתון0%נמוכה
Ministral 3 8Bאין נתון0%נמוכה
Ministral 3 8B (Reasoning)אין נתון0%נמוכה
Mistral Large 3אין נתון0%נמוכה
Mistral Medium 3אין נתון0%נמוכה
Mistral Medium 3.5 128Bאין נתון0%נמוכה
Mistral Small 4אין נתון0%נמוכה
Nemotron 3 Nano 30Bאין נתון0%נמוכה
Nemotron 3 Super 120B A12Bאין נתון0%נמוכה
Nemotron Ultra 253Bאין נתון0%נמוכה
Nova Proאין נתון0%נמוכה
Qwen3.5 397B (Reasoning)אין נתון0%נמוכה
Sarvam 105Bאין נתון0%נמוכה
Sarvam 30Bאין נתון0%נמוכה
Solar Pro 2אין נתון0%נמוכה
Step 3.5 Flashאין נתון0%נמוכה

ציון העברית מוצג בנפרד ואינו משפיע על ציון ההתאמה או על סדר הדירוג. ערך חסר נשאר חסר במכוון, אנחנו לא מנחשים ולא ממלאים אותו בממוצע. ציון עברית שמבוסס על מבחנים רב לשוניים אינו תחליף למבחן עברית ייעודי.