אוטומציה וסוכני AI · עבודה מול כלים וממשקים

דירוג לפי איכות

1

Kimi K3

נבדק כמודל

מצב חשיבה · חלון הקשר 1,050K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

תצורות נוספות:מצב מאמץ מרבימצב מאמץ גבוהמצב מאמץ נמוךמצב אצווה במחיר מופחתלא נכללות בציון
ציון התאמה
74.3
כיסוי נתונים 34%

כיסוי אפקטיבי: 86% ממשקל היכולות במקצוע נמדד בפועל.

עלות שימוש: קלט $3 · פלט $15 למיליון טוקנים

  • התוצאות הגבוהות ביותר שלו הן בכתיבת קוד עצמאית ועבודה בשורת פקודה.
  • היתרון נשען בעיקר על LiveBench, Terminal-Bench 2.0.
  • כיסוי נתונים: 34% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • שימוש בכליםמשקל 27%
    78.7 · 2 מבחנים
  • כתיבת קוד עצמאיתמשקל 23%
    74.3 · 4 מבחנים
  • עבודה בשורת פקודהמשקל 18%
    88.3 · מבחן אחד
  • הפעלת מחשבמשקל 14%
    לא נמדד במודל הזה
  • עמידה בהוראותמשקל 9%
    74.9 · מבחן אחד
  • ידע וחשיבהמשקל 9%
    76.0 · 3 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
34%
איכות המקורות
87%
יציבות התוצאה
61%
השוואה הוגנת
73%

שימוש בכלים משקל 27%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
84.20.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

כתיבת קוד עצמאית משקל 23%

כיסוי 45%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.91.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
60.80.70קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
67.50.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · Vibe Code Bench

עבודה בשורת פקודה משקל 18%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
88.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

עמידה בהוראות משקל 9%

כיסוי 26%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.91.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 41%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
74.91.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
93.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
56.00.57קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

2

Muse Spark 1.1

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

ציון התאמה
72.2
כיסוי נתונים 39%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

  • התוצאות הגבוהות ביותר שלו הן בכתיבת קוד עצמאית ועבודה בשורת פקודה.
  • היתרון נשען בעיקר על LiveBench, Terminal-Bench 2.0.
  • כיסוי נתונים: 39% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • שימוש בכליםמשקל 27%
    81.8 · 2 מבחנים
  • כתיבת קוד עצמאיתמשקל 23%
    69.0 · 4 מבחנים
  • עבודה בשורת פקודהמשקל 18%
    80.0 · מבחן אחד
  • הפעלת מחשבמשקל 14%
    76.4 · 2 מבחנים
  • עמידה בהוראותמשקל 9%
    71.8 · מבחן אחד
  • ידע וחשיבהמשקל 9%
    69.4 · 2 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
42%
איכות המקורות
87%
יציבות התוצאה
67%
השוואה הוגנת
68%

שימוש בכלים משקל 27%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
88.10.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
75.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

כתיבת קוד עצמאית משקל 23%

כיסוי 46%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
61.50.72קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
53.30.42קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench

עבודה בשורת פקודה משקל 18%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
80.00.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

הפעלת מחשב משקל 14%

כיסוי 49%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.80.72קישור למקור
WebArena-Verified
מדד משני
לפי דיווח היצרן
69.00.42קישור למקור

לא נמצאו תוצאות עבור: ScreenSpot Pro · AndroidWorld

עמידה בהוראות משקל 9%

כיסוי 26%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

ידע וחשיבה משקל 9%

כיסוי 29%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
71.81.00קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
62.10.33קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · GPQA / GPQA Diamond · SuperGPQA · MMLU-Redux

3

Qwen3.7 Plus

נבדק כמודל

מצב חשיבה · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

ציון התאמה
70.2
עברית
85.7
מבוסס על מבחנים רב לשוניים, לא על מבחן עברית ייעודי. מוצג בנפרד ואינו משפיע על הציון.
כיסוי נתונים 50%

כיסוי אפקטיבי: 100% ממשקל היכולות במקצוע נמדד בפועל.

  • התוצאות הגבוהות ביותר שלו הן בשימוש בכלים ועבודה בשורת פקודה.
  • היתרון נשען בעיקר על Berkeley Function Calling Leaderboard (BFCL) V4, MCP Atlas.
  • כיסוי נתונים: 50% · רמת ביסוס: בינונית

הציון מחושב לפי החשיבות של כל יכולת ולפי הנתונים הזמינים עליה.

  • שימוש בכליםמשקל 27%
    70.8 · 3 מבחנים
  • כתיבת קוד עצמאיתמשקל 23%
    64.5 · 2 מבחנים
  • עבודה בשורת פקודהמשקל 18%
    70.3 · מבחן אחד
  • הפעלת מחשבמשקל 14%
    76.9 · 3 מבחנים
  • עמידה בהוראותמשקל 9%
    85.8 · 3 מבחנים
  • ידע וחשיבהמשקל 9%
    74.2 · 5 מבחנים
עד כמה ההמלצה מבוססתבינונית
כיסוי נתונים
50%
איכות המקורות
87%
יציבות התוצאה
94%
השוואה הוגנת
54%

שימוש בכלים משקל 27%

כיסוי 67%
מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
72.90.85קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
73.20.42קישור למקור
Claw-Eval
מדד משני · בהסתייגות
לפי דיווח היצרן
62.70.34קישור למקור

לא נמצאו תוצאות עבור: Toolathlon

כתיבת קוד עצמאית משקל 23%

כיסוי 24%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
57.60.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 3.0 · LiveBench Agentic Coding · CursorBench · Vibe Code Bench · DeepSWE

עבודה בשורת פקודה משקל 18%

כיסוי 43%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
70.30.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 3.0

הפעלת מחשב משקל 14%

כיסוי 67%
מבחן הערכהסטטוסציוןמשקלמקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
73.30.72קישור למקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
79.00.42קישור למקור
AndroidWorld
מדד משני
לפי דיווח היצרן
81.00.42קישור למקור

לא נמצאו תוצאות עבור: WebArena-Verified

עמידה בהוראות משקל 9%

כיסוי 40%
מבחן הערכהסטטוסציוןמשקלמקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.10.72קישור למקור
IFEval
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
94.60.42קישור למקור
MAXIFE
מדד משני · עברית
לפי דיווח היצרן
88.80.38קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following

ידע וחשיבה משקל 9%

כיסוי 58%
מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
87.90.85קישור למקור
MMLU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
88.50.72קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
34.70.72קישור למקור
SuperGPQA
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
71.40.72קישור למקור
MMLU-Redux
מדד משני
לפי דיווח היצרן
94.50.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning

דירוג מלא

כל המודלים שנבדקו

הכיסוי מחושב על היכולות שנושאות את עיקר המשקל במשימה שנבחרה. מודל שנמדד בפחות מדדים מוצג עם הציון שלו ומסומן ככיסוי חלקי, ואינו נכנס לדירוג.

מודלציון התאמהכיסוי נתוניםעבריתרמת ביסוס
Kimi K374.334%בינונית
Muse Spark 1.172.242%בינונית
Qwen3.7 Plus70.250%85.7מבוסס על מבחנים רב לשונייםבינונית
GPT-5.569.849%96.6בינונית
Qwen3.7 Max69.547%87.5מבוסס על מבחנים רב לשונייםגבוהה
Gemini 3.5 Flash67.347%94.7בינונית
GPT-5.467.247%94.8בינונית
Claude Opus 4.666.939%בינונית
Claude Opus 566.044%91.1מבוסס על מבחנים רב לשונייםבינונית
DeepSeek V4 Pro 081365.736%בינונית
MiniMax M364.740%בינונית
GPT-5.6 Sol64.152%97.1בינונית
Claude Sonnet 4.663.238%בינונית
Claude Opus 4.862.663%87.6מבוסס על מבחנים רב לשונייםגבוהה
Kimi K2.660.952%בינונית
Qwen3.6-27B60.632%בינונית
Claude Opus 4.559.445%85.7מבוסס על מבחנים רב לשונייםבינונית
Qwen3.6 Plus59.047%84.7מבוסס על מבחנים רב לשונייםבינונית
GPT-5.4 mini58.541%93.6בינונית
GPT-5.6 Terra57.552%97.1בינונית
Qwen3.5 397B55.336%70.8בינונית
GLM-5.254.555%גבוהה
GPT-5.6 Luna54.252%95.1בינונית
GPT-5.4 nano52.741%88.2בינונית
Kimi K2.549.933%82.3מבוסס על מבחנים רב לשונייםבינונית
Claude Fable 5כיסוי חלקי, אינו מדורג65.348%בינונית
Claude Opus 4.7 (Adaptive)כיסוי חלקי, אינו מדורג68.827%נמוכה
Claude Sonnet 5כיסוי חלקי, אינו מדורג58.148%בינונית
Claude Fable 5.1כיסוי חלקי, אינו מדורג67.923%בינונית
Inkling-Smallכיסוי חלקי, אינו מדורג64.528%נמוכה
GPT-5.3 Codexכיסוי חלקי, אינו מדורג66.023%נמוכה
GLM-5.1כיסוי חלקי, אינו מדורג62.030%58.5בינונית
Inklingכיסוי חלקי, אינו מדורג63.726%בינונית
Qwen3.8-27Bכיסוי חלקי, אינו מדורג66.620%בינונית
Ling 3.0 Flashכיסוי חלקי, אינו מדורג65.321%נמוכה
Grok 4.5כיסוי חלקי, אינו מדורג54.540%בינונית
Gemini 3.1 Proכיסוי חלקי, אינו מדורג64.419%בינונית
GPT-6 Astraכיסוי חלקי, אינו מדורג69.310%נמוכה
Muse Sparkכיסוי חלקי, אינו מדורג59.927%נמוכה
Muse Glimmer 30Bכיסוי חלקי, אינו מדורג64.717%נמוכה
Gemini 3.8 Flashכיסוי חלקי, אינו מדורג66.014%נמוכה
MiMo-V2.5-Proכיסוי חלקי, אינו מדורג62.122%נמוכה
Gemini 3.6 Flashכיסוי חלקי, אינו מדורג66.014%92.8נמוכה
Gemini 3.5 Flash-Liteכיסוי חלקי, אינו מדורג59.625%בינונית
GLM-5.3-Flashכיסוי חלקי, אינו מדורג66.212%61.3נמוכה
Kimi K2.7 Codeכיסוי חלקי, אינו מדורג63.117%בינונית
Step 3.7 Flashכיסוי חלקי, אינו מדורג57.927%נמוכה
Qwen3.8-Flash-Nextכיסוי חלקי, אינו מדורג59.423%בינונית
Qwen 3.6 Max (preview)כיסוי חלקי, אינו מדורג63.016%נמוכה
GLM-5כיסוי חלקי, אינו מדורג54.629%83.1מבוסס על מבחנים רב לשונייםבינונית
MiniMax M2.7כיסוי חלקי, אינו מדורג54.330%53.6נמוכה
Qwen3.5-122B-A10Bכיסוי חלקי, אינו מדורג58.318%67.2נמוכה
Claude Opus 4.7כיסוי חלקי, אינו מדורג58.517%בינונית
LFM2.5-2.6Bכיסוי חלקי, אינו מדורג58.017%נמוכה
GPT-5.2כיסוי חלקי, אינו מדורג58.715%93.9נמוכה
Muse Spark 1.2כיסוי חלקי, אינו מדורג63.36%נמוכה
GLM-5.3כיסוי חלקי, אינו מדורג53.125%נמוכה
Nemotron 3 Ultraכיסוי חלקי, אינו מדורג55.517%83.0מבוסס על מבחנים רב לשונייםבינונית
Qwen3.5-27Bכיסוי חלקי, אינו מדורג55.018%82.2מבוסס על מבחנים רב לשונייםנמוכה
Hy3 Previewכיסוי חלקי, אינו מדורג57.313%נמוכה
Qwen3.5-35B-A3Bכיסוי חלקי, אינו מדורג54.318%81.0מבוסס על מבחנים רב לשונייםנמוכה
Nemotron 3 Nano Omni 30B A3Bכיסוי חלקי, אינו מדורג61.53%נמוכה
Kimi K2.5 (Reasoning)כיסוי חלקי, אינו מדורג54.215%נמוכה
Granite 4.2 8Bכיסוי חלקי, אינו מדורג54.115%נמוכה
Grok 4.6כיסוי חלקי, אינו מדורג49.824%בינונית
LFM2.5-8B-A1Bכיסוי חלקי, אינו מדורג55.412%נמוכה
DeepSeek V3כיסוי חלקי, אינו מדורג61.50%נמוכה
MiMo-V2-Flashכיסוי חלקי, אינו מדורג61.50%נמוכה
Trinity-Large-Thinkingכיסוי חלקי, אינו מדורג60.80%נמוכה
Gemini 3 Proכיסוי חלקי, אינו מדורג57.85%74.7נמוכה
Mercury 2כיסוי חלקי, אינו מדורג60.60%נמוכה
MiMo-V2-Proכיסוי חלקי, אינו מדורג57.36%נמוכה
GLM-5-Turboכיסוי חלקי, אינו מדורג56.66%נמוכה
Gemma 4 31Bכיסוי חלקי, אינו מדורג59.70%59.9נמוכה
Exaone 4.0 32Bכיסוי חלקי, אינו מדורג59.70%נמוכה
DeepSeek-R1כיסוי חלקי, אינו מדורג59.40%נמוכה
Trinity-Large-Previewכיסוי חלקי, אינו מדורג59.40%נמוכה
Grok 4.3כיסוי חלקי, אינו מדורג54.58%נמוכה
GLM-5V-Turboכיסוי חלקי, אינו מדורג55.96%נמוכה
Gemini 3.7 Flashכיסוי חלקי, אינו מדורג47.424%96.0בינונית
Gemma 4 26B A4Bכיסוי חלקי, אינו מדורג58.50%52.8נמוכה
Llama 4 Maverickכיסוי חלקי, אינו מדורג58.20%נמוכה
GLM-4.7כיסוי חלקי, אינו מדורג51.413%נמוכה
DeepSeek R1 Distill Qwen 32Bכיסוי חלקי, אינו מדורג57.90%נמוכה
Gemini 3 Flashכיסוי חלקי, אינו מדורג53.68%74.0נמוכה
Claude Opus 4.6 (Adaptive)כיסוי חלקי, אינו מדורג56.42%נמוכה
GLM-4.7-Flashכיסוי חלקי, אינו מדורג57.40%נמוכה
Apodex 1.1כיסוי חלקי, אינו מדורג56.90%נמוכה
Phi-4כיסוי חלקי, אינו מדורג56.90%נמוכה
Llama 4 Scoutכיסוי חלקי, אינו מדורג56.40%נמוכה
Mistral Large 2כיסוי חלקי, אינו מדורג56.30%נמוכה
Llama 3.1 405Bכיסוי חלקי, אינו מדורג56.20%נמוכה
MiMo-V2-Omniכיסוי חלקי, אינו מדורג53.16%נמוכה
DeepSeek V3.2כיסוי חלקי, אינו מדורג51.56%נמוכה
GPT-5.1כיסוי חלקי, אינו מדורג51.92%72.7נמוכה
Granite-4.0-1Bכיסוי חלקי, אינו מדורג52.90%נמוכה
Gemini 2.5 Proכיסוי חלקי, אינו מדורג51.82%77.4נמוכה
Claude Opus 4.5 Thinkingכיסוי חלקי, אינו מדורג51.32%נמוכה
GPT-5 (high)כיסוי חלקי, אינו מדורג51.22%נמוכה
MiniMax M2.5כיסוי חלקי, אינו מדורג50.32%50.4נמוכה
Granite-4.0-350Mכיסוי חלקי, אינו מדורג51.30%נמוכה
Nemotron 3.5 Lightning 30B A3B NVFP4כיסוי חלקי, אינו מדורג44.413%נמוכה
GLM-4.6כיסוי חלקי, אינו מדורג48.52%54.2נמוכה
Grok 4.1 Fast (Reasoning)כיסוי חלקי, אינו מדורג48.22%נמוכה
Grok 4 Fast (Reasoning)כיסוי חלקי, אינו מדורג48.02%נמוכה
Nemotron 3 Super 100Bכיסוי חלקי, אינו מדורג40.06%נמוכה
Command A+אין נתון0%נמוכה
DeepSeek V3.1אין נתון0%נמוכה
DeepSeek V3.1 (Reasoning)אין נתון0%נמוכה
Exaone 4.0 1.2Bאין נתון0%נמוכה
Gemini 2.5 Flashאין נתון0%71.8נמוכה
GLM-4.5-Airאין נתון0%נמוכה
Granite-4.0-H-1Bאין נתון0%נמוכה
Granite-4.0-H-350Mאין נתון0%נמוכה
Grok 4אין נתון0%נמוכה
Grok 4.1 Fastאין נתון0%נמוכה
Grok Code Fast 1אין נתון0%נמוכה
Hy3אין נתון0%נמוכה
K-Exaoneאין נתון0%נמוכה
Kimi K2אין נתון0%נמוכה
Ling 2.6 Flashאין נתון0%נמוכה
MiniMax M1 80kאין נתון0%נמוכה
Ministral 3 14Bאין נתון0%נמוכה
Ministral 3 14B (Reasoning)אין נתון0%נמוכה
Ministral 3 3B (Reasoning)אין נתון0%נמוכה
Ministral 3 8Bאין נתון0%נמוכה
Ministral 3 8B (Reasoning)אין נתון0%נמוכה
Mistral Large 3אין נתון0%נמוכה
Mistral Medium 3אין נתון0%נמוכה
Mistral Medium 3.5 128Bאין נתון0%נמוכה
Mistral Small 4אין נתון0%נמוכה
Nemotron 3 Nano 30Bאין נתון0%נמוכה
Nemotron 3 Super 120B A12Bאין נתון0%נמוכה
Nemotron Ultra 253Bאין נתון0%נמוכה
Nova Proאין נתון0%נמוכה
Qwen3.5 397B (Reasoning)אין נתון0%נמוכה
Sarvam 105Bאין נתון0%נמוכה
Sarvam 30Bאין נתון0%נמוכה
Solar Pro 2אין נתון0%נמוכה
Step 3.5 Flashאין נתון0%נמוכה

ציון העברית מוצג בנפרד ואינו משפיע על ציון ההתאמה או על סדר הדירוג. ערך חסר נשאר חסר במכוון, אנחנו לא מנחשים ולא ממלאים אותו בממוצע. ציון עברית שמבוסס על מבחנים רב לשוניים אינו תחליף למבחן עברית ייעודי.