תוכנה ו IT

דירוג לפי איכות

1

Claude Opus 5

נבדק כמודל API

מצב חשיבה/היסק · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

התאמה למקצוע
70.8
עברית (נתון נלווה)
91.1
קירוב רב לשוני, לא מדד עברית ייעודי. אינו חלק מציון ההתאמה.
כיסוי מדדים 35%
  • חזק במיוחד בקוד ופיתוח תוכנה ובידע וחשיבה.
  • הדירוג מבוסס על 35% מהמדדים שהוגדרו למקצוע.
  • היתרון נשען בעיקר על LiveBench, SWE-bench Verified.
  • אין מספיק נתונים בקוד ופיתוח תוכנה.
  • אין מספיק נתונים בשימוש בכלים.
סולם המדדיםשש היכולות המכריעות למקצוע ומה שידוע עליהן
  • קוד ופיתוח תוכנהמשקל 61%
    80.6 · 8 מדדים
  • ידע וחשיבהמשקל 11%
    82.3 · 3 מדדים
  • שימוש בכליםמשקל 9%
    83.2 · 2 מדדים
  • ביצוע משימות מרובות שלביםמשקל 8%
    62.3 · 6 מדדים
  • עמידה בהוראותמשקל 6%
    83.2 · 1 מדדים
  • מסמכים ארוכיםמשקל 6%
    אין נתון
רמת ביסוסבינונית
כיסוי המדדים
35%
איכות המקורות
82%
ודאות סטטיסטית
100%
השוואתיות התנאים
70%

קוד ופיתוח תוכנה משקל 61%

כיסוי 37%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.21.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
96.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
79.20.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.00.70קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
89.50.42קישור למקור
DeepSWE
מדד משני
לפי דיווח היצרן
68.80.42קישור למקור
FrontierCode 1.1
מדד משני
לפי דיווח היצרן
53.40.42קישור למקור
ProgramBench
מדד משני
לפי דיווח היצרן
93.00.42קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SciCode · Vibe Code Bench · NL2Repo

ידע וחשיבה משקל 11%

כיסוי 44%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.21.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
93.90.85קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
64.70.62קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux

שימוש בכלים משקל 9%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
85.80.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
80.60.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

ביצוע משימות מרובות שלבים משקל 8%

כיסוי 37%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
42.71.00קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
70.60.72קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
85.80.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
80.60.42קישור למקור
AutomationBench
מדד משני
לפי דיווח היצרן
26.00.42קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
95.00.34קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · AndroidWorld · WideResearch · Agents' Last Exam · JobBench · MLE-bench · Gert Labs · Claw-Eval

עמידה בהוראות משקל 6%

כיסוי 26%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
83.21.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench Instruction Following · IFBench · IFEval · MAXIFE

2

Claude Fable 5

נבדק כמודל API

מצב חשיבה/היסק · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

התאמה למקצוע
68.4
כיסוי מדדים 41%
  • חזק במיוחד בקוד ופיתוח תוכנה ובידע וחשיבה.
  • הדירוג מבוסס על 41% מהמדדים שהוגדרו למקצוע.
  • היתרון נשען בעיקר על LiveBench, LiveBench Coding.
  • אין מספיק נתונים בשימוש בכלים.
  • אין מספיק נתונים בביצוע משימות מרובות שלבים.
סולם המדדיםשש היכולות המכריעות למקצוע ומה שידוע עליהן
  • קוד ופיתוח תוכנהמשקל 61%
    72.5 · 8 מדדים
  • ידע וחשיבהמשקל 11%
    84.3 · 3 מדדים
  • שימוש בכליםמשקל 9%
    אין נתון
  • ביצוע משימות מרובות שלביםמשקל 8%
    65.0 · 3 מדדים
  • עמידה בהוראותמשקל 6%
    75.8 · 2 מדדים
  • מסמכים ארוכיםמשקל 6%
    אין נתון
רמת ביסוסבינונית
כיסוי המדדים
41%
איכות המקורות
95%
ודאות סטטיסטית
89%
השוואתיות התנאים
70%

קוד ופיתוח תוכנה משקל 61%

כיסוי 51%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
82.51.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
50.71.00קישור למקור
MirrorCode
מדידה עצמאית · מתעדכן
לוח עצמאי
63.91.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
95.00.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
80.00.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
70.50.70קישור למקור
FrontierCode 1.1
מדד משני
לוח עצמאי
53.50.50קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · SciCode · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · ProgramBench

ידע וחשיבה משקל 11%

כיסוי 48%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
87.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
85.90.85קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

ביצוע משימות מרובות שלבים משקל 8%

כיסוי 29%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
34.01.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
84.30.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
85.00.72קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

עמידה בהוראות משקל 6%

כיסוי 53%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
79.51.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
72.01.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

3

Claude Opus 4.8

נבדק כמודל API

מצב חשיבה/היסק · חלון הקשר 1,000K טוקנים · נמדד כמודל API, ללא ממשק צ'אט

התאמה למקצוע
67.8
עברית (נתון נלווה)
87.6
קירוב רב לשוני, לא מדד עברית ייעודי. אינו חלק מציון ההתאמה.
כיסוי מדדים 45%
  • חזק במיוחד בקוד ופיתוח תוכנה ובידע וחשיבה.
  • הדירוג מבוסס על 45% מהמדדים שהוגדרו למקצוע.
  • היתרון נשען בעיקר על LiveBench, LiveBench Coding.
  • אין מספיק נתונים בשימוש בכלים.
  • אין מספיק נתונים במסמכים ארוכים.
סולם המדדיםשש היכולות המכריעות למקצוע ומה שידוע עליהן
  • קוד ופיתוח תוכנהמשקל 61%
    71.4 · 8 מדדים
  • ידע וחשיבהמשקל 11%
    80.6 · 4 מדדים
  • שימוש בכליםמשקל 9%
    71.0 · 2 מדדים
  • ביצוע משימות מרובות שלביםמשקל 8%
    63.9 · 7 מדדים
  • עמידה בהוראותמשקל 6%
    75.7 · 2 מדדים
  • מסמכים ארוכיםמשקל 6%
    אין נתון
רמת ביסוסבינונית
כיסוי המדדים
45%
איכות המקורות
88%
ודאות סטטיסטית
100%
השוואתיות התנאים
70%

קוד ופיתוח תוכנה משקל 61%

כיסוי 46%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.91.00קישור למקור
LiveBench Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
79.31.00קישור למקור
LiveBench Agentic Coding
מדידה עצמאית · מתעדכן
לוח עצמאי
56.11.00קישור למקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לפי דיווח היצרן
88.60.85קישור למקור
SWE-bench Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
69.20.72קישור למקור
CursorBench
מדידה בתחום · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
62.30.70קישור למקור
FrontierCode 1.1
מדד משני
לוח עצמאי
46.50.50קישור למקור
SWE-bench Multilingual
מדד משני
לפי דיווח היצרן
84.40.42קישור למקור

לא נמצאו תוצאות עבור: SWE-rebench · LiveCodeBench · Aider Polyglot · MirrorCode · SciCode · Vibe Code Bench · NL2Repo · DeepSWE · ProgramBench

ידע וחשיבה משקל 11%

כיסוי 61%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.91.00קישור למקור
LiveBench Reasoning
מדידה עצמאית · מתעדכן
לוח עצמאי
89.71.00קישור למקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
91.00.85קישור למקור
Humanity's Last Exam (HLE)
מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לפי דיווח היצרן
57.90.72קישור למקור

לא נמצאו תוצאות עבור: MMLU-Pro · SuperGPQA · MMLU-Redux

שימוש בכלים משקל 9%

כיסוי 35%
מבחן הערכהסטטוסציוןמשקלמקור
MCP Atlas
מדד משני
לפי דיווח היצרן
82.20.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
59.90.42קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Claw-Eval

ביצוע משימות מרובות שלבים משקל 8%

כיסוי 47%
מבחן הערכהסטטוסציוןמשקלמקור
Terminal-Bench 3.0
מדידה עצמאית · מתעדכן
לוח עצמאי
21.11.00קישור למקור
Terminal-Bench 2.0
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
74.60.85קישור למקור
OSWorld
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
83.40.72קישור למקור
MCP Atlas
מדד משני
לפי דיווח היצרן
82.20.42קישור למקור
Toolathlon
מדד משני
לפי דיווח היצרן
59.90.42קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
73.00.40קישור למקור
DeepSearchQA
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
93.10.34קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · MLE-bench · Claw-Eval

עמידה בהוראות משקל 6%

כיסוי 53%
מבחן הערכהסטטוסציוןמשקלמקור
LiveBench
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
78.91.00קישור למקור
LiveBench Instruction Following
מדידה עצמאית · מתעדכן
לוח עצמאי
72.41.00קישור למקור

לא נמצאו תוצאות עבור: IFBench · IFEval · MAXIFE

דירוג מלא

כל המערכות שנבדקו

מערכתהתאמהכיסויעבריתביסוס
Claude Opus 570.835%91.1קירובבינונית
Claude Fable 568.441%בינונית
Claude Opus 4.867.845%87.6קירובבינונית
Qwen3.7 Max67.656%87.5קירובבינונית
Qwen3.7 Plus66.536%85.7קירובבינונית
DeepSeek V4 Pro 081366.139%בינונית
Claude Opus 4.665.348%בינונית
GPT-5.565.140%בינונית
Claude Opus 4.764.037%בינונית
Kimi K2.663.954%בינונית
Gemini 3.5 Flash63.845%בינונית
MiniMax M363.636%בינונית
GLM-5.263.539%בינונית
Qwen3.6 Plus63.054%84.7קירובבינונית
Kimi K2.561.138%82.3קירובבינונית
Kimi K367.323%בינונית
Qwen3.8-Flash-Next64.428%בינונית
Kimi K2.7 Code63.229%בינונית
GPT-5.6 Sol62.929%בינונית
GPT-5.462.829%בינונית
Muse Spark 1.165.523%בינונית
Qwen3.8-27B64.424%בינונית
GLM-562.427%83.1קירובבינונית
GPT-5.6 Terra63.924%בינונית
GPT-5.4 nano60.431%בינונית
Inkling64.522%בינונית
GPT-5.6 Luna62.624%בינונית
GLM-5.162.324%בינונית
Grok 4.564.120%נמוכה
Inkling-Small63.819%נמוכה
Claude Opus 4.7 (Adaptive)66.214%נמוכה
MiniMax M2.759.825%בינונית
Gemini 3.6 Flash64.415%נמוכה
Ling 3.0 Flash62.419%נמוכה
DeepSeek V3.262.618%נמוכה
Grok 4.662.416%נמוכה
Gemini 3.5 Flash-Lite62.814%נמוכה
Grok 4.359.321%נמוכה
Muse Spark61.815%נמוכה
GLM-5.360.217%נמוכה
Gemini 3 Pro62.112%נמוכה
Gemini 3.7 Flash63.210%נמוכה
Kimi K2.5 (Reasoning)62.210%נמוכה
Muse Spark 1.261.910%נמוכה
Apodex 1.163.56%נמוכה
Grok 463.95%נמוכה
MiniMax M2.560.710%נמוכה
MiMo-V2-Pro63.05%נמוכה
MiMo-V2.5-Pro61.48%נמוכה
Gemma 4 31B60.29%נמוכה
MiMo-V2-Omni62.35%נמוכה
Trinity-Large-Preview62.53%נמוכה
GLM-5-Turbo61.72%נמוכה
GLM-5V-Turbo61.42%נמוכה
Phi-461.82%נמוכה
Grok 4.1 Fast (Reasoning)58.32%נמוכה
Grok 4 Fast (Reasoning)58.22%נמוכה
Command A+56.35%נמוכה
Hy30%נמוכה
Ministral 3 14B (Reasoning)0%נמוכה
Nemotron 3 Nano 30B0%נמוכה
Nova Pro0%נמוכה
Qwen3.5 397B (Reasoning)0%נמוכה
Step 3.5 Flash0%נמוכה

ציון העברית הוא נתון נלווה בלבד ואינו נכנס לציון ההתאמה או לסולם המדדים. „אין נתון” נשאר גלוי במכוון. ערך חסר אינו מוחלף בהערכה או בממוצע. מערכת ללא ציון (—): חסר מדד ביכולת מכריעה למשימה, או שהכיסוי נמוך מהסף. „קירוב" ליד ציון העברית = הציון נגזר ממדדים רב לשוניים (Global-MMLU, INCLUDE, MMLU-ProX, MAXIFE) ולא ממדד עברית ייעודי.