מערכת שנבדקה

Gemini 3 Flash

נבדק כמודל APIמודל סגורגוגל

מודל סגור של גוגל עם חלון הקשר של 1,000K מילים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 59.7.

ציונים לפי יכולת
ידע וחשיבה
כיסוי 14%
89.4
חשיבה מדעית
כיסוי 28%
89.4
עברית
כיסוי 26%
74.0
שפה וניסוח
כיסוי 19%
74.0
דיוק עובדתי
כיסוי 33%
66.8
קוד ופיתוח תוכנה
כיסוי 14%
61.1
שימוש בכלים
כיסוי 17%
49.2
ביצוע משימות מרובות שלבים
כיסוי 15%
44.8
מתמטיקה
כיסוי 7%
35.6
חשיבה מופשטת
כיסוי 18%
33.6
תוצרים מקצועיים
כיסוי 100%
31.5
כתיבת קוד עצמאית
כיסוי 8%
20.2
תוצאות

כל תוצאות המבחנים (12)

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
89.40.85קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
89.40.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

עברית

מבחן הערכהסטטוסציוןמשקלמקור
Hebrew LLM Leaderboard
מדידה עצמאית · עברית
לוח עצמאי
74.01.00קישור למקור

לא נמצאו תוצאות עבור: מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX · MAXIFE

שפה וניסוח

מבחן הערכהסטטוסציוןמשקלמקור
Hebrew LLM Leaderboard
מדידה עצמאית · עברית
לוח עצמאי
74.01.00קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · מבחן העברית של האתר · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX

דיוק עובדתי

מבחן הערכהסטטוסציוןמשקלמקור
SimpleQA Verified
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
66.80.40קישור למקור

לא נמצאו תוצאות עבור: SimpleQA · DeepSearchQA

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
75.81.00קישור למקור
SWE-bench Multilingual
מדד משני
לוח עצמאי
72.70.50קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
20.20.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Lite · CursorBench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
49.20.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · MCP Atlas · Toolathlon

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Claw-Eval
מדד משני · בהסתייגות
לוח עצמאי
49.20.40קישור למקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
11.40.07קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
56.60.06קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
35.60.40קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5 · MathVision

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
33.60.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
11.40.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
56.60.40קישור למקור

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Vibe Code Bench
מדד משני
לוח עצמאי
20.20.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE

מערכות נוספות

להשוואה

Apodex 1.1Claude Fable 5Claude Fable 5.1Claude Opus 4.5Claude Opus 4.5 ThinkingClaude Opus 4.6Claude Opus 4.6 (Adaptive)Claude Opus 4.7Claude Opus 4.7 (Adaptive)Claude Opus 4.8Claude Opus 5Claude Sonnet 4.6Claude Sonnet 5Command A+DeepSeek-R1DeepSeek R1 Distill Qwen 32BDeepSeek V3DeepSeek V3.1DeepSeek V3.1 (Reasoning)DeepSeek V3.2DeepSeek V4.1 FlashDeepSeek V4 Flash 0423DeepSeek V4 Flash Vision ExpDeepSeek V4 Pro 0423DeepSeek V4 Pro 0813Exaone 4.0 1.2BExaone 4.0 32BGemini 2.5 FlashGemini 2.5 ProGemini 3.1 Flash LiteGemini 3.1 ProGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.7 FlashGemini 3.8 FlashGemini 3 ProGemma 4 26B A4BGemma 4 31BGLM-4.5-AirGLM-4.6GLM-4.7GLM-4.7-FlashGLM-5GLM-5.1GLM-5.2GLM-5.3GLM-5.3-FlashGLM-5-TurboGLM-5V-TurboGPT-5.1GPT-5.2GPT-5.3 CodexGPT-5.4GPT-5.4 miniGPT-5.4 nanoGPT-5.5GPT-5.6 LunaGPT-5.6 SolGPT-5.6 TerraGPT-5 (high)GPT-6 AstraGranite-4.0-1BGranite-4.0-350MGranite-4.0-H-1BGranite-4.0-H-350MGranite 4.2 8BGrok 4Grok 4.1 FastGrok 4.1 Fast (Reasoning)Grok 4.3Grok 4.5Grok 4.6Grok 4 Fast (Reasoning)Grok Build 0.1Grok Code Fast 1Hy3Hy3 PreviewInklingInkling-SmallK-ExaoneKimi K2.6Kimi K2Kimi K2.5Kimi K2.5 (Reasoning)Kimi K2.7 CodeKimi K3LFM2.5-2.6BLFM2.5-8B-A1BLing 2.6 FlashLing 3.0 FlashLlama 3.1 405BLlama 4 MaverickLlama 4 ScoutMercury 2MiMo-V2.5-ProMiMo-V2-FlashMiMo-V2-OmniMiMo-V2-ProMiniMax M1 80kMiniMax M2.5MiniMax M2.7MiniMax M3Ministral 3 14BMinistral 3 14B (Reasoning)Ministral 3 3B (Reasoning)Ministral 3 8BMinistral 3 8B (Reasoning)Mistral Large 2Mistral Large 3Mistral Medium 3Mistral Medium 3.5 128BMistral Small 4Muse Glimmer 30BMuse SparkMuse Spark 1.1Muse Spark 1.2Nemotron 3.5 Content SafetyNemotron 3.5 LightningNemotron 3.5 Lightning 30B A3B NVFP4Nemotron 3 Nano 30BNemotron 3 Nano Omni 30B A3BNemotron 3 Super 100BNemotron 3 Super 120B A12BNemotron 3 UltraNemotron Ultra 253BNova ProPhi-4Qwen3.5-122B-A10BQwen3.5-27BQwen3.5-35B-A3BQwen3.5 397BQwen3.5 397B (Reasoning)Qwen3.5 Plus 2026-04-20Qwen3.6-27BQwen3.6 35B A3BQwen3.6 FlashQwen 3.6 Max (preview)Qwen3.6 PlusQwen3.7 FlashQwen3.7 MaxQwen3.7 PlusQwen3.8 2.4T A95BQwen3.8-27BQwen3.8 FlashQwen3.8-Flash-NextSarvam 105BSarvam 30BSolar Pro 2Step 3.5 FlashStep 3.7 FlashTrinity-Large-PreviewTrinity-Large-Thinking