מערכת שנבדקה

Gemini 3 Pro

נבדק כמודל APIמודל סגורגוגל

מודל סגור של גוגל עם חלון הקשר של 2,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.8.

ציונים לפי יכולת
ידע וחשיבה
כיסוי 14%
92.6
חשיבה מדעית
כיסוי 28%
92.6
הבנה חזותית
כיסוי 47%
81.8
ניתוח נתונים
כיסוי 21%
81.4
טקסט ותמונה
כיסוי 33%
81.0
הפעלת מחשב
כיסוי 18%
72.7
מתמטיקה
כיסוי 14%
60.5
קוד ופיתוח תוכנה
כיסוי 15%
59.5
חשיבה מופשטת
כיסוי 18%
54.0
ביצוע משימות מרובות שלבים
כיסוי 10%
34.4
תוצרים מקצועיים
כיסוי 100%
34.4
כתיבת קוד עצמאית
כיסוי 8%
14.3
מדדים

כל רשומות המדד (14)

ידע וחשיבה

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
92.60.85קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux

חשיבה מדעית

מבחן הערכהסטטוסציוןמשקלמקור
GPQA / GPQA Diamond
מדידה עצמאית · לוח השוואה
לוח עצמאי
92.60.85קישור למקור

לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt

הבנה חזותית

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.40.59קישור למקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
72.70.42קישור למקור
VideoMMMU
מדד משני
לפי דיווח היצרן
87.60.42קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
86.60.35קישור למקור

לא נמצאו תוצאות עבור: OfficeQA Pro · ERQA · ZeroBench

ניתוח נתונים

מבחן הערכהסטטוסציוןמשקלמקור
CharXiv
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.40.59קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis

טקסט ותמונה

מבחן הערכהסטטוסציוןמשקלמקור
MMMU-Pro
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
81.00.72קישור למקור

לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU

הפעלת מחשב

מבחן הערכהסטטוסציוןמשקלמקור
ScreenSpot Pro
מדד משני
לפי דיווח היצרן
72.70.42קישור למקור

לא נמצאו תוצאות עבור: OSWorld · AndroidWorld · WebArena-Verified

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
FrontierMath v2
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לוח עצמאי
37.60.40קישור למקור
MathVision
מדד משני
לפי דיווח היצרן
86.60.35קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5

קוד ופיתוח תוכנה

מבחן הערכהסטטוסציוןמשקלמקור
SWE-bench Verified
מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת
לוח עצמאי
77.41.00קישור למקור
SWE-bench Multilingual
מדד משני
לוח עצמאי
68.70.50קישור למקור
Vibe Code Bench
מדד משני
לוח עצמאי
14.30.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench

חשיבה מופשטת

מבחן הערכהסטטוסציוןמשקלמקור
ARC-AGI-2
מדד משניזיקה מסחרית מוצהרת
לוח עצמאי
54.00.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
11.40.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
63.20.40קישור למקור

לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Claw-Eval

תוצרים מקצועיים

מבחן הערכהסטטוסציוןמשקלמקור
JobBench
מדד משניהערכה על ידי מודל אחר
לוח עצמאי
11.40.50קישור למקור
Gert Labs
מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת
לוח עצמאי
63.20.40קישור למקור

כתיבת קוד עצמאית

מבחן הערכהסטטוסציוןמשקלמקור
Vibe Code Bench
מדד משני
לוח עצמאי
14.30.50קישור למקור

לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE

מערכות נוספות

להשוואה