Gemini 3 Pro
מודל סגור של גוגל עם חלון הקשר של 2,000K טוקנים. מדד האיכות המרוכז של המקור עומד על 67.8.
כל רשומות המדד (14)
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 92.6 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 92.6 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
הבנה חזותית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 81.4 | 0.59 | קישור למקור |
| ScreenSpot Pro | מדד משני לפי דיווח היצרן | 72.7 | 0.42 | קישור למקור |
| VideoMMMU | מדד משני לפי דיווח היצרן | 87.6 | 0.42 | קישור למקור |
| MathVision | מדד משני לפי דיווח היצרן | 86.6 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: OfficeQA Pro · ERQA · ZeroBench
ניתוח נתונים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| CharXiv | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 81.4 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Data Analysis
טקסט ותמונה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMMU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 81.0 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: Humanity's Last Exam (HLE) · MMMU
הפעלת מחשב
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ScreenSpot Pro | מדד משני לפי דיווח היצרן | 72.7 | 0.42 | קישור למקור |
לא נמצאו תוצאות עבור: OSWorld · AndroidWorld · WebArena-Verified
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 37.6 | 0.40 | קישור למקור |
| MathVision | מדד משני לפי דיווח היצרן | 86.6 | 0.35 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MATH Level 5
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 77.4 | 1.00 | קישור למקור |
| SWE-bench Multilingual | מדד משני לוח עצמאי | 68.7 | 0.50 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 14.3 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · CursorBench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 54.0 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 11.4 | 0.50 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 63.2 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · DeepSearchQA · MLE-bench · Claw-Eval
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| JobBench | מדד משניהערכה על ידי מודל אחר לוח עצמאי | 11.4 | 0.50 | קישור למקור |
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 63.2 | 0.40 | קישור למקור |
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Vibe Code Bench | מדד משני לוח עצמאי | 14.3 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE
