Gemini 2.5 Pro
מודל סגור של גוגל עם חלון הקשר של 1,000K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 58.0.
כל תוצאות המבחנים (12)
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 85.3 | 0.85 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
עברית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Hebrew LLM Leaderboard | מדידה עצמאית · עברית לוח עצמאי | 71.9 | 1.00 | קישור למקור |
| מבחן העברית של האתר | מדידה עצמאית · עבריתהערכה על ידי מודל אחר לוח עצמאי | 94.0 | 0.33 | קישור למקור |
לא נמצאו תוצאות עבור: Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX · MAXIFE
שפה וניסוח
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Hebrew LLM Leaderboard | מדידה עצמאית · עברית לוח עצמאי | 71.9 | 1.00 | קישור למקור |
| מבחן העברית של האתר | מדידה עצמאית · עבריתהערכה על ידי מודל אחר לוח עצמאי | 94.0 | 0.33 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Language · Global-MMLU (GMMLU) · INCLUDE · MMLU-ProX
מתמטיקה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MATH Level 5 | מדידה עצמאית · לוח השוואה לוח עצמאי | 95.9 | 0.85 | קישור למקור |
| FrontierMath v2 | מדד משני · בהסתייגותזיקה מסחרית מוצהרת לוח עצמאי | 14.1 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · AIME 2026 · HMMT Feb 2026 · MathVision
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לוח עצמאי | 85.3 | 0.85 | קישור למקור |
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 18.8 | 0.28 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · MMLU-Pro · SuperGPQA · MMLU-Redux
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת לוח עצמאי | 57.6 | 1.00 | קישור למקור |
| Aider Polyglot | מדידה עצמאית · מתעדכן לוח עצמאי | 83.1 | 1.00 | קישור למקור |
| Vibe Code Bench | מדד משני לוח עצמאי | 0.4 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Lite · CursorBench · SWE-bench Multilingual · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 42.0 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 42.0 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
הבנת תמונות ומסמכים חזותיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Humanity's Last Exam (HLE) | מדידה עצמאית · לוח השוואההערכה על ידי מודל אחרזיקה מסחרית מוצהרת לפי דיווח היצרן | 18.8 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: MMMU-Pro · MMMU
חשיבה מופשטת
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| ARC-AGI-2 | מדד משניזיקה מסחרית מוצהרת לוח עצמאי | 4.9 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench Reasoning · ARC-AGI-3 · ZeroBench
כתיבת קוד עצמאית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Vibe Code Bench | מדד משני לוח עצמאי | 0.4 | 0.50 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · Terminal-Bench 2.0 · Terminal-Bench 3.0 · LiveBench Agentic Coding · SWE-bench Pro · CursorBench · DeepSWE
