Trinity-Large-Thinking
מודל פתוח של Arcee AI עם חלון הקשר של 512K מילים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 47.9.
כל תוצאות המבחנים (5)
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-Pro | מדידה עצמאית · לוח השוואה מקור לא מאומת | 83.4 | 0.59 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה מקור לא מאומת | 76.3 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה מקור לא מאומת | 76.3 | 0.59 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
קוד ופיתוח תוכנה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| SWE-bench Verified | מדידה עצמאית · מתעדכןזיקה מסחרית מוצהרת מקור לא מאומת | 63.2 | 0.70 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · SWE-rebench · LiveCodeBench · Aider Polyglot · LiveBench Coding · LiveBench Agentic Coding · MirrorCode · SWE-bench Pro · SciCode · SWE-bench Lite · CursorBench · SWE-bench Multilingual · Vibe Code Bench · NL2Repo · DeepSWE · FrontierCode 1.1 · ProgramBench
ביצוע משימות מרובות שלבים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 32.5 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: Berkeley Function Calling Leaderboard (BFCL) V4 · Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Claw-Eval
תוצרים מקצועיים
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| Gert Labs | מדד משני · בהסתייגותהערכה על ידי מודל אחרזיקה מסחרית מוצהרת לוח עצמאי | 32.5 | 0.40 | קישור למקור |
לא נמצאו תוצאות עבור: JobBench
