מערכת שנבדקה
Trinity-Large-Preview
נבדק כמודל APIמודל פתוחArcee AI
מודל פתוח של Arcee AI עם חלון הקשר של 512K טוקנים. מדד האיכות המרוכז של המקור עומד על 57.1.
ציונים לפי יכולת
ידע וחשיבה
כיסוי 24%
69.3
חשיבה מדעית
כיסוי 24%
63.3
מדדים
כל רשומות המדד (3)
ידע וחשיבה
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| MMLU-Pro | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 75.2 | 0.72 | קישור למקור |
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 63.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: LiveBench · LiveBench Reasoning · Humanity's Last Exam (HLE) · SuperGPQA · MMLU-Redux
חשיבה מדעית
| מבחן הערכה | סטטוס | ציון | משקל | מקור |
|---|---|---|---|---|
| GPQA / GPQA Diamond | מדידה עצמאית · לוח השוואה לפי דיווח היצרן | 63.3 | 0.72 | קישור למקור |
לא נמצאו תוצאות עבור: SciCode · SuperGPQA · CritPt
מערכות נוספות
להשוואה
Apodex 1.1Claude Fable 5Claude Opus 4.6Claude Opus 4.7Claude Opus 4.7 (Adaptive)Claude Opus 4.8Claude Opus 5Claude Sonnet 5Command A+DeepSeek V3.2DeepSeek V4 Flash Vision ExpDeepSeek V4 Pro 0813Gemini 3.1 Flash LiteGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.7 FlashGemini 3 ProGemma 4 31BGLM-5GLM-5.1GLM-5.2GLM-5.3GLM 5.3 FlashGLM-5-TurboGLM-5V-TurboGPT-5.4GPT-5.4 nanoGPT-5.5GPT-5.6 LunaGPT-5.6 SolGPT-5.6 TerraGrok 4Grok 4.1 Fast (Reasoning)Grok 4.3Grok 4.5Grok 4.6Grok 4 Fast (Reasoning)Grok Build 0.1Hy3InklingInkling-SmallKimi K2.6Kimi K2.5Kimi K2.5 (Reasoning)Kimi K2.7 CodeKimi K3Ling 3.0 FlashMiMo-V2.5-ProMiMo-V2-OmniMiMo-V2-ProMiniMax M2.5MiniMax M2.7MiniMax M3Ministral 3 14B (Reasoning)Mistral Medium 3.5Muse Glimmer 30BMuse SparkMuse Spark 1.1Muse Spark 1.2Nemotron 3.5 LightningNemotron 3 Nano 30BNemotron 3 UltraNova ProPhi-4Qwen3.5 397B (Reasoning)Qwen3.6 27BQwen3.6 PlusQwen3.7 FlashQwen3.7 MaxQwen3.7 PlusQwen3.8 2.4T A95BQwen3.8-27BQwen3.8 FlashQwen3.8-Flash-NextQwen3.8 MaxStep 3.5 Flash
