מערכת שנבדקה

LFM2.5-8B-A1B

נבדק כמודל APIמודל פתוחLiquidAI

מודל פתוח של LiquidAI עם חלון הקשר של 128K טוקנים. ציון האיכות הכולל שלו במבחני ההערכה עומד על 41.4.

ציונים לפי יכולת
שירות לקוחות אוטומטי
כיסוי 85%
88.1
עמידה בהוראות
כיסוי 30%
69.6
מתמטיקה
כיסוי 13%
50.0
ביצוע משימות מרובות שלבים
כיסוי 9%
49.7
שימוש בכלים
כיסוי 35%
49.7
תוצאות

כל תוצאות המבחנים (6)

שירות לקוחות אוטומטי

מבחן הערכהסטטוסציוןמשקלמקור
τ²-bench
מדד משני · בהסתייגותזיקה מסחרית מוצהרת
לפי דיווח היצרן
88.10.34קישור למקור

עמידה בהוראות

מבחן הערכהסטטוסציוןמשקלמקור
IFBench
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
56.50.72קישור למקור
IFEval
מדד משניזיקה מסחרית מוצהרת
לפי דיווח היצרן
91.80.42קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Instruction Following · MAXIFE

מתמטיקה

מבחן הערכהסטטוסציוןמשקלמקור
AIME 2026
מדידה עצמאית · לוח השוואה
לפי דיווח היצרן
50.00.72קישור למקור

לא נמצאו תוצאות עבור: LiveBench · LiveBench Mathematics · HMMT Feb 2026 · MATH Level 5 · MathVision · FrontierMath v2

ביצוע משימות מרובות שלבים

מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
49.70.85קישור למקור

לא נמצאו תוצאות עבור: Terminal-Bench 2.0 · Terminal-Bench 3.0 · OSWorld · MCP Atlas · Toolathlon · AndroidWorld · WideResearch · Agents' Last Exam · AutomationBench · JobBench · DeepSearchQA · MLE-bench · Gert Labs · Claw-Eval

שימוש בכלים

מבחן הערכהסטטוסציוןמשקלמקור
Berkeley Function Calling Leaderboard (BFCL) V4
מדידה עצמאית · מתעדכן
לפי דיווח היצרן
49.70.85קישור למקור

לא נמצאו תוצאות עבור: MCP Atlas · Toolathlon · Claw-Eval

מערכות נוספות

להשוואה

Apodex 1.1Claude Fable 5Claude Fable 5.1Claude Opus 4.5Claude Opus 4.5 ThinkingClaude Opus 4.6Claude Opus 4.6 (Adaptive)Claude Opus 4.7Claude Opus 4.7 (Adaptive)Claude Opus 4.8Claude Opus 5Claude Sonnet 4.6Claude Sonnet 5Command A+DeepSeek-R1DeepSeek R1 Distill Qwen 32BDeepSeek V3DeepSeek V3.1DeepSeek V3.1 (Reasoning)DeepSeek V3.2DeepSeek V4.1 FlashDeepSeek V4 Flash 0423DeepSeek V4 Flash Vision ExpDeepSeek V4 Pro 0423DeepSeek V4 Pro 0813Exaone 4.0 1.2BExaone 4.0 32BGemini 2.5 FlashGemini 2.5 ProGemini 3.1 Flash LiteGemini 3.1 ProGemini 3.5 FlashGemini 3.5 Flash-LiteGemini 3.6 FlashGemini 3.7 FlashGemini 3.8 FlashGemini 3 FlashGemini 3 ProGemma 4 26B A4BGemma 4 31BGLM-4.5-AirGLM-4.6GLM-4.7GLM-4.7-FlashGLM-5GLM-5.1GLM-5.2GLM-5.3GLM-5.3-FlashGLM-5-TurboGLM-5V-TurboGPT-5.1GPT-5.2GPT-5.3 CodexGPT-5.4GPT-5.4 miniGPT-5.4 nanoGPT-5.5GPT-5.6 LunaGPT-5.6 SolGPT-5.6 TerraGPT-5 (high)GPT-6 AstraGranite-4.0-1BGranite-4.0-350MGranite-4.0-H-1BGranite-4.0-H-350MGranite 4.2 8BGrok 4Grok 4.1 FastGrok 4.1 Fast (Reasoning)Grok 4.3Grok 4.5Grok 4.6Grok 4 Fast (Reasoning)Grok Build 0.1Grok Code Fast 1Hy3Hy3 PreviewInklingInkling-SmallK-ExaoneKimi K2.6Kimi K2Kimi K2.5Kimi K2.5 (Reasoning)Kimi K2.7 CodeKimi K3LFM2.5-2.6BLing 2.6 FlashLing 3.0 FlashLlama 3.1 405BLlama 4 MaverickLlama 4 ScoutMercury 2MiMo-V2.5-ProMiMo-V2-FlashMiMo-V2-OmniMiMo-V2-ProMiniMax M1 80kMiniMax M2.5MiniMax M2.7MiniMax M3Ministral 3 14BMinistral 3 14B (Reasoning)Ministral 3 3B (Reasoning)Ministral 3 8BMinistral 3 8B (Reasoning)Mistral Large 2Mistral Large 3Mistral Medium 3Mistral Medium 3.5 128BMistral Small 4Muse Glimmer 30BMuse SparkMuse Spark 1.1Muse Spark 1.2Nemotron 3.5 Content SafetyNemotron 3.5 LightningNemotron 3.5 Lightning 30B A3B NVFP4Nemotron 3 Nano 30BNemotron 3 Nano Omni 30B A3BNemotron 3 Super 100BNemotron 3 Super 120B A12BNemotron 3 UltraNemotron Ultra 253BNova ProPhi-4Qwen3.5-122B-A10BQwen3.5-27BQwen3.5-35B-A3BQwen3.5 397BQwen3.5 397B (Reasoning)Qwen3.5 Plus 2026-04-20Qwen3.6-27BQwen3.6 35B A3BQwen3.6 FlashQwen 3.6 Max (preview)Qwen3.6 PlusQwen3.7 FlashQwen3.7 MaxQwen3.7 PlusQwen3.8 2.4T A95BQwen3.8-27BQwen3.8 FlashQwen3.8-Flash-NextSarvam 105BSarvam 30BSolar Pro 2Step 3.5 FlashStep 3.7 FlashTrinity-Large-PreviewTrinity-Large-Thinking