登录成功后会自动刷新界面
用于评估 AI 模型的可复现基准测试
Open LLM Benchmark 是一个开源模型评测平台,用于比较 AI 模型在推理、编程、指令遵循、可靠性、速度及资源需求等方面的表现。它通过标准化测试推动模型评估的透明度与可复现性,帮助开发者和研究人员更客观地比较不同模型。