AI COMPASS灵感导航
AI模型评测
16 个工具MagicArena
提供模型能力评估相关的基准与资源。
MMLU
用于评估语言模型多学科知识与理解能力的研究基准。
Open LLM Leaderboard
提供模型能力评估相关的基准与资源。
C-Eval
用于评估中文语言模型知识与推理能力的基准项目。
FlagEval
提供模型能力评估相关的基准与资源。
SuperCLUE
面向中文大模型的综合评测项目,覆盖语言、知识、智能体与安全等能力。
AGI-Eval
提供模型能力评估相关的基准与资源。
OpenCompass
面向大模型评测的开源工具与基准资源。
CMMLU
面向中文多领域知识理解的语言模型评测数据集。
MMBench
围绕多模态理解能力开展模型评测的基准项目。
HELM
斯坦福 CRFM 的语言模型综合评测项目。
Arena
通过模型对比与公开排行榜,了解不同 AI 模型的表现。
LLMEval3
比较模型评测结果。
H2O EvalGPT
提供模型能力评估相关的基准与资源。
PubMedQA
提供模型能力评估相关的基准与资源。
Label Studio
支持多种数据标注、人工反馈和 AI 评估的开源平台。