All Benchmarks
Browse all benchmarks referenced by AI Benchmark Hub.
All benchmarks referenced by AI Benchmark Hub.
ARC
ARC
reasoning
小学级别科学考试问题集,分为Easy和Challenge两个子集,挑战子集需要推理能力
BBH
BBH (BIG-Bench Hard)
reasoning
BIG-Bench 的 23 个最难任务子集,覆盖逻辑推理、符号操作、常识推理等领域,传统模型表现不佳,用于评估模型的复杂推理能力。
GPQA
GPQA
knowledge
由生物学、物理学、化学领域的博士专家撰写的难题集,确保问题难以通过Google搜索直接找到答案
GSM8K
GSM8K (Grade School Math 8K)
math
OpenAI 发布的 8500 道小学数学应用题,需要 2-8 步推理求解,评估模型的多步数学推理与基础算术能力。
HUMANEVAL
HumanEval
coding
OpenAI 发布的 164 道 Python 编程任务,每题包含函数签名、文档字符串、函数体与单元测试,评估模型的代码生成能力(pass@1)。
IFEVAL
IFEval
reasoning
评估大型语言模型严格遵循指令的能力,包含500个可验证的指令
MATH
MATH
math
12,500 道竞赛数学题(含 7 个学科:代数、几何、数论、微积分、概率等,5 个难度级别),评估模型的复杂数学推理能力。
MMLU
MMLU (Massive Multitask Language Understanding)
knowledge
57 学科多选题知识评测,覆盖人文、社科、STEM、医学等领域,共 14042 道题,评估模型的广泛世界知识与问题解决能力。
MUSR
MUSR
reasoning
评估多步骤软推理能力,包含逻辑、数学和高效推理三个领域各250个问题
WINOGRANDE
WinoGrande
reasoning
大规模Winograd Schema挑战集,需要常识推理来消除代词指代歧义