← Evaluation overview

8 research contributions

Knowledge & Reasoning

Academic knowledge, mathematical concepts, rule-based reasoning, and dynamically composed problems.

Benchmarks & related work

8 works

Search by name or capability, or narrow by publication status and authorship.

Academic & domain knowledge

ACADREASON

Tests reasoning on problems drawn from academic research.

Scientific reasoningAcademic research
ICLR 2026
Paper & authors

ACADREASON: Exploring the Limits of Reasoning Models with Academic Research Problems

Xin Gui, JinCheng Ren, Qianben Chen, Zekun Wang, Yizhi Li, Xinpeng Liu, Wallis_Wenli Ren, Linyu Miao, Tianrui Qin, Ziqi Shu, He Zhu, Dingfeng Shi, Jiaheng Liu, Yuchen Jiang, Minghao Liu#, Ge Zhang#, Wangchunshu Zhou#

* Equal contribution; # Corresponding author.

Academic & domain knowledge

KINA

Evaluates academic knowledge across disciplines.

Academic knowledgeMultidisciplinary
arXiv preprint, 2026
Paper & authors

Knowledge Index of Noah's Ark

Sheng Jin, Minghao Liu#, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan#, Ge Zhang#

* Equal contribution; # Corresponding author.

Mathematics & rule-based reasoning

KORGym

Provides dynamic game environments for evaluating language-model reasoning.

GamesInteractive reasoning
NeurIPS 2025
Paper & authors

KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation

Jiajun Shi, Jian Yang#, Jiaheng Liu, Xingyuan Bu, Jiangjie Chen, Junting Zhou, Kaijing Ma, Zhoufutu Wen, Bingli Wang, Yancheng He, Liang Song, Hualei Zhu, Shilong Li, Xingjian Wang, Wei Zhang, Ruibin Yuan, Yifan Yao, Wenjun Yang, Yunli Wang, Siyuan Fang, Siyu Yuan, Qianyu He, Robert Tang, Yingshui Tan, Wangchunshu Zhou, Zhao-Xiang Zhang, Zhoujun Li, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Academic & domain knowledge

SuperGPQA

Evaluates knowledge and reasoning across 285 graduate-level disciplines.

Academic knowledgeMultidisciplinary
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors

SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines

Xeron Du, Yifan Yao, Kaijing Ma, Bingli Wang, Tianyu Zheng, Minghao Liu, Yiming Liang, Xiaolong Jin, Zhenlin Wei, Chujie Zheng, Kaixin Deng, Shuyue Guo, Shian Jia, Sichao Jiang, Yiyan Liao, Rui Li, Qinrui Li, Sirun Li, Yizhi Li, Yunwen Li, Dehua Ma, Yuansheng Ni, Haoran Que, Qiyao Wang, Zhoufutu Wen, Siwei Wu, Tianshun Xing, 明 许, Zhenzhu Yang, Noah Wang, Junting Zhou, Yuelin Bai, Xingyuan Bu, Chenglin Cai, Liang Chen, Yifan Chen, Cheng Chengtuo, Tianhao Cheng, Keyi Ding, Siming Huang, Huang Yun, Yaoru Li, Yizhe Li, Zhaoqun Li, Tianhao Liang, Chengdong Lin, Hongquan Lin, Yinghao Ma, Zhongyuan Peng, Zifan Peng, Qige Qi, Shi Qiu, Xingwei Qu, Shanghaoran Quan, Yizhou Tan, Zili Wang, Hao Wang, Yiya Wang, Yubo Wang, Jiajun Xu, Kexin Yang, Ruibin Yuan, Yuanhao Yue, Tianyang Zhan, Chun Zhang, Jinyang Zhang, Xiyue Zhang, Owen Zhang, Yue Zhang, Yongchi Zhao, Xiangyu Zheng, Yang Gao, Zhoujun Li, Dayiheng Liu, Qian Liu, Tianyu Liu, Shiwen Ni, Junran Peng, Yujia Qin, Wenbo Su, Guoyin Wang, Shi Wang, Jian Yang, Min Yang, Meng Cao, Xiang Yue, Zhao-Xiang Zhang, Wangchunshu Zhou, Jiaheng Liu#, Qunshu Lin#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Mathematics & rule-based reasoning

KOR-Bench

Tests rule-based reasoning designed to be orthogonal to prior knowledge.

LogicRule following
ICLR 2025
Paper & authors

KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks

Kaijing Ma, Xeron Du, Yunran Wang, Haoran Zhang, Zhoufutu Wen, Xingwei Qu, Jian Yang, Jiaheng Liu, Minghao Liu, Xiang Yue, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Academic & domain knowledge

Encyclo-K

Tests understanding of dynamically composed knowledge statements.

KnowledgeCompositionality
arXiv preprint, 2025
Paper & authors

Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements

Yiming Liang, Yizhi Li, Yantao Du#, Ge Zhang, Jiayi Zhou, Yuchen Wu, Yinzhu Piao, Denghui Cao, Tong Sun, Ziniu Li, Li Du, Bo Lei, Jiaheng Liu, Chenghua Lin, Zhaoxiang Zhang, Wenhao Huang#, Jiajun Zhang#

* Equal contribution; # Corresponding author.

Mathematics & rule-based reasoning

ConceptMath

Evaluates mathematical reasoning by concept in both Chinese and English.

MathematicsBilingual
Findings of ACL 2024Corresponding author
Paper & authors

ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models

Yanan Wu*, Jie Liu*, Xingyuan Bu, Jiaheng Liu#, Zhanhui Zhou, Yuanxing Zhang, Chenchen Zhang, Zhiqi Bai, Haibin Chen, Tiezheng Ge, Wanli Ouyang, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

Academic & domain knowledge

Owl-Bench

Evaluates knowledge and tasks in IT operations within the OWL study.

IT operationsDomain knowledge
ICLR 2024Corresponding author
Paper & authors

OWL: A Large Language Model for IT Operations

Hongcheng Guo, Jian Yang#, Jiaheng Liu#, Liqun Yang, Linzheng Chai, Jiaqi Bai, Junran Peng, Xiaorong Hu, Chao Chen, Dongfeng Zhang, xu Shi, Tieqiao Zheng, Liangfan Zheng, Bo Zhang, Ke Xu, Zhoujun Li

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.