← Evaluation overview

9 research contributions

Reward Modeling

Reward models, reasoning critique, learned judges, and efficient evaluation.

Benchmarks & related work

9 works

Search by name or capability, or narrow by publication status and authorship.

Reasoning critique & reward models

DeepResearch RewardBench

Evaluates reward models for assessing deep-research reports.

Reward modelsDeep research
Findings of EMNLP 2026 · Accepted
Paper & authors

DeepResearch RewardBench: Evaluating Reward Models for Deep Research Report

Shudong Liu, Yuting Zhong, Guanhua Chen, Xinyi Yang, Junnan Liu, Lidia S. Chao, Jiaheng Liu, Derek F. Wong

* Equal contribution; # Corresponding author.

Learned evaluation methodsEvaluation method

CoTJudger

Evaluates chain-of-thought efficiency and redundancy using a graph-based framework.

LLM-as-a-judgeReasoning efficiency
Findings of ACL 2026Corresponding author
Paper & authors

CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs

Siyi Li, Jiajun Shi, Shiwen Ni#, Ge Zhang#, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi LI, Hamid Alinejad-Rokny, Jiaheng Liu#, Min Yang#, Wenhao Huang

* Equal contribution; # Corresponding author.

Reasoning critique & reward models

CriticLeanBench

Tests critics' judgments of semantic correctness in mathematical formalization.

Formal mathematicsCritique
ACL 2026Corresponding author
Paper & authors

CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization

Zhongyuan Peng, Yifan Yao, Kaijing Ma, Shuyue Guo, Yizhe Li, Yichi Zhang, Chenchen Zhang, Yifan Zhang, Zhouliang Yu, Luming Li, Minghao Liu, Yihang Xia, Jiawei Shen, Yuchen Wu, Yixin Cao, Zhaoxiang Zhang, Wenhao Huang, Jiaheng Liu#, Ge Zhang#

* Equal contribution; # Corresponding author.

Reasoning critique & reward models

CRBench

Evaluates Chinese reward models alongside the COIG-P preference dataset.

Reward modelsChinese
Findings of EACL 2026
Paper & authors

COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values

Siwei Wu, JinCheng Ren, Xeron Du, Shuyue Guo, Xingwei Qu, Yiming Liang, Jie Liu, Yunwen Li, Tyler Loakman, Tianyu Zheng, Boyu Feng, Huaqing Yuan, Zili Wang, Jiaheng Liu, Wenhao Huang, Chenglin Cai, Haoran Que, Jian Yang, Yuelin Bai, Zekun Moore Wang, Zhouliang Yu, Qunshu Lin, Ding Pan, Yuchen Eleanor Jiang, Tiannan Wang, Wangchunshu Zhou, Shenzhi Wang, Xingyuan Bu, Minghao Liu#, Guoyin Wang#, Ge Zhang#, Chenghua Lin#

* Equal contribution; # Corresponding author.

Reasoning critique & reward models

Long-form RewardBench

Evaluates reward models for long-form text generation.

Reward modelsLong-form generation
AAAI 2026Corresponding author
Paper & authors

Long-form RewardBench: Evaluating Reward Models for Long-form Generation

Hui Huang, Yancheng He, Wei Liu, Muyun Yang#, Jiaheng Liu#, Kehai Chen, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao

* Equal contribution; # Corresponding author.

Learned evaluation methodsEvaluation method

Think-J

Develops generative judges that reason before evaluating model outputs.

LLM-as-a-judgeReasoning
AAAI 2026Corresponding author
Paper & authors

Think-J: Learning to Think for Generative LLM-as-a-Judge

Hui Huang, Yancheng He, Hongli Zhou, Rui Zhang, Wei Liu, Weixun Wang, Jiaheng Liu#, Wenbo Su

* Equal contribution; # Corresponding author.

Reasoning critique & reward models

DeltaBench

Tests error detection in long chains of reasoning.

Reasoning critiqueError detection
ACL 2025Corresponding author
Paper & authors

Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?

Yancheng He, Shilong Li, Jiaheng Liu#, Weixun Wang, Xingyuan Bu, Ge Zhang, Z.Y. Peng, Zhaoxiang Zhang, Zhicheng Zheng, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

Evaluation efficiency

LIME / MOLIME

Studies compact multimodal evaluation across multiple tasks.

Multimodal evaluationEfficiency
Findings of ACL 2025
Paper & authors

LIME: Less Is More for MLLM Evaluation

King Zhu, Qianbo Zang, Shian Jia, Siwei Wu, Feiteng Fang, Yizhi Li, Shuyue Guo, Tianyu Zheng, Jiawei Guo, Bo Li, Haoning Wu, Xingwei Qu, Jian Yang, Ruibo Liu, Xiang Yue, Jiaheng Liu, Chenghua Lin, Hamid Alinejad-Rokny, Min Yang, Shiwen Ni#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Evaluation efficiency

PTSBench

Benchmarks post-training sparsity across algorithms and models.

Model compressionSparsity
ACM MM 2024
Paper & authors

PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models

Zining Wnag, Jinyang Guo#, Ruihao Gong, Yang Yong, Aishan Liu, Yushi Huang, Jiaheng Liu, Xianglong Liu

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.