Benchmarks & evaluation research

Evaluation

How do we know what a model can really do?

Benchmarks, datasets, and evaluation methods from my work with collaborators — spanning coding agents, knowledge work, reasoning, and multimodal intelligence.

Benchmarks & datasets
93
Research areas
9

Browse by capability

Explore all work

95 works

Search by name or capability, or narrow by publication status and authorship.

OmniHalluc-L

Evaluates long-form omni-modal hallucination using counterfactual and modality-perturbation analysis.

HallucinationAudio-visual
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

OmniHalluc-L: Counterfactual Benchmarking and Modality-Perturbation Calibration for Long-Form Omni Hallucination

Zixuan Dong, Jiafu Tang, Zhide Lei, Zhe Cao, Zijie Zhang, Yanghai Wang, Shihao Li, Xiaodong Wang, Baoyun Peng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

MM-BrowseComp

Evaluates multimodal web browsing and information-seeking agents.

Web browsingMultimodal
EMNLP 2026 · Accepted
Paper & authors

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Shilong Li, Xingyuan Bu#, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen#

* Equal contribution; # Corresponding author.

TVIR-Bench

Evaluates research reports that interleave text and visual evidence.

Deep researchMultimodal reports
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

Xinkai Ma, Zhiqi Bai, Dingling Zhang, Pei Liu, Yishuo Yuan, He Zhu, Jiakai Wang, Qianqian Xie, Yifan Zhao, Xinlong Yang, Hao Cong, Zhiheng Yao, Fengxia Xie, Zihao Xu, Haoran Xu, Zhaohui Wang, Minghao Liu, Shirong Lin, Yingshui Tan, Yuchi Xu, Wenbo Su, Zhaoxiang Zhang, Bo Zheng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

WebCompass

Evaluates multimodal agents on web development from visual inputs, instructions, and interaction.

Web developmentMultimodal
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

WebCompass: Evaluating Multimodal Code Agents in Web Development from Vision, Instruction, and Interaction to Implementation

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

DR³-Eval

Evaluates deep-research agents in realistic, reproducible settings with multiple files and modalities.

Deep researchReproducibility
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

DR³-Eval: Towards Realistic and Reproducible Deep Research Evaluation

Qianqian Xie, He Zhu, Xueming Han, Qingheng Xiong, Tiantian Xia, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng#, Jiaheng Liu#

* Equal contribution; # Corresponding author.

ArtifactsBench

Evaluates the visual quality and interactive behavior of generated code artifacts.

Visual qualityInteraction
EMNLP 2026 · Accepted
Paper & authors

ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation

Chenchen Zhang, Yuhang Li, Jiaheng Liu, Can Xu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruilin Lv, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou#, Chayse Zhou#, Fengzong Lian#

* Equal contribution; # Corresponding author.

ClawBench

Evaluates completion of everyday online tasks by AI agents.

Online tasksTask completion
Findings of EMNLP 2026 · Accepted
Paper & authors

ClawBench: Can AI Agents Complete Everyday Online Tasks?

Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du, Junwen Miao, Xuan Lu, Zhuofeng Li, Xingwei Qu, Zhengkang Guo, Yuanzhe Shen, Dingjie Song, Han Zhou, Tuney Zheng, Xian Wu, Hao Yu, Songcheng Cai, Yi Lu, Yunzhuo Hao, Minyi Lei, Liang Chen, Kai Zou, Huifeng Yin, Wendong Xu, Dongfu Jiang, Ping Nie, Jiaheng Liu, Wenhu Chen, Kelsey R. Allen

* Equal contribution; # Corresponding author.

MMG2Skill-Bench

Tests whether agents can turn multimodal guides into reusable, evolving skills.

Skill learningMultimodal
Findings of EMNLP 2026 · AcceptedCorresponding author
Paper & authors

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinghua Hao, Ming Sun, Han Li, Jiaheng Liu#

* Equal contribution; # Corresponding author.

MSQA

Evaluates multilingual and multicultural factual knowledge with natively sourced questions.

FactualityMultilingual
Findings of EMNLP 2026 · Accepted
Paper & authors

MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark

Yukai Huang, Xianru Chen, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Jiaheng Liu, Ge Zhang, Wenhao Huang

* Equal contribution; # Corresponding author.

DeepResearch RewardBench

Evaluates reward models for assessing deep-research reports.

Reward modelsDeep research
Findings of EMNLP 2026 · Accepted
Paper & authors

DeepResearch RewardBench: Evaluating Reward Models for Deep Research Report

Shudong Liu, Yuting Zhong, Guanhua Chen, Xinyi Yang, Junnan Liu, Lidia S. Chao, Jiaheng Liu, Derek F. Wong

* Equal contribution; # Corresponding author.

WorldTravel

Evaluates multimodal travel planning under tightly coupled constraints.

PlanningMultimodal
ICML 2026
Paper & authors

WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints

Zexuan Wang, Chenghao Yang, Yingqi Que, Zhenzhu Yang, Huaqing Yuan, Yiwen Wang, Zhengxuan Jiang, Shengjie Fang, Zhenhe Wu, Zhaohui Wang, Zhixin Yao, Jiashuo Liu, Jincheng Ren, Yuzhen Li, Yang Yang, Jiaheng Liu, Jian Yang, Zaiyuan Wang, Ge Zhang, Zhoufutu Wen#, Wenhao Huang

* Equal contribution; # Corresponding author.

T2AV-Compass

Evaluates text-to-audio-video generation through a unified framework.

Audio-video generationText alignment
ICML 2026Corresponding author
Paper & authors

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jiahao Wang, Jialu Chen, Miao Deng, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

NL2Repo-Bench

Tests long-horizon development of complete repositories from natural-language requirements.

Repository generationLong horizon
ICML 2026
Paper & authors

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

* Equal contribution; # Corresponding author.

SWE-Compass

Evaluates agentic coding across diverse tasks in real software repositories.

Coding agentsRepositories
ICML 2026Corresponding author
Paper & authors

SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models

Jingxuan Xu, Ken Deng, Weihao Li, Songwei Yu, Huaixi Tang, Haoyang Huang, Zhiyi Lai, Zizheng Zhan, Yanan Wu, Chenchen Zhang, Kepeng Lei, Yifan Yao, Xinping Lei, Wenqiang Zhu, Zongxian Feng, Han Li, Junqi Xiong, Dailin Li, Zuchen Gao, Kun Wu, Wen Xiang, Ziqi Zhan, Yuanxing Zhang, Wuxuan Gong, Ziyuan Gao, Guanxiang Wang, Yirong Xue, Mengtong Li, Mengfei Xie, Xiaojiang Zhang, Jinghui Wang, Wenhao Zhuang, Zheng Lin, Huiming Wang, Zhaoxiang Zhang, Yuqun Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu#

* Equal contribution; # Corresponding author.

M²EVAL

Evaluates multilingual programming from visual design diagrams and textual specifications.

Visual codingMultilingual
ICML 2026
Paper & authors

From Diagrams to Code: Multilingual Programming with Visual Design

Linzheng Chai, Jian Yang#, Shukai Liu, Wei Zhang, Liran Wang, Ke Jin, Tao Sun, Congnan Liu, Chenchen Zhang, Hualei Zhu, Jiaheng Liu, Xianjie Wu, Ge Zhang, Tianyu Liu, Zhoujun Li

* Equal contribution; # Corresponding author.

TableAgent-Bench

Evaluates multi-turn agentic table question answering in realistic settings.

TablesTool use
ICML 2026
Paper & authors

How Far Can LLM Agents Reason with Tables? Benchmarking Multi-Turn Agentic Table Question Answering in the Wild

Jingwang Huang, Jie Zhang, Haoyang Zeng, Changzai Pan, Xianjie Wu, Guanting Dong, Jiaheng Liu, Wei Zhang, Mingyu Zheng, Chunxiao Liu, Kaiwen Wei, Jiang Zhong, Jian Yang

* Equal contribution; # Corresponding author.

Reward ModelingEvaluation method

CoTJudger

Evaluates chain-of-thought efficiency and redundancy using a graph-based framework.

LLM-as-a-judgeReasoning efficiency
Findings of ACL 2026Corresponding author
Paper & authors

CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs

Siyi Li, Jiajun Shi, Shiwen Ni#, Ge Zhang#, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi LI, Hamid Alinejad-Rokny, Jiaheng Liu#, Min Yang#, Wenhao Huang

* Equal contribution; # Corresponding author.

Multi-Docker-Eval

Evaluates automatic setup of executable environments for real software projects.

Environment setupCoding agents
Findings of ACL 2026
Paper & authors

Multi-Docker-Eval: A ‘Shovel of the Gold Rush’ Benchmark on Automatic Environment Building for Software Engineering

Kelin Fu#, Tianyu Liu#, Zeyu Shang, Yingwei MA, Jiaheng Liu, Jian Yang, Kaigui Bian#

* Equal contribution; # Corresponding author.

MT-Video-Bench

Evaluates video understanding through multi-turn dialogues.

Video understandingMulti-turn
Findings of ACL 2026Corresponding author
Paper & authors

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Moore Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

M3TQA-BENCH

Evaluates multilingual, multitask table question answering.

TablesMultilingual
Findings of ACL 2026
Paper & authors

M3TQA: Massively Multilingual Multitask Table Question Answering

Daixin Shu, Jian Yang#, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Guan Xiangyuan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang, Jiaheng Liu, Zhoujun Li

* Equal contribution; # Corresponding author.

CriticLeanBench

Tests critics' judgments of semantic correctness in mathematical formalization.

Formal mathematicsCritique
ACL 2026Corresponding author
Paper & authors

CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization

Zhongyuan Peng, Yifan Yao, Kaijing Ma, Shuyue Guo, Yizhe Li, Yichi Zhang, Chenchen Zhang, Yifan Zhang, Zhouliang Yu, Luming Li, Minghao Liu, Yihang Xia, Jiawei Shen, Yuchen Wu, Yixin Cao, Zhaoxiang Zhang, Wenhao Huang, Jiaheng Liu#, Ge Zhang#

* Equal contribution; # Corresponding author.

USB

Provides unified evaluation of multimodal safety and over-refusal.

Multimodal safetyOver-refusal
ACL 2026
Paper & authors

USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models

Baolin Zheng#, Guanlin Chen, Qingyang Teng, Hongqiong Zhong, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

* Equal contribution; # Corresponding author.

CRBench

Evaluates Chinese reward models alongside the COIG-P preference dataset.

Reward modelsChinese
Findings of EACL 2026
Paper & authors

COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values

Siwei Wu, JinCheng Ren, Xeron Du, Shuyue Guo, Xingwei Qu, Yiming Liang, Jie Liu, Yunwen Li, Tyler Loakman, Tianyu Zheng, Boyu Feng, Huaqing Yuan, Zili Wang, Jiaheng Liu, Wenhao Huang, Chenglin Cai, Haoran Que, Jian Yang, Yuelin Bai, Zekun Moore Wang, Zhouliang Yu, Qunshu Lin, Ding Pan, Yuchen Eleanor Jiang, Tiannan Wang, Wangchunshu Zhou, Shenzhi Wang, Xingyuan Bu, Minghao Liu#, Guoyin Wang#, Ge Zhang#, Chenghua Lin#

* Equal contribution; # Corresponding author.

MdEval

Measures code debugging across multiple programming languages.

DebuggingMultilingual
Findings of ACL 2026
Paper & authors

MdEval: Massively Multilingual Code Debugging

Shukai Liu, Linzheng Chai, Jian Yang#, Jiajun Shi, He Zhu, Liran Wang, Jin Ke, Wei Zhang, Hualei Zhu, Shuyue Guo, Tao Sun, Jiaheng Liu, Yunlong Duan, Yu Hao, Liqun Yang, Guanglin Niu, Ge Zhang, Zhoujun Li

* Equal contribution; # Corresponding author.

MMRA

Tests relational association across multiple images and levels of granularity.

Multi-imageRelations
Findings of EACL 2026
Paper & authors

MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models

Siwei Wu, King Zhu, Yu Bai (白宇), Yiming Liang, Yizhi Li, Haoning Wu, Jiaheng Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang#, Wenhao Huang#, Chenghua Lin#

* Equal contribution; # Corresponding author.

MMTableBench

Tests table question answering across reasoning demands and visual layout complexity.

TablesDocument understanding
WWW 2026
Paper & authors

MMTableBench: A Multi-level Multimodal Benchmark for Reasoning and Layout Complexity in Table QA

Xianjie Wu, Xiaohang Xu, Tingyu Jiang, Jian Yang, Di Liang, Xianfu Cheng, Zhenhe Wu, Linzheng Chai, Wei Zhang, Jiaheng Liu, Ge Zhang, Bob Simons, Tongliang Li, Zhoujun Li

* Equal contribution; # Corresponding author.

IF-VidCap

Tests whether video-captioning models follow user instructions.

Video captioningInstruction following
ICLR 2026Corresponding author
Paper & authors

IF-VidCap: Can Video Caption Models Follow Instructions?

Shihao Li, Yuanxing Zhang, Jiangtao Wu, Zhide Lei, Yiwen He, Runzhe Wen, Chenxi Liao, Chengkang Jiang, An Ping, Shuo Gao, Suhan Wang, Zhaozhou Bian, Zijun Zhou, Jingyi Xie, Jiayi Zhou, Jing Wang, Yifan Yao, Weihao Xie, Yingshui Tan, Yanghai Wang, Qianqian Xie, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

ACADREASON

Tests reasoning on problems drawn from academic research.

Scientific reasoningAcademic research
ICLR 2026
Paper & authors

ACADREASON: Exploring the Limits of Reasoning Models with Academic Research Problems

Xin Gui, JinCheng Ren, Qianben Chen, Zekun Wang, Yizhi Li, Xinpeng Liu, Wallis_Wenli Ren, Linyu Miao, Tianrui Qin, Ziqi Shu, He Zhu, Dingfeng Shi, Jiaheng Liu, Yuchen Jiang, Minghao Liu#, Ge Zhang#, Wangchunshu Zhou#

* Equal contribution; # Corresponding author.

OmniVideoBench

Evaluates joint audio-visual understanding in omni-modal language models.

Audio-visualOmni-modal
ICLR 2026Corresponding author
Paper & authors

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao MA, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Inverse IFEval

Tests whether models follow real instructions that conflict with learned training conventions.

Instruction followingRobustness
ICLR 2026Corresponding author
Paper & authors

Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?

Qinyan Zhang*, Xinping Lei*, Ruijie Miao*, Yu Fu, Haojie Fan, Le Chang, Jiafan Hou, Dingling Zhang, Zhongfei Hou, Ziqiang Yang, Changxin Pu, Fei Hu, Jingkai Liu, Xinjie Chen, Jianpeng Jiao, Jiaheng Liu#, Tong Yang#, Zaiyuan Wang#, Ge Zhang#, Wenhao Huang

* Equal contribution; # Corresponding author.

ScaleLong

Evaluates long-video understanding across multiple temporal scales.

Long videoTemporal reasoning
ICLR 2026
Paper & authors

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo ZANG, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#, Xiaojie Jin#

* Equal contribution; # Corresponding author.

IV-Bench

Tests image-grounded video perception and reasoning.

Video understandingVisual grounding
ICLR 2026
Paper & authors

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Xiaojie Jin#

* Equal contribution; # Corresponding author.

SafeDialBench

Evaluates safety in multi-turn dialogues with diverse jailbreak attacks.

Jailbreak resistanceMulti-turn
ICLR 2026
Paper & authors

SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks

Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Jiaheng Liu, Boyan Wang, Tianpei Yang, Jing Huo#, Yang Gao, Fanyu Meng#, Xi Yang, Chao Deng, Junlan Feng

* Equal contribution; # Corresponding author.

Long-form RewardBench

Evaluates reward models for long-form text generation.

Reward modelsLong-form generation
AAAI 2026Corresponding author
Paper & authors

Long-form RewardBench: Evaluating Reward Models for Long-form Generation

Hui Huang, Yancheng He, Wei Liu, Muyun Yang#, Jiaheng Liu#, Kehai Chen, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao

* Equal contribution; # Corresponding author.

Reward ModelingEvaluation method

Think-J

Develops generative judges that reason before evaluating model outputs.

LLM-as-a-judgeReasoning
AAAI 2026Corresponding author
Paper & authors

Think-J: Learning to Think for Generative LLM-as-a-Judge

Hui Huang, Yancheng He, Hongli Zhou, Rui Zhang, Wei Liu, Weixun Wang, Jiaheng Liu#, Wenbo Su

* Equal contribution; # Corresponding author.

HappyWorld-Bench

Evaluates generated worlds for state consistency and responsiveness across video, spatial, and embodied tracks.

World modelsState consistency
arXiv preprint, 2026
Paper & authors

HappyWorld-Bench

Zhiqi Bai, Junai Cai, Yixin Chen, Jingrun Du, Tao Feng, Wei Gong, Siyuan Huang, Xiao Lin, Jiaheng Liu, Jun Luo, Yongzhe Lyu, Liya Ma, Zenan Meng, Lin Qu, Wenbo Su, Jiaming Wang, Qinghe Wang, Shaofei Wang, Yanghai Wang, Zequn Wang, Ziming Wang, Hu Wei, Jiangtao Wu, Ruiqi Wu, Jiaxin Xie, Yuchi Xu, Ze Xu, Chengting Yu, Liangyu Yuan, Gang Zeng, Yawen Zeng, Xingyao Zhang, Zizheng Zhang, Bo Zheng, Jiancheng Zhu, Song-Chun Zhu

* Equal contribution; # Corresponding author.

GameLogicBench

Tests runtime gameplay logic with reproducible assertions at each simulation tick.

Game developmentExecutable checks
arXiv preprint, 2026Corresponding author
Paper & authors

GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions

Xinyu Che, Yunfei Ge, Shihao Li, Yanchen Liu, Hang Yan, Xinping Lei, Yanghai Wang, Zixuan Dong, Yifan Yao, Qianqian Xie, Letian Zhu, Jiaheng Liu#

* Equal contribution; # Corresponding author.

xDailyBench

Evaluates professional consultation on real-life problems and implicit user needs.

Professional knowledgeUser intent
arXiv preprint, 2026
Paper & authors

xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems

Yongchang Peng, Qingshui Gu, Liya Zhu, Ge Zhang#, Duo Wang, Haodong Wang, Jingzhe Ding, Tianhao Yu, Letian Gao, Yongjie Zhong, Chaoxin Li, Zixin Su, Jinchao Tao, Xingyu Ma, Xin'ao Guo, Feng Tian, Shiyuan Dong, Xiaoyan He, Sen Liu, Xin Chen, Jiajun Li, Zejia Zhang, Xi Lin, Wen Zhang, Yi Zhu, Duju Zeng, Xiang Gao, Yunyang Wang, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan#, Xiaolong Chang#, Wenhao Huang#

* Equal contribution; # Corresponding author.

HarnessDev

Tests whether models can create and evolve their own agent harnesses.

Self-improvementAgent harnesses
arXiv preprint, 2026
Paper & authors

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

Yuhao Wu#, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan#, Wenhao Huang#, Ge Zhang#, Wenxuan Zhang

* Equal contribution; # Corresponding author.

ASPIRE

Evaluates whether models can improve themselves starting from vague goals.

Self-improvementGoal formulation
arXiv preprint, 2026
Paper & authors

Aspire: Can Models Self-Evolve from Vague Goals?

Yuhao Wu#, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang#, Shen Yan#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

S³Gym

Studies whether self-testing and self-judging translate into self-improvement.

Self-testingSelf-improvement
arXiv preprint, 2026
Paper & authors

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang#, Zhoujun Li#, Shen Yan#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Generation & World ModelsCompanion dataset

MechBench-36

Provides a companion evaluation set for multi-part procedural 3D modeling.

Procedural 3DControllability
arXiv preprint, 2026Corresponding author
Paper & authors

Procedura: Agentic 3D Modeling with Procedural Control

Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao, Jiaheng Liu#, Yao Yao#

* Equal contribution; # Corresponding author.

PAW-Bench

Evaluates academic paper-writing tasks associated with multi-turn generation research.

Academic writingLong-form generation
arXiv preprint, 2026
Paper & authors

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

Qiankai Xu#, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang#

* Equal contribution; # Corresponding author.

StartupBench

Evaluates general-purpose agents on market-validated, end-to-end workflows.

CoworkEnd-to-end workflows
arXiv preprint, 2026
Paper & authors

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang#, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan#, Xiaolong Chang#, Wenhao Huang#

* Equal contribution; # Corresponding author.

LoopsBench

Evaluates the execution loops used by coding agents in long-horizon software development.

Coding agentsLong horizon
arXiv preprint, 2026
Paper & authors

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao#, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

* Equal contribution; # Corresponding author.

AVE-Compass

Evaluates instruction-driven audio-video editing abilities.

Audio-video editingInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

P3D-Bench

Tests parametric 3D generation and structural reasoning in multimodal models.

3D generationStructural reasoning
arXiv preprint, 2026
Paper & authors

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao#

* Equal contribution; # Corresponding author.

Workflow-GYM

Evaluates long-horizon computer-use tasks in real professional software environments.

Computer useLong horizon
arXiv preprint, 2026
Paper & authors

Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields

Liya Zhu, Jingzhe Ding, Jian Zhang, Jianbo Xue, Shihao Liang, Ge Zhang#, Yi Zhu, Duju Zeng, Xiang Gao, Qingshui Gu, Mailun Gao, Huimin Che, Yan Zhao, Peiheng Zhou, Haojun Wang, Chaobo Xian, Lili Le, Chi Wu, Yiwei Liu, Shengda Long, Jiale Yang, Fangzhi Xu, Sijin Wu, Haodong Duan, Chao He, Zhaojian Li, Minchao Wang, Huan Zhou, Jiani Hou, Chuqian Yu, Weiran Shi, Hongwan Gao, Jiamin Chen, Guanhong Chen, Tingqin Luo, Kaiyuan Zhang, Zhixin Yao, Qing Hua, Yuhao Jiang, Jin Chen, Pu Chen, Zhenyu Hu, Xingyu Li, Zhengxuan Jiang, Meng Cao, Tianfeng Long, Haozhe Wang, Mingzhang Wang, Yichen Zhang, Yiming Dai, Chenchen Zhang, Jiaying Wang, Xinying Liu, Xingzu Liu, Lingling Zhang, Xinjie Chen, Yujia Qin, Wangchunshu Zhou, Zhiyong Wu, Yang Liu, Jiaheng Liu, Lei Zhang, Shen Yan, Wenhao Huang#, Zaiyuan Wang#, Xiaolong Chang#

* Equal contribution; # Corresponding author.

OmniCap-IF

Tests content and format instruction following in omni-video captioning.

Omni-modalInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

CoVEBench

Tests video editing under complex, compositional instructions.

Video editingCompositionality
arXiv preprint, 2026Corresponding author
Paper & authors

CoVEBench: Can Video Editing Models Handle Complex Instructions?

Jiangtao Wu, Jiaming Wang, Yiwen He, Yuanxing Zhang, Shihao Li, Dunyuan Liu, Xuedong Zhao, Jialu Chen, Zekun Moore Wang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

KINA

Evaluates academic knowledge across disciplines.

Academic knowledgeMultidisciplinary
arXiv preprint, 2026
Paper & authors

Knowledge Index of Noah's Ark

Sheng Jin, Minghao Liu#, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan#, Ge Zhang#

* Equal contribution; # Corresponding author.

TELBench

Localizes errors within the trajectories of deep-research agents.

Deep researchFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

CodeTraceBench

Diagnoses coding-agent failures through traceable execution states and trajectories.

Agent trajectoriesFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors

CodeTracer: Towards Traceable Agent States

Han Li, Yifan Yao, Letian Zhu, Rili Feng, Hongyi Ye, Jiaming Wang, Yancheng He, Pengyu Zou, Lehan Zhang, Xinping Lei, Haoyang Huang, Ken Deng, Ming Sun, Zhaoxiang Zhang, He Ye, Jiaheng Liu#

* Equal contribution; # Corresponding author.

EcoGym

Evaluates long-horizon planning and execution in interactive economic environments.

PlanningInteractive environments
arXiv preprint, 2026
Paper & authors

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu#, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou#

* Equal contribution; # Corresponding author.

MVU-Eval

Tests understanding and reasoning across multiple videos.

Multi-videoReasoning
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

Tianhao Peng, Haochen Wang, Yuanxing Zhang, Noah Wang, Zili Wang, Ge Zhang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Wenhao Huang, Zhao-Xiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

KORGym

Provides dynamic game environments for evaluating language-model reasoning.

GamesInteractive reasoning
NeurIPS 2025
Paper & authors

KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation

Jiajun Shi, Jian Yang#, Jiaheng Liu, Xingyuan Bu, Jiangjie Chen, Junting Zhou, Kaijing Ma, Zhoufutu Wen, Bingli Wang, Yancheng He, Liang Song, Hualei Zhu, Shilong Li, Xingjian Wang, Wei Zhang, Ruibin Yuan, Yifan Yao, Wenjun Yang, Yunli Wang, Siyuan Fang, Siyu Yuan, Qianyu He, Robert Tang, Yingshui Tan, Wangchunshu Zhou, Zhao-Xiang Zhang, Zhoujun Li, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

SuperGPQA

Evaluates knowledge and reasoning across 285 graduate-level disciplines.

Academic knowledgeMultidisciplinary
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors

SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines

Xeron Du, Yifan Yao, Kaijing Ma, Bingli Wang, Tianyu Zheng, Minghao Liu, Yiming Liang, Xiaolong Jin, Zhenlin Wei, Chujie Zheng, Kaixin Deng, Shuyue Guo, Shian Jia, Sichao Jiang, Yiyan Liao, Rui Li, Qinrui Li, Sirun Li, Yizhi Li, Yunwen Li, Dehua Ma, Yuansheng Ni, Haoran Que, Qiyao Wang, Zhoufutu Wen, Siwei Wu, Tianshun Xing, 明 许, Zhenzhu Yang, Noah Wang, Junting Zhou, Yuelin Bai, Xingyuan Bu, Chenglin Cai, Liang Chen, Yifan Chen, Cheng Chengtuo, Tianhao Cheng, Keyi Ding, Siming Huang, Huang Yun, Yaoru Li, Yizhe Li, Zhaoqun Li, Tianhao Liang, Chengdong Lin, Hongquan Lin, Yinghao Ma, Zhongyuan Peng, Zifan Peng, Qige Qi, Shi Qiu, Xingwei Qu, Shanghaoran Quan, Yizhou Tan, Zili Wang, Hao Wang, Yiya Wang, Yubo Wang, Jiajun Xu, Kexin Yang, Ruibin Yuan, Yuanhao Yue, Tianyang Zhan, Chun Zhang, Jinyang Zhang, Xiyue Zhang, Owen Zhang, Yue Zhang, Yongchi Zhao, Xiangyu Zheng, Yang Gao, Zhoujun Li, Dayiheng Liu, Qian Liu, Tianyu Liu, Shiwen Ni, Junran Peng, Yujia Qin, Wenbo Su, Guoyin Wang, Shi Wang, Jian Yang, Min Yang, Meng Cao, Xiang Yue, Zhao-Xiang Zhang, Wangchunshu Zhou, Jiaheng Liu#, Qunshu Lin#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

OmniBench

Evaluates joint understanding of text, images, and audio.

Omni-modalCross-modal reasoning
NeurIPS 2025 (Datasets and Benchmarks)
Paper & authors

OmniBench: Towards The Future of Universal Omni-Language Models

Yizhi Li, Yinghao Ma, Ge Zhang#, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin#

* Equal contribution; # Corresponding author.

Safety & FactualityCompanion dataset

FigStep-benign

Evaluates over-refusal on benign multimodal requests constructed in the DREAM study.

Over-refusalMultimodal safety
NAACL 2025
Paper & authors

DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models

Jianyu Liu, Hangyu Guo, Ranjie Duan, Xingyuan Bu#, Yancheng He, Shilong Li, Hui Huang, Jiaheng Liu, Yucheng Wang, Chenchen Jing, Xingwei Qu, Xiao Zhang, Pei Wang, Yanan Wu, Jihao Gu, Yangguang Li, Jianke Zhu

* Equal contribution; # Corresponding author.

DeltaBench

Tests error detection in long chains of reasoning.

Reasoning critiqueError detection
ACL 2025Corresponding author
Paper & authors

Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?

Yancheng He, Shilong Li, Jiaheng Liu#, Weixun Wang, Xingyuan Bu, Ge Zhang, Z.Y. Peng, Zhaoxiang Zhang, Zhicheng Zheng, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

VidCapBench

Evaluates video captions used to support controllable text-to-video generation.

Video captioningControllability
Findings of ACL 2025
Paper & authors

VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation

Xinlong Chen, Yuanxing Zhang, Chongling Rao, Yushuo Guan, Jiaheng Liu, Fuzheng Zhang, Chengru Song, Qiang Liu#, Di Zhang, Tieniu Tan

* Equal contribution; # Corresponding author.

ChineseSimpleVQA

Evaluates factual question answering grounded in images and Chinese knowledge.

Visual factualityChinese
Findings of ACL 2025
Paper & authors

See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models

Jihao Gu, Yingyao Wang, Pi Bu, Chen Wang, Ziming Wang, Tengtao Song, Donglai Wei, Jiale Yuan, Yingxiu Zhao, Yancheng He, Shilong Li, Jiaheng Liu, Meng Cao, Jun Song#, Yingshui Tan, Xiang Li, Wenbo Su, Xiaoyong Zhu, Bo Zheng

* Equal contribution; # Corresponding author.

Chinese SafetyQA

Tests the factual accuracy of safety-related knowledge.

Safety knowledgeFactuality
ACL 2025
Paper & authors

Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models

Yingshui Tan#, Boren Zheng, Baihui Zheng, Kerui Cao, Huiyun Jing, Jincheng Wei, Jiaheng Liu, Yancheng He, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

* Equal contribution; # Corresponding author.

Chinese SimpleQA

Evaluates short-form factual question answering in Chinese.

FactualityChinese
ACL 2025Corresponding author
Paper & authors

Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models

Yancheng He, Shilong Li, Jiaheng Liu#, Yingshui Tan, Weixun Wang, Hui Huang, Xingyuan Bu, Hangyu Guo, Chengwei Hu, Boren Zheng, Zhuoran Lin, Dekai Sun, Zhicheng Zheng, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

M²RC-EVAL

Evaluates multilingual repository-level code completion using cross-file context.

Code completionMultilingual
ACL 2025Corresponding author
Paper & authors

M2RC-EVAL: Massively Multilingual Repository-level Code Completion Evaluation

Jiaheng Liu#, Ken Deng, Congnan Liu, Jian Yang, Shukai Liu, He Zhu, Peng Zhao, Linzheng Chai, Yanan Wu, Jin Ke, Ge Zhang, Zekun Moore Wang, Guoan Zhang, Yingshui Tan, Bangyu Xiang, Zhaoxiang Zhang, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

CII-Bench

Tests understanding of implicit meanings in images within Chinese cultural contexts.

Cultural understandingVisual reasoning
ACL 2025
Paper & authors

Can MLLMs Understand the Deep Implication Behind Chinese Images?

Chenhao Zhang, Xi Feng, Yuelin Bai, Xeron Du, Jinchang Hou, Kaixin Deng, Guangzeng Han, Qinrui Li, Bingli Wang, Jiaheng Liu, Xingwei Qu, Yifei Zhang, Qixuan Zhao, Yiming Liang, Ziqiang Liu, Feiteng Fang, Min Yang, Wenhao Huang, Chenghua Lin, Ge Zhang#, Shiwen Ni#

* Equal contribution; # Corresponding author.

LIME / MOLIME

Studies compact multimodal evaluation across multiple tasks.

Multimodal evaluationEfficiency
Findings of ACL 2025
Paper & authors

LIME: Less Is More for MLLM Evaluation

King Zhu, Qianbo Zang, Shian Jia, Siwei Wu, Feiteng Fang, Yizhi Li, Shuyue Guo, Tianyu Zheng, Jiawei Guo, Bo Li, Haoning Wu, Xingwei Qu, Jian Yang, Ruibo Liu, Xiang Yue, Jiaheng Liu, Chenghua Lin, Hamid Alinejad-Rokny, Min Yang, Shiwen Ni#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

MTU-Bench

Tests tool use at multiple granularities, including multi-turn and multi-tool interactions.

Tool useMulti-turn
ICLR 2025Corresponding author
Paper & authors

MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models

Pei Wang, Yanan Wu, Zekun Wang, Jiaheng Liu#, Xiaoshuai Song, Z.Y. Peng, Ken Deng, Chenchen Zhang, Junran Peng, Ge Zhang, Hangyu Guo, Zhaoxiang Zhang, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

KOR-Bench

Tests rule-based reasoning designed to be orthogonal to prior knowledge.

LogicRule following
ICLR 2025
Paper & authors

KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks

Kaijing Ma, Xeron Du, Yunran Wang, Haoran Zhang, Zhoufutu Wen, Xingwei Qu, Jian Yang, Jiaheng Liu, Minghao Liu, Xiang Yue, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

McEval

Tests code understanding, completion, and generation across programming languages.

Code generationMultilingual
ICLR 2025
Paper & authors

McEval: Massively Multilingual Code Evaluation

Linzheng Chai, Shukai Liu, Jian Yang#, Yuwei Yin, Ke Jin, Jiaheng Liu, Tao Sun, Ge Zhang, Changyu Ren, Hongcheng Guo, Zekun Wang, Boyang Wang, Xianjie Wu, Bing Wang, Tongliang Li, Liqun Yang, Sufeng Duan, Zhoujun Li

* Equal contribution; # Corresponding author.

TableBench

Tests complex question answering and reasoning over tables.

TablesReasoning
AAAI 2025
Paper & authors

TableBench: A Comprehensive and Complex Benchmark for Table Question Answering

Xianjie Wu, Jian Yang#, Linzheng Chai, Ge Zhang, Jiaheng Liu, Xinrun Du, Di Liang, Daixin Shu, Xianfu Cheng, Tianzhen Sun, Guanglin Niu, Tongliang Li, Zhoujun Li#

* Equal contribution; # Corresponding author.

SimpleVQA

Evaluates factual question answering with multimodal inputs.

Visual factualityQuestion answering
ICCV 2025
Paper & authors

SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models

Xianfu Cheng, Wei Zhang, Shiwei Zhang, Jian Yang#, Xiangyuan Guan, Xianjie Wu, Xiang Li#, Ge Zhang, Jiaheng Liu, Yuying Mai, Yutao Zeng, Zhoufutu Wen, Ke Jin, Baorui Wang, Weixiao Zhou, Yunhong Lu, Hangyuan Ji, Tongliang Li, Wenhao Huang, Zhoujun Li

* Equal contribution; # Corresponding author.

PhysGame

Tests recognition of physical commonsense violations in gameplay videos.

Physical reasoningVideo
CVPR 2025 · CV2 Workshop
Paper & authors

PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos

Meng Cao, Haoran Tang, Haoze Zhao, Hangyu Guo, Jiaheng Liu, Ge Zhang, Ruyang Liu, Qiang Sun#, Ian Reid, Xiaodan Liang

* Equal contribution; # Corresponding author.

Encyclo-K

Tests understanding of dynamically composed knowledge statements.

KnowledgeCompositionality
arXiv preprint, 2025
Paper & authors

Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements

Yiming Liang, Yizhi Li, Yantao Du#, Ge Zhang, Jiayi Zhou, Yuchen Wu, Yinzhu Piao, Denghui Cao, Tong Sun, Ziniu Li, Li Du, Bo Lei, Jiaheng Liu, Chenghua Lin, Zhaoxiang Zhang, Wenhao Huang#, Jiajun Zhang#

* Equal contribution; # Corresponding author.

ViDiC-1K

Evaluates descriptions of similarities and differences between paired videos.

Video comparisonCaptioning
arXiv preprint, 2025Corresponding author
Paper & authors

ViDiC: Video Difference Captioning

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang#, Jiaheng Liu#

* Equal contribution; # Corresponding author.

FINDER

Evaluates the usefulness and overall quality of deep-research reports.

Deep researchReport quality
arXiv preprint, 2025Corresponding author
Paper & authors

How Far Are We from Genuinely Useful Deep Research Agents?

Dingling Zhang, He Zhu, Jincheng Ren, Kangqi Song, Xinran Zhou, Boyu Feng, Shudong Liu, Jiabin Luo, Weihao Xie, Zhaohui Wang, Tianrui Qin, King Zhu, Yuqing Wang, Qianben Chen, Yuchen Eleanor Jiang, Wei Wang, Jiaheng Liu#, Wangchunshu Zhou#

* Equal contribution; # Corresponding author.

IFEvalCode

Evaluates whether generated code satisfies both functional requirements and explicit instructions.

Instruction followingCode generation
arXiv preprint, 2025
Paper & authors

IFEvalCode: Controlled Code Generation

Jian Yang, Wei Zhang#, Shukai Liu, Linzheng Chai, Yingshui Tan, Jiaheng Liu, Ge Zhang, Wangchunshu Zhou, Guanglin Niu#, Zhoujun Li#, Binyuan Hui, Junyang Lin

* Equal contribution; # Corresponding author.

BSA Bench(Beyond Safe Answers)

Tests whether reasoning models recognize risk beyond producing superficially safe answers.

Risk awarenessSafety reasoning
arXiv preprint, 2025
Paper & authors

Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models

Baihui Zheng, Boren Zheng, Kerui Cao, Yingshui Tan#, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang

* Equal contribution; # Corresponding author.

CodeCriticBench

Measures models' ability to critique code and provide useful feedback.

Code critiqueFeedback
arXiv preprint, 2025Corresponding author
Paper & authors

CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models

Alexander Zhang, Marcus Dong, Jiaheng Liu#, Wei Zhang, Yejie Wang, Jian Yang, Ge Zhang, Tianyu Liu, Zhongyuan Peng, Yingshui Tan, Yuanxing Zhang, Zhexu Wang, Weixun Wang, Yancheng He, Ken Deng, Wangchunshu Zhou, Wenhao Huang, Zhaoxiang Zhang

* Equal contribution; # Corresponding author.

II-Bench

Evaluates recognition of implications and deeper meanings in images.

Visual reasoningImplicit meaning
NeurIPS 2024 (Datasets and Benchmarks)
Paper & authors

II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models

Ziqiang Liu, Feiteng Fang, Xi Feng, Xinrun Du, Chenhao Zhang, Zekun Wang, Yuelin Bai, Qixuan Zhao, Liyang Fan, Chengguang Gan, Hongquan Lin, Jiaming Li, Yuansheng Ni, Haihong Wu, Yaswanth Narsupalli, Zhigang Zheng, Chengming Li, Xiping Hu, Ruifeng Xu, Xiaojun Chen, Min Yang, Jiaheng Liu, Ruibo Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#

* Equal contribution; # Corresponding author.

RoleAgentBench

Evaluates role-playing agents built from scripts through interactive tasks.

Role playingMulti-turn
NeurIPS 2024 (Datasets and Benchmarks)
Paper & authors

RoleAgent: Building, Interacting, and Benchmarking High-quality Role-Playing Agents from Scripts

Jiaheng Liu*, Zehao Ni*, Haoran Que*, Tao Sun, Zekun Wang, Jian Yang, Jiakai Wang, Hongcheng Guo, Zhongyuan Peng, Ge Zhang, Jiayi Tian, Xingyuan Bu, Ke Xu, Wenge Rong, Junran Peng#, Zhaoxiang Zhang

* Equal contribution; # Corresponding author.

MT-Bench-101

Provides fine-grained evaluation of multi-turn dialogue abilities.

DialogueMulti-turn
ACL 2024
Paper & authors

MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues

Ge Bai, Jie Liu, Xingyuan Bu#, Yancheng He, Jiaheng Liu, Zhanhui Zhou, Zhuoran Lin, Wenbo Su, Tiezheng Ge, Bo Zheng, Wanli Ouyang

* Equal contribution; # Corresponding author.

ConceptMath

Evaluates mathematical reasoning by concept in both Chinese and English.

MathematicsBilingual
Findings of ACL 2024Corresponding author
Paper & authors

ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models

Yanan Wu*, Jie Liu*, Xingyuan Bu, Jiaheng Liu#, Zhanhui Zhou, Yuanxing Zhang, Chenchen Zhang, Zhiqi Bai, Haibin Chen, Tiezheng Ge, Wanli Ouyang, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

RoleBench

Evaluates role-playing abilities and consistency in language models.

Role playingDialogue
Findings of ACL 2024Corresponding author
Paper & authors

RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models

Noah Wang, Z.Y. Peng, Haoran Que*, Jiaheng Liu#, Wangchunshu Zhou, Yuhan Wu, Hongcheng Guo, Ruitong Gan, Zehao Ni, Jian Yang, Man Zhang, Zhaoxiang Zhang#, Wanli Ouyang, Ke Xu, Wenhao Huang, Jie Fu, Junran Peng

* Equal contribution; # Corresponding author.

Owl-Bench

Evaluates knowledge and tasks in IT operations within the OWL study.

IT operationsDomain knowledge
ICLR 2024Corresponding author
Paper & authors

OWL: A Large Language Model for IT Operations

Hongcheng Guo, Jian Yang#, Jiaheng Liu#, Liqun Yang, Linzheng Chai, Jiaqi Bai, Junran Peng, Xiaorong Hu, Chao Chen, Dongfeng Zhang, xu Shi, Tieqiao Zheng, Liangfan Zheng, Bo Zhang, Ke Xu, Zhoujun Li

* Equal contribution; # Corresponding author.

PTSBench

Benchmarks post-training sparsity across algorithms and models.

Model compressionSparsity
ACM MM 2024
Paper & authors

PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models

Zining Wnag, Jinyang Guo#, Ruihao Gong, Yang Yong, Aishan Liu, Yushi Huang, Jiaheng Liu, Xianglong Liu

* Equal contribution; # Corresponding author.

Multimodal UnderstandingCompanion dataset

MIO

Provides a held-out material-segmentation evaluation set alongside the MaterialSeg3D method.

MaterialsSegmentation
ACM MM 2024
Paper & authors

MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets

Zeyu Li, Ruitong Gan, Chuanchen Luo, Yuxi Wang, Jiaheng Liu, Ziwei Zhu, Man Zhang#, Qing Li, Xucheng Yin, Zhaoxiang Zhang#, Junran Peng

* Equal contribution; # Corresponding author.

FullStack Bench

Evaluates programming ability across full-stack development scenarios.

Full-stack codingMultilingual
arXiv preprint, 2024
Paper & authors

FullStack Bench: Evaluating LLMs as Full Stack Coders

Bytedance-Seed-Foundation-Code-Team, Yao Cheng, Jianfeng Chen, Jie Chen, Li Chen, Liyu Chen, Wentao Chen, Zhengyu Chen, Shijie Geng, Aoyan Li, Bo Li, Bowen Li, Linyi Li, Boyi Liu, Jiaheng Liu, Kaibo Liu, Qi Liu, Shukai Liu, Siyao Liu, Tianyi Liu, Tingkai Liu, Yongfei Liu, Rui Long, Jing Mai, Guanghan Ning, Z. Y. Peng, Kai Shen, Jiahao Su, Jing Su, Tao Sun, Yifan Sun, Yunzhe Tao, Guoyin Wang, Siwei Wang, Xuwu Wang, Yite Wang, Zihan Wang, Jinxiang Xia, Liang Xiang, Xia Xiao, Yongsheng Xiao, Chenguang Xi, Shulin Xin, Jingjing Xu, Shikun Xu, Hongxia Yang, Jack Yang, Yingxiang Yang, Jianbo Yuan, Jun Zhang, Yufeng Zhang, Yuyu Zhang, Shen Zheng, He Zhu, Ming Zhu

* Equal contribution; # Corresponding author.

ING-VP

Tests spatial planning and interaction in vision-based games.

Visual agentsSpatial planning
arXiv preprint, 2024Corresponding author
Paper & authors

ING-VP: MLLMs cannot Play Easy Vision-based Games Yet

Haoran Zhang, Hangyu Guo, Shuyue Guo, Meng Cao, Wenhao Huang, Jiaheng Liu#, Ge Zhang#

* Equal contribution; # Corresponding author.

HelloBench

Evaluates the ability to generate long, coherent text.

Long-form generationWriting
arXiv preprint, 2024
Paper & authors

HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models

Haoran Que, Feiyu Duan, Liqun He, Yutao Mou, Wangchunshu Zhou, Jiaheng Liu, Wenge Rong, Zekun Moore Wang, Jian Yang, Ge Zhang, Junran Peng, Zhaoxiang Zhang, Songyang Zhang, Kai Chen

* Equal contribution; # Corresponding author.

LongIns

Tests instruction following and multitask reasoning over long contexts.

Long contextInstruction following
arXiv preprint, 2024
Paper & authors

LongIns: A Challenging Long-context Instruction-based Exam for LLMs

Shawn Gavin, Tuney Zheng, Jiaheng Liu, Quehry Que, Noah Wang, Jian Yang, Chenchen Zhang, Wenhao Huang, Ge Zhang#

* Equal contribution; # Corresponding author.

GIEBench

Evaluates empathy through the lens of group identity.

EmpathyHuman alignment
arXiv preprint, 2024
Paper & authors

GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models

Leyan Wang, Yonggang Jin, Tianhao Shen, Tianyu Zheng, Xinrun Du, Chenchen Zhang, Wenhao Huang, Jiaheng Liu, Shi Wang, Ge Zhang#, Liuyu Xiang#, Zhaofeng He

* Equal contribution; # Corresponding author.

R²C²-Bench

Evaluates code completion in real-world repositories.

RepositoriesCode completion
arXiv preprint, 2024Corresponding author
Paper & authors

R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models

Ken Deng, Jiaheng Liu#, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng

* Equal contribution; # Corresponding author.

LD-T3D

Evaluates retrieval of 3D models from textual descriptions.

3D retrievalText grounding
arXiv preprint, 2024Corresponding author
Paper & authors

LD-T3D: A Large-scale and Diverse Benchmark for Text-based 3D Model Retrieval

Ze Yuan, Jiaheng Liu#, Xuebo Liu, Zhipeng Yu, Ke Xu, Jianhao Li, Ding Liang

* Equal contribution; # Corresponding author.

M2C

Evaluates multimodal manga text completion in two languages.

Multimodal completionBilingual
Findings of EMNLP 2023
Paper & authors

M2C: Towards Automatic Multimodal Manga Complement

Hongcheng Guo*, Boyang Wang*, Jiaqi Bai, Jiaheng Liu, Jian Yang, Zhoujun Li#

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.