Evaluates long-form omni-modal hallucination using counterfactual and modality-perturbation analysis.
HallucinationAudio-visual
EMNLP 2026 · AcceptedCorresponding author
Paper & authors
OmniHalluc-L: Counterfactual Benchmarking and Modality-Perturbation Calibration for Long-Form Omni Hallucination
Zixuan Dong, Jiafu Tang, Zhide Lei, Zhe Cao, Zijie Zhang, Yanghai Wang, Shihao Li, Xiaodong Wang, Baoyun Peng, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates multimodal web browsing and information-seeking agents.
Web browsingMultimodal
EMNLP 2026 · Accepted
Paper & authors
MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents
Shilong Li, Xingyuan Bu#, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen#
* Equal contribution; # Corresponding author.
Evaluates research reports that interleave text and visual evidence.
Deep researchMultimodal reports
EMNLP 2026 · AcceptedCorresponding author
Paper & authors
TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation
Xinkai Ma, Zhiqi Bai, Dingling Zhang, Pei Liu, Yishuo Yuan, He Zhu, Jiakai Wang, Qianqian Xie, Yifan Zhao, Xinlong Yang, Hao Cong, Zhiheng Yao, Fengxia Xie, Zihao Xu, Haoran Xu, Zhaohui Wang, Minghao Liu, Shirong Lin, Yingshui Tan, Yuchi Xu, Wenbo Su, Zhaoxiang Zhang, Bo Zheng, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates multimodal agents on web development from visual inputs, instructions, and interaction.
Web developmentMultimodal
EMNLP 2026 · AcceptedCorresponding author
Paper & authors
WebCompass: Evaluating Multimodal Code Agents in Web Development from Vision, Instruction, and Interaction to Implementation
Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates deep-research agents in realistic, reproducible settings with multiple files and modalities.
Deep researchReproducibility
EMNLP 2026 · AcceptedCorresponding author
Paper & authors
DR³-Eval: Towards Realistic and Reproducible Deep Research Evaluation
Qianqian Xie, He Zhu, Xueming Han, Qingheng Xiong, Tiantian Xia, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng#, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates the visual quality and interactive behavior of generated code artifacts.
Visual qualityInteraction
EMNLP 2026 · Accepted
Paper & authors
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
Chenchen Zhang, Yuhang Li, Jiaheng Liu, Can Xu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruilin Lv, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou#, Chayse Zhou#, Fengzong Lian#
* Equal contribution; # Corresponding author.
Evaluates completion of everyday online tasks by AI agents.
Online tasksTask completion
Findings of EMNLP 2026 · Accepted
Paper & authors
ClawBench: Can AI Agents Complete Everyday Online Tasks?
Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du, Junwen Miao, Xuan Lu, Zhuofeng Li, Xingwei Qu, Zhengkang Guo, Yuanzhe Shen, Dingjie Song, Han Zhou, Tuney Zheng, Xian Wu, Hao Yu, Songcheng Cai, Yi Lu, Yunzhuo Hao, Minyi Lei, Liang Chen, Kai Zou, Huifeng Yin, Wendong Xu, Dongfu Jiang, Ping Nie, Jiaheng Liu, Wenhu Chen, Kelsey R. Allen
* Equal contribution; # Corresponding author.
Tests whether agents can turn multimodal guides into reusable, evolving skills.
Skill learningMultimodal
Findings of EMNLP 2026 · AcceptedCorresponding author
Paper & authors
MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?
Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinghua Hao, Ming Sun, Han Li, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates multilingual and multicultural factual knowledge with natively sourced questions.
FactualityMultilingual
Findings of EMNLP 2026 · Accepted
Paper & authors
MSQA: A Natively Sourced Multilingual and Multicultural SimpleQA Benchmark
Yukai Huang, Xianru Chen, Mingxiang Chen, Xinping Lei, Fangbing Deng, Jin Chen, Jiaheng Liu, Ge Zhang, Wenhao Huang
* Equal contribution; # Corresponding author.
Evaluates reward models for assessing deep-research reports.
Reward modelsDeep research
Findings of EMNLP 2026 · Accepted
Paper & authors
DeepResearch RewardBench: Evaluating Reward Models for Deep Research Report
Shudong Liu, Yuting Zhong, Guanhua Chen, Xinyi Yang, Junnan Liu, Lidia S. Chao, Jiaheng Liu, Derek F. Wong
* Equal contribution; # Corresponding author.
Evaluates multimodal travel planning under tightly coupled constraints.
PlanningMultimodal
ICML 2026
Paper & authors
WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints
Zexuan Wang, Chenghao Yang, Yingqi Que, Zhenzhu Yang, Huaqing Yuan, Yiwen Wang, Zhengxuan Jiang, Shengjie Fang, Zhenhe Wu, Zhaohui Wang, Zhixin Yao, Jiashuo Liu, Jincheng Ren, Yuzhen Li, Yang Yang, Jiaheng Liu, Jian Yang, Zaiyuan Wang, Ge Zhang, Zhoufutu Wen#, Wenhao Huang
* Equal contribution; # Corresponding author.
Evaluates text-to-audio-video generation through a unified framework.
Audio-video generationText alignment
ICML 2026Corresponding author
Paper & authors
T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation
Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jiahao Wang, Jialu Chen, Miao Deng, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Tests long-horizon development of complete repositories from natural-language requirements.
Repository generationLong horizon
ICML 2026
Paper & authors
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang
* Equal contribution; # Corresponding author.
Evaluates agentic coding across diverse tasks in real software repositories.
Coding agentsRepositories
ICML 2026Corresponding author
Paper & authors
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
Jingxuan Xu, Ken Deng, Weihao Li, Songwei Yu, Huaixi Tang, Haoyang Huang, Zhiyi Lai, Zizheng Zhan, Yanan Wu, Chenchen Zhang, Kepeng Lei, Yifan Yao, Xinping Lei, Wenqiang Zhu, Zongxian Feng, Han Li, Junqi Xiong, Dailin Li, Zuchen Gao, Kun Wu, Wen Xiang, Ziqi Zhan, Yuanxing Zhang, Wuxuan Gong, Ziyuan Gao, Guanxiang Wang, Yirong Xue, Mengtong Li, Mengfei Xie, Xiaojiang Zhang, Jinghui Wang, Wenhao Zhuang, Zheng Lin, Huiming Wang, Zhaoxiang Zhang, Yuqun Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates multilingual programming from visual design diagrams and textual specifications.
Visual codingMultilingual
ICML 2026
Paper & authors
From Diagrams to Code: Multilingual Programming with Visual Design
Linzheng Chai, Jian Yang#, Shukai Liu, Wei Zhang, Liran Wang, Ke Jin, Tao Sun, Congnan Liu, Chenchen Zhang, Hualei Zhu, Jiaheng Liu, Xianjie Wu, Ge Zhang, Tianyu Liu, Zhoujun Li
* Equal contribution; # Corresponding author.
Evaluates multi-turn agentic table question answering in realistic settings.
TablesTool use
ICML 2026
Paper & authors
How Far Can LLM Agents Reason with Tables? Benchmarking Multi-Turn Agentic Table Question Answering in the Wild
Jingwang Huang, Jie Zhang, Haoyang Zeng, Changzai Pan, Xianjie Wu, Guanting Dong, Jiaheng Liu, Wei Zhang, Mingyu Zheng, Chunxiao Liu, Kaiwen Wei, Jiang Zhong, Jian Yang
* Equal contribution; # Corresponding author.
Evaluates chain-of-thought efficiency and redundancy using a graph-based framework.
LLM-as-a-judgeReasoning efficiency
Findings of ACL 2026Corresponding author
Paper & authors
CoTJudger: A Graph-Driven Framework for Automatic Evaluation of Chain-of-Thought Efficiency and Redundancy in LRMs
Siyi Li, Jiajun Shi, Shiwen Ni#, Ge Zhang#, Shuaimin Li, Shijian Wang, Zhoufutu Wen, Yizhi LI, Hamid Alinejad-Rokny, Jiaheng Liu#, Min Yang#, Wenhao Huang
* Equal contribution; # Corresponding author.
Evaluates automatic setup of executable environments for real software projects.
Environment setupCoding agents
Findings of ACL 2026
Paper & authors
Multi-Docker-Eval: A ‘Shovel of the Gold Rush’ Benchmark on Automatic Environment Building for Software Engineering
Kelin Fu#, Tianyu Liu#, Zeyu Shang, Yingwei MA, Jiaheng Liu, Jian Yang, Kaigui Bian#
* Equal contribution; # Corresponding author.
Evaluates video understanding through multi-turn dialogues.
Video understandingMulti-turn
Findings of ACL 2026Corresponding author
Paper & authors
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Moore Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates multilingual, multitask table question answering.
TablesMultilingual
Findings of ACL 2026
Paper & authors
M3TQA: Massively Multilingual Multitask Table Question Answering
Daixin Shu, Jian Yang#, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Guan Xiangyuan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang, Jiaheng Liu, Zhoujun Li
* Equal contribution; # Corresponding author.
Tests critics' judgments of semantic correctness in mathematical formalization.
Formal mathematicsCritique
ACL 2026Corresponding author
Paper & authors
CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization
Zhongyuan Peng, Yifan Yao, Kaijing Ma, Shuyue Guo, Yizhe Li, Yichi Zhang, Chenchen Zhang, Yifan Zhang, Zhouliang Yu, Luming Li, Minghao Liu, Yihang Xia, Jiawei Shen, Yuchen Wu, Yixin Cao, Zhaoxiang Zhang, Wenhao Huang, Jiaheng Liu#, Ge Zhang#
* Equal contribution; # Corresponding author.
Provides unified evaluation of multimodal safety and over-refusal.
Multimodal safetyOver-refusal
ACL 2026
Paper & authors
USB: A Comprehensive and Unified Safety Evaluation Benchmark for Multimodal Large Language Models
Baolin Zheng#, Guanlin Chen, Qingyang Teng, Hongqiong Zhong, Yingshui Tan, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Huiyun Jing, Jincheng Wei, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang
* Equal contribution; # Corresponding author.
Evaluates Chinese reward models alongside the COIG-P preference dataset.
Reward modelsChinese
Findings of EACL 2026
Paper & authors
COIG-P: A High-Quality and Large-Scale Chinese Preference Dataset for Alignment with Human Values
Siwei Wu, JinCheng Ren, Xeron Du, Shuyue Guo, Xingwei Qu, Yiming Liang, Jie Liu, Yunwen Li, Tyler Loakman, Tianyu Zheng, Boyu Feng, Huaqing Yuan, Zili Wang, Jiaheng Liu, Wenhao Huang, Chenglin Cai, Haoran Que, Jian Yang, Yuelin Bai, Zekun Moore Wang, Zhouliang Yu, Qunshu Lin, Ding Pan, Yuchen Eleanor Jiang, Tiannan Wang, Wangchunshu Zhou, Shenzhi Wang, Xingyuan Bu, Minghao Liu#, Guoyin Wang#, Ge Zhang#, Chenghua Lin#
* Equal contribution; # Corresponding author.
Measures code debugging across multiple programming languages.
DebuggingMultilingual
Findings of ACL 2026
Paper & authors
MdEval: Massively Multilingual Code Debugging
Shukai Liu, Linzheng Chai, Jian Yang#, Jiajun Shi, He Zhu, Liran Wang, Jin Ke, Wei Zhang, Hualei Zhu, Shuyue Guo, Tao Sun, Jiaheng Liu, Yunlong Duan, Yu Hao, Liqun Yang, Guanglin Niu, Ge Zhang, Zhoujun Li
* Equal contribution; # Corresponding author.
Tests relational association across multiple images and levels of granularity.
Multi-imageRelations
Findings of EACL 2026
Paper & authors
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
Siwei Wu, King Zhu, Yu Bai (白宇), Yiming Liang, Yizhi Li, Haoning Wu, Jiaheng Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang#, Wenhao Huang#, Chenghua Lin#
* Equal contribution; # Corresponding author.
Tests table question answering across reasoning demands and visual layout complexity.
TablesDocument understanding
WWW 2026
Paper & authors
MMTableBench: A Multi-level Multimodal Benchmark for Reasoning and Layout Complexity in Table QA
Xianjie Wu, Xiaohang Xu, Tingyu Jiang, Jian Yang, Di Liang, Xianfu Cheng, Zhenhe Wu, Linzheng Chai, Wei Zhang, Jiaheng Liu, Ge Zhang, Bob Simons, Tongliang Li, Zhoujun Li
* Equal contribution; # Corresponding author.
Tests whether video-captioning models follow user instructions.
Video captioningInstruction following
ICLR 2026Corresponding author
Paper & authors
IF-VidCap: Can Video Caption Models Follow Instructions?
Shihao Li, Yuanxing Zhang, Jiangtao Wu, Zhide Lei, Yiwen He, Runzhe Wen, Chenxi Liao, Chengkang Jiang, An Ping, Shuo Gao, Suhan Wang, Zhaozhou Bian, Zijun Zhou, Jingyi Xie, Jiayi Zhou, Jing Wang, Yifan Yao, Weihao Xie, Yingshui Tan, Yanghai Wang, Qianqian Xie, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Tests reasoning on problems drawn from academic research.
Scientific reasoningAcademic research
ICLR 2026
Paper & authors
ACADREASON: Exploring the Limits of Reasoning Models with Academic Research Problems
Xin Gui, JinCheng Ren, Qianben Chen, Zekun Wang, Yizhi Li, Xinpeng Liu, Wallis_Wenli Ren, Linyu Miao, Tianrui Qin, Ziqi Shu, He Zhu, Dingfeng Shi, Jiaheng Liu, Yuchen Jiang, Minghao Liu#, Ge Zhang#, Wangchunshu Zhou#
* Equal contribution; # Corresponding author.
Evaluates joint audio-visual understanding in omni-modal language models.
Audio-visualOmni-modal
ICLR 2026Corresponding author
Paper & authors
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao MA, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Tests whether models follow real instructions that conflict with learned training conventions.
Instruction followingRobustness
ICLR 2026Corresponding author
Paper & authors
Inverse IFEval: Can LLMs Unlearn Stubborn Training Conventions to Follow Real Instructions?
Qinyan Zhang*, Xinping Lei*, Ruijie Miao*, Yu Fu, Haojie Fan, Le Chang, Jiafan Hou, Dingling Zhang, Zhongfei Hou, Ziqiang Yang, Changxin Pu, Fei Hu, Jingkai Liu, Xinjie Chen, Jianpeng Jiao, Jiaheng Liu#, Tong Yang#, Zaiyuan Wang#, Ge Zhang#, Wenhao Huang
* Equal contribution; # Corresponding author.
Evaluates long-video understanding across multiple temporal scales.
Long videoTemporal reasoning
ICLR 2026
Paper & authors
ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
David Ma, Huaqing Yuan, Xingjian Wang, Qianbo ZANG, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#, Xiaojie Jin#
* Equal contribution; # Corresponding author.
Tests image-grounded video perception and reasoning.
Video understandingVisual grounding
ICLR 2026
Paper & authors
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Xiaojie Jin#
* Equal contribution; # Corresponding author.
Evaluates safety in multi-turn dialogues with diverse jailbreak attacks.
Jailbreak resistanceMulti-turn
ICLR 2026
Paper & authors
SafeDialBench: A Fine-Grained Safety Evaluation Benchmark for Large Language Models in Multi-Turn Dialogues with Diverse Jailbreak Attacks
Hongye Cao, Sijia Jing, Yanming Wang, Ziyue Peng, Zhixin Bai, Zhe Cao, Meng Fang, Fan Feng, Jiaheng Liu, Boyan Wang, Tianpei Yang, Jing Huo#, Yang Gao, Fanyu Meng#, Xi Yang, Chao Deng, Junlan Feng
* Equal contribution; # Corresponding author.
Evaluates reward models for long-form text generation.
Reward modelsLong-form generation
AAAI 2026Corresponding author
Paper & authors
Long-form RewardBench: Evaluating Reward Models for Long-form Generation
Hui Huang, Yancheng He, Wei Liu, Muyun Yang#, Jiaheng Liu#, Kehai Chen, Bing Xu, Conghui Zhu, Hailong Cao, Tiejun Zhao
* Equal contribution; # Corresponding author.
Develops generative judges that reason before evaluating model outputs.
LLM-as-a-judgeReasoning
AAAI 2026Corresponding author
Paper & authors
Think-J: Learning to Think for Generative LLM-as-a-Judge
Hui Huang, Yancheng He, Hongli Zhou, Rui Zhang, Wei Liu, Weixun Wang, Jiaheng Liu#, Wenbo Su
* Equal contribution; # Corresponding author.
Evaluates generated worlds for state consistency and responsiveness across video, spatial, and embodied tracks.
World modelsState consistency
arXiv preprint, 2026
Paper & authors
HappyWorld-Bench
Zhiqi Bai, Junai Cai, Yixin Chen, Jingrun Du, Tao Feng, Wei Gong, Siyuan Huang, Xiao Lin, Jiaheng Liu, Jun Luo, Yongzhe Lyu, Liya Ma, Zenan Meng, Lin Qu, Wenbo Su, Jiaming Wang, Qinghe Wang, Shaofei Wang, Yanghai Wang, Zequn Wang, Ziming Wang, Hu Wei, Jiangtao Wu, Ruiqi Wu, Jiaxin Xie, Yuchi Xu, Ze Xu, Chengting Yu, Liangyu Yuan, Gang Zeng, Yawen Zeng, Xingyao Zhang, Zizheng Zhang, Bo Zheng, Jiancheng Zhu, Song-Chun Zhu
* Equal contribution; # Corresponding author.
Tests runtime gameplay logic with reproducible assertions at each simulation tick.
Game developmentExecutable checks
arXiv preprint, 2026Corresponding author
Paper & authors
GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions
Xinyu Che, Yunfei Ge, Shihao Li, Yanchen Liu, Hang Yan, Xinping Lei, Yanghai Wang, Zixuan Dong, Yifan Yao, Qianqian Xie, Letian Zhu, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates professional consultation on real-life problems and implicit user needs.
Professional knowledgeUser intent
arXiv preprint, 2026
Paper & authors
xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems
Yongchang Peng, Qingshui Gu, Liya Zhu, Ge Zhang#, Duo Wang, Haodong Wang, Jingzhe Ding, Tianhao Yu, Letian Gao, Yongjie Zhong, Chaoxin Li, Zixin Su, Jinchao Tao, Xingyu Ma, Xin'ao Guo, Feng Tian, Shiyuan Dong, Xiaoyan He, Sen Liu, Xin Chen, Jiajun Li, Zejia Zhang, Xi Lin, Wen Zhang, Yi Zhu, Duju Zeng, Xiang Gao, Yunyang Wang, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan#, Xiaolong Chang#, Wenhao Huang#
* Equal contribution; # Corresponding author.
Tests whether models can create and evolve their own agent harnesses.
Self-improvementAgent harnesses
arXiv preprint, 2026
Paper & authors
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
Yuhao Wu#, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan#, Wenhao Huang#, Ge Zhang#, Wenxuan Zhang
* Equal contribution; # Corresponding author.
Evaluates whether models can improve themselves starting from vague goals.
Self-improvementGoal formulation
arXiv preprint, 2026
Paper & authors
Aspire: Can Models Self-Evolve from Vague Goals?
Yuhao Wu#, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang#, Shen Yan#, Wenhao Huang#, Ge Zhang#
* Equal contribution; # Corresponding author.
Studies whether self-testing and self-judging translate into self-improvement.
Self-testingSelf-improvement
arXiv preprint, 2026
Paper & authors
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang#, Zhoujun Li#, Shen Yan#, Wenhao Huang#, Ge Zhang#
* Equal contribution; # Corresponding author.
Provides a companion evaluation set for multi-part procedural 3D modeling.
Procedural 3DControllability
arXiv preprint, 2026Corresponding author
Paper & authors
Procedura: Agentic 3D Modeling with Procedural Control
Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao, Jiaheng Liu#, Yao Yao#
* Equal contribution; # Corresponding author.
Evaluates academic paper-writing tasks associated with multi-turn generation research.
Academic writingLong-form generation
arXiv preprint, 2026
Paper & authors
Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training
Qiankai Xu#, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang#
* Equal contribution; # Corresponding author.
Evaluates general-purpose agents on market-validated, end-to-end workflows.
CoworkEnd-to-end workflows
arXiv preprint, 2026
Paper & authors
StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang#, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan#, Xiaolong Chang#, Wenhao Huang#
* Equal contribution; # Corresponding author.
Evaluates the execution loops used by coding agents in long-horizon software development.
Coding agentsLong horizon
arXiv preprint, 2026
Paper & authors
LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation
Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao#, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang
* Equal contribution; # Corresponding author.
Evaluates instruction-driven audio-video editing abilities.
Audio-video editingInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors
AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities
Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Tests parametric 3D generation and structural reasoning in multimodal models.
3D generationStructural reasoning
arXiv preprint, 2026
Paper & authors
P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning
Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao#
* Equal contribution; # Corresponding author.
Evaluates long-horizon computer-use tasks in real professional software environments.
Computer useLong horizon
arXiv preprint, 2026
Paper & authors
Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields
Liya Zhu, Jingzhe Ding, Jian Zhang, Jianbo Xue, Shihao Liang, Ge Zhang#, Yi Zhu, Duju Zeng, Xiang Gao, Qingshui Gu, Mailun Gao, Huimin Che, Yan Zhao, Peiheng Zhou, Haojun Wang, Chaobo Xian, Lili Le, Chi Wu, Yiwei Liu, Shengda Long, Jiale Yang, Fangzhi Xu, Sijin Wu, Haodong Duan, Chao He, Zhaojian Li, Minchao Wang, Huan Zhou, Jiani Hou, Chuqian Yu, Weiran Shi, Hongwan Gao, Jiamin Chen, Guanhong Chen, Tingqin Luo, Kaiyuan Zhang, Zhixin Yao, Qing Hua, Yuhao Jiang, Jin Chen, Pu Chen, Zhenyu Hu, Xingyu Li, Zhengxuan Jiang, Meng Cao, Tianfeng Long, Haozhe Wang, Mingzhang Wang, Yichen Zhang, Yiming Dai, Chenchen Zhang, Jiaying Wang, Xinying Liu, Xingzu Liu, Lingling Zhang, Xinjie Chen, Yujia Qin, Wangchunshu Zhou, Zhiyong Wu, Yang Liu, Jiaheng Liu, Lei Zhang, Shen Yan, Wenhao Huang#, Zaiyuan Wang#, Xiaolong Chang#
* Equal contribution; # Corresponding author.
Tests content and format instruction following in omni-video captioning.
Omni-modalInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors
OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning
Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Tests video editing under complex, compositional instructions.
Video editingCompositionality
arXiv preprint, 2026Corresponding author
Paper & authors
CoVEBench: Can Video Editing Models Handle Complex Instructions?
Jiangtao Wu, Jiaming Wang, Yiwen He, Yuanxing Zhang, Shihao Li, Dunyuan Liu, Xuedong Zhao, Jialu Chen, Zekun Moore Wang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates academic knowledge across disciplines.
Academic knowledgeMultidisciplinary
arXiv preprint, 2026
Paper & authors
Knowledge Index of Noah's Ark
Sheng Jin, Minghao Liu#, Yunze Xiao, Zeqi Zhou, Heli Qi, Yifan Yao, Meishu Song, Kaijing Ma, Xuan Zhang, Sicong Jiang, Yizhe Li, Ningshan Ma, Jie Wei, Ziniu Li, Minglai Yang, Bangya Liu, Yiming Liang, Xiao Fang, Qingcheng Zeng, Jiarui Liu, Rui Yang, Shen Yan, Wenhao Huang, Jiaheng Liu, Zihan Wang, Weihao Xuan#, Ge Zhang#
* Equal contribution; # Corresponding author.
Localizes errors within the trajectories of deep-research agents.
Deep researchFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors
Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories
Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Diagnoses coding-agent failures through traceable execution states and trajectories.
Agent trajectoriesFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors
CodeTracer: Towards Traceable Agent States
Han Li, Yifan Yao, Letian Zhu, Rili Feng, Hongyi Ye, Jiaming Wang, Yancheng He, Pengyu Zou, Lehan Zhang, Xinping Lei, Haoyang Huang, Ken Deng, Ming Sun, Zhaoxiang Zhang, He Ye, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates long-horizon planning and execution in interactive economic environments.
PlanningInteractive environments
arXiv preprint, 2026
Paper & authors
EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies
Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu#, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou#
* Equal contribution; # Corresponding author.
Tests understanding and reasoning across multiple videos.
Multi-videoReasoning
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
Tianhao Peng, Haochen Wang, Yuanxing Zhang, Noah Wang, Zili Wang, Ge Zhang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Wenhao Huang, Zhao-Xiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Provides dynamic game environments for evaluating language-model reasoning.
GamesInteractive reasoning
NeurIPS 2025
Paper & authors
KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation
Jiajun Shi, Jian Yang#, Jiaheng Liu, Xingyuan Bu, Jiangjie Chen, Junting Zhou, Kaijing Ma, Zhoufutu Wen, Bingli Wang, Yancheng He, Liang Song, Hualei Zhu, Shilong Li, Xingjian Wang, Wei Zhang, Ruibin Yuan, Yifan Yao, Wenjun Yang, Yunli Wang, Siyuan Fang, Siyu Yuan, Qianyu He, Robert Tang, Yingshui Tan, Wangchunshu Zhou, Zhao-Xiang Zhang, Zhoujun Li, Wenhao Huang#, Ge Zhang#
* Equal contribution; # Corresponding author.
Evaluates knowledge and reasoning across 285 graduate-level disciplines.
Academic knowledgeMultidisciplinary
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors
SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines
Xeron Du, Yifan Yao, Kaijing Ma, Bingli Wang, Tianyu Zheng, Minghao Liu, Yiming Liang, Xiaolong Jin, Zhenlin Wei, Chujie Zheng, Kaixin Deng, Shuyue Guo, Shian Jia, Sichao Jiang, Yiyan Liao, Rui Li, Qinrui Li, Sirun Li, Yizhi Li, Yunwen Li, Dehua Ma, Yuansheng Ni, Haoran Que, Qiyao Wang, Zhoufutu Wen, Siwei Wu, Tianshun Xing, 明 许, Zhenzhu Yang, Noah Wang, Junting Zhou, Yuelin Bai, Xingyuan Bu, Chenglin Cai, Liang Chen, Yifan Chen, Cheng Chengtuo, Tianhao Cheng, Keyi Ding, Siming Huang, Huang Yun, Yaoru Li, Yizhe Li, Zhaoqun Li, Tianhao Liang, Chengdong Lin, Hongquan Lin, Yinghao Ma, Zhongyuan Peng, Zifan Peng, Qige Qi, Shi Qiu, Xingwei Qu, Shanghaoran Quan, Yizhou Tan, Zili Wang, Hao Wang, Yiya Wang, Yubo Wang, Jiajun Xu, Kexin Yang, Ruibin Yuan, Yuanhao Yue, Tianyang Zhan, Chun Zhang, Jinyang Zhang, Xiyue Zhang, Owen Zhang, Yue Zhang, Yongchi Zhao, Xiangyu Zheng, Yang Gao, Zhoujun Li, Dayiheng Liu, Qian Liu, Tianyu Liu, Shiwen Ni, Junran Peng, Yujia Qin, Wenbo Su, Guoyin Wang, Shi Wang, Jian Yang, Min Yang, Meng Cao, Xiang Yue, Zhao-Xiang Zhang, Wangchunshu Zhou, Jiaheng Liu#, Qunshu Lin#, Wenhao Huang#, Ge Zhang#
* Equal contribution; # Corresponding author.
Evaluates joint understanding of text, images, and audio.
Omni-modalCross-modal reasoning
NeurIPS 2025 (Datasets and Benchmarks)
Paper & authors
OmniBench: Towards The Future of Universal Omni-Language Models
Yizhi Li, Yinghao Ma, Ge Zhang#, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin#
* Equal contribution; # Corresponding author.
Evaluates over-refusal on benign multimodal requests constructed in the DREAM study.
Over-refusalMultimodal safety
NAACL 2025
Paper & authors
DREAM: Disentangling Risks to Enhance Safety Alignment in Multimodal Large Language Models
Jianyu Liu, Hangyu Guo, Ranjie Duan, Xingyuan Bu#, Yancheng He, Shilong Li, Hui Huang, Jiaheng Liu, Yucheng Wang, Chenchen Jing, Xingwei Qu, Xiao Zhang, Pei Wang, Yanan Wu, Jihao Gu, Yangguang Li, Jianke Zhu
* Equal contribution; # Corresponding author.
Tests error detection in long chains of reasoning.
Reasoning critiqueError detection
ACL 2025Corresponding author
Paper & authors
Can Large Language Models Detect Errors in Long Chain-of-Thought Reasoning?
Yancheng He, Shilong Li, Jiaheng Liu#, Weixun Wang, Xingyuan Bu, Ge Zhang, Z.Y. Peng, Zhaoxiang Zhang, Zhicheng Zheng, Wenbo Su, Bo Zheng
* Equal contribution; # Corresponding author.
Evaluates video captions used to support controllable text-to-video generation.
Video captioningControllability
Findings of ACL 2025
Paper & authors
VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation
Xinlong Chen, Yuanxing Zhang, Chongling Rao, Yushuo Guan, Jiaheng Liu, Fuzheng Zhang, Chengru Song, Qiang Liu#, Di Zhang, Tieniu Tan
* Equal contribution; # Corresponding author.
Evaluates factual question answering grounded in images and Chinese knowledge.
Visual factualityChinese
Findings of ACL 2025
Paper & authors
See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models
Jihao Gu, Yingyao Wang, Pi Bu, Chen Wang, Ziming Wang, Tengtao Song, Donglai Wei, Jiale Yuan, Yingxiu Zhao, Yancheng He, Shilong Li, Jiaheng Liu, Meng Cao, Jun Song#, Yingshui Tan, Xiang Li, Wenbo Su, Xiaoyong Zhu, Bo Zheng
* Equal contribution; # Corresponding author.
Tests the factual accuracy of safety-related knowledge.
Safety knowledgeFactuality
ACL 2025
Paper & authors
Chinese SafetyQA: A Safety Short-form Factuality Benchmark for Large Language Models
Yingshui Tan#, Boren Zheng, Baihui Zheng, Kerui Cao, Huiyun Jing, Jincheng Wei, Jiaheng Liu, Yancheng He, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang
* Equal contribution; # Corresponding author.
Evaluates short-form factual question answering in Chinese.
FactualityChinese
ACL 2025Corresponding author
Paper & authors
Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models
Yancheng He, Shilong Li, Jiaheng Liu#, Yingshui Tan, Weixun Wang, Hui Huang, Xingyuan Bu, Hangyu Guo, Chengwei Hu, Boren Zheng, Zhuoran Lin, Dekai Sun, Zhicheng Zheng, Wenbo Su, Bo Zheng
* Equal contribution; # Corresponding author.
Evaluates multilingual repository-level code completion using cross-file context.
Code completionMultilingual
ACL 2025Corresponding author
Paper & authors
M2RC-EVAL: Massively Multilingual Repository-level Code Completion Evaluation
Jiaheng Liu#, Ken Deng, Congnan Liu, Jian Yang, Shukai Liu, He Zhu, Peng Zhao, Linzheng Chai, Yanan Wu, Jin Ke, Ge Zhang, Zekun Moore Wang, Guoan Zhang, Yingshui Tan, Bangyu Xiang, Zhaoxiang Zhang, Wenbo Su, Bo Zheng
* Equal contribution; # Corresponding author.
Tests understanding of implicit meanings in images within Chinese cultural contexts.
Cultural understandingVisual reasoning
ACL 2025
Paper & authors
Can MLLMs Understand the Deep Implication Behind Chinese Images?
Chenhao Zhang, Xi Feng, Yuelin Bai, Xeron Du, Jinchang Hou, Kaixin Deng, Guangzeng Han, Qinrui Li, Bingli Wang, Jiaheng Liu, Xingwei Qu, Yifei Zhang, Qixuan Zhao, Yiming Liang, Ziqiang Liu, Feiteng Fang, Min Yang, Wenhao Huang, Chenghua Lin, Ge Zhang#, Shiwen Ni#
* Equal contribution; # Corresponding author.
Studies compact multimodal evaluation across multiple tasks.
Multimodal evaluationEfficiency
Findings of ACL 2025
Paper & authors
LIME: Less Is More for MLLM Evaluation
King Zhu, Qianbo Zang, Shian Jia, Siwei Wu, Feiteng Fang, Yizhi Li, Shuyue Guo, Tianyu Zheng, Jiawei Guo, Bo Li, Haoning Wu, Xingwei Qu, Jian Yang, Ruibo Liu, Xiang Yue, Jiaheng Liu, Chenghua Lin, Hamid Alinejad-Rokny, Min Yang, Shiwen Ni#, Wenhao Huang#, Ge Zhang#
* Equal contribution; # Corresponding author.
Tests tool use at multiple granularities, including multi-turn and multi-tool interactions.
Tool useMulti-turn
ICLR 2025Corresponding author
Paper & authors
MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models
Pei Wang, Yanan Wu, Zekun Wang, Jiaheng Liu#, Xiaoshuai Song, Z.Y. Peng, Ken Deng, Chenchen Zhang, Junran Peng, Ge Zhang, Hangyu Guo, Zhaoxiang Zhang, Wenbo Su, Bo Zheng
* Equal contribution; # Corresponding author.
Tests rule-based reasoning designed to be orthogonal to prior knowledge.
LogicRule following
ICLR 2025
Paper & authors
KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks
Kaijing Ma, Xeron Du, Yunran Wang, Haoran Zhang, Zhoufutu Wen, Xingwei Qu, Jian Yang, Jiaheng Liu, Minghao Liu, Xiang Yue, Wenhao Huang#, Ge Zhang#
* Equal contribution; # Corresponding author.
Tests code understanding, completion, and generation across programming languages.
Code generationMultilingual
ICLR 2025
Paper & authors
McEval: Massively Multilingual Code Evaluation
Linzheng Chai, Shukai Liu, Jian Yang#, Yuwei Yin, Ke Jin, Jiaheng Liu, Tao Sun, Ge Zhang, Changyu Ren, Hongcheng Guo, Zekun Wang, Boyang Wang, Xianjie Wu, Bing Wang, Tongliang Li, Liqun Yang, Sufeng Duan, Zhoujun Li
* Equal contribution; # Corresponding author.
Tests complex question answering and reasoning over tables.
TablesReasoning
AAAI 2025
Paper & authors
TableBench: A Comprehensive and Complex Benchmark for Table Question Answering
Xianjie Wu, Jian Yang#, Linzheng Chai, Ge Zhang, Jiaheng Liu, Xinrun Du, Di Liang, Daixin Shu, Xianfu Cheng, Tianzhen Sun, Guanglin Niu, Tongliang Li, Zhoujun Li#
* Equal contribution; # Corresponding author.
Evaluates factual question answering with multimodal inputs.
Visual factualityQuestion answering
ICCV 2025
Paper & authors
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
Xianfu Cheng, Wei Zhang, Shiwei Zhang, Jian Yang#, Xiangyuan Guan, Xianjie Wu, Xiang Li#, Ge Zhang, Jiaheng Liu, Yuying Mai, Yutao Zeng, Zhoufutu Wen, Ke Jin, Baorui Wang, Weixiao Zhou, Yunhong Lu, Hangyuan Ji, Tongliang Li, Wenhao Huang, Zhoujun Li
* Equal contribution; # Corresponding author.
Tests recognition of physical commonsense violations in gameplay videos.
Physical reasoningVideo
CVPR 2025 · CV2 Workshop
Paper & authors
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
Meng Cao, Haoran Tang, Haoze Zhao, Hangyu Guo, Jiaheng Liu, Ge Zhang, Ruyang Liu, Qiang Sun#, Ian Reid, Xiaodan Liang
* Equal contribution; # Corresponding author.
Tests understanding of dynamically composed knowledge statements.
KnowledgeCompositionality
arXiv preprint, 2025
Paper & authors
Encyclo-K: Evaluating LLMs with Dynamically Composed Knowledge Statements
Yiming Liang, Yizhi Li, Yantao Du#, Ge Zhang, Jiayi Zhou, Yuchen Wu, Yinzhu Piao, Denghui Cao, Tong Sun, Ziniu Li, Li Du, Bo Lei, Jiaheng Liu, Chenghua Lin, Zhaoxiang Zhang, Wenhao Huang#, Jiajun Zhang#
* Equal contribution; # Corresponding author.
Evaluates descriptions of similarities and differences between paired videos.
Video comparisonCaptioning
arXiv preprint, 2025Corresponding author
Paper & authors
ViDiC: Video Difference Captioning
Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang#, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Evaluates the usefulness and overall quality of deep-research reports.
Deep researchReport quality
arXiv preprint, 2025Corresponding author
Paper & authors
How Far Are We from Genuinely Useful Deep Research Agents?
Dingling Zhang, He Zhu, Jincheng Ren, Kangqi Song, Xinran Zhou, Boyu Feng, Shudong Liu, Jiabin Luo, Weihao Xie, Zhaohui Wang, Tianrui Qin, King Zhu, Yuqing Wang, Qianben Chen, Yuchen Eleanor Jiang, Wei Wang, Jiaheng Liu#, Wangchunshu Zhou#
* Equal contribution; # Corresponding author.
Evaluates whether generated code satisfies both functional requirements and explicit instructions.
Instruction followingCode generation
arXiv preprint, 2025
Paper & authors
IFEvalCode: Controlled Code Generation
Jian Yang, Wei Zhang#, Shukai Liu, Linzheng Chai, Yingshui Tan, Jiaheng Liu, Ge Zhang, Wangchunshu Zhou, Guanglin Niu#, Zhoujun Li#, Binyuan Hui, Junyang Lin
* Equal contribution; # Corresponding author.
Tests whether reasoning models recognize risk beyond producing superficially safe answers.
Risk awarenessSafety reasoning
arXiv preprint, 2025
Paper & authors
Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models
Baihui Zheng, Boren Zheng, Kerui Cao, Yingshui Tan#, Zhendong Liu, Weixun Wang, Jiaheng Liu, Jian Yang, Wenbo Su, Xiaoyong Zhu, Bo Zheng, Kaifu Zhang
* Equal contribution; # Corresponding author.
Measures models' ability to critique code and provide useful feedback.
Code critiqueFeedback
arXiv preprint, 2025Corresponding author
Paper & authors
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
Alexander Zhang, Marcus Dong, Jiaheng Liu#, Wei Zhang, Yejie Wang, Jian Yang, Ge Zhang, Tianyu Liu, Zhongyuan Peng, Yingshui Tan, Yuanxing Zhang, Zhexu Wang, Weixun Wang, Yancheng He, Ken Deng, Wangchunshu Zhou, Wenhao Huang, Zhaoxiang Zhang
* Equal contribution; # Corresponding author.
Evaluates recognition of implications and deeper meanings in images.
Visual reasoningImplicit meaning
NeurIPS 2024 (Datasets and Benchmarks)
Paper & authors
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
Ziqiang Liu, Feiteng Fang, Xi Feng, Xinrun Du, Chenhao Zhang, Zekun Wang, Yuelin Bai, Qixuan Zhao, Liyang Fan, Chengguang Gan, Hongquan Lin, Jiaming Li, Yuansheng Ni, Haihong Wu, Yaswanth Narsupalli, Zhigang Zheng, Chengming Li, Xiping Hu, Ruifeng Xu, Xiaojun Chen, Min Yang, Jiaheng Liu, Ruibo Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#
* Equal contribution; # Corresponding author.
Evaluates role-playing agents built from scripts through interactive tasks.
Role playingMulti-turn
NeurIPS 2024 (Datasets and Benchmarks)
Paper & authors
RoleAgent: Building, Interacting, and Benchmarking High-quality Role-Playing Agents from Scripts
Jiaheng Liu*, Zehao Ni*, Haoran Que*, Tao Sun, Zekun Wang, Jian Yang, Jiakai Wang, Hongcheng Guo, Zhongyuan Peng, Ge Zhang, Jiayi Tian, Xingyuan Bu, Ke Xu, Wenge Rong, Junran Peng#, Zhaoxiang Zhang
* Equal contribution; # Corresponding author.
Provides fine-grained evaluation of multi-turn dialogue abilities.
DialogueMulti-turn
ACL 2024
Paper & authors
MT-Bench-101: A Fine-Grained Benchmark for Evaluating Large Language Models in Multi-Turn Dialogues
Ge Bai, Jie Liu, Xingyuan Bu#, Yancheng He, Jiaheng Liu, Zhanhui Zhou, Zhuoran Lin, Wenbo Su, Tiezheng Ge, Bo Zheng, Wanli Ouyang
* Equal contribution; # Corresponding author.
Evaluates mathematical reasoning by concept in both Chinese and English.
MathematicsBilingual
Findings of ACL 2024Corresponding author
Paper & authors
ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models
Yanan Wu*, Jie Liu*, Xingyuan Bu, Jiaheng Liu#, Zhanhui Zhou, Yuanxing Zhang, Chenchen Zhang, Zhiqi Bai, Haibin Chen, Tiezheng Ge, Wanli Ouyang, Wenbo Su, Bo Zheng
* Equal contribution; # Corresponding author.
Evaluates role-playing abilities and consistency in language models.
Role playingDialogue
Findings of ACL 2024Corresponding author
Paper & authors
RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models
Noah Wang, Z.Y. Peng, Haoran Que*, Jiaheng Liu#, Wangchunshu Zhou, Yuhan Wu, Hongcheng Guo, Ruitong Gan, Zehao Ni, Jian Yang, Man Zhang, Zhaoxiang Zhang#, Wanli Ouyang, Ke Xu, Wenhao Huang, Jie Fu, Junran Peng
* Equal contribution; # Corresponding author.
Evaluates knowledge and tasks in IT operations within the OWL study.
IT operationsDomain knowledge
ICLR 2024Corresponding author
Paper & authors
OWL: A Large Language Model for IT Operations
Hongcheng Guo, Jian Yang#, Jiaheng Liu#, Liqun Yang, Linzheng Chai, Jiaqi Bai, Junran Peng, Xiaorong Hu, Chao Chen, Dongfeng Zhang, xu Shi, Tieqiao Zheng, Liangfan Zheng, Bo Zhang, Ke Xu, Zhoujun Li
* Equal contribution; # Corresponding author.
Benchmarks post-training sparsity across algorithms and models.
Model compressionSparsity
ACM MM 2024
Paper & authors
PTSBench: A Comprehensive Post-Training Sparsity Benchmark Towards Algorithms and Models
Zining Wnag, Jinyang Guo#, Ruihao Gong, Yang Yong, Aishan Liu, Yushi Huang, Jiaheng Liu, Xianglong Liu
* Equal contribution; # Corresponding author.
Provides a held-out material-segmentation evaluation set alongside the MaterialSeg3D method.
MaterialsSegmentation
ACM MM 2024
Paper & authors
MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets
Zeyu Li, Ruitong Gan, Chuanchen Luo, Yuxi Wang, Jiaheng Liu, Ziwei Zhu, Man Zhang#, Qing Li, Xucheng Yin, Zhaoxiang Zhang#, Junran Peng
* Equal contribution; # Corresponding author.
Evaluates programming ability across full-stack development scenarios.
Full-stack codingMultilingual
arXiv preprint, 2024
Paper & authors
FullStack Bench: Evaluating LLMs as Full Stack Coders
Bytedance-Seed-Foundation-Code-Team, Yao Cheng, Jianfeng Chen, Jie Chen, Li Chen, Liyu Chen, Wentao Chen, Zhengyu Chen, Shijie Geng, Aoyan Li, Bo Li, Bowen Li, Linyi Li, Boyi Liu, Jiaheng Liu, Kaibo Liu, Qi Liu, Shukai Liu, Siyao Liu, Tianyi Liu, Tingkai Liu, Yongfei Liu, Rui Long, Jing Mai, Guanghan Ning, Z. Y. Peng, Kai Shen, Jiahao Su, Jing Su, Tao Sun, Yifan Sun, Yunzhe Tao, Guoyin Wang, Siwei Wang, Xuwu Wang, Yite Wang, Zihan Wang, Jinxiang Xia, Liang Xiang, Xia Xiao, Yongsheng Xiao, Chenguang Xi, Shulin Xin, Jingjing Xu, Shikun Xu, Hongxia Yang, Jack Yang, Yingxiang Yang, Jianbo Yuan, Jun Zhang, Yufeng Zhang, Yuyu Zhang, Shen Zheng, He Zhu, Ming Zhu
* Equal contribution; # Corresponding author.
Tests spatial planning and interaction in vision-based games.
Visual agentsSpatial planning
arXiv preprint, 2024Corresponding author
Paper & authors
ING-VP: MLLMs cannot Play Easy Vision-based Games Yet
Haoran Zhang, Hangyu Guo, Shuyue Guo, Meng Cao, Wenhao Huang, Jiaheng Liu#, Ge Zhang#
* Equal contribution; # Corresponding author.
Evaluates the ability to generate long, coherent text.
Long-form generationWriting
arXiv preprint, 2024
Paper & authors
HelloBench: Evaluating Long Text Generation Capabilities of Large Language Models
Haoran Que, Feiyu Duan, Liqun He, Yutao Mou, Wangchunshu Zhou, Jiaheng Liu, Wenge Rong, Zekun Moore Wang, Jian Yang, Ge Zhang, Junran Peng, Zhaoxiang Zhang, Songyang Zhang, Kai Chen
* Equal contribution; # Corresponding author.
Tests instruction following and multitask reasoning over long contexts.
Long contextInstruction following
arXiv preprint, 2024
Paper & authors
LongIns: A Challenging Long-context Instruction-based Exam for LLMs
Shawn Gavin, Tuney Zheng, Jiaheng Liu, Quehry Que, Noah Wang, Jian Yang, Chenchen Zhang, Wenhao Huang, Ge Zhang#
* Equal contribution; # Corresponding author.
Evaluates empathy through the lens of group identity.
EmpathyHuman alignment
arXiv preprint, 2024
Paper & authors
GIEBench: Towards Holistic Evaluation of Group Identity-based Empathy for Large Language Models
Leyan Wang, Yonggang Jin, Tianhao Shen, Tianyu Zheng, Xinrun Du, Chenchen Zhang, Wenhao Huang, Jiaheng Liu, Shi Wang, Ge Zhang#, Liuyu Xiang#, Zhaofeng He
* Equal contribution; # Corresponding author.
Evaluates code completion in real-world repositories.
RepositoriesCode completion
arXiv preprint, 2024Corresponding author
Paper & authors
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
Ken Deng, Jiaheng Liu#, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng
* Equal contribution; # Corresponding author.
Evaluates retrieval of 3D models from textual descriptions.
3D retrievalText grounding
arXiv preprint, 2024Corresponding author
Paper & authors
LD-T3D: A Large-scale and Diverse Benchmark for Text-based 3D Model Retrieval
Ze Yuan, Jiaheng Liu#, Xuebo Liu, Zhipeng Yu, Ke Xu, Jianhao Li, Ding Liang
* Equal contribution; # Corresponding author.
Evaluates multimodal manga text completion in two languages.
Multimodal completionBilingual
Findings of EMNLP 2023
Paper & authors
M2C: Towards Automatic Multimodal Manga Complement
Hongcheng Guo*, Boyang Wang*, Jiaqi Bai, Jiaheng Liu, Jian Yang, Zhoujun Li#
* Equal contribution; # Corresponding author.