Multimodal & interactive coding
WebCompass
Evaluates multimodal agents on web development from visual inputs, instructions, and interaction.
Web developmentMultimodal
EMNLP 2026 · AcceptedCorresponding author
Paper & authors
WebCompass: Evaluating Multimodal Code Agents in Web Development from Vision, Instruction, and Interaction to Implementation
Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Multimodal & interactive coding
ArtifactsBench
Evaluates the visual quality and interactive behavior of generated code artifacts.
Visual qualityInteraction
EMNLP 2026 · Accepted
Paper & authors
ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation
Chenchen Zhang, Yuhang Li, Jiaheng Liu, Can Xu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruilin Lv, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou#, Chayse Zhou#, Fengzong Lian#
* Equal contribution; # Corresponding author.
Software engineering agents
NL2Repo-Bench
Tests long-horizon development of complete repositories from natural-language requirements.
Repository generationLong horizon
ICML 2026
Paper & authors
NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents
Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang
* Equal contribution; # Corresponding author.
Software engineering agents
SWE-Compass
Evaluates agentic coding across diverse tasks in real software repositories.
Coding agentsRepositories
ICML 2026Corresponding author
Paper & authors
SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models
Jingxuan Xu, Ken Deng, Weihao Li, Songwei Yu, Huaixi Tang, Haoyang Huang, Zhiyi Lai, Zizheng Zhan, Yanan Wu, Chenchen Zhang, Kepeng Lei, Yifan Yao, Xinping Lei, Wenqiang Zhu, Zongxian Feng, Han Li, Junqi Xiong, Dailin Li, Zuchen Gao, Kun Wu, Wen Xiang, Ziqi Zhan, Yuanxing Zhang, Wuxuan Gong, Ziyuan Gao, Guanxiang Wang, Yirong Xue, Mengtong Li, Mengfei Xie, Xiaojiang Zhang, Jinghui Wang, Wenhao Zhuang, Zheng Lin, Huiming Wang, Zhaoxiang Zhang, Yuqun Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Multimodal & interactive coding
M²EVAL
Evaluates multilingual programming from visual design diagrams and textual specifications.
Visual codingMultilingual
ICML 2026
Paper & authors
From Diagrams to Code: Multilingual Programming with Visual Design
Linzheng Chai, Jian Yang#, Shukai Liu, Wei Zhang, Liran Wang, Ke Jin, Tao Sun, Congnan Liu, Chenchen Zhang, Hualei Zhu, Jiaheng Liu, Xianjie Wu, Ge Zhang, Tianyu Liu, Zhoujun Li
* Equal contribution; # Corresponding author.
Software engineering agents
Multi-Docker-Eval
Evaluates automatic setup of executable environments for real software projects.
Environment setupCoding agents
Findings of ACL 2026
Paper & authors
Multi-Docker-Eval: A ‘Shovel of the Gold Rush’ Benchmark on Automatic Environment Building for Software Engineering
Kelin Fu#, Tianyu Liu#, Zeyu Shang, Yingwei MA, Jiaheng Liu, Jian Yang, Kaigui Bian#
* Equal contribution; # Corresponding author.
Code foundations & completion
MdEval
Measures code debugging across multiple programming languages.
DebuggingMultilingual
Findings of ACL 2026
Paper & authors
MdEval: Massively Multilingual Code Debugging
Shukai Liu, Linzheng Chai, Jian Yang#, Jiajun Shi, He Zhu, Liran Wang, Jin Ke, Wei Zhang, Hualei Zhu, Shuyue Guo, Tao Sun, Jiaheng Liu, Yunlong Duan, Yu Hao, Liqun Yang, Guanglin Niu, Ge Zhang, Zhoujun Li
* Equal contribution; # Corresponding author.
Multimodal & interactive coding
GameLogicBench
Tests runtime gameplay logic with reproducible assertions at each simulation tick.
Game developmentExecutable checks
arXiv preprint, 2026Corresponding author
Paper & authors
GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions
Xinyu Che, Yunfei Ge, Shihao Li, Yanchen Liu, Hang Yan, Xinping Lei, Yanghai Wang, Zixuan Dong, Yifan Yao, Qianqian Xie, Letian Zhu, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Software engineering agents
LoopsBench
Evaluates the execution loops used by coding agents in long-horizon software development.
Coding agentsLong horizon
arXiv preprint, 2026
Paper & authors
LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation
Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao#, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang
* Equal contribution; # Corresponding author.
Software engineering agents
CodeTraceBench
Diagnoses coding-agent failures through traceable execution states and trajectories.
Agent trajectoriesFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors
CodeTracer: Towards Traceable Agent States
Han Li, Yifan Yao, Letian Zhu, Rili Feng, Hongyi Ye, Jiaming Wang, Yancheng He, Pengyu Zou, Lehan Zhang, Xinping Lei, Haoyang Huang, Ken Deng, Ming Sun, Zhaoxiang Zhang, He Ye, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Code foundations & completion
M²RC-EVAL
Evaluates multilingual repository-level code completion using cross-file context.
Code completionMultilingual
ACL 2025Corresponding author
Paper & authors
M2RC-EVAL: Massively Multilingual Repository-level Code Completion Evaluation
Jiaheng Liu#, Ken Deng, Congnan Liu, Jian Yang, Shukai Liu, He Zhu, Peng Zhao, Linzheng Chai, Yanan Wu, Jin Ke, Ge Zhang, Zekun Moore Wang, Guoan Zhang, Yingshui Tan, Bangyu Xiang, Zhaoxiang Zhang, Wenbo Su, Bo Zheng
* Equal contribution; # Corresponding author.
Code foundations & completion
McEval
Tests code understanding, completion, and generation across programming languages.
Code generationMultilingual
ICLR 2025
Paper & authors
McEval: Massively Multilingual Code Evaluation
Linzheng Chai, Shukai Liu, Jian Yang#, Yuwei Yin, Ke Jin, Jiaheng Liu, Tao Sun, Ge Zhang, Changyu Ren, Hongcheng Guo, Zekun Wang, Boyang Wang, Xianjie Wu, Bing Wang, Tongliang Li, Liqun Yang, Sufeng Duan, Zhoujun Li
* Equal contribution; # Corresponding author.
Code foundations & completion
IFEvalCode
Evaluates whether generated code satisfies both functional requirements and explicit instructions.
Instruction followingCode generation
arXiv preprint, 2025
Paper & authors
IFEvalCode: Controlled Code Generation
Jian Yang, Wei Zhang#, Shukai Liu, Linzheng Chai, Yingshui Tan, Jiaheng Liu, Ge Zhang, Wangchunshu Zhou, Guanglin Niu#, Zhoujun Li#, Binyuan Hui, Junyang Lin
* Equal contribution; # Corresponding author.
Code foundations & completion
CodeCriticBench
Measures models' ability to critique code and provide useful feedback.
Code critiqueFeedback
arXiv preprint, 2025Corresponding author
Paper & authors
CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models
Alexander Zhang, Marcus Dong, Jiaheng Liu#, Wei Zhang, Yejie Wang, Jian Yang, Ge Zhang, Tianyu Liu, Zhongyuan Peng, Yingshui Tan, Yuanxing Zhang, Zhexu Wang, Weixun Wang, Yancheng He, Ken Deng, Wangchunshu Zhou, Wenhao Huang, Zhaoxiang Zhang
* Equal contribution; # Corresponding author.
Code foundations & completion
FullStack Bench
Evaluates programming ability across full-stack development scenarios.
Full-stack codingMultilingual
arXiv preprint, 2024
Paper & authors
FullStack Bench: Evaluating LLMs as Full Stack Coders
Bytedance-Seed-Foundation-Code-Team, Yao Cheng, Jianfeng Chen, Jie Chen, Li Chen, Liyu Chen, Wentao Chen, Zhengyu Chen, Shijie Geng, Aoyan Li, Bo Li, Bowen Li, Linyi Li, Boyi Liu, Jiaheng Liu, Kaibo Liu, Qi Liu, Shukai Liu, Siyao Liu, Tianyi Liu, Tingkai Liu, Yongfei Liu, Rui Long, Jing Mai, Guanghan Ning, Z. Y. Peng, Kai Shen, Jiahao Su, Jing Su, Tao Sun, Yifan Sun, Yunzhe Tao, Guoyin Wang, Siwei Wang, Xuwu Wang, Yite Wang, Zihan Wang, Jinxiang Xia, Liang Xiang, Xia Xiao, Yongsheng Xiao, Chenguang Xi, Shulin Xin, Jingjing Xu, Shikun Xu, Hongxia Yang, Jack Yang, Yingxiang Yang, Jianbo Yuan, Jun Zhang, Yufeng Zhang, Yuyu Zhang, Shen Zheng, He Zhu, Ming Zhu
* Equal contribution; # Corresponding author.
Code foundations & completion
R²C²-Bench
Evaluates code completion in real-world repositories.
RepositoriesCode completion
arXiv preprint, 2024Corresponding author
Paper & authors
R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models
Ken Deng, Jiaheng Liu#, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng
* Equal contribution; # Corresponding author.