← Evaluation overview

16 research contributions

Coding & Software Engineering

Multilingual programming, repository-level development, environment setup, and visually grounded software engineering.

Benchmarks & related work

16 works

Search by name or capability, or narrow by publication status and authorship.

Multimodal & interactive coding

WebCompass

Evaluates multimodal agents on web development from visual inputs, instructions, and interaction.

Web developmentMultimodal
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

WebCompass: Evaluating Multimodal Code Agents in Web Development from Vision, Instruction, and Interaction to Implementation

Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu Zhou, Haoyang Huang, Minghao Liu, Letian Zhu, Hongyi Ye, Jinhua Hao, Ken Deng, Zizheng Zhan, Han Li, Dailin Li, Yifan Yao, Ming Sun, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Multimodal & interactive coding

ArtifactsBench

Evaluates the visual quality and interactive behavior of generated code artifacts.

Visual qualityInteraction
EMNLP 2026 · Accepted
Paper & authors

ArtifactsBench: Bridging the Visual-Interactive Gap in LLM Code Generation Evaluation

Chenchen Zhang, Yuhang Li, Jiaheng Liu, Can Xu, Ao Liu, Changzhi Zhou, Ken Deng, Dengpeng Wu, Guanhua Huang, Kejiao Li, Qi Yi, Ruilin Lv, Shihui Hu, Yue Zhang, Yuhao Jiang, Zenan Xu, Yuanxing Zhang, Wiggin Zhou#, Chayse Zhou#, Fengzong Lian#

* Equal contribution; # Corresponding author.

Software engineering agents

NL2Repo-Bench

Tests long-horizon development of complete repositories from natural-language requirements.

Repository generationLong horizon
ICML 2026
Paper & authors

NL2Repo-Bench: Towards Long-Horizon Repository Generation Evaluation of Coding Agents

Jingzhe Ding, Shengda Long, Changxin Pu, Huan Zhou, Hongwan Gao, Xiang Gao, Chao He, Yue Hou, Fei Hu, Zhaojian Li, Weiran Shi, Zaiyuan Wang, Daoguang Zan, Chenchen Zhang, Xiaoxu Zhang, Qizhi Chen, Xianfu Cheng, Bo Deng, Qingshui Gu, Kai Hua, Juntao Lin, Pai Liu, Mingchen Li, Xuanguang Pan, Zifan Peng, Yujia Qin, Yong Shan, Zhewen Tan, Weihao Xie, Zihan Wang, Yishuo Yuan, Jiayu Zhang, Enduo Zhao, Yunfei Zhao, He Zhu, Liya Zhu, Chenyang Zou, Ming Ding, Jianpeng Jiao, Jiaheng Liu, Minghao Liu, Qian Liu, Chongyang Tao, Jian Yang, Tong Yang, Zhaoxiang Zhang, Xinjie Chen, Wenhao Huang, Ge Zhang

* Equal contribution; # Corresponding author.

Software engineering agents

SWE-Compass

Evaluates agentic coding across diverse tasks in real software repositories.

Coding agentsRepositories
ICML 2026Corresponding author
Paper & authors

SWE-Compass: Towards Unified Evaluation of Agentic Coding Abilities for Large Language Models

Jingxuan Xu, Ken Deng, Weihao Li, Songwei Yu, Huaixi Tang, Haoyang Huang, Zhiyi Lai, Zizheng Zhan, Yanan Wu, Chenchen Zhang, Kepeng Lei, Yifan Yao, Xinping Lei, Wenqiang Zhu, Zongxian Feng, Han Li, Junqi Xiong, Dailin Li, Zuchen Gao, Kun Wu, Wen Xiang, Ziqi Zhan, Yuanxing Zhang, Wuxuan Gong, Ziyuan Gao, Guanxiang Wang, Yirong Xue, Mengtong Li, Mengfei Xie, Xiaojiang Zhang, Jinghui Wang, Wenhao Zhuang, Zheng Lin, Huiming Wang, Zhaoxiang Zhang, Yuqun Zhang, Haotian Zhang, Bin Chen, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Multimodal & interactive coding

M²EVAL

Evaluates multilingual programming from visual design diagrams and textual specifications.

Visual codingMultilingual
ICML 2026
Paper & authors

From Diagrams to Code: Multilingual Programming with Visual Design

Linzheng Chai, Jian Yang#, Shukai Liu, Wei Zhang, Liran Wang, Ke Jin, Tao Sun, Congnan Liu, Chenchen Zhang, Hualei Zhu, Jiaheng Liu, Xianjie Wu, Ge Zhang, Tianyu Liu, Zhoujun Li

* Equal contribution; # Corresponding author.

Software engineering agents

Multi-Docker-Eval

Evaluates automatic setup of executable environments for real software projects.

Environment setupCoding agents
Findings of ACL 2026
Paper & authors

Multi-Docker-Eval: A ‘Shovel of the Gold Rush’ Benchmark on Automatic Environment Building for Software Engineering

Kelin Fu#, Tianyu Liu#, Zeyu Shang, Yingwei MA, Jiaheng Liu, Jian Yang, Kaigui Bian#

* Equal contribution; # Corresponding author.

Code foundations & completion

MdEval

Measures code debugging across multiple programming languages.

DebuggingMultilingual
Findings of ACL 2026
Paper & authors

MdEval: Massively Multilingual Code Debugging

Shukai Liu, Linzheng Chai, Jian Yang#, Jiajun Shi, He Zhu, Liran Wang, Jin Ke, Wei Zhang, Hualei Zhu, Shuyue Guo, Tao Sun, Jiaheng Liu, Yunlong Duan, Yu Hao, Liqun Yang, Guanglin Niu, Ge Zhang, Zhoujun Li

* Equal contribution; # Corresponding author.

Multimodal & interactive coding

GameLogicBench

Tests runtime gameplay logic with reproducible assertions at each simulation tick.

Game developmentExecutable checks
arXiv preprint, 2026Corresponding author
Paper & authors

GameLogicBench: Evaluating Coding Agents on Runtime Game Logic with Tick-Level State Assertions

Xinyu Che, Yunfei Ge, Shihao Li, Yanchen Liu, Hang Yan, Xinping Lei, Yanghai Wang, Zixuan Dong, Yifan Yao, Qianqian Xie, Letian Zhu, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Software engineering agents

LoopsBench

Evaluates the execution loops used by coding agents in long-horizon software development.

Coding agentsLong horizon
arXiv preprint, 2026
Paper & authors

LoopsBench: From Harness Engineering to Loop Engineering in Coding Agent Evaluation

Han Li, Zhemin Fang, Rili Feng, Yingqi Zhao, Jiaheng Liu, Pengfei Gao#, He Ye, Dayi Lin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

* Equal contribution; # Corresponding author.

Software engineering agents

CodeTraceBench

Diagnoses coding-agent failures through traceable execution states and trajectories.

Agent trajectoriesFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors

CodeTracer: Towards Traceable Agent States

Han Li, Yifan Yao, Letian Zhu, Rili Feng, Hongyi Ye, Jiaming Wang, Yancheng He, Pengyu Zou, Lehan Zhang, Xinping Lei, Haoyang Huang, Ken Deng, Ming Sun, Zhaoxiang Zhang, He Ye, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Code foundations & completion

M²RC-EVAL

Evaluates multilingual repository-level code completion using cross-file context.

Code completionMultilingual
ACL 2025Corresponding author
Paper & authors

M2RC-EVAL: Massively Multilingual Repository-level Code Completion Evaluation

Jiaheng Liu#, Ken Deng, Congnan Liu, Jian Yang, Shukai Liu, He Zhu, Peng Zhao, Linzheng Chai, Yanan Wu, Jin Ke, Ge Zhang, Zekun Moore Wang, Guoan Zhang, Yingshui Tan, Bangyu Xiang, Zhaoxiang Zhang, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

Code foundations & completion

McEval

Tests code understanding, completion, and generation across programming languages.

Code generationMultilingual
ICLR 2025
Paper & authors

McEval: Massively Multilingual Code Evaluation

Linzheng Chai, Shukai Liu, Jian Yang#, Yuwei Yin, Ke Jin, Jiaheng Liu, Tao Sun, Ge Zhang, Changyu Ren, Hongcheng Guo, Zekun Wang, Boyang Wang, Xianjie Wu, Bing Wang, Tongliang Li, Liqun Yang, Sufeng Duan, Zhoujun Li

* Equal contribution; # Corresponding author.

Code foundations & completion

IFEvalCode

Evaluates whether generated code satisfies both functional requirements and explicit instructions.

Instruction followingCode generation
arXiv preprint, 2025
Paper & authors

IFEvalCode: Controlled Code Generation

Jian Yang, Wei Zhang#, Shukai Liu, Linzheng Chai, Yingshui Tan, Jiaheng Liu, Ge Zhang, Wangchunshu Zhou, Guanglin Niu#, Zhoujun Li#, Binyuan Hui, Junyang Lin

* Equal contribution; # Corresponding author.

Code foundations & completion

CodeCriticBench

Measures models' ability to critique code and provide useful feedback.

Code critiqueFeedback
arXiv preprint, 2025Corresponding author
Paper & authors

CodeCriticBench: A Holistic Code Critique Benchmark for Large Language Models

Alexander Zhang, Marcus Dong, Jiaheng Liu#, Wei Zhang, Yejie Wang, Jian Yang, Ge Zhang, Tianyu Liu, Zhongyuan Peng, Yingshui Tan, Yuanxing Zhang, Zhexu Wang, Weixun Wang, Yancheng He, Ken Deng, Wangchunshu Zhou, Wenhao Huang, Zhaoxiang Zhang

* Equal contribution; # Corresponding author.

Code foundations & completion

FullStack Bench

Evaluates programming ability across full-stack development scenarios.

Full-stack codingMultilingual
arXiv preprint, 2024
Paper & authors

FullStack Bench: Evaluating LLMs as Full Stack Coders

Bytedance-Seed-Foundation-Code-Team, Yao Cheng, Jianfeng Chen, Jie Chen, Li Chen, Liyu Chen, Wentao Chen, Zhengyu Chen, Shijie Geng, Aoyan Li, Bo Li, Bowen Li, Linyi Li, Boyi Liu, Jiaheng Liu, Kaibo Liu, Qi Liu, Shukai Liu, Siyao Liu, Tianyi Liu, Tingkai Liu, Yongfei Liu, Rui Long, Jing Mai, Guanghan Ning, Z. Y. Peng, Kai Shen, Jiahao Su, Jing Su, Tao Sun, Yifan Sun, Yunzhe Tao, Guoyin Wang, Siwei Wang, Xuwu Wang, Yite Wang, Zihan Wang, Jinxiang Xia, Liang Xiang, Xia Xiao, Yongsheng Xiao, Chenguang Xi, Shulin Xin, Jingjing Xu, Shikun Xu, Hongxia Yang, Jack Yang, Yingxiang Yang, Jianbo Yuan, Jun Zhang, Yufeng Zhang, Yuyu Zhang, Shen Zheng, He Zhu, Ming Zhu

* Equal contribution; # Corresponding author.

Code foundations & completion

R²C²-Bench

Evaluates code completion in real-world repositories.

RepositoriesCode completion
arXiv preprint, 2024Corresponding author
Paper & authors

R2C2-Coder: Enhancing and Benchmarking Real-world Repository-level Code Completion Abilities of Code Large Language Models

Ken Deng, Jiaheng Liu#, He Zhu, Congnan Liu, Jingxin Li, Jiakai Wang, Peng Zhao, Chenchen Zhang, Yanan Wu, Xueqiao Yin, Yuanxing Zhang, Zizheng Zhan, Wenbo Su, Bangyu Xiang, Tiezheng Ge, Bo Zheng

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.