← Evaluation overview

11 research contributions

Agents & Tool Use

Tool use, everyday online tasks, long-horizon workflows, and agents that build and improve their own skills.

Benchmarks & related work

11 works

Search by name or capability, or narrow by publication status and authorship.

Planning & task execution

ClawBench

Evaluates completion of everyday online tasks by AI agents.

Online tasksTask completion
Findings of EMNLP 2026 · Accepted
Paper & authors

ClawBench: Can AI Agents Complete Everyday Online Tasks?

Yuxuan Zhang, Yubo Wang, Yipeng Zhu, Penghui Du, Junwen Miao, Xuan Lu, Zhuofeng Li, Xingwei Qu, Zhengkang Guo, Yuanzhe Shen, Dingjie Song, Han Zhou, Tuney Zheng, Xian Wu, Hao Yu, Songcheng Cai, Yi Lu, Yunzhuo Hao, Minyi Lei, Liang Chen, Kai Zou, Huifeng Yin, Wendong Xu, Dongfu Jiang, Ping Nie, Jiaheng Liu, Wenhu Chen, Kelsey R. Allen

* Equal contribution; # Corresponding author.

Skills & self-improvement

MMG2Skill-Bench

Tests whether agents can turn multimodal guides into reusable, evolving skills.

Skill learningMultimodal
Findings of EMNLP 2026 · AcceptedCorresponding author
Paper & authors

MMG2Skill: Can Agents Distill In-the-Wild Guides into Self-Evolving Skills?

Xinyu Che, Junqi Xiong, Yunfei Ge, Xinping Lei, Shihao Li, Hang Yan, Han Li, Yuanxing Zhang, Zhiqi Bai, Jinghua Hao, Ming Sun, Han Li, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Planning & task execution

WorldTravel

Evaluates multimodal travel planning under tightly coupled constraints.

PlanningMultimodal
ICML 2026
Paper & authors

WorldTravel: A Realistic Multimodal Travel-Planning Benchmark with Tightly Coupled Constraints

Zexuan Wang, Chenghao Yang, Yingqi Que, Zhenzhu Yang, Huaqing Yuan, Yiwen Wang, Zhengxuan Jiang, Shengjie Fang, Zhenhe Wu, Zhaohui Wang, Zhixin Yao, Jiashuo Liu, Jincheng Ren, Yuzhen Li, Yang Yang, Jiaheng Liu, Jian Yang, Zaiyuan Wang, Ge Zhang, Zhoufutu Wen#, Wenhao Huang

* Equal contribution; # Corresponding author.

Skills & self-improvement

HarnessDev

Tests whether models can create and evolve their own agent harnesses.

Self-improvementAgent harnesses
arXiv preprint, 2026
Paper & authors

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

Yuhao Wu#, Jingyuan Zhang, Jiajun Shi, Xinping Lei, Qingshui Gu, Yuxuan Zhang, Zexuan Wang, Chen He, Chen Huang, Maojia Song, Zhiyuan Zeng, Shaowen Wang, Jinkai Liu, Yunfeng Shi, Jiaheng Liu, Shen Yan#, Wenhao Huang#, Ge Zhang#, Wenxuan Zhang

* Equal contribution; # Corresponding author.

Skills & self-improvement

ASPIRE

Evaluates whether models can improve themselves starting from vague goals.

Self-improvementGoal formulation
arXiv preprint, 2026
Paper & authors

Aspire: Can Models Self-Evolve from Vague Goals?

Yuhao Wu#, Jingyuan Zhang, Jiajun Shi, Yuxuan Zhang, Xinping Lei, Junting Zhou, Zexuan Wang, Yuchen Wu, Huan Zhou, Duo Wang, Yinzhu Piao, Yongchang Peng, Yunfeng Shi, Jin Chen, Zuo Wang, Jinkai Liu, Jiaheng Liu, Wenxuan Zhang#, Shen Yan#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Skills & self-improvement

S³Gym

Studies whether self-testing and self-judging translate into self-improvement.

Self-testingSelf-improvement
arXiv preprint, 2026
Paper & authors

S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?

Jiajun Shi, Siyuan Tao, Yuhao Wu, Zexuan Wang, Jingyuan Zhang, Jiaheng Liu, Xinping Lei, Xinrong Zhang, Siyuan Fang, Zhewen Tan, Tianle Cai, Junhao Fang, Jiameng Huang, Yueyang Wang, Jinkai Liu, Yuxuan Zhang, Jian Yang#, Zhoujun Li#, Shen Yan#, Wenhao Huang#, Ge Zhang#

* Equal contribution; # Corresponding author.

Planning & task execution

StartupBench

Evaluates general-purpose agents on market-validated, end-to-end workflows.

CoworkEnd-to-end workflows
arXiv preprint, 2026
Paper & authors

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang#, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan#, Xiaolong Chang#, Wenhao Huang#

* Equal contribution; # Corresponding author.

Planning & task execution

Workflow-GYM

Evaluates long-horizon computer-use tasks in real professional software environments.

Computer useLong horizon
arXiv preprint, 2026
Paper & authors

Workflow-GYM: Towards Long-Horizon Evaluation of Computer-use Agentic tasks in Real-World Professional Fields

Liya Zhu, Jingzhe Ding, Jian Zhang, Jianbo Xue, Shihao Liang, Ge Zhang#, Yi Zhu, Duju Zeng, Xiang Gao, Qingshui Gu, Mailun Gao, Huimin Che, Yan Zhao, Peiheng Zhou, Haojun Wang, Chaobo Xian, Lili Le, Chi Wu, Yiwei Liu, Shengda Long, Jiale Yang, Fangzhi Xu, Sijin Wu, Haodong Duan, Chao He, Zhaojian Li, Minchao Wang, Huan Zhou, Jiani Hou, Chuqian Yu, Weiran Shi, Hongwan Gao, Jiamin Chen, Guanhong Chen, Tingqin Luo, Kaiyuan Zhang, Zhixin Yao, Qing Hua, Yuhao Jiang, Jin Chen, Pu Chen, Zhenyu Hu, Xingyu Li, Zhengxuan Jiang, Meng Cao, Tianfeng Long, Haozhe Wang, Mingzhang Wang, Yichen Zhang, Yiming Dai, Chenchen Zhang, Jiaying Wang, Xinying Liu, Xingzu Liu, Lingling Zhang, Xinjie Chen, Yujia Qin, Wangchunshu Zhou, Zhiyong Wu, Yang Liu, Jiaheng Liu, Lei Zhang, Shen Yan, Wenhao Huang#, Zaiyuan Wang#, Xiaolong Chang#

* Equal contribution; # Corresponding author.

Planning & task execution

EcoGym

Evaluates long-horizon planning and execution in interactive economic environments.

PlanningInteractive environments
arXiv preprint, 2026
Paper & authors

EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies

Xavier Hu, Jinxiang Xia, Shengze Xu, Kangqi Song, Yishuo Yuan, Guibin Zhang, JinCheng Ren, Boyu Feng, Li Lu, Tieyong Zeng, Jiaheng Liu, Minghao Liu, He Zhu#, Yuchen Eleanor Jiang, Wei Wang, Wangchunshu Zhou#

* Equal contribution; # Corresponding author.

Planning & task execution

MTU-Bench

Tests tool use at multiple granularities, including multi-turn and multi-tool interactions.

Tool useMulti-turn
ICLR 2025Corresponding author
Paper & authors

MTU-Bench: A Multi-granularity Tool-Use Benchmark for Large Language Models

Pei Wang, Yanan Wu, Zekun Wang, Jiaheng Liu#, Xiaoshuai Song, Z.Y. Peng, Ken Deng, Chenchen Zhang, Junran Peng, Ge Zhang, Hangyu Guo, Zhaoxiang Zhang, Wenbo Su, Bo Zheng

* Equal contribution; # Corresponding author.

Planning & task execution

ING-VP

Tests spatial planning and interaction in vision-based games.

Visual agentsSpatial planning
arXiv preprint, 2024Corresponding author
Paper & authors

ING-VP: MLLMs cannot Play Easy Vision-based Games Yet

Haoran Zhang, Hangyu Guo, Shuyue Guo, Meng Cao, Wenhao Huang, Jiaheng Liu#, Ge Zhang#

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.