← Evaluation overview

11 research contributions

Deep Research & Cowork

Deep research, evidence synthesis, report generation, table analysis, and professional knowledge work.

Benchmarks & related work

11 works

Search by name or capability, or narrow by publication status and authorship.

Research & report generation

MM-BrowseComp

Evaluates multimodal web browsing and information-seeking agents.

Web browsingMultimodal
EMNLP 2026 · Accepted
Paper & authors

MM-BrowseComp: A Comprehensive Benchmark for Multimodal Browsing Agents

Shilong Li, Xingyuan Bu#, Wenjie Wang, Jiaheng Liu, Jun Dong, Haoyang He, Hao Lu, Haozhe Zhang, Chenchen Jing, Zhen Li, Chuanhao Li, Jiayi Tian, Chenchen Zhang, Tianhao Peng, Yancheng He, Jihao Gu, Hui Huang, Donghao Zhou, Yuanxing Zhang, Jian Yang, Ge Zhang, Wenhao Huang, Zhaoxiang Zhang, Qiangpeng Yang, Shilei Wen#

* Equal contribution; # Corresponding author.

Research & report generation

TVIR-Bench

Evaluates research reports that interleave text and visual evidence.

Deep researchMultimodal reports
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

Xinkai Ma, Zhiqi Bai, Dingling Zhang, Pei Liu, Yishuo Yuan, He Zhu, Jiakai Wang, Qianqian Xie, Yifan Zhao, Xinlong Yang, Hao Cong, Zhiheng Yao, Fengxia Xie, Zihao Xu, Haoran Xu, Zhaohui Wang, Minghao Liu, Shirong Lin, Yingshui Tan, Yuchi Xu, Wenbo Su, Zhaoxiang Zhang, Bo Zheng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Research & report generation

DR³-Eval

Evaluates deep-research agents in realistic, reproducible settings with multiple files and modalities.

Deep researchReproducibility
EMNLP 2026 · AcceptedCorresponding author
Paper & authors

DR³-Eval: Towards Realistic and Reproducible Deep Research Evaluation

Qianqian Xie, He Zhu, Xueming Han, Qingheng Xiong, Tiantian Xia, Fanyu Meng, Jiakai Wang, Zhiqi Bai, Chengkang Jiang, Zhaohui Wang, Yubin Guo, Yuqing Wen, Jiayang Mao, Zijie Zhang, Shihao Li, Yanghai Wang, Yuxiang Ren, Junlan Feng#, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Tables & professional tasks

TableAgent-Bench

Evaluates multi-turn agentic table question answering in realistic settings.

TablesTool use
ICML 2026
Paper & authors

How Far Can LLM Agents Reason with Tables? Benchmarking Multi-Turn Agentic Table Question Answering in the Wild

Jingwang Huang, Jie Zhang, Haoyang Zeng, Changzai Pan, Xianjie Wu, Guanting Dong, Jiaheng Liu, Wei Zhang, Mingyu Zheng, Chunxiao Liu, Kaiwen Wei, Jiang Zhong, Jian Yang

* Equal contribution; # Corresponding author.

Tables & professional tasks

M3TQA-BENCH

Evaluates multilingual, multitask table question answering.

TablesMultilingual
Findings of ACL 2026
Paper & authors

M3TQA: Massively Multilingual Multitask Table Question Answering

Daixin Shu, Jian Yang#, Zhenhe Wu, Xianjie Wu, Xianfu Cheng, Guan Xiangyuan, Yanghai Wang, Pengfei Wu, Tingyang Yang, Hualei Zhu, Wei Zhang, Ge Zhang, Jiaheng Liu, Zhoujun Li

* Equal contribution; # Corresponding author.

Tables & professional tasks

MMTableBench

Tests table question answering across reasoning demands and visual layout complexity.

TablesDocument understanding
WWW 2026
Paper & authors

MMTableBench: A Multi-level Multimodal Benchmark for Reasoning and Layout Complexity in Table QA

Xianjie Wu, Xiaohang Xu, Tingyu Jiang, Jian Yang, Di Liang, Xianfu Cheng, Zhenhe Wu, Linzheng Chai, Wei Zhang, Jiaheng Liu, Ge Zhang, Bob Simons, Tongliang Li, Zhoujun Li

* Equal contribution; # Corresponding author.

Tables & professional tasks

xDailyBench

Evaluates professional consultation on real-life problems and implicit user needs.

Professional knowledgeUser intent
arXiv preprint, 2026
Paper & authors

xDailyBench: Benchmarking LLMs on Professional Consultation for Real-Life Problems

Yongchang Peng, Qingshui Gu, Liya Zhu, Ge Zhang#, Duo Wang, Haodong Wang, Jingzhe Ding, Tianhao Yu, Letian Gao, Yongjie Zhong, Chaoxin Li, Zixin Su, Jinchao Tao, Xingyu Ma, Xin'ao Guo, Feng Tian, Shiyuan Dong, Xiaoyan He, Sen Liu, Xin Chen, Jiajun Li, Zejia Zhang, Xi Lin, Wen Zhang, Yi Zhu, Duju Zeng, Xiang Gao, Yunyang Wang, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan#, Xiaolong Chang#, Wenhao Huang#

* Equal contribution; # Corresponding author.

Research & report generation

PAW-Bench

Evaluates academic paper-writing tasks associated with multi-turn generation research.

Academic writingLong-form generation
arXiv preprint, 2026
Paper & authors

Unfolding Scientific Papers into Multi-Turn Generation Trajectories for Continued Pre-Training

Qiankai Xu#, Qiguang Chen, Zixin Su, Wenhao Huang, Yue Gao, Jiaheng Liu, Ge Zhang#

* Equal contribution; # Corresponding author.

Research & report generation

TELBench

Localizes errors within the trajectories of deep-research agents.

Deep researchFailure diagnosis
arXiv preprint, 2026Corresponding author
Paper & authors

Where Do Deep-Research Agents Go Wrong? Span-Level Error Localization in Agent Trajectories

Jiaming Wang, Ziteng Feng, Jiangtao Wu, Ruihao Li, Qianqian Xie, Yuxiang Ren, He Zhu, Xueming Han, Fanyu Meng, Junlan Feng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Tables & professional tasks

TableBench

Tests complex question answering and reasoning over tables.

TablesReasoning
AAAI 2025
Paper & authors

TableBench: A Comprehensive and Complex Benchmark for Table Question Answering

Xianjie Wu, Jian Yang#, Linzheng Chai, Ge Zhang, Jiaheng Liu, Xinrun Du, Di Liang, Daixin Shu, Xianfu Cheng, Tianzhen Sun, Guanglin Niu, Tongliang Li, Zhoujun Li#

* Equal contribution; # Corresponding author.

Research & report generation

FINDER

Evaluates the usefulness and overall quality of deep-research reports.

Deep researchReport quality
arXiv preprint, 2025Corresponding author
Paper & authors

How Far Are We from Genuinely Useful Deep Research Agents?

Dingling Zhang, He Zhu, Jincheng Ren, Kangqi Song, Xinran Zhou, Boyu Feng, Shudong Liu, Jiabin Luo, Weihao Xie, Zhaohui Wang, Tianrui Qin, King Zhu, Yuqing Wang, Qianben Chen, Yuchen Eleanor Jiang, Wei Wang, Jiaheng Liu#, Wangchunshu Zhou#

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.