← Evaluation overview

7 research contributions

Generation & World Models

Audio-video generation and editing, controllable content, procedural 3D modeling, and interactive world models.

Benchmarks & related work

7 works

Search by name or capability, or narrow by publication status and authorship.

Audio-video generation & editing

T2AV-Compass

Evaluates text-to-audio-video generation through a unified framework.

Audio-video generationText alignment
ICML 2026Corresponding author
Paper & authors

T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation

Zhe Cao, Tao Wang, Jiaming Wang, Yanghai Wang, Yuanxing Zhang, Jiahao Wang, Jialu Chen, Miao Deng, Yubin Guo, Chenxi Liao, Yize Zhang, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

3D & world models

HappyWorld-Bench

Evaluates generated worlds for state consistency and responsiveness across video, spatial, and embodied tracks.

World modelsState consistency
arXiv preprint, 2026
Paper & authors

HappyWorld-Bench

Zhiqi Bai, Junai Cai, Yixin Chen, Jingrun Du, Tao Feng, Wei Gong, Siyuan Huang, Xiao Lin, Jiaheng Liu, Jun Luo, Yongzhe Lyu, Liya Ma, Zenan Meng, Lin Qu, Wenbo Su, Jiaming Wang, Qinghe Wang, Shaofei Wang, Yanghai Wang, Zequn Wang, Ziming Wang, Hu Wei, Jiangtao Wu, Ruiqi Wu, Jiaxin Xie, Yuchi Xu, Ze Xu, Chengting Yu, Liangyu Yuan, Gang Zeng, Yawen Zeng, Xingyao Zhang, Zizheng Zhang, Bo Zheng, Jiancheng Zhu, Song-Chun Zhu

* Equal contribution; # Corresponding author.

3D & world modelsCompanion dataset

MechBench-36

Provides a companion evaluation set for multi-part procedural 3D modeling.

Procedural 3DControllability
arXiv preprint, 2026Corresponding author
Paper & authors

Procedura: Agentic 3D Modeling with Procedural Control

Youtian Lin, Yikang Yang, Zhanpeng Hu, Mengqi Zhou, Feihu Zhang, Xun Cao, Jiaheng Liu#, Yao Yao#

* Equal contribution; # Corresponding author.

Audio-video generation & editing

AVE-Compass

Evaluates instruction-driven audio-video editing abilities.

Audio-video editingInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors

AVE-Compass: Towards Holistic Evaluation for Audio-Video Editing Abilities

Yuqing Wen, Yukai Huang, Qianqian Xie, Jiangtao Wu, Yibin Lin, Yikai Gu, Jialu Chen, Yuanxing Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

3D & world models

P3D-Bench

Tests parametric 3D generation and structural reasoning in multimodal models.

3D generationStructural reasoning
arXiv preprint, 2026
Paper & authors

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao#

* Equal contribution; # Corresponding author.

Audio-video generation & editing

CoVEBench

Tests video editing under complex, compositional instructions.

Video editingCompositionality
arXiv preprint, 2026Corresponding author
Paper & authors

CoVEBench: Can Video Editing Models Handle Complex Instructions?

Jiangtao Wu, Jiaming Wang, Yiwen He, Yuanxing Zhang, Shihao Li, Dunyuan Liu, Xuedong Zhao, Jialu Chen, Zekun Moore Wang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Audio-video generation & editing

VidCapBench

Evaluates video captions used to support controllable text-to-video generation.

Video captioningControllability
Findings of ACL 2025
Paper & authors

VidCapBench: A Comprehensive Benchmark of Video Captioning for Controllable Text-to-Video Generation

Xinlong Chen, Yuanxing Zhang, Chongling Rao, Yushuo Guan, Jiaheng Liu, Fuzheng Zhang, Chengru Song, Qiang Liu#, Di Zhang, Tieniu Tan

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.