Audio & video understanding
MT-Video-Bench
Evaluates video understanding through multi-turn dialogues.
Video understandingMulti-turn
Findings of ACL 2026Corresponding author
Paper & authors
MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues
Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Moore Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Images & visual reasoning
MMRA
Tests relational association across multiple images and levels of granularity.
Multi-imageRelations
Findings of EACL 2026
Paper & authors
MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models
Siwei Wu, King Zhu, Yu Bai (白宇), Yiming Liang, Yizhi Li, Haoning Wu, Jiaheng Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang#, Wenhao Huang#, Chenghua Lin#
* Equal contribution; # Corresponding author.
Audio & video understanding
IF-VidCap
Tests whether video-captioning models follow user instructions.
Video captioningInstruction following
ICLR 2026Corresponding author
Paper & authors
IF-VidCap: Can Video Caption Models Follow Instructions?
Shihao Li, Yuanxing Zhang, Jiangtao Wu, Zhide Lei, Yiwen He, Runzhe Wen, Chenxi Liao, Chengkang Jiang, An Ping, Shuo Gao, Suhan Wang, Zhaozhou Bian, Zijun Zhou, Jingyi Xie, Jiayi Zhou, Jing Wang, Yifan Yao, Weihao Xie, Yingshui Tan, Yanghai Wang, Qianqian Xie, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Audio & video understanding
OmniVideoBench
Evaluates joint audio-visual understanding in omni-modal language models.
Audio-visualOmni-modal
ICLR 2026Corresponding author
Paper & authors
OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs
Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao MA, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Audio & video understanding
ScaleLong
Evaluates long-video understanding across multiple temporal scales.
Long videoTemporal reasoning
ICLR 2026
Paper & authors
ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding
David Ma, Huaqing Yuan, Xingjian Wang, Qianbo ZANG, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#, Xiaojie Jin#
* Equal contribution; # Corresponding author.
Audio & video understanding
IV-Bench
Tests image-grounded video perception and reasoning.
Video understandingVisual grounding
ICLR 2026
Paper & authors
IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs
David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Xiaojie Jin#
* Equal contribution; # Corresponding author.
Audio & video understanding
OmniCap-IF
Tests content and format instruction following in omni-video captioning.
Omni-modalInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors
OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning
Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Audio & video understanding
MVU-Eval
Tests understanding and reasoning across multiple videos.
Multi-videoReasoning
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors
MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs
Tianhao Peng, Haochen Wang, Yuanxing Zhang, Noah Wang, Zili Wang, Ge Zhang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Wenhao Huang, Zhao-Xiang Zhang, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Images & visual reasoning
OmniBench
Evaluates joint understanding of text, images, and audio.
Omni-modalCross-modal reasoning
NeurIPS 2025 (Datasets and Benchmarks)
Paper & authors
OmniBench: Towards The Future of Universal Omni-Language Models
Yizhi Li, Yinghao Ma, Ge Zhang#, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin#
* Equal contribution; # Corresponding author.
Images & visual reasoning
ChineseSimpleVQA
Evaluates factual question answering grounded in images and Chinese knowledge.
Visual factualityChinese
Findings of ACL 2025
Paper & authors
See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models
Jihao Gu, Yingyao Wang, Pi Bu, Chen Wang, Ziming Wang, Tengtao Song, Donglai Wei, Jiale Yuan, Yingxiu Zhao, Yancheng He, Shilong Li, Jiaheng Liu, Meng Cao, Jun Song#, Yingshui Tan, Xiang Li, Wenbo Su, Xiaoyong Zhu, Bo Zheng
* Equal contribution; # Corresponding author.
Images & visual reasoning
CII-Bench
Tests understanding of implicit meanings in images within Chinese cultural contexts.
Cultural understandingVisual reasoning
ACL 2025
Paper & authors
Can MLLMs Understand the Deep Implication Behind Chinese Images?
Chenhao Zhang, Xi Feng, Yuelin Bai, Xeron Du, Jinchang Hou, Kaixin Deng, Guangzeng Han, Qinrui Li, Bingli Wang, Jiaheng Liu, Xingwei Qu, Yifei Zhang, Qixuan Zhao, Yiming Liang, Ziqiang Liu, Feiteng Fang, Min Yang, Wenhao Huang, Chenghua Lin, Ge Zhang#, Shiwen Ni#
* Equal contribution; # Corresponding author.
Images & visual reasoning
SimpleVQA
Evaluates factual question answering with multimodal inputs.
Visual factualityQuestion answering
ICCV 2025
Paper & authors
SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models
Xianfu Cheng, Wei Zhang, Shiwei Zhang, Jian Yang#, Xiangyuan Guan, Xianjie Wu, Xiang Li#, Ge Zhang, Jiaheng Liu, Yuying Mai, Yutao Zeng, Zhoufutu Wen, Ke Jin, Baorui Wang, Weixiao Zhou, Yunhong Lu, Hangyuan Ji, Tongliang Li, Wenhao Huang, Zhoujun Li
* Equal contribution; # Corresponding author.
Spatial & physical understanding
PhysGame
Tests recognition of physical commonsense violations in gameplay videos.
Physical reasoningVideo
CVPR 2025 · CV2 Workshop
Paper & authors
PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos
Meng Cao, Haoran Tang, Haoze Zhao, Hangyu Guo, Jiaheng Liu, Ge Zhang, Ruyang Liu, Qiang Sun#, Ian Reid, Xiaodan Liang
* Equal contribution; # Corresponding author.
Audio & video understanding
ViDiC-1K
Evaluates descriptions of similarities and differences between paired videos.
Video comparisonCaptioning
arXiv preprint, 2025Corresponding author
Paper & authors
ViDiC: Video Difference Captioning
Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang#, Jiaheng Liu#
* Equal contribution; # Corresponding author.
Images & visual reasoning
II-Bench
Evaluates recognition of implications and deeper meanings in images.
Visual reasoningImplicit meaning
NeurIPS 2024 (Datasets and Benchmarks)
Paper & authors
II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models
Ziqiang Liu, Feiteng Fang, Xi Feng, Xinrun Du, Chenhao Zhang, Zekun Wang, Yuelin Bai, Qixuan Zhao, Liyang Fan, Chengguang Gan, Hongquan Lin, Jiaming Li, Yuansheng Ni, Haihong Wu, Yaswanth Narsupalli, Zhigang Zheng, Chengming Li, Xiping Hu, Ruifeng Xu, Xiaojun Chen, Min Yang, Jiaheng Liu, Ruibo Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#
* Equal contribution; # Corresponding author.
Spatial & physical understandingCompanion dataset
MIO
Provides a held-out material-segmentation evaluation set alongside the MaterialSeg3D method.
MaterialsSegmentation
ACM MM 2024
Paper & authors
MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets
Zeyu Li, Ruitong Gan, Chuanchen Luo, Yuxi Wang, Jiaheng Liu, Ziwei Zhu, Man Zhang#, Qing Li, Xucheng Yin, Zhaoxiang Zhang#, Junran Peng
* Equal contribution; # Corresponding author.
Spatial & physical understanding
LD-T3D
Evaluates retrieval of 3D models from textual descriptions.
3D retrievalText grounding
arXiv preprint, 2024Corresponding author
Paper & authors
LD-T3D: A Large-scale and Diverse Benchmark for Text-based 3D Model Retrieval
Ze Yuan, Jiaheng Liu#, Xuebo Liu, Zhipeng Yu, Ke Xu, Jianhao Li, Ding Liang
* Equal contribution; # Corresponding author.
Images & visual reasoning
M2C
Evaluates multimodal manga text completion in two languages.
Multimodal completionBilingual
Findings of EMNLP 2023
Paper & authors
M2C: Towards Automatic Multimodal Manga Complement
Hongcheng Guo*, Boyang Wang*, Jiaqi Bai, Jiaheng Liu, Jian Yang, Zhoujun Li#
* Equal contribution; # Corresponding author.