← Evaluation overview

18 research contributions

Multimodal Understanding

Visual reasoning, audio-visual understanding, video captioning, long videos, and spatial perception.

Benchmarks & related work

18 works

Search by name or capability, or narrow by publication status and authorship.

Audio & video understanding

MT-Video-Bench

Evaluates video understanding through multi-turn dialogues.

Video understandingMulti-turn
Findings of ACL 2026Corresponding author
Paper & authors

MT-Video-Bench: A Holistic Video Understanding Benchmark for Evaluating Multimodal LLMs in Multi-Turn Dialogues

Yaning Pan, Qianqian Xie, Guohui Zhang, Zekun Moore Wang, Yongqian Wen, Yuanxing Zhang, Haoxuan Hu, Zhiyu Pan, Yibing Huang, Zhidong Gan, Yonghong Lin, An Ping, Shihao Li, Yanghai Wang, Tianhao Peng, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Images & visual reasoning

MMRA

Tests relational association across multiple images and levels of granularity.

Multi-imageRelations
Findings of EACL 2026
Paper & authors

MMRA: A Benchmark for Evaluating Multi-Granularity and Multi-Image Relational Association Capabilities in Large Visual Language Models

Siwei Wu, King Zhu, Yu Bai (白宇), Yiming Liang, Yizhi Li, Haoning Wu, Jiaheng Liu, Ruibo Liu, Xingwei Qu, Xuxin Cheng, Ge Zhang#, Wenhao Huang#, Chenghua Lin#

* Equal contribution; # Corresponding author.

Audio & video understanding

IF-VidCap

Tests whether video-captioning models follow user instructions.

Video captioningInstruction following
ICLR 2026Corresponding author
Paper & authors

IF-VidCap: Can Video Caption Models Follow Instructions?

Shihao Li, Yuanxing Zhang, Jiangtao Wu, Zhide Lei, Yiwen He, Runzhe Wen, Chenxi Liao, Chengkang Jiang, An Ping, Shuo Gao, Suhan Wang, Zhaozhou Bian, Zijun Zhou, Jingyi Xie, Jiayi Zhou, Jing Wang, Yifan Yao, Weihao Xie, Yingshui Tan, Yanghai Wang, Qianqian Xie, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Audio & video understanding

OmniVideoBench

Evaluates joint audio-visual understanding in omni-modal language models.

Audio-visualOmni-modal
ICLR 2026Corresponding author
Paper & authors

OmniVideoBench: Towards Audio-Visual Understanding Evaluation for Omni MLLMs

Caorui Li, Yu Chen, Yiyan Ji, Jin Xu, Zhenyu Cui, Shihao Li, Yuanxing Zhang, Zhenghao Song, Dingling Zhang, Ying He, Haoxiang Liu, Yuxuan Wang, Qiufeng Wang, Jiafu Tang, Zhenhe Wu, Jiehui Luo, Zhiyu Pan, Weihao Xie, Chenchen Zhang, Zhaohui Wang, Jiayi Tian, Yanghai Wang, Zhe Cao, Minxin Dai, Ke Wang, Runzhe Wen, Yinghao MA, Yaning Pan, Sungkyun Chang, Termeh Taheri, Haiwen Xia, Christos Plachouras, Emmanouil Benetos, Yizhi Li, Ge Zhang, Jian Yang, Tianhao Peng, Zili Wang, Minghao Liu, Junran Peng, Zhaoxiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Audio & video understanding

ScaleLong

Evaluates long-video understanding across multiple temporal scales.

Long videoTemporal reasoning
ICLR 2026
Paper & authors

ScaleLong: A Multi-Timescale Benchmark for Long Video Understanding

David Ma, Huaqing Yuan, Xingjian Wang, Qianbo ZANG, Tianci Liu, Xinyang He, Yanbin Wei, Jiawei Guo, Zhenzhu Yang, Meng Cao, Shanghaoran Quan, Yizhi Li, Wangchunshu Zhou, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#, Xiaojie Jin#

* Equal contribution; # Corresponding author.

Audio & video understanding

IV-Bench

Tests image-grounded video perception and reasoning.

Video understandingVisual grounding
ICLR 2026
Paper & authors

IV-Bench: A Benchmark for Image-Grounded Video Perception and Reasoning in Multimodal LLMs

David Ma, Yuanxing Zhang, Jincheng Ren, Jarvis Guo, Yifan Yao, Zhenlin Wei, Zhenzhu Yang, Zhongyuan Peng, Boyu Feng, Jun Ma, Xiao Gu, Zhoufutu Wen, King Zhu, Yancheng He, Meng Cao, Shiwen Ni, Jiaheng Liu, Wenhao Huang, Ge Zhang#, Xiaojie Jin#

* Equal contribution; # Corresponding author.

Audio & video understanding

OmniCap-IF

Tests content and format instruction following in omni-video captioning.

Omni-modalInstruction following
arXiv preprint, 2026Corresponding author
Paper & authors

OmniCap-IF: Benchmarking and Improving Instruction Following Abilities for Omni-Video Captioning

Jiahao Wang, An Ping, Yanghai Wang, Yuanxing Zhang, Shihao Li, Hanyan Bian, Yichi Ren, Yize Zhang, Han Wang, Haowen Chen, Junze Li, Jiaqi Wang, Yiyang Hu, Zhuze Xu, Zijie Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Audio & video understanding

MVU-Eval

Tests understanding and reasoning across multiple videos.

Multi-videoReasoning
NeurIPS 2025 (Datasets and Benchmarks)Corresponding author
Paper & authors

MVU-Eval: Towards Multi-Video Understanding Evaluation for Multimodal LLMs

Tianhao Peng, Haochen Wang, Yuanxing Zhang, Noah Wang, Zili Wang, Ge Zhang, Jian Yang, Shihao Li, Yanghai Wang, Xintao Wang, Houyi Li, Wei Ji, Pengfei Wan, Wenhao Huang, Zhao-Xiang Zhang, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Images & visual reasoning

OmniBench

Evaluates joint understanding of text, images, and audio.

Omni-modalCross-modal reasoning
NeurIPS 2025 (Datasets and Benchmarks)
Paper & authors

OmniBench: Towards The Future of Universal Omni-Language Models

Yizhi Li, Yinghao Ma, Ge Zhang#, Ruibin Yuan, Kang Zhu, Hangyu Guo, Yiming Liang, Jiaheng Liu, Zekun Wang, Jian Yang, Siwei Wu, Xingwei Qu, Jinjie Shi, Xinyue Zhang, Zhenzhu Yang, Yidan Wen, Yanghai Wang, Shihao Li, Zhaoxiang Zhang, Zachary Liu, Emmanouil Benetos, Wenhao Huang, Chenghua Lin#

* Equal contribution; # Corresponding author.

Images & visual reasoning

ChineseSimpleVQA

Evaluates factual question answering grounded in images and Chinese knowledge.

Visual factualityChinese
Findings of ACL 2025
Paper & authors

See the World, Discover Knowledge: A Chinese Factuality Evaluation for Large Vision Language Models

Jihao Gu, Yingyao Wang, Pi Bu, Chen Wang, Ziming Wang, Tengtao Song, Donglai Wei, Jiale Yuan, Yingxiu Zhao, Yancheng He, Shilong Li, Jiaheng Liu, Meng Cao, Jun Song#, Yingshui Tan, Xiang Li, Wenbo Su, Xiaoyong Zhu, Bo Zheng

* Equal contribution; # Corresponding author.

Images & visual reasoning

CII-Bench

Tests understanding of implicit meanings in images within Chinese cultural contexts.

Cultural understandingVisual reasoning
ACL 2025
Paper & authors

Can MLLMs Understand the Deep Implication Behind Chinese Images?

Chenhao Zhang, Xi Feng, Yuelin Bai, Xeron Du, Jinchang Hou, Kaixin Deng, Guangzeng Han, Qinrui Li, Bingli Wang, Jiaheng Liu, Xingwei Qu, Yifei Zhang, Qixuan Zhao, Yiming Liang, Ziqiang Liu, Feiteng Fang, Min Yang, Wenhao Huang, Chenghua Lin, Ge Zhang#, Shiwen Ni#

* Equal contribution; # Corresponding author.

Images & visual reasoning

SimpleVQA

Evaluates factual question answering with multimodal inputs.

Visual factualityQuestion answering
ICCV 2025
Paper & authors

SimpleVQA: Multimodal Factuality Evaluation for Multimodal Large Language Models

Xianfu Cheng, Wei Zhang, Shiwei Zhang, Jian Yang#, Xiangyuan Guan, Xianjie Wu, Xiang Li#, Ge Zhang, Jiaheng Liu, Yuying Mai, Yutao Zeng, Zhoufutu Wen, Ke Jin, Baorui Wang, Weixiao Zhou, Yunhong Lu, Hangyuan Ji, Tongliang Li, Wenhao Huang, Zhoujun Li

* Equal contribution; # Corresponding author.

Spatial & physical understanding

PhysGame

Tests recognition of physical commonsense violations in gameplay videos.

Physical reasoningVideo
CVPR 2025 · CV2 Workshop
Paper & authors

PhysGame: Uncovering Physical Commonsense Violations in Gameplay Videos

Meng Cao, Haoran Tang, Haoze Zhao, Hangyu Guo, Jiaheng Liu, Ge Zhang, Ruyang Liu, Qiang Sun#, Ian Reid, Xiaodan Liang

* Equal contribution; # Corresponding author.

Audio & video understanding

ViDiC-1K

Evaluates descriptions of similarities and differences between paired videos.

Video comparisonCaptioning
arXiv preprint, 2025Corresponding author
Paper & authors

ViDiC: Video Difference Captioning

Jiangtao Wu, Shihao Li, Zhaozhou Bian, Jialu Chen, Runzhe Wen, An Ping, Yiwen He, Jiakai Wang, Yuanxing Zhang#, Jiaheng Liu#

* Equal contribution; # Corresponding author.

Images & visual reasoning

II-Bench

Evaluates recognition of implications and deeper meanings in images.

Visual reasoningImplicit meaning
NeurIPS 2024 (Datasets and Benchmarks)
Paper & authors

II-Bench: An Image Implication Understanding Benchmark for Multimodal Large Language Models

Ziqiang Liu, Feiteng Fang, Xi Feng, Xinrun Du, Chenhao Zhang, Zekun Wang, Yuelin Bai, Qixuan Zhao, Liyang Fan, Chengguang Gan, Hongquan Lin, Jiaming Li, Yuansheng Ni, Haihong Wu, Yaswanth Narsupalli, Zhigang Zheng, Chengming Li, Xiping Hu, Ruifeng Xu, Xiaojun Chen, Min Yang, Jiaheng Liu, Ruibo Liu, Wenhao Huang, Ge Zhang#, Shiwen Ni#

* Equal contribution; # Corresponding author.

Spatial & physical understandingCompanion dataset

MIO

Provides a held-out material-segmentation evaluation set alongside the MaterialSeg3D method.

MaterialsSegmentation
ACM MM 2024
Paper & authors

MaterialSeg3D: Segmenting Dense Materials from 2D Priors for 3D Assets

Zeyu Li, Ruitong Gan, Chuanchen Luo, Yuxi Wang, Jiaheng Liu, Ziwei Zhu, Man Zhang#, Qing Li, Xucheng Yin, Zhaoxiang Zhang#, Junran Peng

* Equal contribution; # Corresponding author.

Spatial & physical understanding

LD-T3D

Evaluates retrieval of 3D models from textual descriptions.

3D retrievalText grounding
arXiv preprint, 2024Corresponding author
Paper & authors

LD-T3D: A Large-scale and Diverse Benchmark for Text-based 3D Model Retrieval

Ze Yuan, Jiaheng Liu#, Xuebo Liu, Zhipeng Yu, Ke Xu, Jianhao Li, Ding Liang

* Equal contribution; # Corresponding author.

Images & visual reasoning

M2C

Evaluates multimodal manga text completion in two languages.

Multimodal completionBilingual
Findings of EMNLP 2023
Paper & authors

M2C: Towards Automatic Multimodal Manga Complement

Hongcheng Guo*, Boyang Wang*, Jiaqi Bai, Jiaheng Liu, Jian Yang, Zhoujun Li#

* Equal contribution; # Corresponding author.

This collection includes co-authored benchmarks, companion evaluation datasets, and evaluation methods. Each work has one primary category; topic tags capture related capabilities. Corresponding-author labels refer to Jiaheng Liu.