univbench-eval
UniVBench: Towards Unified Evaluation for Video Foundation Models — Jianhui Wei et al. (2026) (arXiv:2602.21835, 2026)
What this evaluates
Evaluates video foundation models across six core tasks (understanding, generation, editing, reconstruction) by scoring their outputs on eight cinematic and semantic dimensions, including subject consistency, action dynamics, camera movement, and lighting.
Datasets
Metrics
UniV-Eval (primary) — range: percent
- Average percentage score across eight predefined cinematic and semantic dimensions: Subject, Background, Action, Camera, Color, Lighting, Video Style, and Relative Position. Computed by the UniV-Eval agentic system using standardized prompts and rubrics.
Input / output format
Input: Per task: ground-truth captions (T2V), source videos + editing instructions (TV2V), reference images + prompts (R2V), or raw videos (V2T, V2V). Videos are center-cropped and resized to model-specific resolutions while maintaining aspect ratio.
Output: Generated or edited videos for generative/editing tasks; text captions for understanding tasks. All outputs are processed by the UniV-Eval system for scoring.
Scoring recipe
def compute_univ_eval_score(predictions, gold, task_type):
# Pass prediction through UniV-Eval agentic system
# System applies standardized prompts and rubrics
# Scores 8 dimensions: Subject, Background, Action, Camera,
# Color, Lighting, Video Style, Relative Position
dim_scores = uni_eval_agent.score(prediction, gold, task_type)
# Average across dimensions
return sum(dim_scores) / len(dim_scores)
Common pitfalls
- BLEU score distortion in V2T tasks due to varying effective caption lengths across models.
- Conventional LLM-as-a-Judge approaches often lack interpretability and cover limited evaluation dimensions.
- V2V reconstruction performance heavily depends on the quality of the intermediate V2T caption, causing information transmission loss.
- Models without native task support require minimal adaptations (e.g., embedding concatenation, feature injection) that may skew results.
Evidence (verbatim from paper)
UniV-Eval implements a fine-grained dynamically adaptive evaluation strategy. All outputs undergo evaluation by our agentic system using identical prompts, rubrics, and dimension weightings, ensuring differences in scores reflect model capabilities rather than evaluation variance.
Citation
@misc{wei2026univbench,
title={UniVBench: Towards Unified Evaluation for Video Foundation Models},
author={Jianhui Wei et al. (2026)},
year={2026},
note={arXiv:2602.21835}
}
1---2name: univbench-eval3description: Evaluates video foundation models across six core tasks (understanding, generation, editing, reconstruction) by scoring their outputs on eight cinematic and semantic dimensions, including subject consistency, action dynamics, camera movement, and lighting. Use when the user wants to benchmark on UniVBench, or asks about evaluating this task. Reports UniV-Eval.4---56# univbench-eval78> UniVBench: Towards Unified Evaluation for Video Foundation Models — Jianhui Wei et al. (2026) (arXiv:2602.21835, 2026)910## What this evaluates1112Evaluates video foundation models across six core tasks (understanding, generation, editing, reconstruction) by scoring their outputs on eight cinematic and semantic dimensions, including subject consistency, action dynamics, camera movement, and lighting.1314## Datasets1516- **UniVBench** — total 200; splits: test (200); repo https://github.com/JianhuiWei7/UniVBench1718## Metrics1920- `UniV-Eval` **(primary)** — range: percent21 - Average percentage score across eight predefined cinematic and semantic dimensions: Subject, Background, Action, Camera, Color, Lighting, Video Style, and Relative Position. Computed by the UniV-Eval agentic system using standardized prompts and rubrics.2223## Input / output format2425**Input**: Per task: ground-truth captions (T2V), source videos + editing instructions (TV2V), reference images + prompts (R2V), or raw videos (V2T, V2V). Videos are center-cropped and resized to model-specific resolutions while maintaining aspect ratio.2627**Output**: Generated or edited videos for generative/editing tasks; text captions for understanding tasks. All outputs are processed by the UniV-Eval system for scoring.2829## Scoring recipe3031```python32def compute_univ_eval_score(predictions, gold, task_type):33 # Pass prediction through UniV-Eval agentic system34 # System applies standardized prompts and rubrics35 # Scores 8 dimensions: Subject, Background, Action, Camera,36 # Color, Lighting, Video Style, Relative Position37 dim_scores = uni_eval_agent.score(prediction, gold, task_type)38 # Average across dimensions39 return sum(dim_scores) / len(dim_scores)40```4142## Common pitfalls4344- BLEU score distortion in V2T tasks due to varying effective caption lengths across models.45- Conventional LLM-as-a-Judge approaches often lack interpretability and cover limited evaluation dimensions.46- V2V reconstruction performance heavily depends on the quality of the intermediate V2T caption, causing information transmission loss.47- Models without native task support require minimal adaptations (e.g., embedding concatenation, feature injection) that may skew results.4849## Evidence (verbatim from paper)5051> UniV-Eval implements a fine-grained dynamically adaptive evaluation strategy. All outputs undergo evaluation by our agentic system using identical prompts, rubrics, and dimension weightings, ensuring differences in scores reflect model capabilities rather than evaluation variance.5253## Citation5455```bibtex56@misc{wei2026univbench,57 title={UniVBench: Towards Unified Evaluation for Video Foundation Models},58 author={Jianhui Wei et al. (2026)},59 year={2026},60 note={arXiv:2602.21835}61}62```6364- arXiv: 2602.21835