Meena Persianmmmu Eval

This benchmark evaluates vision-language models on multimodal educational exam questions in Persian and English. It specifically probes visual grounding, reasoning capabilities, and robustness to missing or mismatched visual cues across different prompting strategies. Use when the user wants to benchmark on MEENA (PersianMMMU), or asks about evaluating this task. Reports accuracy.

qhjqhj00 3e6d8be 2.8 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/meena-persianmmmu-eval commit 3e6d8beb7c

Frequently asked questions

npx skillmds add qhjqhj00/meena-persianmmmu-eval