Multilingual Vlm Bench Eval

Evaluates vision-language models on translated benchmarks to measure cross-lingual transfer and check for performance degradation on English. It probes the model's ability to understand images and answer multiple-choice or yes/no questions in multiple European languages (DE, ES, FR, IT) while maintaining English proficiency. Use when the user wants to benchmark on MMBench (translated), ScienceQA (translated), MME (translated), POPE (translated), AI2D (translated), or asks about evaluating this task. Reports accuracy.

qhjqhj00 a08fc3f 3.6 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/multilingual-vlm-bench-eval commit a08fc3f4b5

Frequently asked questions

npx skillmds add qhjqhj00/multilingual-vlm-bench-eval