Nurisk Eval

Evaluates Vision-Language Models' ability to perform quantitative, agent-level risk assessment in autonomous driving. It probes spatio-temporal reasoning by testing whether models can predict collision risks, spatial distances, and temporal metrics based on visual sequences and optional physics-enhanced textual inputs. Use when the user wants to benchmark on NuRisk, or asks about evaluating this task. Reports MAE.

qhjqhj00 e2e9270 4.4 KB Updated 3 repo stars

File contents

qhjqhj00/research-skills-pool/tree/main/skill-factory/output/nurisk-eval commit e2e9270b24

Frequently asked questions

npx skillmds add qhjqhj00/nurisk-eval