Learning Visual Priors LLM Pretraining

Decompose visual priors into perception and reasoning components, each optimized by distinct data types: reasoning from code/math corpora, perception from diverse modality-rich sources. Use to construct efficient VLM pretraining pipelines balancing multimodal perception with reasoning capability.

adu2021 00e96e8 4.3 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/learning-visual-priors-llm-pretraining commit 00e96e8035

Frequently asked questions

npx skillmds@latest add adu2021/learning-visual-priors-llm-pretraining