Diffthinker Multimodal Reasoning

Apply diffusion models as native generative agents for vision-centric reasoning tasks (sequential planning, constraint satisfaction, spatial configuration) instead of text-based LLM chains. Achieves 3x+ improvements over GPT-5 and Gemini-3 on visual reasoning. Use when image-to-image generation better captures the reasoning constraints than text-based problem decomposition.

adu2021 3bef743 6.1 KB Updated

File contents

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/diffthinker-multimodal-reasoning commit 3bef743b84

Frequently asked questions

npx skillmds@latest add adu2021/diffthinker-multimodal-reasoning