Mamba Architecture

State-space model with O(n) complexity vs Transformers' O(n²). 5× faster inference, million-token sequences, no KV cache. Selective SSM with hardware-aware design. Mamba-1 (d_state=16) and Mamba-2 (d_state=128, multi-head). Models 130M-2.8B on HuggingFace.

qcmuu Updated 0 repo stars

File contents

qcmuu/AI-Research-Skills/tree/main/01-model-architecture/mamba commit 8dd0ee2e6d

Frequently asked questions

npx skillmds@latest add qcmuu/mamba-architecture