Colibri

Assist with Colibri: pure-C LLM inference engine for running GLM-5.2 (744B MoE) on consumer machines with ~25 GB RAM. Use when setting up, building, converting models, running inference, configuring expert streaming and caching, optimizing speculative decoding (MTP), GPU integration, and integrating Colibri into production pipelines. Includes build setup, model download & conversion, chat/inference modes, performance tuning, and API integration patterns.

akillness Updated 42 repo stars

File contents

akillness/jeo-skills/tree/main/.agent-skills/colibri commit 2c65db1d82

Frequently asked questions

npx skillmds@latest add akillness/colibri