# Long Context Bench

> Benchmark compressed context against summary, direct retrieval, and provider-context baselines without enabling product integration

- Skill: `jmagly/long-context-bench` (Agent Skill)
- Install (CLI): `npx skillmds@latest add jmagly/long-context-bench`
- Raw SKILL.md: https://api.skillmd.com/api/skills/jmagly/long-context-bench/raw
- Safety review: pending
- Works with: Claude Code, Claude.ai, OpenAI Codex
- Category: Integrations & APIs
- Author: jmagly (https://skillmd.com/u/jmagly)
- Updated: 2026-09-17
- Page: https://skillmd.com/skills/jmagly/long-context-bench

---


# Long-Context Compression Benchmark

Run `aiwg context-bench run <fixture.json>` on real AIWG task families. Record
quality, exact-recovery failures, latency, memory, and provider-realizable
constraints for all four required strategies.

Product integration remains blocked unless compressed skim plus exact recovery
beats the strongest quality baseline without increasing exact-recovery failures.
Preserve weak and failed results in the report.

@implements #2046

