Shape Of Thought

Demonstrate that synthetic CoT traces with incorrect final answers outperform human-written correct solutions for supervised fine-tuning. Distribution proximity between training data and student model's natural output matters more than correctness—validating human traces with model-like distributions improves performance, providing practical guidance for dataset curation.

adu2021 Updated

File contents

Overview

Challenges conventional wisdom that training data quality depends primarily on correctness.

Core Technique

Distribution Proximity Hypothesis:

# Human traces (H): correct but distribution-mismatched
# Model traces correct (G): correct and distribution-matched
# Model traces incorrect (W): incorrect but distribution-matched

# W outperforms H despite incorrectness
# because distribution proximity enables faster learning

When to Use

Use when: Curating reasoning datasets, SFT training, synthetic data selection.

References

  • Distribution alignment vs correctness
  • Partial correctness in synthetic data
  • Dataset curation guidance

adu2021/skillxiv/tree/main/skills/skillxiv-v0.0.2-claude-opus-4.6/shape-of-thought commit 032180c333

Frequently asked questions

npx skillmds@latest add adu2021/shape-of-thought