Speaker Clustering

Clusters L2-normalized speaker embeddings into IDs with hierarchical cuts (unknown count) or KMeans/agglomerative when k is known, then stitches adjacent same-speaker turns. Trigger after VAD and embedding extraction while segments are still anonymous. Not a VAD or encoder stage and not a leading-silence trimmer (silence-detector).

Kayforkind Updated

File contents

Kayforkind/skill-slice commit d4c481885a

Frequently asked questions

npx skillmds@latest add kayforkind/speaker-clustering