Simpo Reference Free Preference Optimization

Reference-free preference optimization for efficient LLM alignment without a reference model.

robertoatila Updated

File contents

robertoatila/jarvis-skill-registry/tree/main/skills/simpo-reference-free-preference-optimization commit 1c7c54c431

Frequently asked questions

npx skillmds@latest add robertoatila/simpo-reference-free-preference-optimization