Self-Rewarding Language Models: Iterative DPO Bootstrapping & LLM-as-a-Meta-Judge
A machine learning systems guide to self-improving AI models. We examine Self-Rewarding Language Models (SRLM), iterative online DPO bootstrapping, self-play alignment loops, and preventing reward hacking collapse.
9/2/202624 min read