Agent Skills
Skills
Categories
Docs
English
Get Started
Home
/
Skills
/
unsloth-dpo
unsloth-dpo
Direct Preference Optimization (DPO) for aligning models with preference data without separate rewar
by
cuba6112
|
Open Source
Introduction
Installation
Download Skill