cuba6112 avatar

unsloth-dpo

Direct Preference Optimization (DPO) for aligning models with preference data without separate rewar

by cuba6112|Open Source