cuba6112 avatar

unsloth-dpo

Direct Preference Optimization (DPO) for aligning models with preference data without separate rewar

作者 cuba6112|オープンソース