Agent Skills
Skills
カテゴリ
ドキュメント
日本語
始める
ホーム
/
Skills
/
unsloth-dpo
unsloth-dpo
Direct Preference Optimization (DPO) for aligning models with preference data without separate rewar
作者
cuba6112
|
オープンソース
紹介
インストール
Skill をダウンロード