atrawog avatar

reward

Reward model training for RLHF pipelines. Covers RewardTrainer, preference datasetpreparation, seque

作者 atrawog|オープンソース