atrawog avatar

reward

Reward model training for RLHF pipelines. Covers RewardTrainer, preference datasetpreparation, seque

by atrawog|Open Source