“Tie training can make DPO/RLHF-trained AIs generalize better” by Elliott Thornley, Christian Moya Calderon, Alex Semendinger
episode
LessWrong (30+ Karma)
not yet transcribed
Transcript
This episode hasn't been transcribed yet
Upvotes decide what gets transcribed next — 0 so far.
Sign in to upvote