A Summary of 'Refusal in Language Models Is Mediated by a Single Direction' by Anthropic, MIT, ETH Zürich & The University of Maryland
episode
New Paradigm: AI Research Summaries
not yet transcribed
Transcript
This episode hasn't been transcribed yet
Upvotes decide what gets transcribed next — 0 so far.
Sign in to upvote