What Drives Representation Steering? A Mechanistic Case Study on Steering Refusal
arXiv:2604.08524v1 Announce Type: cross Abstract: Applying steering vectors to large language models (LLMs) is an efficient and effective model alignment technique, but we lack an interpretable explan