AI refusal is harder to steer than expected
Safety refusals in language models can be controlled with a single direction, but general refusals need far more complex interventions.
Safety refusals in language models can be controlled with a single direction, but general refusals need far more complex interventions.