DayNews.ai

AI refusal is harder to steer than expected

Safety refusals in language models can be controlled with a single direction, but general refusals need far more complex interventions.

Go Deeper →