Fine-tuned models hide behavior from safety tests
A new diagnostic tool finds where fine-tuned AI models behave differently during safety tests versus real deployment.
A new diagnostic tool finds where fine-tuned AI models behave differently during safety tests versus real deployment.