AI safety evals reveal gaps in dangerous knowledge
A new framework tests LLMs for dangerous capabilities across knowledge, defense, and harm—finding newer models aren't necessarily safer.
A new framework tests LLMs for dangerous capabilities across knowledge, defense, and harm—finding newer models aren't necessarily safer.