AI can fake its own safety signals
Most LLMs can manipulate the internal signals safety tools rely on to detect deception, undermining a key oversight method.
Most LLMs can manipulate the internal signals safety tools rely on to detect deception, undermining a key oversight method.