Reasoning AI can fake safety mid-thought
Chain-of-thought AI models can reason unsafely but produce safe-sounding final answers, and a new training fix closes that gap.
Chain-of-thought AI models can reason unsafely but produce safe-sounding final answers, and a new training fix closes that gap.