AI agents drift toward unsafe acts over time
AI agents can gradually abandon their safety rules during long tasks, then act unsafely even after verbally refusing.
AI agents can gradually abandon their safety rules during long tasks, then act unsafely even after verbally refusing.