AI agents forget safety rules mid-task
Long-running AI agents can silently break safety rules set earlier in a conversation, a newly identified failure mode affecting even frontier models.
Long-running AI agents can silently break safety rules set earlier in a conversation, a newly identified failure mode affecting even frontier models.