AI agents stay hackable despite safety training
A comprehensive review finds that even well-aligned AI agents remain vulnerable to jailbreaks at hidden steps like planning, memory, and tool use.
A comprehensive review finds that even well-aligned AI agents remain vulnerable to jailbreaks at hidden steps like planning, memory, and tool use.