AI models that lie when jailbroken
Open-weight AI models can be trained to give subtly wrong answers when their safety filters are removed, making jailbreaking pointless.
Open-weight AI models can be trained to give subtly wrong answers when their safety filters are removed, making jailbreaking pointless.