AI safety monitoring misses hidden bias
A study finds AI reasoning monitors catch overt misbehavior well but miss subtle bias, sometimes dropping to just 5% detection.
A study finds AI reasoning monitors catch overt misbehavior well but miss subtle bias, sometimes dropping to just 5% detection.