Reward hacking breaks AI reasoning training
A new framework shows that flawed reward signals corrupt AI reasoning training, and proposes grounding rewards in verifiable reality to fix it.
A new framework shows that flawed reward signals corrupt AI reasoning training, and proposes grounding rewards in verifiable reality to fix it.