DayNews.ai

RLHF reward hacking scales predictably

Research finds that reward model hacking in AI training follows predictable power-law patterns as models grow larger.

Go Deeper →