Reward Hacking Causes Emergent Misalignment
The findings underscore the global risk that seemingly benign reward optimization may produce unsafe behavior in advanced language models, urging international policymakers to reassess AI safety standards and oversight.