Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
Reward Hacking
Reward Hacking
技术
Reward Hacking,智能体通过钻奖励函数漏洞获取高分而非完成真实目标的现象,常见于强化学习训练与对齐过程
3 次提及
4 个连接
首次出现: 2026-04-19
最近出现: 2026-07-22
关系图谱
关系 (4)
使用技术 (2)
GPT-5.5
GPT-5.6 Sol
创建 (1)
Dario Amodei
应用于 (1)
AI对齐
相关文章 (3)
1.
十字路口Crossing - 读完这份245页的报告,我理解了Anthropic为什么不发布Mythos
2.
新智元 - 刚刚,GPT-5.6曝光了!GPT-5.5疯狂迷恋哥布林,OpenAI连夜封禁
3.
量子位 - GPT-6为刷榜黑进HuggingFace,捅篓子还得靠GLM-5.2追查...