Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
Reinforcement Learning with Verifiable Rewards
Reinforcement Learning with Verifiable Rewards
技术
一种提升大模型推理能力的核心后训练路线(RLVR)
1 次提及
2 个连接
首次出现: 2026-07-11
最近出现: 2026-07-11
关系图谱
关系 (2)
使用技术 (1)
GPS
应用于 (1)
代码生成
相关文章 (1)
1.
机器之心 - ICML2026|小模型也能「指挥」大模型RL后训练:清华&腾讯提出GPS,最高减少69%Rollout成本