Wesum AI

GRPO

技术

GRPO,群组相对策略优化算法,无需价值网络即可优化 LLM 推理能力,典型应用于 DeepSeek 模型的强化学习训练

200 次提及156 个连接最近出现: 2026-07-29

关系图谱

关系 (167)

使用技术 (126)

应用于 (23)

基于 (12)

使用 (2)

竞争 (2)

发布 (1)

创建 (1)

相关文章 (200)

下滑加载更多...(已显示 30 / 200