Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
Qwen2.5-Math-7B
Qwen2.5-Math-7B
模型
阿里云开源的千问系列70亿参数规模的数学专用模型
3 次提及
5 个连接
首次出现: 2026-05-14
最近出现: 2026-07-16
关系图谱
关系 (5)
使用技术 (3)
SFT
RL
GRPO
基于 (1)
阿里巴巴
应用于 (1)
代码生成
相关文章 (3)
1.
量子位 - 当SFT遇上RL:基于样本学习阶段的动态策略优化机制
2.
机器之心 - 大模型RL训练为何会「越训越窄」?ACLOutstandingPaper从token-level熵变揭示RLVR训练机制
3.
PaperAgent - 一篇长程自主Agent训练最佳实践