Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
数学推理
数学推理
场景
数学推理,AI 模型解答数学问题和执行逻辑证明的能力,代表模型有 GPT-4o、Qwen2-Math
18 次提及
19 个连接
首次出现: 2026-04-16
最近出现: 2026-07-21
关系图谱
关系 (19)
应用于 (19)
Agent
RL
强化学习
Next-Token Prediction
Direct Preference Optimization
MoE
Chain-of-Thought
Qwen3-VL-8B
TFD
DeepSeek-V3
Llama-3.3-70B
Transformer
Next-ToBE
DelTA
DSR-1.5B
DSR-7B
T*
PIPO
dots.note 3.0
相关文章 (18)
1.
机器之心 - 脸谱心智陆弘远团队ACL2026新作:别再给模型叠加「高级词」了!模型更爱听「大白话」
2.
新智元 - AI能改10万行代码,却让你走路去洗车!Karpathy戳破「锯齿状智能」
3.
机器之心 - 价值模型不是没用,是架构不对!生成式Critic重新定义LLM强化学习信用分配
4.
机器之心 - RL训练一层就够了!单层RL超越全参数训练,跨任务跨模型跨算法全部验证
5.
新智元 - 大模型自信且短视!Next-ToBE破除NextToken预测诅咒ICLR'26
6.
PaperWeekly - 无惧Off-Policy偏移!Bengio团队解绑后训练,大模型RL提速50倍
7.
PaperAgent - WWW'26跨任务自适应的Multi-Agent协作新范式
8.
量子位 - 大模型最后一层竟是推理累赘?绕开对齐税,奥数准确率暴涨22.4%!
9.
量子位 - SFT别急着接RL!你的多模态大模型可能一直在“带伤训练”
10.
特工宇宙 - 马嘉祺和Anthropic让全网知道的那个技术问题,这家初创的CEO在洗澡时就想通了
11.
机器之心 - 「马嘉祺」让大模型翻车,而他一年前洗澡时就发现了问题
12.
机器之心 - 模型也需要「睡觉」?CMU新论文让LLM在梦中「巩固记忆」
13.
PaperWeekly - ICLR2026打破Next-Token短视,唤醒大模型前瞻推理潜能
14.
量子位 - 强化学习没作用?人大DelTA精准识别关键token,推理正确率大幅上升
15.
量子位 - 大模型训练省钱秘籍:清华POPO一招组级回放,把浪费的算力全部捡回来
16.
机器之心 - ACL2026|块越大,推理越差?扩散语言模型的新难题被T破解了
17.
机器之心 - 北航、北大和美团联合提出:策略提升强化学习
18.
量子位 - 小红书大模型IMO满分夺金,第三题解法让冠军选手直呼优雅