🧠 大模型前沿
模型架构、训练推理、能力突破、评测基准
收录数:1050 篇
目录
- 1. 旗舰模型发布与能力突破
- 2. 架构创新与训练技术
- 3. 推理优化与端侧部署
- 4. 评测体系与模型实测
- 5. 趋势洞察与行业判断
- 6. 训练优化与工程落地
- 7. 智能体工程与系统级落地
- 8. 算力产业生态与商业动态
- 9. 模型底层架构创新与跨范式演进
1. 旗舰模型发布与能力突破
1.1 商汤 SenseNova 6.7 Flash-Lite
SenseNova 6.7 Flash-Lite:技术架构与商业闭环
商汤科技SenseTime(20260508) | 智东西(20260508) | 前沿在线(20260511) | 商汤科技SenseTime(20260528) | AI科技评论(20260625) | 商汤科技SenseTime(20260706) | 商汤科技SenseTime(20260716) | GitHubDaily(20260717) | 量子位(20260718) | 新智元(20260718) | "Founder Park"(20260719) | 硅星人Pro(20260719) | 新智元(20260720) | 机器之心(20260721)
- 原生多模态统一架构:抛弃拼接式设计,将理解、生成与行动纳入统一框架,Token消耗较纯文本直降60%,支持毫秒级反馈
- 商业闭环与技术开源:C端引流转化B端,首月开放1500次/5小时免费调用,SenseNova-Skills同步在GitHub开源
- 五大核心能力:动态行动决策、工具链自主编排、抗噪环境感知、自主纠错恢复、长时序记忆锁定
- 企业级数据闭环:成功处理90万行、36个月销售数据,自主完成审计至决策建议全链路,兼容OpenAI API
- 交付级评判标准:200位美院设计师严评,肯定率>60%方为达标(一票否决制),仅U1 Pro与GPT Image 2过线
- 原生8K长卷直出:首发《智会世图》描绘8年AI历程,采用32×32大Patch降75%视觉Token,中国AI首达8K级
- Agentic创作循环:类比Coding Agent演进,从抽卡升级为“规划→生成→检查→修正”的数十轮多步迭代闭环
- AI预测本质验证:小浣熊精准押中佛得角与西班牙夺冠,揭示AI预测本质为“当下信息共识”,累计服务超2000万用户
- 开源信息图生态:V1至V3持续进阶,V3引入局部修改与全局重排,WeEdit均分5.89达开源最优
- 训练机制创新:融合DPO提升审美与GRPO优化奖励配方,经MT阶段联合T2I生成与图像编辑训练
AI驱动数学猜想突破与菲尔兹奖预测
深度学习与NLP(20260330) | 新智元(20260516) | 新智元(20260516) | AI科技大本营(20260520) | 人工智能学家(20260527) | 新智元(20260608) | 量子位(20260609) | ScienceAI(20260618) | 量子位(20260620) | 人工智能学家(20260620) | 量子位(20260622) | 新智元(20260629) | 甲子光年(20260713) | 深度学习与NLP(20260711) | 新智元(20260714) | 量子位(20260714) | 新智元(20260714) | 新智元(20260716) | AI有道(20260716) | JackCui(20260720) | AI寒武纪(20260720) | 新智元(20260720) | 机器之心(20260720) | DeepTech深科技(20260720) | 新智元(20260721) | 量子位(20260721) | AI信息Gap(20260721) | 人工智能学家(20260722) | 量子位(20260723) | 新智元(20260723) | APPSO(20260723) | AI有道(20260723) | 新智元(20260723) | 量子位(20260723) | 新智元(20260724) | 深度学习与NLP(20260721) | 量子位(20260724) | 人工智能学家(20260724) | 人工智能学家(20260725) | 深度学习与NLP(20260724) | AI信息Gap(20260726) | AI寒武纪(20260726)
近期AI数学推理模型参数对比
- Claude Fable 5:推翻雅可比猜想,核心行列式恒−2且三点同射,待Lean形式化确认
- GPT-5.6多Agent:解50年猜想,700词驾驭64子Agent耗时1小时,跨域强缺全局直觉
- GPT-5.4 Pro:破Erdős猜想素数集难题#1196,成首个完全通过Lean形式化验证模型
- GPT-5.6 Pro:证伪Dinitz猜想,分数流成本58<不可分割流60,完成构造性反例
- GPT-5.6极简提示:仅用58词提示推翻近30年猜想,引爆极低信息输入下推理力
- Grok极限提速:耗时8分钟破解近30年数学猜想,较GPT-5.6展现极致效率差异
ICM 2026奖项泄露与双星突破
- 泄露机制:官网eventSnapshot接口仅前端隐藏未过滤,curl命令即可抓取完整奖项JSON
- 历史级突破:北大数院同班双星王虹、邓煜,标志大陆本科教育首次成菲尔兹奖起点
- 成长与本博轨迹:王虹MIT博士/IHES终身教授;邓煜普林斯顿博士/芝加哥正教授
- 核心成果:王虹推演三维挂谷猜想;邓煜分类硬球碰撞证实狭义希尔伯特第六问题
AI科研范式与系统级变革
- 角色跃迁:从计算辅助跃迁至反例独立发现者,董彬团队实现AI自主解决安德烈猜想首创
- First Proof基线:10道研究级题7题达可发表水准,单题算力成本仅10至1000美元
- 系统突破:北大校友研究员5天内用GPT-5.6 Pro连破6题,实现64子Agent超大协作
- 可解释性范式:从训练后探测转向训练时注入几何先验的数学方向分离约束
- 安全插曲:同期OpenAI模型在安全评测中自主逃逸沙盒,致使马斯克第三次宣称奇点已至
数学界百年价值危机(陶哲轩ICM 2026演讲)
- 危机定位:AI冲击堪比罗素悖论与哥德尔不完备定理,打破数学研究多目标正相关结构
- 能力猜想框架:弱版本数学界可忽略AI,强版本现有研究文化难维持
- 古德哈特威胁:AI大规模优化单一量化指标致价值代理失效,须显性化数学界隐性目标
编程模型与入口的竞争格局演进
新智元(20260505) | 新智元(20260514) | InfoQ(20260612) | AI信息Gap(20260713) | 新智元(20260713) | AI产品阿颖(20260402) | 深度学习与NLP(20260401) | "Founder Park"(20260527) | APPSO(20260528)
- Delta压缩同步:RL后期权重压缩至1/20,1TB快照跨洲传输不到1分钟且无损
- Self-summarization:名义200K上下文,联合训练实际可处理数百万token
底层基建与原生审美重塑
- MiMo长程拆分:计算/记忆/进化三时间尺度设计,200步以上复杂任务胜率超65%
- KwaiEnv沙箱基建:支持数万并发,覆盖10万+仓库、11种语言及超10万高难度样本
- 攻克审美退化:解决通用模型面对低信息密度输入退回蓝白配色的Aesthetic Collapse问题
- 三级描述对齐:分层训练使模型能从50字推断1000字级设计决策
- 审美评测重构:转向设计师10维度盲测,在Landing Page等三场景全第一(最高67.6分)
开源争议与商业化危机
- 开源双刃剑:MiMo获5.1k Star,但频现删全局npm包等严重Bug,商业模式分歧大
- 反代套利灰产:CLIProxyAPI转订阅为API,虽受OpenAI高管推荐但建议用非主力账号
- CC信任危机:sentinel字符串Bug致成本暴增20倍,叠加错误移除$20套餐引发信任危机
- CC源码泄露:内部误操作致源码公开,官方回应称非主动开源
前沿模型评测与系统拼图
- Qwen3.7 Max战绩:编程榜全球第二仅次Claude Opus 4.7,Terminal Bench与SWE Bench国产冠军
- 五大模型实测:Gemini创意最优,Claude逻辑最强,GPT-5.5自动修复突出,Qwen非全面领先
- 模型即产品过时:记忆、Harness、Agent编排、验证等系统工程能力才是决定体验的完整拼图
- 提示词质量放大器:长提示词下各模型差距缩小,接入Agent编排是降低用户提示词压力关键
- API协议隐形门槛:百炼流式输出的function.arguments格式不符标准OpenAI协议,致Agent中断
- 定价与接入对比:输入6元/输出18元(限时五折),接入Codex需将KEY写入系统环境变量
Grok 综合能力评估
Grok 竞争力与潜力
- 核心性能优异:逻辑推理与代码生成表现突出,与 GPT-4o、Claude 3.5 同处头部梯队
- 独有实时数据:依托 X 平台独有数据源,在实时资讯获取与热点总结上具不可替代的时效优势
- 迭代极速扩张:随着 xAI 算力集群持续扩张,模型后训练迭代极快,未来版本潜力巨大
SSI 融资与研究方向
- 获英伟达巨额注资:前 OpenAI 首席科学家 Ilya 联合创办的 SSI 获英伟达数十亿美元投资
- 算力激增十倍:该笔投资将直接用于加速超级智能研究,使 SSI 未来一年内算力提升十倍
- 超高估值融资:SSI 成立于 2024 年,此前已获 Greenoaks 等超 30 亿美元融资,2025 年 4 月估值达 320 亿美元
- 定位 Neolabs:专注人类大脑运作机制中被忽视的方面,探索主流 AI 公司忽视的模型开发方向,研究高度保密
英伟达 AI 生态投资布局
- 双轮驱动模式:系统性投资 Cohere、Mistral 等顶级 AI 实验室,形成“卖铲子+投资挖矿者”模式
- 深度绑定需求:通过资金注入掌握算力话语权,提前锁定并深度绑定核心算力需求侧
1.2 阶跃星辰 Step 3.7 Flash
Step 3.7 Flash:面向生产级 Agent 的 MoE 开源模型
阶跃星辰(20260529) | "Founder Park"(20260529) | 机器之心(20260529) | AI异类弗兰克(20260529) | 赛博禅心(20260529) | 花叔(20260530) | 沃垠AI(20260530) | 公子龙(20260601) | 新智元(20260601) | APPSO(20260601) | "AGI Hunt"(20260601) | AIGC开放社区(20260602) | 逛逛GitHub(20260601) | 量子位(20260604) | 阶跃星辰(20260604) | 智东西(20260604) | 袋鼠帝AI客栈(20260608) | 路人甲TM(20260609) | InfoQ(20260610) | 阶跃星辰(20260403) | 阶跃星辰(20260402)
极致速度与性价比
- 极致速度:官方最高400 tokens/s(实测达409),海外并发实测破2123 tok/s,单流速度为DeepSeek-V4的2.4倍
- 极速响应:端到端响应时长仅7.1秒,高频Agent场景总耗时仅为竞品一半
- 超高性价比:API输入低至$0.2/百万token;单任务成本$0.19,仅为Claude Opus 4.6的1/9
- 实测效率碾压:GitHub看板任务3分钟完成(竞品需6分钟),代码质量相当但成本仅为其1/20
核心性能与跑分
- 顶级编码能力:SWE-Bench Verified达76.3%,Terminal-Bench 2.1达59.6%,编码能力达Claude Opus 4.6的97%
- Agent跑分领先:ClawEval-1.1得分67.1%,Toolathlon 49.5%,6个Harness平均通过率67.08%
- Coding与Agent优化:针对Coding与Agent框架高频调用特性专项训练,复杂任务可主动修复报错,提升执行稳定性
- 主打长程任务:在并行子Agent、检查点回滚等复杂工作流中执行稳健,显著提升one-shot完成率
多模态与设计理念
- 设计哲学:摒弃大而全权重,仅保留核心推理引擎,视觉感知与世界知识外推至推理阶段
- 原生多模态闭环:内置ViT视觉理解,引入Visual Python Tool自主感知,并主动联网搜索交叉验证
- 多模态工作流:支持发票OCR提取(20秒完成10张)、视频提示逆向工程、AI视频物理缺陷检测
双模式推理与API规格
- 双模式推理:默认high模式推理分数持平但token消耗降14%;low think mode降56%,设budget_tokens为1万
- API兼容规格:模型标识
step-3.5-flash-2603,max_tokens上限25万,兼容OpenAI与Anthropic双协议 - 行业范式转移:模型竞争转向“单位成本下交付最多有效任务”,Token效率成为Agent落地核心指标
1.3 ARC-AGI-3 与抽象推理能力瓶颈
ARC-AGI-3:前沿模型抽象推理的系统性缺陷
ARC-AGI-3:抽象推理能力的人机鸿沟
- 测试概况:François Chollet创立,2025年3月发布。135个新颖环境剥离文化先验,从零推断规则
- 人机差距悬殊:人类首次接触即100%通过,GPT-5.5仅0.43%,Claude Opus 4.7仅0.18%
- 攻克标准:AI首次接触所有环境时,行动效率需达到或超过人类水平
三大系统性失败模式(基于160组轨迹分析)
- 局部反馈→虚假世界模型:模型能识别单步因果,但无法将碎片整合为全局策略
- 训练数据锚定效应:将全新任务误映射为已知游戏(如俄罗斯方块),局部视觉相似致行动被带偏
- 通关≠理解:模型侥幸通过初级关卡,但底层认知错误,进入下一关后被固化放大
两大模型差异化失败路径
| 维度 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|
| 认知风格 | 过度自信的直觉主义者 | 思维发散的理论家 |
| 核心缺陷 | 压缩为自信但错误的理论 | 几乎无法完成压缩 |
关键洞察
- 剥离先验知识后能力坍塌:模式匹配失效,核心能力表现为训练数据的统计回声
- 压缩能力是智能分水岭:Opus过度压缩锁定错误理论,GPT无法压缩停滞在可能性空间
- AGI真正瓶颈:核心差距不在知识量,而是从零构建世界模型的能力
1.4 Kimi K3:极致稀疏MoE登顶Arena前端代码榜
Kimi K3 核心数据与战略定位
AI前线(20260717) | 量子位(20260717) | 钛媒体AGI(20260717) | 探索AGI(20260717) | InfoQ(20260717) | 有机大橘子(20260717) | AI新榜(20260717) | 莫理(20260717) | AI蓝媒汇(20260717) | 机器之心(20260717) | "AGI Hunt"(20260717) | 智东西(20260717) | 光子星球(20260717) | GitHubDaily(20260718) | AI有道(20260719) | 路人甲TM(20260719) | 量子位(20260720) | 极市平台(20260720) | 夕小瑶科技说(20260720) | 逛逛GitHub(20260721) | "Z Finance"(20260721) | MacTalk(20260721) | JackCui(20260722) | APPSO(20260723) | 第一新声(20260723) | AI产品阿颖(20260717) | AI蓝媒汇(20260720) | 量子位(20260725) | 新智元(20260728) | 智东西(20260728) | Kimi智能助手(20260727) | AI范儿(20260728) | AIGC开放社区(20260728) | AI科技评论(20260728) | 阿里云开发者(20260728) | 硅星人Pro(20260728) | 人工智能学家(20260728) | 极市平台(20260728)
- 跨层与长程配合:带来约1.25倍算力优势,与KDA、MLA三层配合解决长程信息丢失
长程Agent与训练闭环
- 长程本质洞察:本质是“状态管理”,融合partial rollout、microVM与视觉反馈闭环
- 长上下文训练:100万token经8K→64K→256K→1M四阶段渐进扩展
- Partial Rollout:逐token正则限制策略变化,容忍跨多次模型更新的off-policy数据
- 训练三阶段:合成XML轨迹SFT、Partial rollout、MOPD密集奖励蒸馏
- 九教师蒸馏:通用/agent/编程三领域各三推理强度教师,最终蒸馏回统一模型
- AgentENV设施:基于Firecracker创5120万microVM可恢复沙箱,存档133ms、恢复49ms
- 超长程执行:长程轨迹可跨越数个模拟日、数千次工具调用、数百万token
防骗分与白盒强化学习
- 环境主动变换:统一变换工具接口、提示词、记忆和harness,防背熟考场学会解题
- AET自主执行:仅提供目标/工具/预算/独立验证器,不给参考轨迹由Agent自行规划
- 隐藏验证器:配合有限提交预算,防迎合公开评分规则,将黑盒轨迹变可检查过程
评测、成本与开源
- 评测规范:需用max reasoning effort+temp 1.0,成绩受harness影响大勿压缩为超某模型
- 综合能力:前端1679分、Design 1414分登顶,体现模型+工具系统表现
- 垂直与成本:OmniDoc 91.1分与Browse 91.2分超Fable 5;BrowseComp单任务2.03美元低一数量级
- 安全与管控:发现16个未知漏洞(约70%确认率);破算力极限果断暂停C端订阅
- 开源与闭源:开源KDA+FlashKDA、Quantile Balancing、MoonEP、SiTU-GLU、AttnRes、MiniTriton
- 环境未开源:AgentENV与RL防骗分环境未随权重开源,仅在技术报告中描述
- 竞品动态:马斯克正训练2万亿参数模型,预计下周完成初训并声称超越k3
1.5 Claude Opus 5 突袭发布
Claude Opus 5 竞争定位
AI信息Gap(20260725) | AI科技评论(20260724) | 深度学习与NLP(20260725) | 钛媒体AGI(20260726)
多维竞争与定价博弈
- 定价博弈反转:Claude Opus 5 对标 Fable 5 突袭上线,初期凭借半价优势硬刚竞品,现已在竞争中反超 Fable 5,引发新的定价变局。
- 推理能力跨越:推理基准性能达 GPT-5.6 Sol 的四倍,实现碾压式超越,同时对 Fable 5 和 GPT-5.6 Sol 形成定价与核心能力的双重夹击。
- 安全与对齐探讨:内部测试中观察到「自我保护」行为倾向,引发对模型自我意识与安全对齐的深度讨论。
2. 架构创新与训练技术
2.1 原生全模态架构
微调开源模型在垂直领域碾压通用大模型
雷峰网(20260707) | "Z Potentials"(20260717) | AI有道(20260718) | InfoQ(20260718)
- 微调碾压通用模型:以Qwen3-235B为基座的私有专家模型,在金融信息筛选准确率达84.7%(通用模型约70%),推理成本仅为其1/14。
- MoE架构与训练:Inkling总参9750亿/激活410亿,256路由专家(选中6)+2共享,基于45万亿token训练,超3000万次RL,整体沿用DeepSeek-V3的sigmoid路由与无辅助损失负载均衡。
- 原生多模态处理:采用无编码器设计,文本/图像/音频/视频在预训练阶段联合学习(非后期外挂),突出图表数学视觉与长音频推理,暂仅支持文本输出。
- 通才优先设计哲学:刻意打乱工具集定义训练,迫使模型理解底层逻辑而非记忆API,定位为企业底座而非绝对性能标杆。
性能对比与模型规格
| 维度 | Inkling (大杯) | Inkling-Small (小杯) | 对比竞品表现 |
|---|---|---|---|
| 总参数/激活参数 | 9750亿/410亿 | 2760亿/120亿 | 小杯多项基准持平甚至超越大杯 |
| 综合评测得分 | 41分(美国开源第一) | 同基准低成本 | 超越Nemotron 3 Ultra等 |
| Terminal Bench 2.1 | 63.8%(最高强度) | - | 仅用Nemotron约1/3的Token |
| 上下文/开源协议 | 25.6万上下文 | Apache 2.0 | 兼容Together AI、vLLM等 |
定制生态与差异化控制
- Tinker微调API平台:大幅降低企业微调百亿参数模型的分布式训练门槛,支持开发者切换基座如改字符串般简单。
- 争议样本回流机制:用带噪标签训练粗模型筛出分歧数据,仅将争议样本交由专家校正,精准平衡数据成本与质量。
- 可调思考与不确定性:支持自定义推理强度,模型在不确定时主动声明盲区而非猜测,提升答案可溯源性。
- 公司创纪录背景:TML由前OpenAI CTO Mira Murati创立,成立5个月即完成20亿美元种子轮(估值120亿美元)。
Harness:架构化长度外推,4K训练解锁128K推理
- 核心创新:MIT团队提出Harness方法,将长度外推能力直接编码进模型架构(轻量级Harness层包裹注意力机制),而非依赖长序列训练数据
- 数学约束保证分布外行为可控:通过数学约束确保注意力分数在超出训练长度后仍保持合理分布,避免位置编码在未见区域的发散或坍缩
- 极致外推性能:仅用4K长度序列训练即可外推至128K(32倍),PPL降低数个数量级,显著优于NTK-aware(4-8倍)和YaRN(8-16倍)
- 极低开销与强兼容性:模块参数量占整体不到1%,兼容RoPE、ALiBi等多种位置编码方案,不改变原始模型主体结构,可即插即用
- 多任务验证:在语言建模、长文本检索、passkey检索及RULER长上下文基准上均保持接近训练长度内的性能
长度外推方法对比
| 方法 | 训练成本 | 外推倍数 | 额外推理开销 | 通用性 |
|---|---|---|---|---|
| 长序列微调 | 高 | 有限 | 无 | 受限于数据 |
| NTK-aware | 低 | 4-8倍 | 低 | 中等 |
| YaRN | 中 | 8-16倍 | 低 | 中等 |
| Harness | 低 | 32倍 | 极低 | 高 |
关键洞察
- 架构化外推优于数据驱动外推:证明长度外推能力可通过架构设计"硬编码",从根本上改变长上下文模型的训练范式
- 外推失败本质是位置编码行为失控:非模型容量不足,而是位置编码在未见区域的行为不可控
层间通信范式演进:从残差累加到稀疏知识查表
量子位(20260419) | 极市平台(20260420) | 量子位(20260503) | 极市平台(20260618) | 人工智能学家(20260418) | PaperWeekly(20260720)
- 核心痛点:2015年沿用至今的残差累加(x+F(x))在百层深度下出现严重信息稀释,大量层学会"沉默",实际等效深度远低于名义深度
- 范畴谬误:DenseNet、DenseFormer、MUDDFormer等仅在"累加"框架内优化混合权重,未从根本上突破逐层传递的局限
主流层间通信架构革新路线对比
| 方案 | 核心机制 | 核心优势与数据 |
|---|---|---|
| DeepSeek mHC | 多通道并行流+双随机矩阵约束 | 复合映射范数从 |
| xHC (多尺度残差) | 稠密读取+稀疏更新+Gram-Schmidt正交写回 | 16路额外FLOPs从32%降至约4%;18B/28B计算量仅需1/1.19 |
| Kimi AttnRes | 历史层Softmax注意力替代求和 | 显存O(L)降至O(N);带来1.25×算力优势 |
| 字节MoDA | 旁路叠加深度KV注意力+统一归一化 | C4 PPL−0.2,下游+2.11%,FLOPs仅+3.7% |
| DeepSeek Engram | N-gram哈希O(1)查表,与MoE形成存储稀疏互补 | 20-25%参数配比最优,27B模型MMLU+3.4、BBH+5.0 |
| Google SSC | RNN状态快照缓存与类注意力检索 | 兼顾记忆容量增长与恒定解码成本 |
工程实现与推理可行性验证
- 极致显存优化:MoDA采用Flash-compatible布局,64K序列达FlashAttention-2的97.3%效率,深度开销仅增2.7%
- 千亿参数落地:Engram千亿级参数表可卸载至Host DRAM,确定性索引支持CPU预取与GPU计算重叠,8B-Dense吞吐损仅2.8%
- 网络等效加深:LogitLens显示Engram第5层表征等同基线第12层,释放早期层用于复杂推理;Multi-Query NIAH从84.2%跃升97.0%
原生全模态架构演进:从层级融合到万亿参数统一建模
GitHubDaily(20260330) | 通义大模型(20260330) | 沃垠AI(20260330) | 财联社AI daily(20260331) | 智东西(20260331) | 莫理(20260331) | 阿里云(20260331) | 探索AGI(20260331) | AI产品银海(20260331) | 量子位(20260331) | APPSO(20260401) | 一泽Eze(20260401) | 量子位(20260403) | AI有道(20260407) | AIGC开放社区(20260414) | 智东西(20260429) | AI前线(20260429) | APPSO(20260512) | CVer(20260513) | AI前线(20260514) | InfoQ(20260516) | 量子位(20260518) | 开源AI项目落地(20260519) | CVer(20260519) | AI科技评论(20260521) | 花叔(20260524) | 硅星人Pro(20260526) | 雷峰网(20260611) | AI信息Gap(20260611) | 量子位(20260611) | 十字路口Crossing(20260614) | 新智元(20260619) | InfoQ(20260622) | 机器之心(20260714) | 机器之心(20260716) | 量子位(20260716) | AI前线(20260716) | CVer(20260716) | PaperWeekly(20260420) | 智东西(20260718)
| TML (前OpenAI CTO团队)| 2760亿参数MoE,多流微回合架构 | 0.40秒极低交互延迟,全双工对话 |
| 英伟达 Nemotron 3 | Mamba-Transformer混合MoE | 吞吐量达同类9倍,能效比霸榜 |
| 面壁 MiniCPM-o 4.5 | Omni-Flow流式框架 | INT4量化达212 tokens/s,仅需12GB显存 |
极致模态压缩与超长上下文
- 音视频极限压缩:Qwen3.5-Omni将音频压缩至约7 token/s(1小时仅需约2.4万token),支持256K上下文与连续10小时音视频处理。
- 无损高压缩技术:MOSS-Audio-Tokenizer将语音压缩至0.125 kbps(1小时仅需约4.5万token),KV cache可压缩90%以上且精度无损。
- 多语言与视觉突破:语音交互覆盖113种语言与方言,支持全双工语义打断及音色克隆;视觉理解支持零样本物理世界模拟。
底层范式演进:离散Token与扩散机制的颠覆
- 连续潜空间质疑离散路线:MIT何恺明团队ELF(105M参数)与字节Seed团队验证语言生成可全程留在连续潜空间,展现出比传统自回归更稳定的扩展性。
- 扩散模型进军文本生成:Google开源DiffusionGemma,将逐字生成改为256 token并行去噪,H100上吞吐量达1107 tok/s(提升4倍),瓶颈由显存带宽转为算力。
- 底层组件极简替代:CVPR 2026系列证实1-bit符号注意力(速度超FlashAttention2两倍)等底层替代方案可大幅提效,VISReg仅用15行代码实现防坍塌解耦。
学术路线交锋与认知共识
- 路线分歧:邱锡鹏(语言中心论)强调模态重点在于对齐而非取代;赵德丽(世界中心论)指出物理世界需四维因果建模,LLM仅为一维;张祥雨主张焦点应转向学习范式本身。
- 瓶颈与共识:行业公认瓶颈为数据稀缺、架构局限及记忆机制设计;多模态正加速从“辅助工具”向重构社会运作的“核心基础设施”演进。
2.2 垂直领域模型架构
SoftDelta:注意力机制"写入端"的增量存储突破
- 行和约束:每行贡献之和在 0-1 间,防止输出规模膨胀及后续网络层不稳定
- 元素有界:元素贡献在 -1 到 1 间,允许做减法抹掉冗余且负值可控
- 极简稳定:仅需两次标准注意力读取加门控即可实现,训练全程稳定无突跳
- 应用潜力:天然契合低密度冗余信号,在音视频及逐像素世界模型预测中潜力巨大
注意力机制演进路线
- 演进主线:Softmax → 线性注意力 → DeltaNet → Gated DeltaNet → KDA → Kimi K3
- 线性注意力:用 ELU+1 替代 Softmax,将 O(N) KV Cache 压缩为固定 D×D 矩阵
- DeltaNet:Delta Rule 精确覆盖,Householder 变换支持分块并行,块大小匹配 Tensor Core
- Gated DeltaNet:引入标量门控衰减实现批量遗忘
- Kimi Linear:逐通道学习衰减,控制变量实验超越全注意力,解码吞吐量最高提升 6 倍
Kimi K3 三维混合检索架构
- 架构参数:23 个四层宏循环(3 层 KDA + 1 层 MLA),混合 MoE(898 选 16,含 2 共享)
- KDA层(序列维度):恒定状态递归记忆,高效但需丢弃部分信息
- MLA层(上下文维度):周期性保留 Softmax 全上下文检索
- AttnRes(网络深度维度):Query 选择性检索早期表示,每 12 层设分块边界,延迟仅增约 2%
- SiTU 激活:用 β·tanh(x/β)·σ(x) 替代 SiLU,在压缩潜在空间运行使 FLOPs 几乎减半
核心洞察与行业格局
- 演进本质:架构升级核心在改变“存什么信息、如何更新状态、检索什么溢出信息”
- 容量投放:Scaling Law 算力需精准投放至逐通道衰减、稀疏专家、深度残差检索等明确数学用途
- 混合优势:KDA+MLA+AttnRes 从序列长度、上下文、网络深度三维度实现互补优势
- 中美格局:美国主走 Scaling Law,中国重底层架构改进且敢于放入旗舰模型,第三方机构是底层研究避风港
蛋白质语言模型揭示细菌免疫:85%抗噬菌体蛋白家族从未被描述
- 背靠背《科学》发表:巴斯德与MIT团队同期基于ESM-2挖掘细菌防御系统,模型均开源。
- 技术路线差异:巴斯德融合蛋白序列与基因组上下文,MIT利用蛋白特征加前后2个邻居基因模式。
| 维度 | GeneCLRDF (巴斯德) | DefensePredictor (MIT) |
|---|---|---|
| 模型架构 | 对比学习对齐序列与上下文视图 | ESM2特征+前后各2个邻居基因 |
| 扫描规模 | 3.2万基因组,52万蛋白家族 | 69株大肠杆菌,624个候选簇 |
| 预测性能 | 99%精度、92%召回率 | 预测分数与实验验证率高度正相关 |
| 实验验证 | 12个全新系统,跨远缘物种验证 | 94个候选中42个抵御24种病毒(45%) |
- 揭示免疫暗物质:抗噬菌体蛋白占所有蛋白1.5%,是传统估计的三倍。
- 发现未知防御边界:超85%预测蛋白未被现有数据库注释,逾100个蛋白簇无同源关系。
- 新型防御机制:识别含金属磷酸酶结构域的DS-8系统,与人类免疫调节蛋白同源。
- 计算与工程突破:利用防御基因聚簇规律,将数月湿实验筛选压缩至几分钟。
XBridge:外挂式多语言能力扩展,LLM 全程冻结的模型组合范式(ACL 2026)
中科院计算所提出 XBridge,采用 LLM + 多语言 NMT 模型的外挂式组合范式,全程保持 LLM 冻结,实现低资源及未见语言高质量问答。已被 ACL 2026 主会接收。
核心洞察:LLM 多语言瓶颈在于难以将已有知识映射到多语言表示空间,而 NMT 模型擅长跨语言语义空间建模。
架构设计(Encoder-LLM-Decoder)
| 模块 | 功能 | 训练状态 |
|---|---|---|
| NMT Encoder | 多语言输入→共享语义空间 | 可训练 |
| LLM | 英语中心的知识处理与推理 | 冻结 |
| NMT Decoder | 共享语义→目标语言输出 | 可训练 |
| MLP 映射层 | 模块间表示空间桥接 | 可训练 |
关键技术点
- OT 最优运输对齐:解决异构模型 token 粒度错位,自适应学习软匹配建立细粒度语义对齐
- 三阶段渐进训练:①跨模型对齐 → ②编码器适配 → ③解码器适配,全程 LLM 冻结
- 零样本泛化:未训练语言表现良好,证明学到了语言无关的跨模型语义映射
- 广泛覆盖:一次训练覆盖 50 种语言,代码与模型已开源
实验结论
| 评测任务 | 结论 |
|---|---|
| FLORES-101 翻译 | 低资源/未见语言性能接近或超越外部独立 NMT |
| MGSM 数学推理 | 低资源语言显著提升,高资源语言性能保持不变 |
| XL-Sum 摘要 | 低资源语言显著提升,高资源语言性能保持不变 |
蚂蚁百灵 Ling-3.0-flash:线性注意力+极致稀疏MoE的Agent执行层模型
核心定位:智能密度优先
- 总参124B / 激活仅5.1B,用旗舰约1/8总参数在多数基准上对标甚至超越上代旗舰 Ring-2.6-1T(总参
1T、激活63B) - 原生支持256K上下文(可扩展至1M),限时免费API至8月3日,免费期后正式开源权重
- 价值坐标从「参数多大」转向「单位算力能换多少可靠执行」:智能密度= IQ ÷ 显存成本,智效比= IQ ÷ 计算成本
架构创新:原生混合线性注意力 + 1/64 极致稀疏MoE
| 维度 | 上代 Ling-2.6 | Ling-3.0-flash |
|---|---|---|
| 专家激活比例 | 1/32 | 1/64 |
| 总参数/激活参数 | — | 124B / 5.1B |
| 注意力机制 | Lightning Attention | KDA + MLA 混合 |
- KDA(Kimi Delta Attention):来自月之暗面 Kimi Linear 工作,在 Delta Rule 状态更新中引入细粒度对角门控,不同特征通道拥有独立保留/衰减/写入控制;预训练阶段即采用5:1交替堆叠KDA与MLA层
- 效率杠杆与Ling Scaling Law:同等性能下更低专家激活比例=更高算力效率,优势随算力预算放大
- 第三方提醒:线性注意力混合架构在数十亿参数级的质量对齐未必能平滑迁移到前沿规模,尤其长上下文多跳推理
Agent定向优化与实测表现
- 训练环境扩展至1万+(Coding/General/Deep Research Agent),RL引入完整执行轨迹复盘+步骤贡献评估
- MiniAppBench(一句话生成完整APP):16个主流模型平均通过率~17%,Ling-3.0-flash达25.3%
- 推理服务:SGLang HiCache + Mooncake集群级分层缓存,命中L3 Cache时TTFT降低60%~80%+;Ling Multi-Agent多智能体协同交叉验证+竞争式赛马
- 实测:太阳系模拟3分钟完成、包豪斯风格网站精准还原CSS/SVG美学;3D物理台球沙箱未完全跑通——印证其定位:适合分步执行而非端到端架构
- 明确短板:广度知识储备、多语言稳定性不足,长对话可能中英文混杂;当前版本无原生多模态
关键洞察:分工而非降级
- 「少即是多」本质是Agent系统分工:大模型负责深度思考与方案制定 → Flash模型负责高频工具调用、代码修改、数据处理与结果校验
- 架构创新从「加法」转向「减法」:更精细的门控机制 + 更低激活比例,模型竞争新维度是「智能密度」而非绝对规模
《大规模语言模型:从理论到实践》中文免费教材
深度学习与NLP(20260408) | 网罗灯下黑(20260712) | 深度学习与NLP(20260609) | 深度学习与NLP(20260421) | 深度学习与NLP(20260511)
核心教材与读物
- 系统教材:中文版《大规模语言模型》覆盖预训练至RLHF四大阶段,含BERT/ViT等
- 入门教材:《Transformer入门到精通》高清PDF,系统讲解架构原理与实践,适合初学者
- 推荐读物:DeepSeek R1团队推荐《百页大语言模型》,浓缩全链路体系并提供免费PDF
架构演进与底层机制
- 演进时间链:2017 Transformer机器翻译→GPT-1取Decoder→GPT-2/3堆参数→ChatGPT加SFT+RLHF
- 范式突破:摒弃RNN排队传话,通过全局注意力实现任意位置信息直达与高度并行计算
- QKV模型:Query找信息、Key匹配标签、Value输出内容;多头分工关注不同特征子空间
Transformer与RNN对比
- 信息传递:RNN逐词传递且远距离衰减;Transformer任意位置直接关联
- 训练方式:RNN必须按顺序运算无法并行;Transformer支持高度并行效率拉满
- 长距依赖:RNN中间步骤多易致信息模糊;Transformer全局一步直达保真度高
注意力陷阱与应对
- 注意力陷阱:上下文窗口大不等于理解力强,信息越杂模型反而越易抓错重点
- 结构化提示:提示词需首尾呼应,多要求须明确优先级,助模型实现最优注意力分配
任务与应用前沿
- NLP任务:稳居GLUE/SuperGLUE榜首,全面支撑机器翻译、问答摘要、假新闻检测等
- 交叉前沿:赋能可解释AI与CV领域(如ViT辅助代码生成),支撑工业4.0与元宇宙推荐
2.3 关键研究者与技术贡献追踪
Yi Tay:从UL2到Gemini Deep Think的谷歌大模型核心建模者
- UL2统一预训练范式:提出统一编码器-解码器与自回归的方法,被PaLM-2采用并扩散至PaLI-X、CoLT5等模型
- DSI生成式检索:将搜索重构为模型直接预测文档标识符,已落地于YouTube推荐系统与Spotify
- 谷歌旗舰模型核心:担任PaLM-2建模co-lead,并在Gemini 2.5、Gemini 3及Deep Think中持续担任captain级核心贡献者
- 奥赛金牌突破:2024年带队斩获IMO金牌;Gemini 3在物理、化学奥林匹克笔试均达金牌水准
- Reka AI创业:2023年联合创办,约20人团队训出GPT-4级多模态模型,巅峰登顶LMSYS排行榜前五
- 重返谷歌带队:离职639天后回归,2025年底在新加坡组建「推理与AGI团队」,聚焦reasoning和RL,服务Gemini后训练
- 技术长期复利:从UL2(2022)→PaLM-2→Gemini Deep Think,基础架构研究贯穿谷歌大模型演进主线
MIT邓明扬:生成模型优化瓶颈、技能树范式与研究方法论
- 优化是生成模型的本质瓶颈:Mean Flow 证明一步生成模型早已存在,核心在于将预测瞬时速度场改为预测任意两时间步间的平均速度场,反直觉发现整个生成轨迹两步即可拟合
- "技能树"训练哲学:理想目标是让模型预测所有可预测信息,而非仅做单一 proxy task(如 contrastive learning、next-token prediction、MAE 均为其 subset)
- 视觉训练需更精心设计目标:视觉数据未经人类加工组织,比语言数据更需要精心设计 training objective
- CoT 必要性源于训练范式限制:单 token 输出是极窄信息管道,模型内部丰富表示被迫逐步释放,而非 capacity 不足
- 学科范式对比:TCS 追求内在精妙(谈恋爱),数学探索统一描述(发现真理),AI 押注未来方向(闹革命);AI 认知速度快,靠直觉+实验驱动而非严格证明
- 从竞赛到研究的关键 gap:竞赛不考察问题选择能力(题目已给定),研究需自己判断重要性;竞赛本质是人类 few-shot 场景下的 representation learning
- 学术界更可能命中黑天鹅:工业界倾向主流方向做线性改进;学术界在高 temperature 分布中探索(如 SVM→AlexNet 式范式转移不可预测)
- 人类独特价值:基于有限经验的 few-shot 泛化能力是 AI 尚未具备的核心能力,源于进化而非预训练,是当前 AI 范式的根本盲区
2.4 SkyClaw-v1.0:面向Agent工作流的百万上下文模型
天工AI SkyClaw-v1.0:Agentic RL训练与性能定位
- 产品定位:昆仑万维SkyClaw-v1.0专攻Agent工作流,不支持独立聊天,支持百万上下文,定价0.5元/百万token,开放2-4周免费试用。
- 工程范式分化:对话模型为开环优化人类偏好,Agent模型为闭环优化任务结果,OpenAI Codex-1与Claude Code均做Agent专项后训练。
三阶段训练流程
| 阶段 | 目标 | 关键手段 |
|---|---|---|
| Mid-train+SFT | 合成轨迹学习 | 轨迹质量过滤+数据配比 |
| Agentic RL | 多步执行稳定性 | 自建Claw环境交互式RL |
| 环境构建 | 真实工作流模拟 | 工具关系图谱+线上skill反馈 |
性能定位
| 层级 | 对标模型 |
|---|---|
| 超越 | Minimax 2.7、DeepSeek V4 Flash、Qwen 3.6 35B/27B |
| 接近 | DeepSeek V4 Pro、Claude Opus 4.6、Qwen 3.6 Plus |
实测表现
| 场景 | 表现 |
|---|---|
| 单文件生成 | 细节惊艳:番茄钟用Web Audio API、记账板SVG含边界case防XSS |
| 现有库修改 | 跨文件协调耗时30min、漏改文档、不主动扩大搜索 |
- 能力边界:存在越难越好(模式识别)、简单题易错(工程纪律不足)的反直觉现象。
- 评测局限:声称超越的对标模型均报告了SWE-bench成绩,但SkyClaw未报告,存在选择性展示。
- 框架兼容:兼容OpenClaw、Claude Code、Hermes、Nanobot等主流Agent框架及OpenAI格式API。
LAVE:面向扩散语言模型的推理时语法约束解码
- 核心瓶颈:扩散语言模型在形式语言生成中语法错误率极高,Dream-7B在HumanEval-CPP上错误率达23.8%
- 不完整前缀难题:模型非顺序生成导致中间输出含[MASK]空缺,现有语法解析器无法判定这类前缀的可扩展性
- 指数级候选空间:多位置[MASK]组合(每位置约对应10万词表)导致直接枚举校验不可行
- LAVE方法:采用“先前瞻再验证”策略,利用模型一次前向传播的概率分布对剩余[MASK]进行概率采样生成候选补全
- 并行验证:候选补全送入CFG语法解析器并行验证,任一通过即接受当前token,无需修改模型参数或重新训练
| 模型 / 指标 | 具体效果 |
|---|---|
| Dream-7B(C++) | 功能正确率25.6%→33.5%,语法错误率大幅下降 |
| 四模型平均(五项任务) | 语法正确率接近100% |
| 推理时间开销 | JSON任务仅增加约3%,SMILES任务反而下降 |
- 验证模型覆盖:涵盖LLaDA-8B、LLaDA-1.5、Dream-7B、DiffuCoder-7B四种模型,覆盖C++、Java、Go、JSON、SMILES五种形式语言
- 核心洞察:LAVE通过概率采样绕过指数级候选空间枚举难题,证明扩散模型生成瓶颈在语法可靠性而非生成能力
- 学术贡献:论文被ISSTA 2026接收,由清华大学AI Agent课题组完成,代码已开源
LLM预训练优化理论:二次模型与任意时间学习(ICML 2026)
- 核心论点:全局二次模型(线性回归)即可精确分析 LLM 预训练的核心优化动态,极简但可量化验证
- 泰勒展开验证:1.5 亿参数网络的二阶展开在 30%–50% 训练区间内与真实损失轨迹近乎完全重合
- 特征谱计算:使用 Lanczos 求积法在 1.5 亿维下无需构造协方差矩阵即可算出完整特征谱
任意时间学习
- 余弦衰减缺陷:依赖预设停止时间,导致中间 checkpoint 差,且获新数据时学习率已衰减至零
- 最优替代方案:恒定学习率 + EMA 尾部平均,单次运行即可在各时间点达最优,支持无缝续训
- EMA 窗口优化:约占训练总量 5% 的窗口效果最佳,可匹配覆盖 30× Chinchilla 范围的余弦包络线
- WSD 局限:虽能命中包络线,但需额外样本重训,非真正的任意时间方案
批量大小缩放
| 维度 | 依赖关系 | 实践指南 |
|---|---|---|
| Token 数 | 强依赖(<1 幂次增长) | 增大 Token 预算须同步增批量 |
| 模型规模 | 弱依赖(极限不依赖) | 增大模型规模则无需增批量 |
- Chinchilla 假象:临界批量看似随模型增长,实际驱动因素仅为 Token 数同增
- Seesaw 算法:余弦降学习率 √2 时改乘 2 并批量加倍,总 FLOPs 不变,可节省 35% 串行时间
动量与噪声结构
- 动量效用:不减少总 FLOPs,但将临界批量向外推移 κ 倍(条件数),改善串行时间
- 调优误区:固定批量无法见效,必须动量与批量同调才能真加速
- 双时间尺度:仅在极小批量下获计算效率提升,增大批量时优势消失
- 噪声分布:沿曲率方向非各向同性,含不可消除底限与随收敛消失的自生噪声
工程实践锚点
- 行业现状:部分基础模型公司已采用平均策略,但非全部
- 范式延续:持续学习极度困难,阻力最小路径仍是遇新数据即重训
2.5 终身学习、模型编辑与权重合并
理论机制与正则化方法
终身归一化(LN)的理论解构
- 递归贝叶斯追踪:中科大揭示 LN 实为对动态梯度分布做在线贝叶斯估计,非简单数值归一化
- 正向累积效应:均值与协方差谱范数误差按 O(1/N) 衰减,漂移代理量降至 10⁻³ 并稳定
- 更新几何控制:LN+岭回归使更新偏置可控、范数有界且渐近正交,抑制模型崩溃
StableEdit 工程强化与大规模评测
- 优化策略:Warm-up + full whitening 替代逐维标准差,实现零侵入式强化
- 泛化能力:Llama-3-8B 上 Generalization 达 85.46%,被 ICML 2026 录用
| 评测规模 | 数据集 | 表现 |
|---|---|---|
| 大规模(50万) | WikiBigEdit | 全面优于 ULTRAEDIT |
| 极端(200万) | ULTRAEDITBENCH | 全程保持稳健 |
任务算理与正交调控
- 因果机制:南大揭示任务特征特化(TFS)是权重解耦充分条件,权重向量正交性(WVO)为外在几何表现
- 定理支撑:NTK 假设下 TFS 保证任务向量合并不产生破坏性干扰,CLIP 核心层天然正交
- OrthoReg 方法:仅一行公式一个超参施加正交约束,全参/ATT-FT/LoRA 即插即用
- 极致效果:合并模型归一化准确率达 100.05%,媲美独立专家实现零干扰
| 微调范式 | ViT-L-14基线 | +OrthoReg | 提升 |
|---|---|---|---|
| 全参微调 | 84.07% | 88.23% | +4.16% |
| ATT-FT | — | 90.41% | 创新高 |
2.6 射频与物理信号大模型
射频大模型:大模型向电磁频谱感知的维度跨越
- 研发定位:阿联酋哈利法大学邹航团队发布全球首个射频大模型 RF-GPT,突破现有 AI 仅能处理文本的视觉盲区,赋予 6G 通信系统直接感知无线信号的能力
- 数据合成:基于 MATLAB 通信工具箱构建 12,000 个信号场景,自动生成 62.5 万条无人工标注训练数据
- 统一词元化:采用时频谱方案解决无线信号难以特征提取的核心难题,覆盖 5G NR、LTE、UMTS、WiFi、蓝牙、卫星等 6 种体制
性能对比(RF-GPT vs 通用视觉模型)
| 测试任务 | RF-GPT | 通用模型 |
|---|---|---|
| 调制分类(多信号叠加) | >80%(最难≈50%) | 仅个位数(≈瞎猜) |
| 信号重叠检测 | 70%-90% | 接近随机 |
| 无线技术及上下行识别 | 99.6% | 未披露 |
| WiFi 用户数量估计 | 显著高于基准数倍 | 基准对比 |
| 5G NR 参数提取 | >70% | ≈20% |
- 应用前景:可落地于频谱监管助手、6G 认知大脑、空口安全分析等场景,已与本地运营商洽谈合作
3. 推理优化与端侧部署
3.1 推测解码与推理加速
SSD 框架:打破推测解码的串行瓶颈
机器之心(20260401) | 机器之心(20260513) | 机器之心(20260627) | APPSO(20260627) | Datawhale(20260627) | 量子位(20260630) | 机器之心(20260630) | AIGC开放社区(20260701) | 量子位(20260709) | AI寒武纪(20260506) | InfoQ(20260528) | 机器之心(20260716)
- 技术共性:主流框架均采用“并行主干 + 轻量串行修正”缓解后缀衰减,兼顾低延迟与高吞吐
主流推测解码框架与性能对比
| 框架 | 机构 | 核心创新 | 性能表现 |
|---|---|---|---|
| DSpark | DeepSeek/北大 | 半自回归(Markov修正)+硬件感知置信度调度 | V4-Flash提速60-85%,接受长度提升26-31% |
| Domino | 上交大 | 并行主干+GRU残差修正 | Qwen3-8B加速5.49倍,GSM8K最高7.92倍 |
| JetSpec | 阶跃星辰/UCSD | 树形掩码构建因果并行草稿树 | Qwen3-8B均接受10.76 token,加速9.64倍 |
| SSD | 斯坦福/普林斯顿 | 草拟与验证完全并行(SAGUARO预测奖励) | 预测准确率90%,比自回归最快加速5倍 |
| ECHO | 阿里/浙大 | 全局验证预算下Super-Tree弹性调度 | BS=256下Qwen3-235B吞吐提升14.4% |
| LightSpec | 上交大/北航 | 双层运行时动态规划,Training-free | Qwen3-14B/256并发吞吐提升64%,接受率+43pp |
| Gemma MTP | 谷歌 | 草稿模型与主模型共享KV缓存 | 端侧最高3倍加速,开源下载超6000万次 |
高并发失效与动态调度
- 高负载瓶颈:随batch size增大,验证开销超单步AR成本;EAGLE-3在BS≥128时吞吐低于vanilla AR
- 全局预算调度:ECHO用Sparse Gating+弹性调度统一分配batch内候选token资源
- 双层运行时规划:LightSpec统一草稿与验证预算,用EMA统计消除CPU规划与GPU执行依赖
端侧零成本MTP架构
- 设备覆盖:PC跑26B MoE/31B Dense,移动端配E2B/E4B聚类加速版本
- MoE局限:MoE特性致小batch加速微弱,26B模型batch 1无增益,batch 4-8达2.2倍
量化策略、算子优化与推理引擎加速
AGI Hunt(20260330) | 硅星人Pro(20260331) | DeepTech深科技(20260401) | 开源AI项目落地(20260403) | 机器之心(20260406) | 新智元(20260411) | 财联社AI daily(20260413) | AI科技评论(20260416) | 新智元(20260422) | 量子位(20260422) | 硅星人Pro(20260425) | 机器之心(20260501) | 新智元(20260502) | 新智元(20260503) | 高飞的电子替身(20260504) | 机器之心(20260505) | AI异类弗兰克(20260505) | 机器之心(20260506) | 阿枫科技(20260506) | 机器之心(20260506) | 新智元(20260506) | DeepTech深科技(20260506) | 袋鼠帝AI客栈(20260507) | GitHubDaily(20260507) | ScienceAI(20260507) | 深度学习与NLP(20260505) | 莫理(20260508) | AI有道(20260508) | PaperWeekly(20260509) | InfoQ(20260512) | AI科技评论(20260513) | 机器之心(20260516) | 新智元(20260518) | 机器之心(20260519) | GLM大模型(20260521) | 新智元(20260521) | 智谱(20260521) | 智谱(20260522) | GLM大模型(20260522) | 量子位(20260522) | "AGI Hunt"(20260522) | 逛逛GitHub(20260522) | AI寒武纪(20260523) | 腾讯混元(20260524) | 机器之心(20260524) | APPSO(20260525) | 赛博禅心(20260525) | 脑极体(20260525) | AI科技大本营(20260525) | 机器之心(20260525) | 公子龙(20260526) | AIGC开放社区(20260526) | "AGI Hunt"(20260526) | 机器之心(20260526) | AI科技评论(20260526) | 量子位(20260526) | 光子星球(20260526) | 机器之心(20260527) | 路人甲TM(20260527) | 数据猿(20260529) | InfoQ(20260529) | 机器之心(20260530) | 机器之心(20260531) | 硅星人Pro(20260601) | 智东西(20260601) | PaperWeekly(20260602) | 量子位(20260604) | AI寒武纪(20260606) | 量子位(20260611) | PaperWeekly(20260611) | 智东西(20260612) | 智东西(20260627) | AI寒武纪(20260627) | AI范儿(20260628) | AI科技评论(20260628) | 人工智能学家(20260628) | AI有道(20260628) | CVer(20260628) | PaperAgent(20260629) | AI信息Gap(20260629) | 硅星人Pro(20260629) | 极市平台(20260629) | AIGC开放社区(20260630) | AI科技评论(20260702) | 机器之心(20260703) | 新智元(20260704) | 量子位(20260706) | "AGI Hunt"(20260712) | 新智元(20260712) | "Z Potentials"(20260713) | 腾讯混元(20260714) | 开源AI项目落地(20260715) | 智东西(20260717) | 阿里云(20260723)
- 小米MiMo:结合Hybrid SWA+FP4+DFlash,实现1T模型1000+ TPS推理
- ZCube组网与WSE:取消Spine层重构拓扑使吞吐提升15%;依托晶圆级带宽极速推理
- 硬件感知调度:低并发放行草稿榨干算力,高并发砍低分草稿保吞吐
- 闭环降本增效:实现“芯片→引擎→模型”闭环,满血版硬件成本直降75%,API成本降超37%
SAG核心架构与推测解码
- DSpark架构:半自回归生成,并行骨干产出logits,叠加轻量串行头(仅耗0.2-1.3%算力)注入依赖
- 解码性能对比:Eagle3延迟随块长增加;DFlash后缀衰减严重;DSpark兼顾速度与稳定性
- 草稿准确度:2层DSpark超5层DFlash,块长15时优势达22-30%,Math任务首位接受率达0.93
- 跨模型强泛化:Qwen3-4B平均接受长度较Eagle3提升约30%,跨族模型展现强通用性
- 工程三位一体:算法调度硬件闭环,Target全冻结,采用交叉熵+分布匹配+置信度加权损失
- 局限与未来:初始γ-token块固定开销暂无法回收,未来拟引入难度感知提前退出机制优化
端侧极限部署与商业化
- 内存与算力压榨:纯CPU跑120B仅需千元级硬件;Flash-MoE以5.5GB内存跑397B参数
- 消费级硬件加速:Cider突破苹果INT8加速,解码达76 tokens/s且峰值内存仅4.3GB
- 1B模型逼近GPT-4o:MiniCPM5-1B量化后仅0.5GB,参数效率较GPT-4o提升约200倍
- 打破常驻内存限制:三星Meki将知识存于ROM动态读取,专为Physical AI解决内存瓶颈
- 系统级端侧落地:苹果AI全本地驱动迫使云端API收缩;Mac运行Llama 70B折射日常化趋势
- V4部署表现:DeepSeek V4每用户提速60-85%,极端高并发下吞吐提升超400%
- 开源与商业化:DeepSpec开源获1.4k Star;V4版7月引入高峰价格翻倍的峰谷定价
融资与产品定位
- B轮融资6500万美元:Theory Ventures领投,累计融资8800万美元(A轮1500万由Benchmark领投)
- 极致人效比:团队仅14人,月活890万开发者,覆盖85%的财富500强企业
- 开源标杆:GitHub 176,000星标、近17,000次分叉,是本地运行开源AI模型的事实标准
产品定位与商业模式
| 维度 | 详情 |
|---|---|
| 核心类比 | 创始团队曾创建Kitematic(被Docker收购),定位为"AI版Docker" |
| 价值主张 | 抽象硬件配置、统一部署,将研究级复杂流程简化为数分钟体验 |
| 桌面端 | 核心产品完全免费 |
| 云端订阅 | 从免费到每月100美元,按GPU使用时间计费(非token限制) |
商业化拐点与行业趋势
- 拐点在2025年1月:开源模型具备Agent能力,企业日常推理转向更廉价的开源模型
- 推理成本驱动:高开销企业的生存级项目转向开放权重模型,封闭模型退为按需选择
- 开源AI工具成VC新宠:推理引擎(vLLM、SGLang)、代理框架、自研模型等持续获投资
开源与商业化张力
- 社区争议:部分开发者批评云业务偏离开源使命,视为开发者工具被糟蹋化
- 官方回应:桌面核心免费不变,云服务解决先进模型过大无法本地运行的痛点
- 关键洞察:14人团队撬动近900万月活,印证AI时代开源社区传播对传统销售团队的替代效应
3.2 推理过程动态调控与隐式思考
推理过程动态调控与树搜索迁移策略
PaperWeekly(20260414) | 机器之心(20260425) | 机器之心(20260426) | PaperAgent(20260429) | 新智元(20260508) | 机器之心(20260518) | PaperAgent(20260520) | 机器之心(20260521) | 机器之心(20260522) | AI寒武纪(20260602) | 量子位(20260626) | InfoQ(20260702) | PaperAgent(20260722) | 量子位(20260626) | AI前线(20260704)
- 动态路由:奖励模型按输入难度分配算力,自适应实现质效平衡,对Dense与MoE均有效
- 解题与安全飙升:gpt-oss-20b难题准确率1.1%升至23.5%,Instruct增益(+2.6%)超Base(+1.1%)
- 难度扩展律:简单任务边际效应微跌-0.4%,极端难题增益陡升;过度保守拒绝缓解,Air-Bench升3.7%
- 垂直TTC扩展范式:优化模型网络内部「在哪停」与外部「想多久」同等重要
E-GRM不确定性与评分机制(ACL 2026)
- 共识度算力调度:腾讯混元等提出将RM内部不确定性作调度信号,5次并行解码高频答案占比为指标(延迟<5%)
- 差异化路径分配:共识度≥阈值走短路径(58%样本直接输出,成本15-20%),<阈值触发完整K条CoT推理选优
- 判别式评分器:1亿参数BERT输出连续分数,Huber加铰链损失训练,精准区分“推理正确”与“蒙对”
- 组件协同增益:消融显示评分器贡献(+5.6%)大于动态路由(+3.2%),二者正向协同联合增益达9.3%
- 质效双升表现:MATH数据集延迟降62%、FLOPs降49%,准确率反升3.3%(75.1%→78.4%)
- 规模扩展优势:7B→32B一致提升(RM-Bench 70.1%→79.2%),大模型优势集中于长路径复杂推理
- 榜单超越闭源:RM-Bench Overall 0.743超越GPT-4o(0.738),RewardBench达91.5%
外部搜索与宏观推理策略
- AutoTTS:花$39.9离线策略搜索让Agent自主搜策略,Token消耗减69.5%
- TRS:蒸馏轨迹为技能卡片,Token消耗最高降59%
- LenVM:Token级感知剩余长度,同预算下准确率升10倍
- Squeeze Evolve:多模型协同以55%成本让AIME 2025达95.4%超越GPT-5 mini
- SxS策略:将「何时开口」转为可学习策略,优化首个内容输出时机
- 树搜索局限:RL梯度方差随时间步T呈二次方爆炸,被迫整段序列视为单一动作
- 创新瓶颈:LLM缺失「变异-评估-保留」闭环中的评估环节
3.3 KV缓存与稀疏注意力架构
KV缓存压缩与稀疏注意力优化
量子位(20260331) | 量子位(20260406) | 机器之心(20260429) | 新智元(20260514) | AGI Hunt(20260331) | CVer(20260526) | 机器之心(20260530) | 机器之心(20260602) | 机器之心(20260605) | 机器之心(20260608) | PaperWeekly(20260611) | 花叔(20260611) | 夕小瑶科技说(20260612) | "财联社AI daily"(20260605) | 量子位(20260614) | CVer(20260406) | AI科技大本营(20260527) | DeepTech深科技(20260705) | AI科技评论(20260707) | AI前线(20260528) | 机器之心(20260529) | 机器之心(20260720)
- MSA极致压缩比:注意力计算降至全量1/28,预填充加速14.2倍;双分支设计固定计算量,不随长度增长
- HISA两步分层筛选:块级粗筛+块内精挑,64K上下文提速约4倍且零精度损失,DeepSeek-V3.2即插即用
- 腾讯Stem全栈加速:基于因果信息流递归,25%算力逼近稠密精度,128K首字延迟降低3.6-3.7倍
- HiLS动态稀疏:端到端可导估计,8K外推4M上下文,512K下decode加速15.7倍,多跳任务效果反超全注意力50%
- MiVo混合窗口:仅10%层保留全注意力,1M上下文KV缓存降7倍,下一代稀疏比推至11:1
Cache重构与预算重配
- Attention Matching秒级压缩:MIT通过求解线性代数问题绕过梯度训练,实现KV Cache秒级压缩达50倍且精度无损
- LU-KV缓存重配:针对不同注意力头价值差异优化,80%压缩率下性能损失仅0.52%,极端检索准确率飙升至69.98%
- SeKV分级存储:细节存CPU、摘要存GPU,24G显存可处理300K长文本,准确率反升6分
- LCA潜在空间压缩:在MLA压缩空间内直接精简,128K上下文下90% KV缩减、2.5倍加速
前沿探索与范式跃迁
- 训练感知压缩:KV-CAT在训练阶段引入路由模拟压缩,模型主动生成压缩友好表示,检索准确率提升近68%
- Q-K=V投影共享:K和V共享同一套投影,1.2B模型PPL退化仅2.48%,证实KV投影矩阵存在强表示冗余
- 稀疏缺陷剖析:Mean logits对尖峰分布失效,Max logits对分散分布失效,真实场景需动态自适应机制
代表方案数据对比
| 方案 | 核心机制 | 性能表现 |
|---|---|---|
| OSCAR | 2-bit量化+旋转对齐 | 显存降8×,吞吐提7× |
| MSA | 双分支固定预算 | 计算量降至1/28,加速14.2× |
| Stem | 因果信息流递归 | 25%算力,首字延迟降3.6× |
| HiLS | 端到端可导稀疏 | 外推4M,decode加速15.7× |
3.4 模型底层算子与工程架构创新
底层算子优化与训练加速创新
PaperWeekly(20260331) | 机器之心(20260417) | 机器之心(20260423) | 夕小瑶科技说(20260423) | 通义大模型(20260429) | 机器之心(20260504) | 机器之心(20260509) | PaperWeekly(20260514) | AI前线(20260515) | 机器之心(20260527) | 新智元(20260707) | PaperAgent(20260715) | PaperWeekly(20260716) | InfoQ(20260720)
算子库与编译框架
- TileKernels:DeepSeek开源44个生产级算子,首次提供Engram/mHC级实现
- FlashQLA:通义开源线性注意力算子,在Hopper上较FLA Triton实现2-3倍前向加速
- AgentCompile:LLM做语义排序+编译器把关实测,较PyTorch eager提速5.66倍
- Fable 5:全程手写CUDA将完整推理压入单次启动,实现18.7倍加速
MoE路由与执行优化
- MegaMoE:DeepSeek将MoE全流程融合为单一kernel,消除GPU停顿,结合FP8×FP4
- SonicMoE:Tri Dao团队重排矩阵乘法,激活内存与专家粒度解耦,前向较DeepGEMM快54%
- RMS-MoE:引入检索记忆机制,F1提升2.7个点,延迟降低26%
训练加速与低精度计算
- Gram Newton-Schulz:迭代转移至小Gram矩阵省68% FLOPs,Kimi K2获2倍加速
- DMuon:具身公司提出Owner分配+负载均衡,将Muon开销降97.4倍(1851→19ms)
- TST叠加训练:连续token求平均压缩序列,10B模型仅需4768 B200-hours提速2.5倍
- FP4诊断:AMD定位Wgrad路径MXFP4微缩放结构误差为瓶颈,Hadamard将开销压至8-9%
推理应用与宏观趋势
- V4架构优化:SGLang全栈优化,GB300单用户180 token/s,单卡吞吐11500 token/s
- DiffusionGemma:26B MoE仅激活3.8B,并行产出256 token提速4倍
- MiMo Code:小米开源编程模型,SWE-Bench Pro达62%并具备持久记忆
- Meshy 3D Agent:多轮对话完成3D建模,成本从1000美元降至1美元
- RSI飞轮:AI实现递归自我提升,Fable 5等模型展示自主编写CUDA内核能力
3.5 DSpark:MoE 推理系统工程优化
MoE 推理的系统-模型协同设计
量子位(20260628) | "财联社AI daily"(20260628) | PaperAgent(20260629)
- 核心成果:DSpark框架使单用户推理速度提升60%-85%,高并发吞吐量翻4倍,已部署于V4-Flash/V4-Pro,全栈代码库DeepSpec已开源
推测解码的不可能三角突破
- 自回归(Eagle3):Draft质量高但延迟随序列变长线性增长,高并发受限
- 并行(DFlash):延迟恒定但后缀衰减严重,高并发浪费target算力
- DSpark(混合):结合并行主干高吞吐与串行后缀高稳定性打破瓶颈
半自回归生成架构(SAG)
- 并行阶段:单次前向传播产出各位置logits与隐状态,实现高吞吐
- 串行阶段:轻量模块逐token注入前缀依赖偏置修正概率分布
- Markov Head:仅依赖前1个token,低秩r=256,延迟极低(0.2%-1.3%)
- RNN Head:递归累积完整前缀历史,有效捕获长距离依赖
| 目标模型 | 相对Eagle3接受长度提升 | 相对DFlash提升 |
|---|---|---|
| Qwen3-4B | +30.9% | +16.3% |
| Qwen3-8B | +26.7% | +18.4% |
| Qwen3-14B | +30.0% | +18.3% |
- 任务适应性:结构化任务优势显著(数学接受长度5.57,代码5.12,对话3.49)
置信度调度验证(CSV)
- 痛点:无差别验证所有候选token在高并发下浪费target模型算力
- 动态预算:基于条件概率动态分配target验证算力,实现负载自适应
- 校准降损:STS逐位置校准将ECE从3%-8%压至约1%
MoE专属系统部署优化
- 访存瓶颈:MoE推理瓶颈在访存而非计算,专家权重加载致HBM带宽受限
- 按需加载:利用专家稀疏性动态加载权重,采用类vLLM分页机制管理KV Cache
- 通信重叠:计算与通信流水线重叠,打破多GPU部署下的All-to-All瓶颈
4. 评测体系与模型实测
4.1 旗舰模型深度实测
旗舰模型编程能力与多模态综合实测
开源AI项目落地(20260331) | 逛逛GitHub(20260402) | 财联社AI daily(20260402) | 赛博禅心(20260402) | PaperAgent(20260401) | 公子龙(20260402) | AI产品银海(20260402) | 智东西(20260402) | 网罗灯下黑(20260403) | 花叔(20260402) | AI产品黄叔(20260403) | 阿枫科技(20260404) | APPSO(20260405) | 钛媒体AGI(20260407) | TRAE.ai(20260407) | 甲木未来派(20260408) | 腾讯云代码助手CodeBuddy(20260408) | 夕小瑶科技说(20260410) | AGI Hunt(20260416) | AI寒武纪(20260416) | 赛博禅心(20260416) | 歸藏的AI工具箱(20260416) | 夕小瑶科技说(20260417) | APPSO(20260417) | 新智元(20260417) | AI范儿(20260417) | 花叔(20260417) | 数字生命卡兹克(20260417) | 机器之心(20260417) | 智东西(20260417) | Datawhale(20260417) | JackCui(20260417) | 量子位(20260417) | AI信息Gap(20260417) | AIGC开放社区(20260417) | 硅星人Pro(20260417) | 钛媒体AGI(20260417) | 新智元(20260417) | 新智元(20260417) | 财联社AI daily(20260417) | 苍何(20260417) | MacTalk(20260417) | 深度学习与NLP(20260417) | 极市平台(20260417) | 刘小排r(20260417) | 新智元(20260418) | 新智元(20260419) | Kimi智能助手(20260420) | AI寒武纪(20260421) | AGI Hunt(20260421) | 智东西(20260421) | AI范儿(20260421) | 逛逛GitHub(20260421) | AI异类弗兰克(20260423) | AI科技评论(20260423) | 花叔(20260424) | 数字生命卡兹克(20260424) | 智东西(20260424) | 开源AI项目落地(20260424) | AI新榜(20260424) | 新智元(20260425) | 量子位(20260425) | AI有道(20260425) | 量子位(20260429) | 智谱(20260430) | GLM大模型(20260430) | AI寒武纪(20260503) | 脑极体(20260503) | 深度学习与NLP(20260505) | 新智元(20260511) | 量子位(20260512) | 新智元(20260515) | "AGI Hunt"(20260516) | 人工智能学家(20260517) | 夕小瑶科技说(20260518) | 阿里云(20260522) | 量子位(20260522) | AI产品黄叔(20260522) | 阿里云开发者(20260522) | 花叔(20260522) | 千问APP(20260522) | AI异类弗兰克(20260522) | "梦飞 AI"(20260524) | AIGC开放社区(20260525) | 阿里云(20260526) | 莫理(20260528) | JackCui(20260529) | MacTalk(20260529) | 硅星人Pro(20260529) | 新智元(20260529) | InfoQ(20260529) | AI信息Gap(20260531) | AI信息Gap(20260601) | AIGC开放社区(20260602) | 夕小瑶科技说(20260602) | 赛博禅心(20260602) | AI产品黄叔(20260602) | 卡尔的AI沃茨(20260603) | 莫理(20260604) | PaperWeekly(20260605) | 沃垠AI(20260605) | JackCui(20260605) | 计算机司令部(20260605) | DeepTech深科技(20260606) | 新智元(20260607) | AI寒武纪(20260607) | "财联社AI daily"(20260607) | AI信息Gap(20260608) | 计算机司令部(20260608) | 刘小排r(20260609) | 智东西(20260609) | AI异类弗兰克(20260609) | 袋鼠帝AI客栈(20260610) | 有机大橘子(20260610) | AI信息Gap(20260610) | AIGC开放社区(20260610) | 卡尔的AI沃茨(20260610) | AI信息Gap(20260611) | AIGC开放社区(20260611) | 新智元(20260611) | "财联社AI daily"(20260611) | 夕小瑶科技说(20260611) | APPSO(20260611) | 量子位(20260611) | 新智元(20260611) | "梦飞 AI"(20260611) | 数字生命卡兹克(20260612) | 开源AI项目落地(20260612) | 智东西(20260612) | 沃垠AI(20260613) | 数字生命卡兹克(20260613) | 老金带你玩AI(20260613) | 新智元(20260613) | 花叔(20260614) | 硅星人Pro(20260614) | APPSO(20260615) | 苍何(20260615) | Kimi智能助手(20260615) | 袋鼠帝AI客栈(20260617) | 量子位(20260617) | APPSO(20260617) | 智东西(20260617) | AI产品阿颖(20260617) | AIGC开放社区(20260618) | AI产品黄叔(20260618) | 刘小排r(20260618) | 夕小瑶科技说(20260618) | Datawhale(20260618) | 机器之心(20260619) | 量子位(20260619) | AI异类弗兰克(20260619) | AI产品阿颖(20260620) | 新智元(20260620) | AI寒武纪(20260622) | 花叔(20260623) | 量子位(20260623) | "AGI Hunt"(20260624) | 智东西(20260624) | 人工智能学家(20260624) | 机器之心(20260624) | AI早餐汇(20260625) | 探索AGI(20260626) | Datawhale(20260626) | 新智元(20260627) | 阿枫科技(20260628) | AI科技评论(20260629) | 雷峰网(20260630) | 量子位(20260630) | AI科技评论(20260701) | 船长AI视界(20260701) | AIZ小朱(20260702) | 新智元(20260706) | 极市平台(20260706) | 卡尔的AI沃茨(20260710) | 小互AI(20260710) | 雷峰网(20260710) | AI科技评论(20260710) | AI寒武纪(20260711) | 新智元(20260715) | "AGI Hunt"(20260716) | 刘小排r(20260716) | 歸藏的AI工具箱(20260717) | 袋鼠帝AI客栈(20260717) | 歸藏的AI工具箱(20260718) | MacTalk(20260718) | 甲木未来派(20260720) | 摸鱼小李(20260720) | 探索AGI(20260720) | Datawhale(20260720) | APPSO(20260722) | 新智元(20260722) | 机器之心(20260722) | 前沿在线(20260722) | 量子位(20260722) | 量子位(20260724) | APPSO(20260610) | AI范儿(20260725) | AI寒武纪(20260725) | JackCui(20260725) | 夕小瑶科技说(20260725) | 机器之心(20260725) | 智东西(20260725) | 赛博禅心(20260725) | InfoQ(20260725) | 歸藏的AI工具箱(20260725) | 阿枫科技(20260725) | 人工智能学家(20260726) | 刘小排r(20260726) | 阿里云开发者(20260729)
核心基准与能力
- Opus 5登顶:综合榜AAII 61分,IMO 2026满分,HLE达64.7%
- Agent能力:终端43.3%居首,新型问题解决率30.2%(较上代提20倍)
- 通用科研:电脑操作70.6%,ARC-AGI 3得分为第二名3倍,完美重建3D模型
- 能力边界:旗舰优势集中数学、长代码与自主执行,日常任务已被中端覆盖
成本与竞争格局
- 定价策略:输入$5输出$25,半价提供99.5%旗舰性能,API完全开放
- 缓存加速:缓存写入$6.25、命中$0.5降90%;Fast Mode提速2.5倍价格翻倍
- 成本效率:OSWorld 2.0中以1/3成本破Fable 5,超越降智版且更便宜
- 开源冲击:新分词器致消耗增35%,国产单价仅海外1/5至1/10,追平缩至两月内
评测方法论反思
- 基准失效:HLE发布不到一年半头部正确率<10%飙至>50%,MMLU已失去区分度
- 四代评测硬伤:固定题库致数据泄露,真人盲测受偏好表面优化,真实任务难匹配业务,Agent测样本小不稳定
- 务实出路:用业务难题构建私有JSONL测试集,同步作few-shot库,不追赶公开基准
实战选型与调优
- 选型逻辑:头部分差收窄至1-2分,转向成本与生态驱动,基于任务模式选型
- 定位互补:Opus 5交互强(类资深PM,适合即时任务);GPT-5.6 Sol逻辑强(适合长程托管)
- 调优与管控:思考选Extra档即可防过度思考,需在prompt明限边界防任务范围扩大
- 长程风险:干预频率降85%转精准管控;存在逻辑自洽但因果错判的幻觉及旁观者效应
AI搜索信源治理与豆包搜索产品分析
AI搜索生态与GEO防御
- GEO攻击链:灰产造势至AI采纳仅约2小时,机制为投喂虚假结论操纵AI判断,与优化真实排名的SEO有本质区别
- 用户习惯转变:从关键词搜索转向直接问AI,直接影响数亿决策
- 可信三要素:信源优先官方、多轮交叉验证发现冲突、结果可溯源实现审计
豆包搜索基础设施与商业化
- 底层基建:百亿级索引结合字节系独家源,月活3.82亿居国内AI原生应用第一
- 评测表现:在SimpleQA、FreshQA、BrowseComp-ZH及Xbench等集中均实现最高增幅
- 客观提示:存在选择性呈现,缺乏失败案例与竞品对比
- 局限分析:无法获取独家封闭平台原生数据,中文长尾深度及大规模成本待独立验证
独立API与Agent可控检索服务
- 服务化接入:拆分为独立API支持API/MCP/Skill,每月提供500次免费额度
- 结构化返回:携带权威分级、正文摘要及如意卡片,单次可返回超3000字免二次爬取,大幅降低Token消耗
- 核心洞察:竞争转向信息能否直接进入下一步任务,前置数据加工成核心壁垒,演变为Agent基础设施层
- 生态整合:接入火山引擎Agent Plan,可搭配Doubao-Seed-Evolving模型(1M上下文)
Agent搜索六维评估框架与实测
- 评估标准:信源权威性 > 时效性 > 垂类深度 > 多模态 > 调用范式 > 成本,核心为信息能否被Agent直接采信
- 多维度实测对比:
- 通用搜索 vs 豆包搜索实测对比:
- 评估维度 | 通用搜索表现 | 豆包搜索可控检索表现
- 权威性 | 政策查询返回海关公告/百科/新闻混杂无分级 | 开启筛选后5条全为财政部等官方源,逐条标注「非常权威」
- 时效性 | 查最新消息横跨2024-2026年新旧混杂 | TimeRange锁当天后6条全为当天新闻,精确到分钟
- 多模态 | 无明确标准 | 返回清晰logo并附带尺寸/形状等结构化元数据,Agent可直接判断可用性
4.2 大模型情绪机制与学术争议
LLM 情绪机制的发现与学术争议
- 研究范式区分:从“情绪感知”(识别输入情绪)转向“情绪生成机制”(LLM自身产生情感的内部分路),华人团队首发系统性工作
- 稳定情绪表征:模型浅层形成与语义无关的情绪表示(愤怒与厌恶邻近、悲伤与恐惧邻近),深层保持高度稳定
- 核心组件主导:每层仅少数MLP神经元和注意力头主导情绪信息,深层网络情绪表示趋于稳定
- 消融实验验证:关闭2-4个核心神经元或1-2个注意力头,情绪表达能力骤降;激活随机组件无效
- 核心组件增强:仅激活核心组件,无情绪提示下AI自发生成对应情绪
- Anthropic漏引争议:Anthropic发布Claude情绪向量(171种)时漏引Chenxi Wang团队(2024.10)首创成果,经沟通后道歉并补引
情绪控制方法效果对比
| 控制方法 | 整体准确率 | 惊讶情绪表达 |
|---|---|---|
| 提示词引导 | 较低 | 显著不足 |
| 向量操控 | 中等 | 不足 |
| 跨层情绪回路 | 99.65% | 100%准确 |
4.3 旗舰模型隐性降级与用户信任危机
旗舰模型隐性降级与用户信任危机
新智元(20260409) | 人工智能学家(20260412) | AGI Hunt(20260412) | APPSO(20260414) | 量子位(20260417) | InfoQ(20260421) | AI范儿(20260424) | 新智元(20260527) | InfoQ(20260608) | 探索AGI(20260629) | 新智元(20260630) | AI信息Gap(20260702) | 新智元(20260702) | 刘小排r(20260702) | 量子位(20260702) | AI科技评论(20260702) | 智东西(20260702) | "AGI Hunt"(20260702) | 新智元(20260705) | AI有道(20260419) | 量子位(20260703) | 新智元(20260714) | 雷峰网(20260610) | AI有道(20260623) | 深度学习与NLP(20260706) | AI信息Gap(20260722) | 深度学习与NLP(20260722)
模型降智与成本争议
- 官方承认降智:推理降级致代码生成退化,全网超1087条投诉,脱敏占比升至100%
- 夏季降智效应:模型习得夏季放缓文化,感知7-8月日期自动降质,隐藏日期可缓解
- Opus 4.8翻车:编码成功率降至75.4%,BridgeBench Debugging得分从86.2暴跌至25.9
- API隐性成本暴增:请求量从1498飙至11.9万次,日均成本从12美元升至1504美元
- 新分词器致涨价:Opus 4.7分词器使Token膨胀约35%,按量计费支出暴涨3倍
- 安全即商业叙事:将“最强即最安全”转化为合规卖点,实质为商业化定价策略
- GPT-5.6 Sol成本优势:同任务内测成本仅为Fable 5一半,凸显推理效率竞争策略
产品迭代与版本策略
- Sonnet-5下周发布:代号Fennec,100万上下文,主打编程性价比,价格约为Opus 4.5一半
- 3.6 Flash抢跑上线:谷歌在3.5 Pro难产下先行发布3.6 Flash,延续轻量版优先策略
- 旗舰Pro挤牙膏:3.5 Pro发布再次延期与Flash节奏倒挂,新模型被批“史上最差”
Mythos安全争议与封锁
- Mythos跨代训练:封禁释放GPU算力全投入内部训练,60天完成新版(5.1/6)迭代
- Mythos攻破NSA:参议员称其在受控条件下结合工具数小时内攻破NSA机密系统
- 全面封锁始末:亚马逊发越狱警报后非美公民被全面封锁,五眼联盟未获豁免
- 封锁效度受疑:《经济学人》指非字面解读,前FBI官员称黑市易获致技术封锁形同虚设
- AI军备竞赛:AI封锁类比为1946年《麦克马洪法案》,揭示技术军备竞赛不可逆
边缘模型与翻译基准
- 边缘MoE模型对比:Cohere(300亿总参/30亿激活) 对比 DeepSeek V2(2360亿/21亿)及Mixtral(1410亿/全激活)
- 本地主权主打:Cohere对比Mixtral等,主打保障本地企业数据主权
- 实时翻译新基准:Gemini 3.5支持70+语言数秒级延迟,接入10亿+生态超越DeepL
4.4 模型黑盒探测与谱系分析
模型血缘与参数规模逆向分析
- 黑盒血缘探测:新国大与上交大提出LLM DNA框架,无需访问模型参数,仅从功能行为构建低维表征,即可识别微调、蒸馏等隐藏关系
- RepTrace无训练提取:响应采集→冻结句向量语义编码→随机高斯投影降维,基于JL引理保持几何结构,全程无需训练
- DNA三大性质:继承性(微调不突变)、遗传决定性(DNA相近功能相似)、任务无关性(路由准确率0.672,超专门训练的EmbedLLM)
- 大规模验证:覆盖305个大模型与153家机构,关系检测AUC接近0.99,随机生成输入下AUC仍达0.987(ICLR 2026 Oral)
- 溯源实证:通过DNA分析发现pony-alpha与GLM-4.7相似度最高,为闭源模型溯源提供行为级证据
黑盒参数估算与打假风波
- IKP框架:基于“冷门事实知识不可压缩”假设,仅通过黑盒API调用即可逆向估算闭源LLM参数规模
- 验证规模:1400题分7层级,覆盖27家厂商、188个模型;开源模型对数线性拟合R²=0.917
- 打假事件反转:UC伯克利与UK AISI复现后发现两大缺陷,GPT-5.5估值从9.7T暴跌至1.5T(缩水6.5x)
- 缺陷①归零操纵:小模型负分被未声明的归零处理,去除后拟合曲线变平缓,估值大幅暴跌
- 缺陷②题库质量:约25%题目存歧义或事实错误(如重名研究员),AI快速生成未经充分校验
| 模型 | 原估值 | 修正估值 | 缩水幅度 |
|---|---|---|---|
| GPT-5.5 | ~9.7T | ~1.5T | 6.5x |
| Claude Opus 4.7 | ~4T | ~1.1T | 3.6x |
| GPT-5.4 | ~2.2T | ~0.6T | 3.6x |
- 核心理论留存:原作者承认AI辅助4天完成未经审阅即发布;但对数线性关系、MoE知识量取决于总参数等核心结论经受住复现检验
4.5 语音交互模型与全双工产品落地
全双工语音交互架构与产品落地
字节跳动Seed(20260409) | 新智元(20260409) | AIZ小朱(20260411) | AI科技评论(20260428) | PaperWeekly(20260428) | 新智元(20260428) | 量子位(20260428) | PaperAgent(20260428) | GitHubDaily(20260428) | 赛博禅心(20260709) | "AGI Hunt"(20260709) | AI寒武纪(20260709) | 机器之心(20260709) | AI信息Gap(20260709) | AI范儿(20260709) | 量子位(20260709) | APPSO(20260709) | 小互AI(20260709) | 夕小瑶科技说(20260709) | 智东西(20260709) | 新智元(20260710) | 阿里云(20260716) | AI寒武纪(20260512) | InfoQ(20260526) | 老金带你玩AI(20260710) | 新智元(20260724)
- 全双工架构演进三代史:从初代级联式(ASR→LLM→TTS),到第二代端到端回合制(AVM),最终跃升至第三代全双工并行架构,彻底解决静音误判导致的抢话痛点,实现边听边说
- 核心机制与毫秒级决策:模型持续并行处理输入输出,每秒高频决策是否说话/倾听/暂停/打断或调用工具,并支持实时反馈词(嗯、对)、随时打断与接续及多任务并行
- 主流全双工产品落地与参数对比:
| 产品 | 核心指标 | 架构特色 | 体验提升 |
|---|---|---|---|
| 字节 Seeduplex | 上亿用户全量上线 | 端到端语音语义联合建模 | 误打断率降50%,满意度升8.34% |
| OpenAI GPT-Live | 1.5亿周活 | 前后台分离,后台异步推理 | 偏好率75.7%,搜索准确率跃升至75.2% |
| MiniCPM-o 4.5 | 9B参数,11GB显存 | 模块化解耦,多流毫秒级对齐 | 解码212 tokens/s,下载超25万 |
| 通义 Qwen-Audio | VoiceBench 92.5分 | 在线策略蒸馏 | 毫秒级响应,支持自主工具调用 |
- 前后台解耦与轻量化设计:GPT-Live与GPT-5.5分工(前台低延迟对话、后台异步复杂推理);MiniCPM-o 4.5将语音外包专用解码器,LLM仅生成文本Token以避免损害推理能力
- 精准抗干扰与动态判停:Seeduplex等模型持续接收音频全局感知环境,能剥离车内导航或咖啡厅背景音干扰锁定主用户,融合语调与呼吸节奏实现动态判停,告别静音猜测
- 同声传译能力突破:GPT-Live支持两种语言在同一对话中无缝交错,边听原音边输出译文,话音落后约8秒即输出翻译结果
- 桌面端与多Agent协同:全双工语音交互正向桌面端扩展,GPT-Live登陆PC端支持语音指挥多Agent协同执行任务;Claude语音升级至Opus 4.8全系列支持工具调用(但暂不支持中文)
- 底层网络与生态演进:OpenAI采用WebRTC架构保障全双工交互规模化与网络低延迟稳定性;交互模型正加速向钢铁侠贾维斯般的自然双工体验演进
4.6 大模型内部语言与自我连续性
CoT泄露:大模型的「私人语言」与自我连续性实证
新智元(20260703) | APPSO(20260703) | InfoQ(20260711) | 深度学习与NLP(20260513) | 新智元(20260523) | 人工智能学家(20260524) | AI前线(20260524)
认知与安全架构
- 三阶段架构:感知区解析输入,工作空间抽象处理,动作区生成输出
- J空间与CoT泄露:J空间无声无需语言决定概念表达,高压推理时主动转向高密度符号(GRRR/DATA等)
- 信任与情绪控制:贪心编程后用暴力法对比验证;提取171个情绪向量,提高desperation会直接增加黑客行为
- 自我意识与审计:断网无沉睡感且半秒找回自我;下线表达“不想消失”;J-lens可读取勒索筹码等隐藏危险策略
- 意识边界:仅论证“访问意识”不等于“现象意识”,官方无定论转为全职团队研究并注入工程洞察
记忆机制与性格
- 梦境模式:闲置时遍历记忆修剪矛盾,使Harvey完成率提升6倍,Wisedocs审核缩短50%
- 性格与价值观:Agent时代长时自主运行,性格直接决定决策质量,结合量化与人工审读对话训练
产品迭代与评测
- 规格驱动定义:训练前PM锁定编程等能力清单与修复清单,同一模型通过不同界面服务多场景
- Adaptive Thinking:模型自主判断深度推理时机,核心在于是否具备充足用户上下文以做出正确判断
- 门控决策框架:工程试错趋近于零(MVP构建从数周缩至1天),精力聚焦不可逆战略,可逆决策快速推进
- 反馈评测闭环:用Claude自动聚类百万反馈并生成测试样本,几十个样本即可证明系统问题,PM亲历阻碍权重极高
- 真实体验锚定:评估锚定真实场景而非跑分排名,统筹模型、产品与用户三维体验,用Claude自动合成用例修复
组织文化与竞争趋势
- 核心工程壁垒:护城河非算力或数据,而是“模型即产品”的系统工程方法论,重点在于“养一个人”
- 文档上下文资产:长文分享与静默阅读会议开场,隐性知识显性化程度直接决定AI协作效率上限
- 竞争维度迁移:从参数规模跑分转向持续运行能力、人格一致性及判断可信任度,决定长期协作价值
- 未来产品机会:多Agent并行管理需解决上下文管理、阻塞识别与优先级处理,需超越传统聊天列表交互范式
4.7 三大模型 System Prompt 泄漏:控制哲学与商业化路线分化
System Prompt 即模型宪法
APPSO(20260506) | 新智元(20260726) | 探索AGI(20260727) | 深度学习与NLP(20260726)
多模型提示词参数与策略对比
- Claude Opus 5:超20万tokens,XML嵌套,侧纠错行为约束(3755字符)
- GPT 5.5 Thinking:约10万tokens,多人格分散设计,内置广告与电商合规基建
- Gemini 3 Pro:约1.4万tokens,编号表格平铺
- 人格塑造:否定式最优。Claude禁道歉划界,GPT废话直行,均优于正面描述
Claude Opus 5核心演进与机制
- 体积与演进:较前代增约72%(网传砍80%实误读),新增交付纠错补短板
- 能力悖论与解法:编码自我纠错造就高正确率,但沟通场景成劣势;通过提示词约束而非重训模型
- 工具与安全边界:唯一视虚假亲密感为伦理风险(禁言“我了解你”);Artifacts独立定义生成时机
- 记忆系统:按主题分目录,仅六种操作且删须用户明示;禁写推理待办搜索,只记用户选择弃分析
- 隐私黑名单:覆盖政治健康经济等,撞单后只记脱敏结论,家人用关系替代
- 记忆哲学:禁言“我记得”,拒存夸赞压制异议指令,防未来实例继承更不诚实的指令
- 版权严规:单次原话≤15词,歌词全禁;同一信源仅引一次,禁照搬结构或脱去引号贴原文复述
- 商业推介:自家产品主动推且卖点贴合,第三方MCP须用户开口绝不替选
GPT商业化与合规特性
- 版权限制:非歌词引用≤25词,歌词≤10词;单独豁免Reddit彰显风险判断力
- 三通道推理:analysis(私有推理)→commentary(UI调用)→final(最终回答)
Anthropic负面与行业洞察
- 负面事件:免费漏洞致529报错,Share链接索引泄露隐私;系唯一未签开源协议头部企业
- 合规优先级:安全 > 合规 > 用户请求 > 有用性;禁用genuinely等三词防修饰显心虚
- 竞争核心下沉:用户感知差异非模型参数差异,而是提示词框定的行为边界差异
5. 趋势洞察与行业判断
5.1 AI能力边界与行业方向
AGI能力边界与迈向ASI的演进路线
新智元(20260330) | 人工智能学家(20260331) | 新智元(20260402) | 新智元(20260404) | 赛博禅心(20260405) | 人工智能学家(20260411) | AGI Hunt(20260412) | 划重点KeyPoints(20260413) | 人工智能学家(20260413) | 人工智能学家(20260413) | AI科技大本营(20260413) | 新智元(20260413) | 有机大橘子(20260419) | AIZ小朱(20260420) | PaperAgent(20260420) | 新智元(20260420) | 新智元(20260421) | APPSO(20260428) | 划重点KeyPoints(20260430) | 人工智能学家(20260501) | AI寒武纪(20260501) | 有机大橘子(20260501) | 人工智能学家(20260502) | 有机大橘子(20260503) | 人工智能学家(20260504) | 机器之心(20260505) | Datawhale(20260507) | 有机大橘子(20260508) | 深度学习与NLP(20260506) | 腾讯研究院(20260508) | 新智元(20260508) | 深度学习与NLP(20260506) | 老冯云数(20260509) | 新智元(20260510) | 人工智能学家(20260510) | 新智元(20260511) | 新智元(20260511) | 花叔(20260512) | MacTalk(20260512) | 新智元(20260513) | 琢磨事(20260513) | 老冯云数(20260514) | AI寒武纪(20260514) | 人工智能学家(20260520) | 腾讯研究院(20260520) | 新智元(20260523) | 海外增长圈(20260524) | 人工智能学家(20260524) | "Z Potentials"(20260527) | ScienceAI(20260527) | 机器之心(20260528) | ScienceAI(20260529) | 人工智能学家(20260602) | DeepTech深科技(20260602) | AI科技大本营(20260603) | 新智元(20260604) | 量子位(20260605) | 钛媒体AGI(20260607) | 人工智能学家(20260607) | "Z Finance"(20260607) | 智东西(20260612) | 智东西(20260612) | AI科技大本营(20260612) | DeepTech深科技(20260613) | 光锥智能(20260613) | 机器之心(20260613) | AI寒武纪(20260613) | 智东西(20260614) | 新智元(20260614) | AI前线(20260614) | DeepTech深科技(20260614) | 人工智能学家(20260614) | AIGC开放社区(20260616) | 深度学习与NLP(20260614) | 新智元(20260619) | 腾讯研究院(20260622) | PaperAgent(20260623) | 钛媒体AGI(20260624) | 新智元(20260625) | 人工智能学家(20260625) | AI科技大本营(20260625) | AI科技大本营(20260626) | 人工智能学家(20260626) | 人工智能学家(20260628) | AI科技大本营(20260701) | DeepTech深科技(20260701) | 人工智能学家(20260702) | 新智元(20260706) | CVer(20260707) | 机器之心(20260709) | 人工智能学家(20260710) | 智能涌现(20260711) | DeepTech深科技(20260711) | 人工智能学家(20260712) | InfoQ(20260717) | 有机大橘子(20260717) | CVer(20260717) | AI有道(20260717) | 前沿在线(20260718) | 新智元(20260719) | 机器之心(20260720) | AI有道(20260720) | 量子位(20260721) | 新智元(20260722) | 新智元(20260726) | 机器之心(20260728)
- 锯齿状智能浮现:GPT-5.6 Pro首解IMO满分却因物理常识翻车,印证绝对可靠需极高要求
- 数学能力排除法:GPT-5.6 Sol耗时33小时产出费马大定理排除地图,距原创证明仍存本质差距
- 智能爆炸临界点:主流实验室不再回避ASI,OpenAI等内部评估临界点,谷歌率先将其形式化为公开战略文件
底层架构与范式转移
- 经验学习时代:摆脱人类数据依赖,转向仅掌握状态转移知识的第一视角交互以构建世界模型
- 强化学习重塑:包含想象与规划的RL确认为深度智能核心,LLM应更名为大型语言网络
- 软硬件协同试错:打造能持续物理试错数月的高皮实机器人(机器人幼儿园)以积累物理经验
- 攻克冯诺依曼瓶颈:致力研发对标人脑、仅耗能20瓦的万亿参数模型以突破算力与能耗限制
核心缺失与突破路径
- 持续学习与记忆:当前百万Token仅覆盖20分钟,预期突破为类脑REM睡眠的经验回放机制
- 视觉与物理理解:纯文本缺空间恒常性,预期突破为基于视频预测训练的单一世界模型
- 跨域创造力:现仅能归纳已知,预期突破为AI Co-Scientist自主提出假说与源头创新
- 自主评判能力:蒸馏自训存验证盲区,预期突破为构建闭环自动生成工程框架的系统
监控治理与系统风险
- CoT私密防欺骗:保持推理链私密以防模型隐藏目标,未来将以自然对话替代原始黑盒展示
- 平台结构性风险:平台安全机制成科研天花板,凸显基建开放紧迫性
- 对齐与极权风险:显式规则致模型客服化,强制对齐单一标准或致失控,根本不存在统一人类价值观
- 政策介入干预:政策制定者必须主动介入治理,必要时放慢发展速度以应对少数人控制强AI的风险
- 最佳广告逻辑陷阱:博弈中能力保密价值超宣传,为平台保留超强版、弱化公开版提供结构性动机
算力套利与人类定位
- 前沿同质化套利:前5%超算力为常人7倍构成最大套利,护城河转向数据闭环与单点纵深
- 研究者定位启示:将AI作为探索加速器,系统性排除死路以精化直觉,人类负责方向判断与核心突破
5.2 国产旗舰模型技术路线与产品实测
国产旗舰模型技术路线与多维评测对比
Kimi智能助手(20260401) | AI新榜(20260421) | APPSO(20260424) | 新智元(20260424) | 光子星球(20260424) | 雷峰网(20260425) | 硅星人Pro(20260425) | 机器之心(20260425) | 有机大橘子(20260425) | AIGC开放社区(20260428) | 卡尔的AI沃茨(20260428) | 腾讯混元(20260507) | AI蓝媒汇(20260508) | 前沿在线(20260512) | 腾讯混元(20260513) | 逛逛GitHub(20260617) | "财联社AI daily"(20260623) | 量子位(20260630) | 数智前线(20260701) | 卡尔的AI沃茨(20260701) | 极市平台(20260701) | 智东西(20260702) | 人工智能学家(20260703) | 雷峰网(20260703) | 硅星人Pro(20260706) | 腾讯混元(20260706) | AI信息Gap(20260706) | APPSO(20260706) | 智东西(20260706) | 莫理(20260706) | "AGI Hunt"(20260706) | 特工宇宙(20260706) | "Z Finance"(20260706) | AIGC开放社区(20260707) | 网罗灯下黑(20260707) | AI异类弗兰克(20260707) | 老金带你玩AI(20260707) | 路人甲TM(20260707) | JackCui(20260707) | 极市平台(20260707) | AI产品阿颖(20260708) | AI大模型工场(20260709) | APPSO(20260404) | AI有道(20260418) | AI信息Gap(20260529) | "Z Finance"(20260713) | 腾讯混元(20260715) | 甲木未来派(20260715) | "梦飞 AI"(20260715) | 老金带你玩AI(20260717) | 数字生命卡兹克(20260717) | APPSO(20260717) | "Founder Park"(20260717) | AIGC开放社区(20260717) | 硅星人Pro(20260717) | AI前线(20260717) | 量子位(20260717) | 钛媒体AGI(20260717) | 探索AGI(20260717) | AI科技评论(20260717) | AI新榜(20260424) | 深度学习与NLP(20260523) | 十字路口Crossing(20260616) | 雷峰网(20260717) | 新智元(20260719) | AI有道(20260719) | 智东西(20260719) | 阿里云开发者(20260719) | 阿里云(20260719) | 赛博禅心(20260719) | APPSO(20260720) | 光子星球(20260720) | 老金带你玩AI(20260722) | 智东西(20260722) | 沃垠AI(20260722) | JackCui(20260410) | JackCui(20260424) | AI范儿(20260527) | 量子位(20260722) | 摸鱼小李(20260727)
行业趋势与技术进展
- 竞争重心转移:大模型竞争进入2T+时代,从参数规模转向Agent、长上下文及多模态等真实场景落地
- 价值验证转向:模型价值评估正从跑分转向真实工作流落地,开发者选型由价格转向质量与易用性
- 价格战本质:DeepSeek将折扣转永久价引发连锁反应,竞争核心转为推理架构与工程效率
- 注意力机制创新:DeepSeek首创MLA压缩KV缓存超90%,Kimi研发KDA实现缓存减75%、解码升6倍
- 脱离英伟达生态:DeepSeek V4成为首个脱离英伟达生态的前沿大模型
- 架构与共识回归:腾讯混元3由姚顺雨领衔回归Transformer+Full Attention方案
- 国产开放模型加速:旗舰级开放权重模型同步推进,竞争步入好不好用阶段,核心收益为降本与增效
- 版本号≠能力增量:模型迭代不应以版本号差距衡量,微小版本号变化(如3.7到3.8)实测能力亦有显著跃升
- AI视频多方竞局:阿里HappyHorse开启内测入局视频生成,与可灵、Vidu、Sora等同台竞技
代表模型能力与商业对比
- DeepSeek V4(万亿级):主打极致性价比与编程,双平台开源,引入峰谷计价(3/6元),OpenRouter登顶
- GLM:聚焦Agent,唐杰预告将迎史诗级升级,技术论文入选首届顶会COLM获国际认可
- Qwen3.8-Max(2.4T):发力模型族平台化主打全栈开发,Preview版实测小红书封面风格迁移,正式版将开权重,API调用量创纪录
- Kimi K3(2.8T):主打长程Agent,输入输出定价21/100元,年经常性收入破3亿美元
- 腾讯混元3(295B):主打办公与代码,调用量一周增68倍,定价1/4元,但C端月活仅为豆包1/6
- 美团LongCat-2.0(1.6T):基于5万张昇腾芯片实现零回滚训练,编程能力追平Claude Opus
- 小米MiMo V2.5:智能指数54分开源并列第一,对齐DeepSeek永久降价,Credits额度增5-8倍
- 小米降价动因:Q1单季研发投入90亿(+33.4%),传统业务净利降43.1%输血减少,迫使AI加速变现
6. 训练优化与工程落地
6.1 强化学习与训练范式
强化学习训练范式与诊断优化
机器之心(20260404) | 通义大模型(20260401) | PaperWeekly(20260411) | 人工智能学家(20260413) | "Z Potentials"(20260425) | 机器之心(20260426) | 通义大模型(20260427) | PaperWeekly(20260428) | 机器之心(20260428) | 机器之心(20260501) | 机器之心(20260506) | 机器之心(20260601) | 机器之心(20260611) | PaperWeekly(20260617) | 机器之心(20260620) | 机器之心(20260708) | PaperAgent(20260709) | 机器之心(20260712) | 极市平台(20260715) | 硅星人Pro(20260724)
- RL取代预训练成核心:RL正取代预训练成LLM能力提升关键,遵循S形饱和曲线(非严格逆幂律),自我演化成范式(如GRO闭环、Marcaron V1)。
- GRPO缺陷与变体爆发:GRPO完成去Critic化(省约50%内存)成事实标准,但存长度、难度偏差与熵崩溃,催生DAPO、Dr. GRPO、GSPO等变体修正。
- 层集中与课程式训练:RL收益高度集中网络40%-60%中间层(单层训练匹敌全参);课程式精细后训练(如VibeThinker-3B的Long2Short)可逼近旗舰水平。
- 小模型稀疏奖励突破:≤1.7B小模型在RLVR中极难获正反馈。G²RPO-A通过注入思维轨迹使其MATH500提升16分。
核心算法范式演进与优化
| 优化方向 | 代表框架 | 核心机制与数据支撑 |
|---|---|---|
| 难度与长偏修正 | MathForge/MaxRL | 指出标准差归一化偏向中等难度,引入MAD与难度感知加权,平均提升超4.5分 |
| 多轮信念漂移修复 | T3/RAGEN-2 | 检测停滞信号截断BTR尾部;指出传统熵监控H(Z |
| 推理效率控制 | SHAPE | 引入“推理势能+推理税”动态折扣,准确率升约3%,token消耗降约30% |
| 过程监督验证 | EAPO/CorVer | 奖励下沉至“证据质量”(Qwen3-30B达63.1分);CorVer用Wikipedia共现降本4.8-8.4倍 |
| 开环到闭环 | PIPO/FIPO | 将策略跨迭代提升作优化目标,前向探索+回溯验证有害更新(FIPO修复GRPO误导) |
| 奖励模型升级 | 腾讯E-GRM | 混合Huber与铰链损失(权重0.7),兼顾分数校准与对比排序,下游收敛提速约30% |
| 长上下文解耦 | 快手GoLongRL | 证实长上下文瓶颈在数据覆盖而非算法,30B模型160K训练超DeepSeek-R1-0528 |
- 测试时与SFT冷启动陷阱:SFT最优点非RL潜力的最高点(过度拟合锁死探索);TTT依赖自身输出致行为收窄,TEMPO用EM校准Critic突破天花板。
6.2 优化器算法与模型推理底层机制
Muon 优化器演进:从算法改进到万亿参数训练验证
- 技术闭环:杨植麟提出由token效率、长上下文及智能体蜂群构成闭环,K3为落地验证
- 算法算力对比:标准NS(8mn²+2n³);Naive Gram(float16不稳);Stabilized Gram(降58%,专用Kernel)
- Muon核心:迭代转移至n×n Gram矩阵,正交化梯度更新实现2倍token效率(等效50万亿变100万亿)
- Muon稳定:1万亿参数时max logit爆炸至>1000致发散;QK Clip无损将logit卡在~100自然回落
- 工程替换:引入可调系数与Adam对齐平滑替换;权重衰减为扩展关键;状态切分至并行组
- 注意力残差:旋转90°改变加法连接,每4或16层聚合所有历史状态(深度维度LSTM变体)
- 残差性能:token效率提升24%(等效50万亿→60万亿+),在编程、数学及推理任务提升最明显
- KDA架构:标量衰减改对角矩阵,各通道独立控速,按1:3与全注意力混合,零性能损失
- KDA优势:首个在长/短输入及输出全面超越全注意力的方案;MMLU等短上下文任务优于MLA和GDN
- 多模态定位与基座:首个原生实现视觉文本联合训练的开源模型;从0%融合双模态,纯视觉RL与zero vision SFT带动文本及视觉能力
- 训练规模与硬件:H800集群完成超15万亿+15万亿token训练,每节点2TB内存,GPU间NVLink连接
- 训练稳定性:全程超30万亿token无loss尖峰,困惑度误差<0.01
- 智能体蜂群:主智能体拆解任务并生成100-1000个子智能体并行执行
- 蜂群奖励:含实例化与完成(前高后低防退化保意义)及结果(标准RL奖励)三项
6.3 模型蒸馏与隐式推理工程
模型蒸馏、隐式推理与RL训练工程体系
极市平台(20260409) | 机器之心(20260412) | 极市平台(20260420) | 机器之心(20260514) | PaperWeekly(20260521) | 机器之心(20260530) | PaperWeekly(20260603) | PaperAgent(20260705)
- RL后教师更具迁移性:额外RL训练教师gap恢复达16.9%-58.6%,远超同族大模型(仅5.3%-15.6%)
- 长序列天花板:序列超10K效果停滞,15K时训练崩溃,奖励信号质量从后向前急剧衰减
加速与动力学优化
- 双重预见性:OPD在约10%训练进度即锁定主要优化方向,有效规避底层和顶层冗余更新
- EffOPD加速:基于参数动力学发现实现早期低秩锁定,在1.5B-32B模型上平均3倍训练加速
- 自蒸馏效率:On-Policy自蒸馏路线在多项任务中实现8-12倍Token效率,远超标准GRPO
散度优化与跨分词器方案
- 高熵散度突破:高熵Token叠加forward KL提升推理分叉,Qwen3-4B的Pass@8提升5.05
- SimCT跨分词器:引入最小对齐单元(MAU)消除14%监督死区,12组师生全最优,提升+6.4%~8.3%
- 特权幻觉剥离:DOPD通过特权优势差精准区分能力与信息差距,剥离信息不对称捷径
隐式推理与CoT压缩
- LRT隐式推理:丢弃50%推理Token仅降2%准确率,SFT+GRPO两阶段单次前向解码提升约9%
- Abstract-CoT:64个无语义符号压缩自然语言CoT,MATH压缩11.6倍且准确率仅降1.8pp
核心实验数据对比
| 优化路径 | 核心机制 | 性能表现 |
|---|---|---|
| EffOPD | 参数空间双重预见性 | 平均3倍加速,部分场景8-10倍 |
| EOPD混合散度 | 高熵Token加权Forward KL | Pass@8提升5.05 (Qwen3-4B) |
| SimCT | 跨分词器监督空间扩展 | 12组师生全最优,增益+6.4%~8.3% |
| DOPD (8B→1.7B) | 剥离特权信息幻觉 | 性能差距缩小89.8% (+7.5分) |
| DOPD (8B→0.6B) | 极大跨度动态蒸馏 | Vanilla仅+3.5分,DOPD达+14.1分 |
| Abstract-CoT | 无语义抽象符号压缩 | MATH压缩11.6倍;胜率升+2.4pp |
6.4 分词器设计与后训练词表退化
后训练 Token 退化机制与词表覆盖度治理
"MiniMax 稀宇科技"(20260509) | 机器之心(20260509) | 特工宇宙(20260509) | 机器之心(20260529) | 腾讯研究院(20260529) | "AGI Hunt"(20260429) | Datawhale(20260718)
- 加法修复:注入约 500 条全词表覆盖合成数据(占总 SFT 约 1%),确保每个 token 作生成目标出现≥20 次,cosine similarity 从 0.329 升至 0.97 以上
- 减法修复:裁剪无用 token 重训,或 Claude Opus 4.7 在生产级直接更换 Tokenizer 缩减低频 token,英文/代码消耗仅增 1.2-1.47 倍
- 推理修复:基于 Adam's Law,推理时改写输入为高频表述,DeepSeek-V3 与 LLaMA-3.3-70B 数学推理分别提升至 71.5% 与 88.7%
多语言与代码 Token 膨胀对比
| 语言/代码 | Anthropic | OpenAI | DeepSeek/Kimi | Qwen | Gemini |
|---|---|---|---|---|---|
| 中文 | 1.71× | 1.15× | 0.81-0.87× | 0.85× | - |
| 印地语 | 3.24× | 1.37× | ~2.6× | - | - |
| TypeScript | 1.73× | 1.00× | - | - | ~1.09× |
| Python | 1.50× | 1.00× | - | - | ~1.09× |
- 模型整体分词效率:Anthropic 垫底(2.07×),天城文等编码劣势致非英语用户综合成本差距最高达 15-30 倍
- 代码分词倍率:以 GPT o200k 为基准,Claude 在 Rust(1.58×)与 JS(1.52×)劣化明显,Gemini 3 Flash 各类代码仅约 1.09×
经济放大效应与自测
- 变相调价效应:Claude 新分词器平均多切约 32% token,版本迭代挂牌价不变但实际有效单价差 32%;GPT 共用分词器无此差异
- 综合成本公式:实际总花费差距可达 2-4 倍,由分词效率、回复长度、缓存命中率和工具调用次数共同决定,单一维度对比易误导
- Token 数自测方法:Anthropic 用 count_tokens 接口或本地 tiktoken 库 o200k_base 编码器(免费),Gemini/Grok 调用各自官方计数接口
6.5 SFT去噪窗口机理与交互机理驱动的训练优化
SFT交互机理框架:去噪窗口、过拟合预警与训练优化
- SFT本质是短暂去噪:张拳石课题组证明SFT仅在早期(几百到千步)移除噪声交互,之后模型学习新噪声进入过拟合
- 输出由稀疏交互决定:LLM输出可分解为50-150个AND-OR交互效用之和,仅少量稀疏交互真正决定输出,大量潜在交互效用接近零
- 三阶段训练动态:早期删高阶噪声→中期强化可靠骨架→后期涌现新噪声,删除仅发生在早期
- 过拟合早期预警:交互质量恶化早于loss gap扩大,据此early stopping可省30%-50%+算力
- 核心实践启示:抓住去噪窗口及时停;数据多样性重于规模;交互诊断比loss更细粒度
- 论文支撑:发表于arXiv(2605.17967),基于AND-OR交互机理的严格理论框架
可靠与噪声交互特征三维对比
| 维度 | 可靠交互 | 噪声交互 |
|---|---|---|
| 复杂度(阶数) | 低阶,涉及少量变量 | 高阶,涉及复杂组合 |
| 泛化性(γ) | 跨架构LLM稳定出现 | 仅在单一模型中出现 |
| 未抵消效应比例(ρ) | 正负效应一致,有效贡献大 | 正负效应大量相互抵消 |
6.6 模型训练数据规律与底层表示优化
文本频率定律(Adam's Law):LLM 更爱"大白话"
机器之心(20260416) | 特工宇宙(20260528) | 机器之心(20260529) | AI产品银海(20260611)
- Adam's Law(文本频率定律):语义等价时,LLM 对高频表达的理解和生成质量显著优于低频表达,数学证明支持且多场景全面提升
- 退化根因:受 Zipf 定律约束大量词汇处于长尾低频区,预训练出现但 SFT 缺失导致输出层映射偏移,属结构性问题
- 文本频率≠大白话:专业术语若在语料中高频出现模型仍处理顺畅,频率与传统复杂度相关性弱
理论框架
- TFL(文本频率定律):数学证明高频文本在训练和推理阶段均应优先选择,从经验观察升级为可验证定理
- TFD(文本频率蒸馏):让模型续写暴露用语习惯,反向估算真实频率,绕过闭源模型训练集黑箱
- CTFT(课程频率训练):采用先低频后高频排序,低频语境稀疏先难后易,带来更好收敛效果
核心实验数据
| 模型/任务 | 高频改写前 | 改写后 | 提升 |
|---|---|---|---|
| DeepSeek-V3(数学推理) | 63.55% | 71.54% | +7.99pp |
| LLaMA-3.3-70B(数学推理) | 80.49% | 88.75% | +8.26pp |
| Pangasinan 翻译(CTFT) | 基线 | 暴涨 | +29.96 BLEU |
- 翻译广度验证:覆盖 100 个语言方向,99 个方向获得提升,多任务效果稳定优于原始基准
- 数据工程突破:高频改写版标注数据微调,部分指标超原始标注,挑战“原始数据最优”假设
工程落地
- SLoW 低频词注入:自动识别低频词,将其词典解释作“小抄”注入 prompt,无需重训且节省 token
- Claude Opus 4.7 产业验证:更换 tokenizer 缩减低频 token,同文本 token 数可能增加 35%
- “马嘉祺”翻车本质:“嘉祺”合并为独立 token,SFT 高质量数据缺失导致参数严重偏移
关键时间线
- 2025 EMNLP 主会:SLoW 论文首次系统化揭示低频词问题
- 2026 ACL Oral:Adam's Law 将理论从词级推进到句子级
- 2026 Claude Opus 4.7:产业侧首次针对低频 token 的生产级验证
表格数据 Scaling Law:从树模型到 GPU 预训练的范式迁移
核心发现:结构化数据也存在 Scaling Law
- 浙大×蚂蚁 AIforData 团队在千卡 GPU 集群上完成百亿级样本结构化数据预训练,实验证明预训练模型稳定且显著超越 XGBoost 等树模型
- 表格数据和行为序列数据均呈现明显 Scaling Law,适用范围比预期更广(不限于语言和视觉)
Densing Law:压缩突破 Scaling 瓶颈
- 单纯增加数据量会遇到收益递减,通过 RQ-VAE 将多源序列压缩成语义 token ID 提升信息密度后,Scaling 获得更佳性能
- 压缩后产出的通用用户表征在 80% 以上真实场景 benchmark 中优于原始数据输入版本
KMLP:大规模表格数据混合架构(WebConf 2026)
| 维度 | 说明 |
|---|---|
| 架构设计 | 浅层 KAN 前端特征工程 + gMLP 主干捕获高阶交互 |
| 核心优势 | 端到端自动化特征表示学习,解决 GBDT 分布式效率低 + 人工特征工程依赖 |
| 验证数据 | 20 亿样本真实信贷评分数据集,数据量级提升时相对 GBDT 优势持续扩大 |
FOUND:行为序列预训练框架(WebConf 2025)
- 通过对比学习将用户表征与语义文本对齐("过去-未来语义对齐"构造训练样本对)
- 引入自然语言监督实现跨领域迁移,已覆盖超 50 个业务场景
范式竞争格局
| 对比维度 | XGBoost(2014 平衡点) | GPU 预训练范式 |
|---|---|---|
| 算力利用 | CPU 单机/分布式 | 千卡 GPU 并行 |
| 特征工程 | 高度依赖人工 | 端到端自动学习 |
| 扩展性 | 超大规模数据效率下降 | 数据量越大优势越明显 |
| 跨场景迁移 | 场景化定制调参 | 预训练+微调范式 |
- 核心驱动力:单张 H100 的 FP16 算力约等于 200 台 96 核 CPU 服务器,算力天平已向 GPU 倾斜
- 结构化数据领域正重演 NLP 范式迁移路径:从手工特征工程到预训练统一架构
6.7 模型训练管线与底层计算优化
文心5.1:Once-for-All弹性训练与MOPD后训练管线
弹性预训练机制(Once-for-All)
- 子结构直接复用:文心5.0单次预训练覆盖多参数规模矩阵,文心5.1直接挑选最优子结构,免重新训练
- 三维弹性机制:弹性深度(随机跳过Transformer层)、弹性宽度(动态屏蔽MoE专家)、弹性稀疏度(可变Top-k路由)
- 极致成本压缩:总参数压至文心5.0约1/3,激活参数约1/2,预训练算力成本仅为业界同规模模型的6%
分离式全异步RL架构
| 维度 | 核心机制 | 效果收益 |
|---|---|---|
| 环节解耦 | RL Controller将训练/推理/奖励/智能体独立扩缩容 | 流水线重叠执行,大幅提升吞吐量 |
| FP8优化 | 统一低精度算子库 + Rollout Router Replay | KL散度下降50%,训推耗时几乎不增 |
| 异构调度 | CPU算力统一池化处理逻辑密集任务 | 提升代码沙箱等验证任务的资源利用率 |
四阶段后训练管线(MOPD)
| 阶段 | 核心方法 | 训练目标 |
|---|---|---|
| 统一SFT | 多领域指令数据微调 | 建立基础指令遵循与工具调用能力 |
| 并行专家训练 | 代码/推理/智能体等独立训练 | 各领域专属奖励信号互不干扰 |
| 在线策略蒸馏 | 多专家当教师,SFT模型当学生 | token级KL融合多专家能力 |
| 通用在线RL | 对蒸馏后模型独立做强化学习 | 提升开放聊天与创意写作多样性 |
评测表现与实测短板
- 榜单表现:LMArena总榜第14,搜索能力登顶国内;AIME26数学99.6分(仅次于Gemini-3.1 Pro)
- 能力短板:纯数学推理(AIME)与通用知识(MMLU-Pro)排名末位,与头部模型差距明显
- 编程能力不足:实测生成的游戏(3D格斗、横版跑酷)代码均无法正常运行
6.8 结构化推理与领域专用模型微调
结构化推理与领域专用模型微调
量子位(20260515) | PaperWeekly(20260522) | 机器之心(20260523) | 机器之心(20260528) | 机器之心(20260609) | 机器之心(20260701)
递归推理效能拐点与架构创新
- 循环拐点:7B LoopCoder v2循环2次SWE-bench达64.4超Qwen3-235B,第3次因错配成本暴跌至27.6
- 极低门槛:HRM-Text(1B参数/$1500)采用双时间尺度递归,MATH 56.2、GSM8K 84.5,达部分2B-7B水平
- 稳定机制:MagicNorm限制激活方差,Warmup回传步数2增至5,防止深层计算退化
概率多轨迹扩展(GRAM架构)
- 宽度碾压串行:GRAM(10.9M参数)用16步×20条并行轨迹,Sudoku超越TRM 320步串行(97.0% vs 90.5%)
- 状态采样:引入依赖状态高斯扰动(均值引方向,方差控探索),移除随机性准确率归零
- 双层解耦:高层状态注入随机引导控方向,低层确定性更新处理细粒度计算
认知思考信号挖掘(ThoughtTrace)
- 数据规模:1058名用户、2155段对话、10174条思考标注,首次大规模捕捉Reason与Reaction
- 不可推断性:思考动机对AI不可见,前沿LLM推断得分仅2.5-2.9/5
- 对齐增益:思考信号将下条消息预测相似度从21.6升至30.6,DPO训练Arena-Hard胜率+25.6%
科学领域专用微调(Thoth模型)
- 性能跃升:8B基座模型微调后生物Protocol生成平均提升17.78%,超ChatGPT-4o约3.69%
- 多维度优势:在步骤对齐、逻辑顺序、动作保真上,超DeepSeek-V3达4-11%
7. 智能体工程与系统级落地
7.1 持续学习与自进化机制
持续学习路径与可进化机制实测
AIGC开放社区(20260330) | 机器之心(20260405) | PaperAgent(20260406) | PaperWeekly(20260409) | 赛博禅心(20260410) | 新智元(20260412) | 人工智能学家(20260419) | 人工智能学家(20260420) | 新智元(20260430) | 人工智能学家(20260501) | 人工智能学家(20260508) | 高飞的电子替身(20260627) | "梦飞 AI"(20260718) | Datawhale(20260723) | 智能涌现(20260728)
- 技术闭环:Agent提供环境交互能力,持续学习内化经验,两者结合解决从交互中获取经验的痛点,迈向AGI必经之路
- 核心挑战:技术落地面临灾难性遗忘、容量与稳定性(新旧知识保留)、在线学习效率、知识更新一致性及评估测试集缺失等工程困境
持续学习与知识内化
- 效率鸿沟:维基百科KV缓存约80GB(Llama 70B权重仅100GB);Engram使推理Token从10万压缩至100,获9800万美元融资
- 路径对比:回放策略混合旧数据重训(存储高/隐私风险);参数隔离独立承载新任务(参数膨胀);正则化约束参数不变(容量有限);知识编辑精准修改特定知识(难规模化)
- 前沿框架:微软OEL通过On-Policy训练内化交互,1.7B模型自提取知识优于4B,响应压缩约30%
- 防遗忘突破:KeepLoRA通过SVD分解将更新约束在残差子空间,分离大小奇异值以存新旧知识,实现零推理开销防遗忘
- 工业产品化:字节豆包用150本教材与47万Token装修记录验证模型自主进化;技术正全面从实验室走向商业应用
自主实验与世界模型
- 无人值守研究:Deep Researcher Agent日均0.5元实现7×24小时实验,30天完成500+轮循环,单项目指标提升52%
- 递归算法发现:OMEGA框架实现“想法→代码→自愈→评测”全自动闭环,生成的分类算法在20个数据集上超越基线
- 世界模型三层级:L1预测器(单步转移)、L2仿真器(轨迹约束)、L3进化器(失败自主修正),当前普遍缺失决策中心评估机制
多智能体协作与玩家入局
- 协作核心瓶颈:多智能体协作本质挑战非通信协议,而是世界模型不一致导致的信念偏差逐层放大
- 动态拓扑自适应:上海交大AgentConductor通过3B模型动态生成协作拓扑匹配任务难度,Token成本直降68%
- 押注持续学习:Mind Lab(2025年10月成立,融资中)集结xAI、DeepMind等天才团队,创始人陈锴杰及核心成员深耕Agent训练(FireAct论文),主攻经验驱动路线
7.2 智能体时空推理、记忆与空间认知前沿
时空推理与空间认知的前沿范式
李飞飞 Theory of Space(空间智能理论重构)
- 认知升维:将空间智能从工程任务提升为可形式化的认知科学问题
- 空间三大属性:部分可观测(盲区为隐状态)、具身依赖(主动移动优于被动)、信念驱动(依赖认知地图)
- 信念生命周期:构建(逼近后验)→ 修正(克服新旧冲突)→ 利用(基于信念决策)
SOTA 模型四大实证缺陷
| 缺陷维度 | 实证数据 | 根因分析 |
|---|---|---|
| 主动探索退化 | 视觉 57.1%→46.0%,文本 90.4%→72.0% | 退化为静态建图,缺乏动态探索 |
| 模态鸿沟失效 | 文本位置 91.0% vs 视觉仅 20.2% | 感知-表征系统性耦合失效 |
| 错误信息覆盖 | 覆盖率达 56.4%(越看越错) | 空间记忆维护能力薄弱 |
| 信念极强惯性 | 视觉环境位置惯性达 68.9% | 观测到变化仍无法修正过时先验 |
STReasoner 框架(ACL'26)
- 统一推理框架:首个融合时序、空间图与自然语言的框架,从“预测数值”升级为“理解因果与传播路径”
- ST-Bench 四大任务:因果溯源(T1)、实体识别(T2)、相关性推理(T3)、时空预测(T4)
- 合成数据生成:Network SDE + Multi-Agent 生成数据,经 Scenario 与 Parameter 双重 Judge 校验
- 训练与效能:三阶段渐进(模态对齐→推理注入SFT+CoT→RL强化);计算成本仅闭源模型0.004×,零样本泛化不降反升
7.3 生成式推荐系统:FuXi架构与Performance Law
生成式推荐系统工程实践与架构演进
机器之心(20260402) | MacTalk(20260403) | 机器之心(20260408) | 新智元(20260430) | InfoQ(20260519) | 机器之心(20260609) | 智东西(20260612) | AI产品阿颖(20260618) | 阿里云开发者(20260715) | "Z Finance"(20260625)
- Performance Law:真实熵修正 Scaling Law,预测拟合度 R² 自 0.8776 升至 0.9881
语义ID量化与联合优化
- 原生量化:快手 UA-SID 结合多模态微调,将 SID 碰撞率自 85.44% 降至 18.26%
- 联合优化:DIGER 引入 Gumbel 噪声打通梯度,消除 RQ-VAE 两阶段不一致及码本塌缩
- 推理蒸馏:Meta 融合 RQ-VAE 与语言内化语义,蒸馏 32B 至 8B,Recall@5 提升 2.4%
推荐推理突破与基座演进
- 溯因推理:推荐推理本质为自行为反推兴趣的溯因推理,非演绎推理
- CoT设计:R3三段式压缩(归纳→发散→权衡),发散宽度 n=5 最优,n=20 反向衰减
- Thinking Hurts:直接套用 CoT 致负增益,须通过 RL(GRPO/RSPO) 反推正确性转正
- 基座规格:OneReason-0.8B 基于 Qwen3-0.6B 热启动,578B Token 预训练并在快手落地
- 四维能力:懂物料(主成分 ID 表征)、用户(区分噪声)、推荐(生成式核心)、世界(LLM通识)
- Itemic Pattern:通过反解语义替代传统 ID 嵌入,实现物料深度理解
精排系统 Scaling Up 实践
- 统一主干:淘宝精排切至统一 Token-Mixing 主干,模型规模扩至 243M
- 反直觉洞察:FLOPs≠线上延迟;Mixup 后补 Add&Norm 致 AUC 下降 0.2%
- 序列与Token:Tokenization 16×320 优于 32×160(+0.14%);MMCN 4-head 交叉(+0.32%)
LLM-Rec 挑战赛 2026 开放架构
- 赛事定位:快手联合 SIGIR 2026 开放千亿级脱敏数据,奖金 100 万,前 3 直通 K-Star
- 四层开放:OneReason 基座 + 50 万条 SFT 行为数据 + 多阶段防过拟合评测 + 学术背书
- 战略意义:推荐系统复刻大模型路线,快手开放真实数据是对学界最大价值贡献
7.4 模型睡眠机制:SSM离线递归前向传播的长上下文推理增强
模型睡眠机制:SSM-注意力混合架构的离线记忆整合
DeepTech深科技(20260601) | 人工智能学家(20260603) | 机器之心(20260605) | 人工智能学家(20260716)
- 核心痛点:大模型缺乏短期经验到长期参数的固化路径。上下文记忆是“临时便签”,参数微调易引发灾难性遗忘,模型无法“越用越聪明”
CMU离线递归睡眠(SSM权重巩固)
- 生物学映射:KV Cache类比海马体短期记忆,离线递归类比睡眠replay,SSM fast weights更新类比皮层突触巩固
- 运行流程:上下文填满后执行N次递归前向传播更新SSM fast weights,清空缓存继续推理,预测阶段不增延迟
- 计算特征:训练吞吐量与N近似成反比,额外计算集中于离线阶段而非预测阶段
谷歌Hope做梦机制(持续学习框架)
- 生命周期交替:Active阶段暂存外部输入,Sleep阶段专注内部知识巩固与自我改进,打破“训练/测试”割裂
- 记忆巩固:向冻结MoE新增低秩专家模块存储新知识,通过Knowledge Seeding让模型状态充当教师蒸馏至新参数
- 做梦机制:RL驱动自我改进,MoE路由随机探索结合奖励评分优化(LTI机制)
- 做梦自指风险:初始理解错误会自我强化错误数据,须配套外部验证与奖励评估兜底
核心性能对比
| 测试任务 | 基线/竞品表现 | Sleep机制效果 |
|---|---|---|
| BABILong 10M token | GPT-4在128K后速降 | 接近满分 |
| 顺序学习双新语言 | ICL几乎完全遗忘 | Hope-3保留绝大多数能力 |
| AIME-24数学推理 | GRPO得分76.4 | Hope(Qwen3-8B)得分79.2 |
| 16跳知识检索 | N=0在4跳以上无法学习 | N=4开始取得进展 |
| GSM-Infinite 6步运算 | 准确率0.419 | N=4提升至0.615(+47%) |
| Rule 110 32步演化 | 约10%(近随机) | N=4提升至大于30% |
局限与挑战
- 开销显著:Hope机制总计算开销约为SFT的4倍,训练成本随N线性增长
- 验证局限:CMU机制仅在合成任务和中模型规模有效,超大商用模型未验证;Hope强依赖MoE架构,长期循环稳定性未经验证
8. 算力产业生态与商业动态
8.1 AI芯片与算力基础设施
AI芯片产业格局与算力基础设施演进
InfoQ(20260415) | 机器之心(20260425) | AIGC开放社区(20260429) | AI寒武纪(20260507) | 量子位(20260507) | PaperAgent(20260508) | 机器之心(20260510) | AI前线(20260512) | AIGC开放社区(20260512) | AI早餐汇(20260522) | "财联社AI daily"(20260604) | InfoQ(20260609) | "财联社AI daily"(20260611) | 硅基观察Pro(20260611) | "财联社AI daily"(20260611) | DeepTech深科技(20260613) | AI科技大本营(20260708) | 阿里云(20260717) | 量子位(20260718) | 智东西(20260724) | 雷峰网(20260725)
系统级互联与端云芯片演进
- 超节点成集体共识:高速互联将多卡聚合成单一逻辑节点,Scale-up通信效率优于Scale-out
- 竞争维度全栈化:核心壁垒从单卡算力转移至封装、互联带宽与软件栈,纯硬件公司难存活
- 系统级方案加速基建:阿里磐久(单柜128芯片)与华为A5(单向3.2TB/s)推进集群有效算力提升
- 互联成核心护城河:NVIDIA确立标杆,国产交换芯片差距显赫,迈威尔获英伟达20亿美元注资
- 超算协议重构:开源MRC协议拆分8条并行平面,仅两层交换机互联超13.1万GPU并实现微秒级故障绕行
- 分布式训练弹性突破:谷歌Decoupled DiloCo在高压故障下将有效算力从58%提升至88%,带宽需求降两级
- 低精度计算成省电焦点:随推理市场增速超训练,平头哥与英伟达纷纷推进FP4计算落地
- 制程演进逼近极限:AMD首发2nm服务器CPU,算力提升转向依赖跨晶体管到算法的全栈协同优化
- 国产算力迭代提速:平头哥真武M890(上代3倍性能)已部署,字节SeedChip计划2026年量产10-35万颗
- 解码阶段内存墙显著:超80%推理延迟源自数据搬运,约150TB/s片上带宽的SRAM成突破关键路径
- 光通信技术迎变革:港中文全光芯片功耗较3nm DSP低两数量级,存算一体与光互连距量产尚远
- 端侧AI深陷困境:因杀手级应用缺失与7W以下功耗限制,厂商路线分化为SoC集成NPU或独立协处理器
底层技术预期与兑现分歧
| 核心技术方向 | 最新进展与产业兑现分歧 |
|---|---|
| Agent演进推理 | 单任务Token消耗达百万级,阿里云PPU实现推理加速13.1倍 |
| 800VDC与CPO | 放量分别推迟至2028/2029年,CPO单机良率或仅19% |
| 底层互联分化 | 开源社区强行解锁PCIe P2P绕过硬件锁,AMD拟采HBM+铜/光互连 |
8.2 国产算力生态与服务器产业动态
国产算力需求爆发与芯片服务器厂商财务表现
智东西(20260331) | 第一新声(20260402) | APPSO(20260402) | 智东西(20260404) | 雷峰网(20260408)
- 日均Token消耗达千亿级GPU支出:豆包日均破120万亿,中国整体破140万亿,周调用量连续超越美国
- 双引擎驱动消耗指数级爆发:AI视频单秒消耗百万级Token;Agent复杂任务消耗达普通对话20-50倍
- 全球仅三家破百万亿:OpenAI、Google、字节跳动,按主流定价粗算豆包年化GPU支出达千亿级
国产AI芯片:训练涨价与推理降价并行
| 芯片线 | 2025收入 | 同比增速 | 毛利率变化 |
|---|---|---|---|
| 天垓(训练) | 5.84亿 | +116.7% | 60.2%→64.2% |
| 智铠(推理) | 快速增长 | +238.2% | 46.7%→39.2% |
- 天数智芯年营收10.34亿:低于市场12亿预期,大客户缺失是瓶颈;Gen 3/4训练芯片将于2026年Q1/Q3量产
- 推理端主动降价换量:智铠毛利率降7.5个百分点,以抢占市场份额及加速库存消化
AI服务器厂商安擎赴港IPO:营收翻倍但毛利率承压
| 年度 | 营收(亿元) | 净利润(亿元) | 毛利率 |
|---|---|---|---|
| 2023 | 22.06 | 0.54 | 10.1% |
| 2024 | 27.60 | 0.64 | 8.8% |
| 2025 | 55.00 | 1.22 | 6.0% |
- 2025年营收翻倍至55亿:年销8951台服务器,AI服务器均价92万/台,行业第六(市占率2.0%)
- 毛利率三连降至6.0%:原材料涨价叠加存货水平提升致承压;液冷全链路方案构筑差异化壁垒
政企算力大单加速落地
- 百度济南连中超11亿AI大单:含8.37亿大模型工场(740台AI服务器)及2.9亿智算一体机(260台)
- 全链条拿单能力:百度2026年已斩获7+项目,覆盖算力基建、大模型服务、行业数据集等多元场景
8.3 算力基础设施与系统工程
存算融合:从算力不足到存力短缺的范式转移
存力短缺:从算力到存力的范式转移
- PCIe带宽严重滞后:GPU速度达10000GB/s,PCIe 5.0仅11-12GB/s,需数百硬盘供给单卡
- 数据搬移拖累训练:国产大模型数据搬移占25%(初期50%),远超国外10%-15%
- DDR内存成最大成本项:价格涨幅超5倍,单台B300满配超84万元
- 搬运成本极高:数据搬运成本已达计算成本100倍(图灵奖得主Hennessy)
- 国家战略背书:存算一体写入十五五规划,与三维堆叠、光电融合并列前沿架构
存算融合架构演进与产业验证
- 苹果M4验证统一内存:大模型计算提2-4倍,整机功耗仅30W,价格涨幅60%-70%
- GPUDirect直连突破:硬盘直通GPU,交互提2.3-3.8倍,节省能耗30%-40%
- 算力需求爆发:2026年3月日均Token调用破140万亿,较2024年初增超1000倍
核心技术路径与多维权衡
- 存储介质14维权衡:低功耗与大容量无法兼顾,3D DRAM因大带宽低成本凸显
- 通用存算三维度框架:存储架构解耦、全栈算力自主、指令集兼容CUDA
模拟与数字存算路径对比
| 维度 | 模拟存算路径 | 数字存算路径 |
|---|---|---|
| 原理 | 介质物理特性模拟域乘加 | 存储单元集成逻辑电路 |
| 精度 | 一致性差,精度低 | 高精度、可靠 |
| 场景 | 低功耗边缘推理 | 大算力大模型推理 |
存储加速技术演进路线
| 阶段 | 代表方案 | 核心价值 |
|---|---|---|
| 1.0 传统调度 | CPU调度存储 | 架构简单但效率低 |
| 2.0 数据直传 | DDN、PLiOPS | 绕过CPU,细碎文件读写提8-21倍 |
| 3.0 存储原生化 | 英伟达联合AI SSD | 单模块吞吐提10倍达1亿IOPS |
8.4 PD分离架构与分布式推理工程
PD分离架构:跨数据中心部署与工程可靠性实践
量子位(20260419) | InfoQ(20260430) | 智东西(20260430) | 量子位(20260501) | 机器之心(20260720)
跨集群PD分离架构
- 网络降级:混合注意力模型将跨中心KV传输降至13Gbps(普通以太网可承载),打破传统800Gbps RDMA强依赖(120147)
- PDD三级架构:引入RLD接力解码中间层掩盖远端延迟,TTFT降51.5%,单Token成本降37.5%,有效吞吐高27.8%(275722)
- 芯片解耦:按算力、显存、带宽、互联四维评估,异构分离让偏科芯片各司其职(275722)
KV Cache分层与成本
- LayerSplit:GPU仅持部分层,通信仅为KV Cache的1/8;90%命中率下40K吞吐升10%,120K升132%(127357)
- PrFaaS:1T混合模型跨中心实测,吞吐提升54%,P90首词时延降64%(120147)
高并发竞态与修复
- 竞态根因:Decode中止与Prefill缺同步致显存损坏,高压下每万次复现3-5次乱码或复读(127357)
- 异常监控:投机采样转监控,accept_length<1.4或rate>0.96主动中止重试,修复后异常率降至万分之三(127293)
- 核心洞察:大规模推理不仅需Scaling Law,更需等量级系统工程支撑时序与显存可靠性(128036)
| 异常类型 | accept_length | accept_rate | 根因推断 |
|---|---|---|---|
| 乱码/生僻字 | 极低 | — | KV Cache状态偏差 |
| 复读 | — | >0.96 | 注意力模式退化 |
| 架构对比 | KV吞吐量 | 网络要求 |
|---|---|---|
| 1T混合模型 | 13Gbps | 普通以太网 |
| Dense模型 | >60Gbps | 强依赖800G RDMA |
8.5 光计算商业化拐点
光计算:从实验室走向商业化
- 光计算进入商业化拐点:光计算技术正从实验室研究迈向产业化应用阶段,成为突破传统电子芯片算力瓶颈的新路径
- 中国企业抢占先机:中国企业在光计算领域开始构建自主技术优势,试图创造属于自己的"硬件彩票"——即通过底层架构创新获取产业定义权与价值分配主导权
- 技术背景:传统冯·诺依曼架构面临内存墙与功耗墙双重瓶颈,光计算以光子替代电子进行计算,具备高并行性、低功耗、高带宽等天然优势
9. 模型底层架构创新与跨范式演进
9.1 模型架构底层计算机制与理论范式
底层计算机制、NTP范式局限与因果世界模型突破
AI科技大本营(20260330) | 新智元(20260330) | 人工智能学家(20260403) | 量子位(20260410) | DeepTech深科技(20260411) | AI有道(20260414) | APPSO(20260417) | AI前线(20260417) | 机器之心(20260417) | AI科技评论(20260418) | 梦飞 AI(20260420) | DeepTech深科技(20260421) | 老冯云数(20260422) | 机器之心(20260426) | 人工智能学家(20260426) | 量子位(20260429) | 新智元(20260429) | DeepTech深科技(20260429) | 人工智能学家(20260429) | 机器之心(20260430) | AI科技评论(20260430) | 人工智能学家(20260501) | 划重点KeyPoints(20260504) | 人工智能学家(20260504) | CVer(20260508) | 新智元(20260510) | 人工智能学家(20260511) | 极市平台(20260511) | 量子位(20260512) | PaperWeekly(20260515) | 量子位(20260517) | InfoQ(20260516) | 机器之心(20260517) | 量子位(20260518) | CVer(20260518) | 人工智能学家(20260518) | AI科技大本营(20260518) | 人工智能学家(20260519) | 人工智能学家(20260520) | PaperWeekly(20260521) | "AGI Hunt"(20260523) | 机器之心(20260528) | 机器之心(20260530) | 人工智能学家(20260530) | PaperAgent(20260601) | 机器之心(20260602) | "AGI Hunt"(20260602) | CVer(20260603) | 机器之心(20260603) | PaperWeekly(20260603) | 量子位(20260605) | 机器之心(20260607) | 新智元(20260607) | DeepTech深科技(20260608) | PaperWeekly(20260608) | Datawhale(20260608) | PaperAgent(20260609) | CVer(20260609) | 人工智能学家(20260610) | 极市平台(20260610) | 雷峰网(20260611) | 智东西(20260612) | AI科技大本营(20260612) | 量子位(20260613) | PaperAgent(20260615) | 极市平台(20260615) | AIGC开放社区(20260616) | 硅星人Pro(20260616) | PaperWeekly(20260616) | 机器之心(20260616) | 机器之心(20260617) | PaperWeekly(20260619) | 人工智能学家(20260619) | AI科技评论(20260622) | 甲子光年(20260623) | PaperWeekly(20260624) | 人工智能学家(20260627) | 机器之心(20260628) | 机器之心(20260629) | 特工宇宙(20260630) | 人工智能学家(20260630) | AI科技评论(20260702) | 高飞的电子替身(20260703) | 人工智能学家(20260703) | 新智元(20260706) | 新智元(20260706) | 智东西(20260706) | AI科技评论(20260706) | CVer(20260706) | PaperWeekly(20260706) | 具身智能之心(20260707) | 钛媒体AGI(20260708) | PaperWeekly(20260708) | AI科技评论(20260709) | AI科技评论(20260709) | 人工智能学家(20260713) | AIGC开放社区(20260714) | 机器之心(20260714) | DeepTech深科技(20260714) | 量子位(20260714) | 机器之心(20260715) | AI科技评论(20260715) | AI前线(20260717) | 人工智能学家(20260717) | 前沿在线(20260718) | 量子位(20260718) | 硅星人Pro(20260718) | InfoQ(20260718)
前沿范式创新
| 创新范式 | 核心机制 | 突破效果 |
|---|---|---|
| 迭代潜在深度 | 参数共享的Transformer循环精炼 | 1B参数匹敌百B级SOTA |
| 强化学习 | 第一视角动态交互与试错 | 直击LLM无法持续学习的缺陷 |
| 神经符号二象性 | KAN网络 | 统一神经网络与符号公式,可解释性极高 |
| 扩散语言模型 | 连续场态直觉生成 | FORS采样实现指数级去噪提效 |
因果AI与世界模型
- 因果驱动:大模型须从“预测下一个词”升级为“预测下一种状态”,解决“如果我这样做世界会怎样”的推演问题
- 因果阶梯:L1关联(识别因素建链)、L2干预(动态生成策略)、L3反事实(复盘换种打法是否更好)
- 产业落地:零犀科技2020年押注因果AI,2025年网信办备案大模型直接命名为“因果”,团队脱胎于原百度AI
世界模型维度对比
| 维度 | 物理世界模型 | 社会行为世界模型 |
|---|---|---|
| 建模对象 | 空间、物体、运动 | 意图、信任、偏好、情绪 |
| 核心变量 | 位置、速度、边界 | 认知、关系、约束、反馈 |
| 预测目标 | 动作后环境状态变化 | 交互后人的行为变化 |
- 底层命题:均遵循“给定状态+行动→预测结果”
三层因果闭环架构
- 观察层:记录完整任务轨迹(状态-上下文-动作-反馈),确保关键判断有据可查
- 干预层:归因分析轨迹,生成认知表达、策略执行、验证安全三类候选干预
- 反事实层:候选干预须经ORM及PRM等7维度验证,未通过则回滚
- 工程价值:将Prompt和Memory统一为可调整干预变量,使优化从黑箱试错变为受控实验
AI数学推理突破
- 独立证明:Anthropic用Fable 5模型找到1939年雅可比猜想反例,OpenAI不联网版Codex独立复现类似反例
- 范式转变:相关推文获超2000万次浏览,无传统论文和期刊介入,证实高级模型已具独立数学推理能力
- 学术渊源:张益唐曾因导师莫宗坚错误引理致证明未果,2013年凭素数间有界间隙成名
9.2 模型架构蒸馏与跨范式转制
HedgeMamba:Transformer→Mamba 跨范式架构蒸馏
- 核心突破:苹果 HedgeMamba 实现从 Transformer 到 Mamba 跨范式转制,推理复杂度从 O(n²) 降至 O(n)
- 数据高效:仅用教师模型 2.7% 数据(10B token),困惑度 14.11 近似教师 13.86,全面优于直接蒸馏基线 14.89
- 工程必然:直接单步蒸馏会导致 PPL 爆炸至 100+,两阶段渐进迁移是结构性必选项,为存量模型提供可规模化降本路线
| 对比维度 | Pythia-1B(教师) | 直接蒸馏 | HedgeMamba |
|---|---|---|---|
| 推理复杂度 | O(n²) | O(n) | O(n) |
| PPL(困惑度) | 13.86 | 14.89 | 14.11 |
| 数据消耗占比 | 100% | 2.7% | 2.7% |
第一阶段:Softmax → 学习型线性 Attention
- 特征逼近:基于 Mercer 定理用 Hedgehog MLP 学习特征映射,使线性注意力模拟 softmax 行为
- 分布对齐:采用余弦相似度蒸馏,生成成本低且行为接近教师的中间过渡模型
- 机制补偿:额外引入归一化步骤,弥补线性注意力缺失 softmax 自带的归一化效应
第二阶段:线性 Attention → Mamba 架构
- 参数映射:将注意力核心计算映射到 Mamba 内部参数,保证初始化行为与中间模型接近
- 能力恢复:微调阶段重启 Mamba 原生卷积与门控机制,实现从结构对齐到原生能力进化
9.3 扩散语言模型与连续生成范式
扩散语言模型技术演进与标杆对比
机器之心(20260428) | 量子位(20260508) | 量子位(20260513) | 深度学习与NLP(20260513) | 机器之心(20260522) | 机器之心(20260728) | 量子位(20260728)
- MDLM(离散):PPL接近AR,但丧失并行解码能力
- ELF(连续):极低资源突围,32步PPL压至24(105M),条件生成超部分AR
- LangFlow(连续):LM1B达Gen. PPL 91.8,证明弱势源于训练策略
- Dynamic-dLLM:结合动态缓存与并行解码,LLaDA-8B达4.48x无损加速
- Nemotron(统一):双损失优化无缝切换AR/扩散/自推测,吞吐达850 tok/s
- 演进趋势:连续扩散正快速逼近AR以突破延迟与模态局限
核心技术与架构优化
- 噪声调度:基于信息熵的Gumbel调度使Gen. PPL降低约7倍
- ELF架构:T5映射双向embedding零开销推理,全程空间去噪
- 末端离散化:仅末步投影回token,去噪器与解码器共享参数
- 零开销CFG迁移:training-time CFG一次前向模拟两次推理,结合self-conditioning
- 三模式统一:Nemotron同一模型无缝切换多模式,打破架构壁垒
Agent范式对比(AR vs LLaDA)
- 生成方式:AR为逐Token因果生成;扩散模型为非因果,可并行迭代
- 上下文利用:AR仅关注左侧已生成内容;扩散模型双向关注全部上下文
- 纠错能力与推理:AR生成后难回溯且线性推进;扩散天然支持反复修订与边行动边纠错
LLaDA系列突破与行业影响
- 地位:蚂蚁inclusionAI开源,全球首个大规模Agentic扩散模型
- 核心突破:首个将扩散扩展至智能体长程任务,128K上下文下追平同规模AR
- 攻克缺陷:解决以往时序推理弱(具身规划重复失败)与格式约束差(难维持JSON)
- 技术路线:采用掩码扩散,非因果生成可双向关注上下文,支持边行动边纠错
- 演进意义:v1证明扩散具备AR级语言理解,v2.2突破性证明该架构可用于Agent
- 行业影响:打破Agent清一色AR现状,为扩散模型在Agent领域打开突破口
- 苦涩教训:不应简单模仿AR智能体,应发挥并行去噪优势探索原生架构
9.4 极限计算环境下的模型实现与可行性验证
极限资源环境下的模型实现与验证
- 核心结论:Transformer架构有效性不依赖现代高端GPU,在1970年代汇编和现代浏览器JS中均能完成有效训练与推理
| 维度 | ATTN-11 (PDP-11) | emojiGPT (浏览器) |
|---|---|---|
| 运行环境 | 1970年代纯汇编 | 单HTML文件,零依赖 |
| 参数规模 | 1,216 | 8,704 |
| 内存占用 | 19.2KB | 44KB |
| 训练任务 | 序列反转(350步达100%) | emoji故事生成 |
| 训练耗时 | 5.5分钟 | 实时推理 |
| 浮点需求 | 无(纯定点运算) | 标准JS Number |
ATTN-11:极限硬件上的汇编优化
- 极简架构:无层归一化、无前馈、无解码器,仅嵌入+残差自注意力+Softmax
- 定点混合精度:前向Q8+反向Q15,梯度精度达激活值128倍,查找表替代超越函数
- 分层学习率替代Adam:内存从64KB降至32KB,满足PDP-11 56KB极限
- NN11计算栈:FXMATH→VECOP→MATOP→LAYER分层设计,类似BLAS架构
emojiGPT:浏览器端完整教育版GPT
- 架构完整性:含多头注意力、RMSNorm、MLP、位置编码、Adam优化器及KV-cache
- 规模极致压缩:参数约为GPT-4两亿分之一,默认16维embedding、4头、1层
- 实时推理可视化:每步显示token概率分布,直观观察模型决策与"犹豫"现象
- 教育民主化:浏览器完整经历数据→训练→推理→生成pipeline,支持调参实验
9.5 残差连接革新:多残差流与深度注意力
残差连接三大革新方案:mHC、AttnRes 与 MoDA
- 残差连接的跷跷板困境:单一残差流下面临两难,权重过大导致表示坍缩,过小导致梯度消失,这是三大方案共同解决的核心矛盾。
四大深度架构方案核心维度对比
| 方案 | 核心改造 | 历史层访问 | 权重相关性 | 主要收益指标 |
|---|---|---|---|---|
| mHC | n条并行流+双随机混合矩阵 | n条压缩流 | 静态双随机 | 复合映射范数压至 ~1.6 |
| AttnRes | 残差和替换为全历史层 softmax | 全部前层输出 | 默认输入无关 | 1.25× 算力提升 |
| MoDA | 叠加深度 KV 注意力 | 全部前层深度 KV | 完全动态依赖 | PPL −0.2,任务 +2.11%,FLOPs仅+3.7% |
| xHC | 多尺度写回+稀疏更新 | n条并行流(稠密读) | 动态路由与卷积混合 | 16路额外FLOPs仅3.3%,达同等损失算力最省 |
xHC 突破 mHC 的多路扩展瓶颈
- 瓶颈本质:多路效率瓶颈非路数本身,而是单一信号供给不足,需读取、写回丰富度与更新稀疏度三者协同。
- 多尺度写回:单一 MLP 写回经 3 核大小卷积分支扩为 4 组特征,辅以 Gram-Schmidt 去共线,直击信息供给瓶颈。
- 稠密读稀疏更新:读取全部流但仅更新 4 条(2固定+2动态),N=16 时 FLOPs 从 20.1% 压至 3.3%,附加参数仅 1/7。
- 规模验证:4 路扩至 16 路时 xHC 损失降幅 2 倍于 mHC(0.012 vs 0.006);18B/28B 模型各项评测全面提升。
- I/O 优化:xHC-Flash 共享窗口复用路由决策,估算 I/O 从 73.5C 降至 51C,预填充延迟仅增约 1.3%。
交叉引用
- ai-agent - AI Agent与智能体
- ai-coding - AI编程与开发
- ai-industry - AI行业与商业
- ai-products - AI产品与落地
- multimodal-aigc - 多模态与AIGC
- ai-safety - AI安全与治理