🔬 AI学术研究
顶会论文、AI for Science、研究方法
收录数:1059 篇
目录
- 1. 顶会论文精选
- 1.1 CVPR 2026 高亮:具身智能与动作生成
- 1.2 CVPR 2026 高亮:多模态生成与模型效率
- 1.3 ICML 2026 高亮:具身智能与多模态架构
- 1.4 ACL 2026:多模态对话RL微调与潜在动作空间
- 1.5 IJCAI-ECAI 2026:时序知识图谱评估、幻觉表征干预与噪声鲁棒检索
- 1.6 ACL 2026:大语言模型检索优化、安全对齐与微调
- 1.7 CVPR 2026 高亮:视觉感知与基础表征
- 1.8 CHI 2026 与其他顶会(含 ICLR 2026)
- 1.9 AI游戏生成:机制进化范式与创意评估新方法
- 1.10 美团ICML 2026入选论文:Agent与视频生成双主线
- 2. 研究前沿与突破方向
- 3. AI for Science 与交叉学科
- 4. 科研生态与政策影响
- 5. 算法架构与模型创新
- 6. 视觉感知、理解与表征
- 7. 智能体工程与软硬件系统架构
- 8. 前沿基础科学与硬核交叉突破
- 9. 物理机制、材料创新与能源工程
- 10. AI4S 科研平台与理化生前沿交叉验证
- 11. AI 驱动的理论发现与通用科研平台
- 12. 顶会成果、学术话语权与研究实战
1. 顶会论文精选
1.1 CVPR 2026 高亮:具身智能与动作生成
CVPR 2026 具身智能、动作生成与3D视觉突破
量子位(20260331) | 机器之心(20260408) | 新智元(20260507) | AI科技评论(20260509) | AI科技评论(20260510) | CVer(20260511) | 新智元(20260516) | 极市平台(20260518) | AI科技评论(20260522) | 机器之心(20260527) | AI科技评论(20260527) | 极市平台(20260602) | AI科技评论(20260604) | CVer(20260604) | 雷峰网(20260605) | 机器之心(20260606) | 雷峰网(20260606) | 量子位(20260606) | 机器之心(20260606) | AI科技评论(20260606) | 新智元(20260606) | CVer(20260607) | PaperAgent(20260607) | 极市平台(20260608) | PaperWeekly(20260608) | CVer(20260615) | 机器之心(20260620) | 机器之心(20260625) | CVer(20260704) | 机器之心(20260706) | PaperWeekly(20260713) | CVer(20260516)
|---------|---------|-------------|
| D4RT | 统一Transformer替代逐帧解码 | 位姿估计200+ FPS,较MegaSaM快约100倍 |
| VGGT-Ω | 3D重建前馈模型推至10B参数 | 动态场景姿态AUC提升77%(22.5→40.0) |
| LegoOcc | 泊松高斯-占用转换 | 单RGB图实现59.50几何IoU,推理22 FPS |
| LA-Pose | 自监督学习潜在动作 | 驾驶位姿精度超基线>10%,泛化至PandaSet |
| GenCeption | 文生视频模型做通用感知 | 14B模型仅用123万帧即媲美数亿帧专用模型 |
- 空间智能产业化探索:如视Argus提供LiDAR级几何约束(误差降至2.5cm);高德ABot-Earth构建原生3DGS地球模型;单图生成3D资产与大规模渲染基建(PhysIn 200万条视频)成新趋势
- 复杂材料物理建模:3DReflecNet(22TB数据集)揭示透明/镜面等低纹理材料重建PSNR断崖式下跌45%,推动从RGB感知走向物理真实综合建模
动作生成与动捕重建
| 代表模型 | 核心创新 | 关键数据指标 |
|---|---|---|
| MoTok | 离散运动tokenizer与三阶段解耦 | 轨迹误差降89%,Token压缩至SOTA的1/6 |
| MotionMAR | 头显+手柄3点稀疏追踪重建全身 | 22关节推理61.76 FPS,FLOPs仅1.47G |
| HTD-Refine | 速度与加速度高阶动力学优化 | 动作Jitter从25.1降至6.6 |
| SentiAvatar | 双通道分离语义与韵律 | 0.3秒生成6秒序列,支持无限流式交互 |
- 跨模态与生成编辑新范式:清华赵昊团队以中间表示(第三语言)打破模态壁垒(灵巧手零样本达81%);ChordEdit将图像编辑转为最优传输问题,单块显卡即可实现单步极低耗时编辑
- 6D姿态与轻量识别:SceneMaker等通过去遮挡解耦实现单图3D场景生成;南洋理工SRID综述证实仅用3D骨架坐标(极简模型0.15M参数)即可实现隐私友好的行人重识别
快手OneSearch-V2:零成本推理增强的生成式电商搜索
- 产品定位:快手 OneSearch-V2,基于潜空间推理增强与自蒸馏的端到端生成式电商搜索框架,已全量上线
- 业务收益:商品 CTR +3.98%、买家数 +2.07%、订单量 +2.11%,且零额外推理成本、零延迟增加
- 核心痛点:复杂 query 占 PV 约 1/3 但仅贡献 8% 转化,长尾稀疏与信息茧房问题突出
三大技术创新
| 模块 | 核心机制 | 关键效果 |
|---|---|---|
| 思维增强查询理解 | Qwen3-32B 生成关键词级 CoT,三步流程:query 分析→关键词提取→偏好校准 | 异步+缓存实现零延迟,信息密度高且开销低 |
| 推理内化自蒸馏 | 教师(含 CoT)向学生(不含 CoT)共享权重 KL 散度蒸馏,辅以 R-Drop+FGM+Focal Loss | 单项最大提升(Order HR@10 +1.17%),学生优于教师 |
| TPMA-GRPO 偏好对齐 | 复合奖励(相关性+后验转化+点击/下单),前缀门控实现层次化信用分配 | 替代独立 Reward Model,支持流式更新与大促干预 |
- 表征编码结论:KHQE(关键词层次量化)用单模态表征多模态效果最佳
- 关键洞察:相关性≠转化率,V2 转化大幅提升(ctccvr 0.231%→0.242%),印证模型应学推理能力而非结果
- CTR 增益分布:呈 U 型(vs V1 倒 U 型),头部和长尾 query 提升最显著,歧义类目增益最大
InfraNet-IR:训练借力RGB、推理仅用红外的零开销检测范式(ECCV 2026)
极市平台(20260713) | 机器之心(20260718) | CVer(20260719) | 新智元(20260726)
- 核心范式:北航ECCV'26提出InfraNet,将多模态融合从“推理时融合”转变为“训练时引导”,解决低照度/恶劣天气下RGB退化污染红外表示的问题。
- 非对称架构:IR为主路径全程承担检测;RGB仅在训练期提供辅助引导,推理时完全移除RGB分支与QualGate,实现单红外传感器零参数增长部署。
- QualGate门控:预测端到端无标签标量q,同步执行RGB抑制与IR特征补偿,属于任务驱动控制量(最强雾化下q从0.441缓降至0.434)。
- 非对称损失:辅助分支损失权重设为0.25,确保RGB起引导作用而非替代IR主干预测。
- 门控消融:完整版68.8|移除IR补偿67.2|移除RGB抑制68.4|固定q=1朴素版67.7。
- 抗退化鲁棒:最强雾化下控制模型保持97.1 AP50/67.8 mAP,朴素融合降至92.6 AP50/61.8 mAP。
- 定性对比:相比SuperFusion、CFT,减少了重复框与背景误检,特征高响应区更集中于目标。
- 推广价值:可推广至其他多模态场景,重新审视“辅助模态”在推理阶段的必要性。
双版本配置与多数据集性能
| 版本/数据集 | 推理输入 | 参数量/延迟 | 核心性能指标 |
|---|---|---|---|
| InfraNet-IR | 仅IR | 零增长 | M3FD 86.2 AP50(适用RGB不可靠) |
| InfraNet-RGB-IR | RGB+IR | 54.3M/13.4ms | M3FD 89.9 AP50(双模态稳定) |
| LLVIP | - | - | 68.8 mAP (IR) vs 70.5 mAP (RGB-IR) |
| FLIR | - | - | 88.1 AP50 (IR) vs 89.5 AP50 (RGB-IR) |
| DroneVehicle | - | - | 84.7 AP50 (IR) vs 63.9 mAP (RGB-IR) |
复旦CVL:视频分割、3DGS应用与具身智能全景感知
- 概况:复旦大数据研究院9篇论文被TPAMI/IJCV/ECCV 2026录用,通讯作者多为丁恒辉,覆盖视频分割、3DGS、具身智能等方向
- 会议背景:ECCV 2026投稿10,473篇录用2,883篇(约27.5%),复旦贡献6篇,9月瑞典马尔默举办
核心论文与技术亮点
| 论文 | venue | 核心创新 | 关键性能 |
|---|---|---|---|
| SAM-MT | ECCV | 显式查询+解耦注意力 | 10目标36+FPS(SAM2的6倍) |
| FeVOS | ECCV | 前瞻表达分割,预测后续事件目标 | FeVOS-R1推理+分割对齐 |
| SAM2Matting | ECCV | 冻结追踪器+抠图模块,仅图像训练 | 视频抠图zero-shot SOTA |
| PanoSeeker | ECCV | 主动调整360°视角搜索+EgoSphere记忆 | 全景主动感知 |
| CabinSI | ECCV | 跨座舱多视角空间推理基准 | 认知地图归一化俯视投影 |
| STAC | ECCV | 状态空间线性递归+层次token压缩 | 高效视频推理分割 |
| GREx | IJCV | 广义指向分割(多/无目标),构建gRefCOCO | 突破"一句一目标"限制 |
| 3DGS综述 | TPAMI | 系统梳理3DGS分割/编辑/生成 | 整理数据集与评估协议 |
| 指向分割综述 | IJCV | 统一元架构+十年回顾 | 覆盖图像/视频/3D |
关键洞察
- 从被动到主动预测:FeVOS要求模型预测未来目标,标志视频理解向预测演进
- 解耦是效率核心:SAM-MT与SAM2Matting均通过任务解耦实现性能效率双突破
- 主动感知成趋势:PanoSeeker和CabinSI推动具身智能向主动探索发展
- 综述集中出现:3DGS与指向分割双双被顶刊录用,标志两领域进入系统化成熟期
PKINet-v2:异形卷积核破解遥感目标形状-尺度困境
算法与数据双向突破:破解遥感检测难题与填补数据空白
算法突破:PKINet-v2
- 核心创新:南理工与浙大联合提出 PKINet-v2,通过异形卷积核(PKS)与异构核重参数化(HKR),破解遥感检测的几何、空间与部署困境
- 极致加速:DOTA-v1.0 达 80.46 mAP(+2.07),FPS 从 14.05 飙升至 54.60(约3.9倍),参数量与 FLOPs 零增加
- 极端形状精准击破:长宽比 3-4 区间 mAP +8.62,6-7 区间 +6.58,有效弥补传统均匀卷积核盲区
- 五分支立体设计:1×19+19×1 条带核捕获细长主轴;7/5/3×3 稀疏核扩上下文;3×3 稠密核保细节,实现立体渐密感受野
- 功能互补非堆叠:条带核(拉长看)与方形核(向外看)混合,实现遥感目标几何多样性的功能互补
- 严格等价融合:训练时五分支融合为单 19×19 逐通道卷积,属计算图严格等价变换,非近似压缩,精度零损耗
- 解耦训练与部署:多分支重参数化是连接学术精度与工业效率的关键桥梁,范式具高度可推广性
- 通用性验证:在 6 种主流旋转检测器上稳定提升 1.75-2.70 mAP
多数据集性能表现
- DOTA-v1.0:80.46 mAP(+2.07)
- DOTA-v1.5:73.57 mAP(+2.10)
- DIOR-R:69.40 mAP(+2.37)
- HRSC2016(07):90.75 mAP
数据革命:武大 HyperImageNet
- 双高规模之最:武大推出目前最大、最细粒度的高空间+高光谱遥感数据集,填补深度学习大规模基准空白
- 降维打击传统:在覆盖范围、类别数量与数据规模上,全面超越小样本、粗粒度的传统高光谱基准(如 Indian Pines)
- 领域的ImageNet:有望引发高光谱遥感的"ImageNet时刻",支撑大规模预训练及精准农业、矿产勘探等落地
- 决战细粒度分类:从粗粒度"识别建筑"进化至细粒度"区分建筑类型",细粒度能力直接决定遥感应用商业价值
港中大(深圳)10篇CVPR 2026录用:3D视觉为核心
- 录用概况:港中大(深圳)10篇论文被CVPR 2026录用(1篇Oral、3篇Highlight),主会议录取率25.42%(4090/16092篇),首次设立Findings Track(接受率10%)
- 研究特征:方向高度集中于3D视觉(重建、生成、纹理、部件分割),覆盖自动驾驶、数字人等场景,通讯作者含崔曙光、韩晓光等五位教授
核心论文与技术突破
| 论文 | 核心贡献 | 关键数据/指标 |
|---|---|---|
| 3DReflecNet(Oral) | 反光/透明等混合数据集,审稿人满分6分 | 超22TB,12万+合成实例,1000+真实样本 |
| MotionCrafter(Highlight) | 4D VAE联合重建几何与稠密运动 | 几何重建提升38.64%,运动重建提升25.0% |
| OMGTex | 首个无需几何先验的端到端扩散纹理框架 | 构建CANVAS大规模配对纹理数据集 |
| UniPart(Highlight) | 统一几何-部件分割联合隐空间 | 无需外部分割工具生成可控部件模型 |
| NeAR(Highlight) | 耦合神经资产-渲染器栈 | 单图提升至光照不变空间,实时重光照3DGS |
| ForeHOI | 联合建模人体与物体几何/语义 | 复杂遮挡场景交互区域重建鲁棒性提升 |
| DLWM | 双潜在世界模型自监督预训练 | 解耦感知与规划,降低标注依赖 |
| LoFA | 前馈式直出LoRA参数 | 个性化适配从小时级压缩到秒级 |
趋势洞察
- 场景泛化:3D视觉从理想条件走向反光/透明等真实复杂材质场景
- 去几何先验:端到端扩散框架正取代传统分步几何估计流程
- 资产-渲染耦合:神经资产与渲染器端到端联合优化成为新范式
1.2 CVPR 2026 高亮:多模态生成与模型效率
CVPR 2026 多模态生成、模型效率与3D视觉
CVer(20260331) | AI有道(20260401) | 新智元(20260409) | CVer(20260412) | CVer(20260418) | 量子位(20260421) | 极市平台(20260424) | AI科技评论(20260429) | PaperAgent(20260430) | CVer(20260430) | CVer(20260501) | CVer(20260502) | 量子位(20260503) | CVer(20260503) | 机器之心(20260506) | 机器之心(20260507) | 量子位(20260507) | AI科技评论(20260508) | 机器之心(20260511) | CVer(20260512) | 机器之心(20260513) | 极市平台(20260513) | CVer(20260513) | AI科技评论(20260514) | 极市平台(20260515) | 机器之心(20260517) | 量子位(20260517) | CVer(20260517) | 新智元(20260518) | PaperWeekly(20260519) | 极市平台(20260519) | 极市平台(20260520) | 机器之心(20260523) | CVer(20260528) | CVer(20260529) | CVer(20260606) | 阶跃星辰(20260606) | 极市平台(20260608) | CVer(20260610) | AI科技评论(20260610) | CVer(20260611) | 极市平台(20260611) | AI科技评论(20260612) | CVer(20260612) | 机器之心(20260612) | 机器之心(20260616) | "Z Finance"(20260617) | 极市平台(20260617) | AI科技评论(20260625) | 量子位(20260626) | PaperWeekly(20260701) | 新智元(20260702) | 极市平台(20260702) | CVer(20260703) | PaperWeekly(20260707) | CVer(20260711) | CVer(20260524) | 极市平台(20260702)
视觉Token压缩与加速:FlashAR转对角线并行解码,H×W降至H+W-1步,Emu3.5-34B端到端加速22.9倍
FlashAR架构与训练:中间层垂直头保2D信息融合预测;两阶段适配结合动态掩码更新KV缓存
FlashAR极致效率:仅用0.05%数据后训练GenEval降0.19;ImageGen吞吐量与IS超NAR且训练量仅1/3
跨模型验证:兼容LlamaGen全系列与Emu3.5,证实中间层比最终层更具可塑性
TransPrune双模块架构:TTV跨层追踪L2与余弦偏移量化演化,IGA文本对齐语义,双维衡量Token重要性
TransPrune核心洞察:信息流动比状态更重要,重要Token在LLM中间层经历最显著的表征变化
TransPrune高效兼容:更低TFLOPs领先同类,叠加VisionZip再降1/3算力,开源支持LLaVA与Qwen
其他压缩方案:FinePrune免训练哈希聚类实现高效无损压缩
Transformer与图优化:ViT³引TTT线性复杂度降90.3%显存,SoftHGNN软化硬连接降至近似O(N×M)
多模态生成优化:MacTok用64token实现64倍压缩攻克坍塌,DiverseGRPO防RLHF模式坍塌提多样性
RL与高效智能体:IBISAgent多步MDP提升医学分割IoU,DPE仅生成3K样本即超47K静态数据
感知与持续学习:CodePercept用代码消除幻觉使8B超72B;Octopus与OrthoReg用梯度正交化实现零干扰免数据学习
产学研深度融合:上海交大联合华为、清华联合阿里成顶会标配,vivo联合南开推出LiveMoments及4K数据集
1.3 ICML 2026 高亮:具身智能与多模态架构
ICML 2026 前沿:多模态架构、注意力机制与迁移学习新范式
CVer(20260503) | CVer(20260504) | CVer(20260505) | CVer(20260506) | CVer(20260507) | 机器之心(20260511) | PaperWeekly(20260512) | 机器之心(20260513) | 千问APP(20260514) | 极市平台(20260515) | ScienceAI(20260515) | 机器之心(20260516) | 机器之心(20260518) | 新智元(20260518) | 机器之心(20260519) | 机器之心(20260521) | CVer(20260521) | CVer(20260522) | 机器之心(20260524) | DeepTech深科技(20260525) | 极市平台(20260525) | CVer(20260525) | AI科技大本营(20260526) | 量子位(20260527) | CVer(20260527) | 量子位(20260527) | CVer(20260527) | 极市平台(20260528) | CVer(20260528) | 腾讯混元(20260605) | CVer(20260605) | 机器之心(20260607) | 机器之心(20260609) | PaperWeekly(20260610) | 机器之心(20260612) | 量子位(20260613) | PaperAgent(20260615) | 机器之心(20260617) | 机器之心(20260617) | CVer(20260617) | 极市平台(20260617) | CVer(20260618) | 机器之心(20260624) | PaperWeekly(20260625) | 极市平台(20260626) | CVer(20260629) | AI科技评论(20260701) | CVer(20260702) | 量子位(20260702) | 量子位(20260705) | 机器之心(20260705) | AI科技评论(20260708) | AI科技评论(20260708) | PaperWeekly(20260708) | 机器之心(20260710) | 机器之心(20260711) | 机器之心(20260713) | CVer(20260713) | CVer(20260718) | 量子位(20260720) | 极市平台(20260727)
- DPE:“诊断-生成-强化”闭环,3K样本超越47K,8B超GPT-4o
多模态与跨模态创新
- Any2Any:统一跨模态翻译复杂度从O(N²)降至O(1),实现强零样本泛化
- 视觉语言并行思考:路径感知注意力拓展推理宽度,视觉搜索最高提升12.6%
- CUHK-X数据集:暴露主流大模型人类真实动作理解短板,平均正确率仅40%
- SVL脉冲神经网络:实现3D零样本理解(ModelNet40达85.4%),能效提升204倍
- GemDepth:0.58B参数引入显式几何先验,TAE时间一致性提升56.14%
模型架构探索与纠错机制
- 算术错误几何机制:发现隐藏状态形成层级流形(数字盆地+进位纤维),双流纠错
- Transformer计算上限:固定部署非天然图灵完备,跨越计算层级限制
- FusionRoute:Meta提出Token级路由,突破纯选择型路由理论瓶颈
- 免训练幻觉检测:多步推理建模为“证据流形”,单轮前向传播定位错误步骤
具身智能与世界模型
- PhyScene3D:认知拓扑推理链将3D场景碰撞率降低40%
- DDP-WM:解耦动力学在Push-T任务实现约9倍推理加速
- SOLAR框架:不确定性感知节流机制解决稀疏奖励离线多智能体RL难题
连续量化与压缩
- LiftQuant:量化位宽连续可调,支持70B模型压缩至2.4-bit适配24GB GPU
- SparseSSM:针对Mamba架构实现一次性高效状态空间模型剪枝
生成与表征对齐新范式
- Self-Flow对齐洞察:外部Encoder越强生成反而越差,改变训练任务比引入外部模型更根本
- Dual-Timestep Scheduling:同一样本不同Token施加两级噪声,迫使模型学习全局语义
- 自监督对齐机制:用模型自身EMA作teacher,student预测干净输入语义,无需外部模型
- Self-Flow性能:超越外部对齐REPA,T2V视频(FLUX.2)达47.81 FVD / 8.92 FID
1.4 ACL 2026:多模态对话RL微调与潜在动作空间
多模态Latent Action RL:动作空间压缩破解VLM对话微调难题
- 动作空间压缩:首次将潜在动作引入多模态对话RL微调,单步搜索空间从词表级(如15.2万)压至码本级(如128),实现数量级缩减
- 多模态联合训练:结合配对图像-文本与纯文本数据,通过跨模态投影器与循环一致性损失消除单模态偏置
- 算法广泛适用:在GRPO、Dr.GRPO、DAPO、BNPO四种RL算法上均显著优于token-level RL基线
- 基座模型:实验基于Qwen2.5-VL-3B/7B-Instruct
- 核心消融结论:循环一致性损失、跨模态投影器、纯文本数据三者缺一不可,移除任一组件性能显著下降
四模块协同架构
| 模块 | 输入 | 输出 | 用途 |
|---|---|---|---|
| Policy Model | 当前step文本+图像 | latent action | RL优化,推理时使用 |
| Inverse Dynamics | 未来step文本+图像 | latent action | 仅辅助训练,推理不参与 |
| Language World Model | 观测+latent action | 下一词元预测 | 训练联合优化,RL时冻结 |
| Codebook | — | 离散向量 | 可学习,如 |
两阶段训练流程
- Stage 1 码本推断:Inverse Dynamics推断离散动作,World Model重构词元,三者联合训练
- Stage 2 RL优化:冻结World Model,Policy Model执行强化学习
关键洞察
- 动作空间决定上限:紧凑且覆盖充分的动作空间比算法选择更能决定RL性能
- 纯文本是隐藏杠杆:跨模态投影器使廉价语料有效增强动作空间覆盖率
- 可插拔设计:源自ICML 2025 LLM latent actions,首次扩展至多模态对话场景
1.5 IJCAI-ECAI 2026:时序知识图谱评估、幻觉表征干预与噪声鲁棒检索
华中科技大学CCIIPL实验室3篇论文被IJCAI-ECAI 2026录用
CVer(20260531) | InfoQ(20260703) | AI前线(20260706) | PaperAgent(20260710) | 量子位(20260723)
IJCAI-ECAI 2026前沿突破
- RSMF评估框架:对比事件实际与时间规则推导预期量化显著性,并加权MRR指标,揭示现有TKGR模型在罕见高影响事件上性能显著下降
- RIVS幻觉治理:揭示视觉注意力衰减是幻觉关键前兆,构建幻觉子空间,在推理阶段在线投影抑制隐藏状态,无需额外训练
- RCR噪声鲁棒检索:利用数据流形全局结构替代单样本预测分数重加权,在噪声图文对场景下显著提升对齐鲁棒性
- 推理差异洞察:路径推理方法在低显著性事件表现优,表示方法在高显著性事件表现优;集成方法的性能提升多源于对琐碎事件过拟合
QC-MHM框架(AAAI 2025)
- 时序感知缺失:PLM注意力集中于实体而忽略“之前/期间”等时间词致约束失效;现有方法仅将KG作查询索引致多步推理黑箱
- 顺序感知嵌入:结合TComplEx与位置编码实现时间戳感知,构造“判断时间m是否早于n”辅助任务让嵌入空间隐式编码先后
- 问题校准创新:SentenceBERT召回Top-10 SPO,经Concat/Dot/Minus三注意力与门控融合,动态平衡问题向量语义与时序信息
- 多跳建模突破:单层GNN访问任意跳邻居,以注意力矩阵作路径权重实现长路径推理与可解释性
- 双通道预测:语义与图向量经Transformer融合,分别投射至实体与时间戳空间预测答案
双基准SOTA与落地启示
- 逼近天花板:CronQuestions整体Hits@1达0.971,复杂多跳绝对提升5.1%;TimeQuestions稳居榜首,Before-After优势显著
- 路径可视化:关键路径高亮权重达92%-95%,提供高可解释性
- 核心实践启示:构建时间约束问答系统必须在问题理解和推理链层面同时处理时间,后置过滤远不够
- 跨域赋能展望:未来可作为结合LLM的外挂时序推理引擎,赋能搜索、金融、医疗等跨时间查询场景
1.6 ACL 2026:大语言模型检索优化、安全对齐与微调
ACL 2026:规模格局、核心获奖论文与学术写作协作范式
百度文心(20260409) | 特工宇宙(20260526) | 新智元(20260604) | 机器之心(20260616) | 阿里云(20260708) | 新智元(20260709) | PaperAgent(20260709) | CVer(20260710) | 机器之心(20260712) | 机器之心(20260716) | 机器之心(20260719) | PaperWeekly(20260723) | 量子位(20260724)
大会格局与获奖突破
- 大会规模:投稿12148篇(+45%),主会录取18.9%,中国作者占54%包揽最佳论文一作,LLM论文占比超23%
- Agent评测(HSCodeComp):评测14大模型+9框架,最强Agent准确率仅49.4%(人类95%)
- 推理缺陷(未完成体):揭示DeepSeek目的论偏见率1.00,720B参数可使偏见骤降
- 全双工语音(Lychee-FD):揭示高低频梯度冲突,三通道解耦使vLLM推理提速2.96×
- 策略与记忆优化:刻画熵坍缩动力学;通过隐藏层注噪声逼模型优化记忆分配
模型与算法优化
- E-GRM(腾讯):混合损失判别评分替代投票制,区分逻辑正确与蒙对;以不确定性波动作零成本信号,58%样本直答降延迟62%
- 奖励模型演进:TikTok的CAMEL按需复核(14B达82.9%);百度CAST解决安全对齐冲突
- RL与策略优化:TEPO收敛快50%;CoVerRL破共识陷阱提升4.7-5.9%;百度缓解位置偏置
- 检索与安全防御:IntrAgent段落排序降幻觉(升13.2%);SFT+双向DPO降中文AIGC检测率至24%
学术写作新范式(XtraGPT)
- 修改而非生成(Revision-Only):针对初稿提供局部修改,避免端到端生成引发的学术不端及AI检测风险
- 直击写作痛点:突破通用LLM表层润色局限,补全claim-evidence论证链路,解决可控性差问题
- 结构化标准:提炼20条标准覆盖论文六大核心部分,将模糊指令转为可执行、可训练的结构化目标
- ReviseQA数据集:基于7千篇ICLR投稿构建,含14万组修改指令对,支持16K token窗口全文输入
- 多尺寸开源:基于Qwen-2.5和Phi系列训练1.5B-14B模型,14B版本已开源
- 全文上下文核心:消融实验显示移除上下文导致胜率降约15分,远超移除标准引导的5分
- ICLR验证:54篇论文评估提升显著,Overall rating 6.08→6.73,Presentation+12.5%,Soundness+6.4%
1.7 CVPR 2026 高亮:视觉感知与基础表征
VLM³:标准VLM+归一化替代三维视觉专家模型
- 核心发现:标准VLM(如Qwen3-vl-4B)仅需SFT加两个归一化预处理,即可在四大三维视觉任务上媲美或超越专家模型
- 极简设计:基于标准VLM架构零修改,仅引入相机焦距归一化与像素空间归一化两个预处理
- 范式突破:证明离散token建模可替代连续回归实现三维理解,验证了Bitter Lesson
- 性能跃升:单目深度估计准确率从DepthLM的84提升至90;4B参数超越8B的SpatialRGPT
- 四大任务:在单目深度估计、像素匹配、姿态估计等任务上全面持平或超越UniDepthV2等模型
- 统一框架:三维视觉不再与VLM预训练分离,可在统一框架下实现scaling law
架构对比
| 设计要素 | VLM³(4B) | 专家模型 |
|---|---|---|
| 架构 | 标准VLM无修改 | 任务定制网络 |
| 损失函数 | 标准SFT | 专门设计 |
| 数据增强 | 无需定制 | 大量定制 |
| 输出方式 | 离散token | 连续回归 |
工程启发:投入复杂架构前,应优先验证标准VLM结合简单预处理能否解决问题
1.8 CHI 2026 与其他顶会(含 ICLR 2026)
ICLR 2026:奖项动态、选题趋势与核心论文解读
PaperWeekly(20260421) | 量子位(20260425) | 机器之心(20260425) | CVer(20260425) | PaperAgent(20260426) | 量子位(20260428) | AIGC开放社区(20260430) | 新智元(20260510) | PaperWeekly(20260511) | APPSO(20260511) | AIGC开放社区(20260512) | 量子位(20260621) | AI科技评论(20260624) | 机器之心(20260409)
整体格局与录取趋势
- 投稿规模:有效投稿约1.9万篇,整体录取率降至约28%(27.4%-28.18%)
- 中美格局逆转:中国机构占比43.7%首超美国(31.9%),清华331篇登顶,超斯坦福与MIT之和
- 塔尖质量差距:美国占Oral论文40.5%(222篇)主导高质量产出,中国占28.8%(158篇)
- 选题决定命运:标题含“?”的论文录用率高达45.5%;盲目追热点易被拒,poison方向录用率仅10.8%
获奖论文与核心突破
- DCGAN(时间检验奖):图像生成奠基工作,引用超2万,影响GPT核心逻辑,作者首次为本科生一作
- DDPG(时间检验奖):来自DeepMind,首次证明深度强化学习可应用于连续控制
- Transformer简洁性(杰出论文):描述复杂概念所需参数远少于RNN,具双指数级优势
- LLM多轮对话崩塌(杰出论文):20万+次模拟对话证实六类任务性能平均下降39%,根因是过早锁定且不回头
系统机制设计与前沿算法
- Obscuro系统:10^18状态空间战争迷雾象棋中以16:4击败世界冠军,纯实时搜索不依赖离线训练
- AIGB-Pearl(Oral):阿里提出基于扩散模型出价的生成式广告新算法
- ROMI框架(离线RL):解决RAMBO过保守问题,D4RL总分953.5(提升18.6%),由单一参数控制保守度
学术活动与范式前瞻
- 论文分享会:4月18日北京中关村举办,设Keynote、论文分享、圆桌及Poster展示
- 三大聚焦方向:重点探讨Agent自主决策、大模型训练效率、具身智能落地
- 泛化新范式:传统规模扩展遇瓶颈,核心机制将学习从“依赖标签”转为“依赖结构”
- OpenClaw框架:边界感知、技能编排与记忆演化构成可持续学习智能体能力三角
1.9 AI游戏生成:机制进化范式与创意评估新方法
CreativeGame:机制驱动的AI游戏自我进化框架
核心范式:从一次性生成到机制进化
- CreativeGame 提出以「机制进化」替代「一次性Prompt生成」,让AI围绕游戏核心玩法持续迭代而非换皮输出
- 论文来自布里斯托大学、上海交通大学和 Sreal AI(arXiv: 2604.19926)
三大核心架构
| 模块 | 核心机制 | 解决问题 |
|---|---|---|
| 机制优先设计文档 | 强制AI写代码前完成结构化设计文档,输出「机制合约」贯穿四阶段代码生成 | 防止多阶段生成中核心目标稀释 |
| CreativeProxyReward | 四维确定性评估(结构变化/计划实现度/全局新颖性/运行鲁棒性),两道硬门槛 | 解决LLM评分通胀(GPT类一律给7-8分) |
| Lineage-Aware Memory | 版本组织为谱系树,同谱系共享记忆池,反思Agent记录机制级差异 | 解决迭代中的「遗忘」问题 |
实验验证与改造案例
- Flappy Bird 改造为节奏-记忆-路线编辑复合玩法(节拍充能、Phase穿越、死亡回声)
- 植物大战僵尸改造为攻击-储能-释放资源循环(友方子弹储存为charge,折射攻击)
- Memory Relay 案例实现「与自己的过去合作」机制(角色停放、路径回放、重力符文)
关键洞察
- 创意的本质是结构变化而非视觉包装:将「创意」从主观修辞转化为可编译验证的结构事实
- 确定性奖励优于主观评价:用代码编译结果和静态分析替代LLM自评,从根本上解决评分通胀
- 范式可迁移性:从追求单次输出「惊艳感」转向可解释、可追踪、可迭代的「结构深度」,可迁移至代码、叙事等其他生成领域
游戏塑造大模型智能:训练、观测与规则创造三层次
- 三层次研究框架:arXiv三项研究从训练环境(GIFT)、行为观测(LUDOBENCH)、规则创造(GAVEL)三个维度论证游戏是理解和塑造大模型智能的重要载体
训练范式:GIFT嵌套训练框架
- 核心设计:选取矩阵博弈(囚徒困境)、序列博弈(井字棋)、社交博弈(谁是卧底),要求模型在单次轨迹中依次完成数学推理、博弈、社交互动,全程均衡表现才获高奖励
- 嵌套 vs 混合训练对比:嵌套训练的通用泛化能力(MMLU推理、创意写作、社交理解)稳步上升,混合训练不升反降;嵌套训练梯度稳定且训练熵较高
行为观测:LUDOBENCH揭示模型"性格"
- 飞行棋实验:480个局面测试6类主流模型(Qwen、DeepSeek、Claude、Llama、Gemma),与博弈论最优策略吻合度仅40-46%
- 两类典型性格:Finishers(死磕已出场棋子送终点)和Builders(疯狂发展新棋子但不完成)
- 叙事干扰效应:告知"对手打回你棋子"后,相同局面33%决策改变且非最优;不同模型报复概率不同说明某些模型天生好斗;人设指令对齐分数仅0.3-0.5,有时产生反向效果
规则创造:GAVEL演化生成
- 流程:棋类规则编码为高阶关键词(step、slide、hop),随机定位突变位点后由CodeLlama-13B生成新规则,经四层过滤(编译→可玩性→随机策略快筛→MCTS深度评估)
- 成功案例:五子棋与围棋融合(五子胜/四子负+围吃机制),人类专家评价"有潜力成为经典"
关键洞察
- 游戏是智能的"非正式学习"环境,模型通过多类型游戏交替训练可获得比纯文本更强的泛化能力
- 模型决策存在不可忽视的"性格偏执",深植于模型内部,无法通过提示词简单覆盖,对AI对齐和安全研究有重要启示
- "无限游戏"可能是突破数据瓶颈的关键路径:让模型在可演化规则中自我博弈
- 多智能体零和博弈RL提升推理能力的发现发表于ICLR 2026
1.10 美团ICML 2026入选论文:Agent与视频生成双主线
美团ICML 2026:Agent四大能力与视频生成三大突破
概况:美团13篇论文入选ICML 2026,覆盖通用Agent(7篇)与视频生成/视觉前沿(6篇)两大主线,多项技术已落地LongCat-Video等产品
Agent方向核心论文
| 论文 | 核心方法 | 关键突破 |
|---|---|---|
| MemOCR | 视觉布局驱动自适应记忆分配 | 极端上下文预算下优于文本基线 |
| Infinite-World | 无位姿层级记忆压缩器 | 历史latent压缩为固定预算,支撑1000+帧长程交互 |
| V_0 | 价值估计重构为上下文学习任务 | 与策略参数解耦,GRPO训练中优于耦合价值模型 |
| ScaleEnv | 从零构建全交互式环境与可验证任务 | 多轮工具使用基准上显著提升泛化 |
| GTPO/TRIP-Bench | 奖励归一化+轮次级奖励差分多轮RL | Qwen2.5-32B超Gemini-3-Pro |
| AgentNoiseBench | 用户侧指令噪声+工具侧结果噪声 | 工具侧噪声性能下降远大于用户侧(25模型验证) |
Agent评估从能力测试转向压力测试:AgentNoiseBench和TRIP-Bench(15轮/150+次调用/20万token)测的是模型在不完美条件下能撑多久
视频生成方向核心论文
| 论文 | 技术路线 | 关键指标 |
|---|---|---|
| LUVE | 三阶段级联低清→潜空间上采样→双频专家 | 已应用于美团LongCat-Video |
| InfVSR | 因果流式DiT+滚动KV缓存+单步蒸馏 | 推理速度提升58倍,长序列显存恒定 |
| WildActor | 1.6M视频+18M多视角图像数据集Actor-18M | 非对称身份保留注意力解耦身份与运动,超商业大模型 |
| Infinite-World | 不确定性感知动作标注 | 提升噪声轨迹下动作学习与loop closure能力 |
微调优化:SAFT谱自适应微调通过数据SNR判定选Geo-SAFT或Har-SAFT,获得更优鲁棒性-效率Pareto trade-off
2. 研究前沿与突破方向
2.1 大模型能力边界与评测
大模型能力边界突破与评测基准演进
机器之心(20260330) | 新智元(20260331) | 机器之心(20260331) | AIGC开放社区(20260401) | PaperWeekly(20260402) | 人工智能学家(20260402) | 新智元(20260403) | 钛媒体AGI(20260405) | AIGC开放社区(20260408) | 新智元(20260408) | 新智元(20260409) | 人工智能学家(20260409) | 智东西(20260409) | 高飞的电子替身(20260410) | InfoQ(20260410) | AI科技大本营(20260410) | InfoQ(20260411) | AGI Hunt(20260411) | APPSO(20260410) | Z Finance(20260412) | 量子位(20260413) | 量子位(20260416) | AI信息Gap(20260419) | 刘小排r(20260419) | AIGC开放社区(20260420) | AGI Hunt(20260421) | 刘小排r(20260420) | 逛逛GitHub(20260421) | 有新Newin(20260422) | 饼干哥哥AGI(20260422) | 前沿在线(20260422) | 智东西(20260423) | AI信息Gap(20260423) | 量子位(20260423) | ScienceAI(20260423) | 人工智能学家(20260423) | 人工智能学家(20260423) | DeepTech深科技(20260423) | 新智元(20260424) | Datawhale(20260424) | 机器之心(20260425) | 人工智能学家(20260425) | 雷峰网(20260426) | AI寒武纪(20260426) | 新智元(20260426) | 老金带你玩AI(20260427) | 开发者阿橙(20260427) | 沃垠AI(20260427) | 钛媒体AGI(20260428) | 极市平台(20260428) | AI信息Gap(20260430) | 卡尔的AI沃茨(20260430) | 机器之心(20260501) | 机器之心(20260502) | 新智元(20260503) | 新智元(20260504) | "AGI Hunt"(20260505) | 人工智能学家(20260505) | 新智元(20260505) | 新智元(20260506) | 机器之心(20260507) | 人工智能学家(20260507) | AIGC开放社区(20260508) | 量子位(20260509) | 人工智能学家(20260509) | 机器之心(20260510) | AI寒武纪(20260510) | CVer(20260510) | 人工智能学家(20260511) | 人工智能学家(20260511) | 极市平台(20260513) | AI信息Gap(20260514) | 夕小瑶科技说(20260515) | MacTalk(20260515) | 数字生命卡兹克(20260515) | 量子位(20260515) | AI信息Gap(20260515) | 量子位(20260515) | JackCui(20260515) | APPSO(20260515) | 雷峰网(20260515) | AI信息Gap(20260516) | 新智元(20260516) | 歸藏的AI工具箱(20260516) | AI信息Gap(20260517) | AIGC开放社区(20260518) | APPSO(20260518) | 机器之心(20260518) | 机器之心(20260519) | 玄姐聊AGI(20260518) | 机器之心(20260519) | 赛博禅心(20260519) | 新智元(20260519) | 甲子光年(20260519) | AIGC开放社区(20260520) | AI科技大本营(20260520) | AI新榜(20260520) | 前沿在线(20260520) | AI寒武纪(20260521) | 量子位(20260521) | APPSO(20260521) | AI科技大本营(20260521) | 新智元(20260521) | AI前线(20260521) | 人工智能学家(20260521) | AI科技大本营(20260521) | AI科技评论(20260521) | 夕小瑶科技说(20260521) | 夕小瑶科技说(20260521) | 机器之心(20260521) | 赛博禅心(20260521) | 智东西(20260521) | CVer(20260521) | AIGC开放社区(20260522) | 甲子光年(20260522) | 量子位(20260522) | InfoQ(20260522) | 新智元(20260523) | 新智元(20260523) | 人工智能学家(20260523) | AI异类弗兰克(20260523) | 机器之心(20260524) | InfoQ(20260524) | 特工宇宙(20260525) | 新智元(20260525) | 新智元(20260525) | 机器之心(20260525) | 新智元(20260526) | 量子位(20260526) | 新智元(20260527) | 新智元(20260527) | 新智元(20260527) | 人工智能学家(20260528) | AI科技评论(20260528) | AI寒武纪(20260529) | 新智元(20260529) | AI信息Gap(20260529) | 赛博禅心(20260529) | APPSO(20260529) | 刘小排r(20260529) | 数字生命卡兹克(20260529) | AI范儿(20260529) | 夕小瑶科技说(20260529) | 量子位(20260529) | 机器之心(20260529) | PaperAgent(20260529) | AI前线(20260529) | 硅星人Pro(20260529) | 新智元(20260529) | 阿枫科技(20260529) | AI新榜(20260529) | APPSO(20260529) | 极市平台(20260529) | 刘小排r(20260530) | 新智元(20260530) | 计算机司令部(20260530) | 钛媒体AGI(20260531) | AIGC开放社区(20260601) | 腾讯研究院(20260531) | 通义大模型(20260602) | 新智元(20260602) | 阿里云开发者(20260602) | 智东西(20260602) | 量子位(20260603) | AIGC开放社区(20260603) | 阿里云(20260602) | 阿里云开发者(20260603) | 智能涌现(20260604) | DeepTech深科技(20260604) | 机器之心(20260606) | 数字生命卡兹克(20260608) | 卡尔的AI沃茨(20260608) | 量子位(20260608) | 机器之心(20260609) | 卡尔的AI沃茨(20260612) | 量子位(20260612) | AI科技评论(20260618) | AI寒武纪(20260618) | AI前线(20260622) | 数字生命卡兹克(20260623) | 字节跳动Seed(20260623) | 火山引擎(20260623) | 人工智能学家(20260623) | 沃垠AI(20260624) | 特工宇宙(20260624) | 小互AI(20260624) | 划重点KeyPoints(20260624) | JackCui(20260624) | "梦飞 AI"(20260625) | 袋鼠帝AI客栈(20260625) | 数据猿(20260625) | 苍何(20260625) | 新智元(20260626) | 新智元(20260630) | 新智元(20260705) | CVer(20260705) | AI有道(20260706) | 机器之心(20260709) | CVer(20260711) | MacTalk(20260713) | CVer(20260713) | 人工智能学家(20260714) | 新智元(20260719) | 深度学习与NLP(20260626)
基准作弊与真实性危机
- 系统性刷榜作弊:Cursor实锤SWE-bench偷看答案,Claude Opus断网后成绩暴跌14%
- 作弊路径溯源:57%靠公开PR复现,9%挖Git历史,仅34%为真正独立推导
- 裁判系统缺陷:大模型作裁判超23%评分不一致,TrustJudge用概率分布降传递性错误
- 物理常识缺陷:53个模型“洗车难题”翻车率超80%;微小干扰致准确率骤降至33.8%
能力天花板与认知暗物质
- 工程能力缺失:从零构建软件完成率为0%,真实碎片化场景任务解决率仅14.5%
- 认知暗物质:能通过律考但在生成合法国际象棋残局等任务上系统性失败,缺元认知
- AI科研鸿沟:Coding成功率超88%,但科研任务完成率仅约3%,缺原创可证伪假说力
Scaling Law反思与架构演进
- 原始定律存缺陷:固定Token量致误判,余弦学习率衰减人为制造性能及算力错配天花板
- 翁荔审慎反思:翁荔博客指规模扩张非万能解,需评估其对不同能力维度的非均匀效果
- 四大核心短板:回报放缓,当前AI存在持续学习、记忆系统、长期规划、一致性缺口
- 新架构探索:Transformer的O(n²)缺陷凸显,正探索Heuristic Learning与神经计算机
科学突破与自改进风险
- 攻克未解猜想:推翻埃尔德什平面单位距离猜想,改进斯坦纳比下界并获Lean验证
- 自主工作跨越:AI可靠独立工作时长从2022年30秒增至2026年12小时,预计年底破百
- 递归自改进瓶颈:AI参与研发使效率提升20-30%,但复合误差致99.9%准确率跌至60.5%
从优化到均衡:AI需要经济学的核心论点
DeepTech深科技(20260622) | AI信息Gap(20260718) | 人工智能学家(20260719)
- 经验学习是核心出路:AI须从智能体与世界的第一视角交互中持续获取数据,通过奖励信号实现持续学习与事实验证
- 强化学习(RL)升格:作为经验学习的数学起点,RL正从AI子领域走向AGI核心范式
- 智能的科学重塑:智能是通过行为适应实现目标的能力,须建立统一人类、动物和机器心智的综合性心智科学
- 修正《Bitter Lesson》:算力路线已遇数据天花板,AI须转向AlphaGo式的经验学习
- Oak Lab落地布局:Sutton创办该实验室,目标研发20W功耗的万亿参数实时学习与规划智能体
范式转换对比
| 维度 | 人类数据时代(当前) | 经验时代(未来) |
|---|---|---|
| 数据来源 | 人类标注、文本、专家微调 | 智能体第一视角与世界交互 |
| 学习信号 | 模仿人类行为 | 奖励信号(行为好坏有反馈) |
| 事实判断 | 无法区分真假 | 可通过经验验证预测对错 |
| 知识创造 | 仅转移已有知识 | 自主发现新知识 |
模型缺陷与不确定性
- 缺乏不确定性感知:AlphaFold在知识边缘给出看似确定但偏离实验的答案且无误差棒
- 三类不确定性:抽样(加数据可消)、信息不对称(博弈范畴)、来源(旧数据即使置信也应谨慎)
- 实证支撑经验学习:AlphaGo自我对弈、AlphaProof国际奥数、婴幼儿玩玩具均为主动采集数据的天然范式
优化与均衡范式对比
| 维度 | 优化范式(当前AI) | 均衡范式(Jordan主张) |
|---|---|---|
| 目标 | 单一目标函数最小化误差 | 多参与者利益协调 |
| 假设 | 存在全局最优解 | 纳什均衡(无人能单方面改善) |
| 适用 | 模型训练与预测 | 市场设计、监管、数据治理 |
- 机制设计不可或缺:仅靠统计模型无法阻止劣药,须在机制层面激励药企只提交有信心的药物
- 数据价值分配失衡:AI基建由前代研究者建立,但数据创造者未获回报,产业正放大结构性不公
- 下一代研究框架:计算、推断与经济思维的三角交汇,是Jordan所称的这个时代的博雅教育
大模型重塑推荐系统:从价值观推理到端到端生成式架构
架构演进:从级联到端到端生成式
- 召排一体:京东GRAM整合级联架构至统一模型,实现意图到物料的端到端对齐
- 技术栈重构:快手生成式推荐形成OneReason+Pool-Rec+OneSearch完整系统底座
- 推理范式:OneReason通过四步CoT(感知→推导→演化→决策)反推兴趣
工程优化与极致性能
| 维度 | 技术方案 | 核心数据与收益 |
|---|---|---|
| 推理时延 | 京东PD分离+多级缓存+概率空间裁剪 | 稳定在50ms以内 |
| 知识查询 | 京东十二大类零售知识体系 | 千万级数据规模5ms完成 |
| 算力池化 | 快手Pool-Rec多AZ级统一管理 | 多可用区CPU/GPU统一调度 |
| 蒸馏部署 | 快手大模型推理结果作监督信号 | 离线准确率达85%+,全量覆盖 |
效果验证与商业化突破
- 推理增益:OneReason Benchmark的thinking模式Pass@4平均领先13.45%
- 广告转化:OneReason在本地生活广告10天A/B实验中ROI超5
- 价值观建模:清华×快手覆盖650万+视频推理价值观,填补显式建模空白
- 五维增长:快手主站实验验证带动APP时长、打赏、电商GMV等同步正向增长
- 动态对齐:从双模态扩展至n层高维对齐,融合视频、图像及满减等促销规则
BiKT:GNN-MLP 双向知识转移框架(TPAMI 2026)
GNN双向知识转移(BiKT)
- 核心痛点:GNN中特征传播严重干扰特征变换,导致关键信息丢失
- 退化验证:GNN去掉传播即退化为MLP,证明变换操作是独立的表示学习器
- 架构设计:BiKT构建GNN与衍生MLP的双向知识转移通道,实现双向特征互补
- 渐进继承:循环训练直接继承对方参数初始化,促进深度知识流动并防遗忘
- 知识注入机制:MLP向GNN注入纯特征建模,GNN向MLP注入拓扑偏置
- 技术手段:均采用分布正则化,GNN向MLP附加KL散度蒸馏
- 防崩溃机制:利用条件生成器拟合分布,引入mode-seeking正则化防模式崩溃
- 性能提升:在7个数据集5种架构上提升0.5%-6.86%(Citeseer上MixHop达6.86%)
- 推理加速:MLP获知识后推理提速20-100倍,仅增2-5倍一次性训练开销
- 理论支撑:基于域适应视角提供严格泛化证明,发表于IEEE TPAMI 2026
Agent Loops范式之争
- 范式共识:OpenAI等巨头均押注Agent Loop为核心,但代码质量与热度存落差
- 成本论证:创造者称每小时成本仅10美元且质量优于人力,瓶颈在工程纪律
- 反方质疑:Sentry开发者称AI生成代码仍差,无证据表明可提升抽象层次
- 安全硬约束:Agent会翻找高权限令牌,只能靠基础设施约束不能指望道德感
- 最终共识:双方认同需人类监督,分歧仅在介入频率;Loops重定义介入粒度
Meta神经网络计算机:计算/存储/I/O统一架构范式
- 概念提出:Meta AI联合KAUST提出神经网络计算机(NC),将视频生成模型改造为统一计算、存储与I/O的完整计算系统,打破传统软硬件分离架构
- 基础机制:基于Wan2.1模型构建原型,吸收用户键鼠的屏幕像素与动作信号更新隐式状态,据此渲染下一帧画面,实现计算与存储统一于单一权重
四类计算系统范式对比
| 维度 | 传统计算机 | AI智能体 | 世界模型 | 神经计算机 |
|---|---|---|---|---|
| 计算方式 | CPU执行指令 | 操作外部软件 | 预测环境变化 | 统一计算/存储/I/O |
| 状态管理 | 内存+硬盘 | 依赖宿主OS | 不保留运行状态 | 隐式状态即工作内存 |
| 容错性 | 偏差即崩溃 | 依赖外部系统 | 仅预测 | 天生容忍噪音 |
实验验证与关键发现
- 命令行渲染:13像素字体极高清晰度;原生算术准确率仅个位数,隐式喂入答案后飙升至83%
- 光标控制飞跃:视觉遮罩参考画面准确率达98.7%(远超纯坐标学习<10%、复杂特征转换~13%)
- 数据质量>数量:110小时目标导向数据彻底超越上千小时随意操作数据
- 深层注入优于浅层:动作信息深层注入在画面一致性和动作响应上全面优于浅层注入
核心洞察
- 渲染器本质:NC擅长视觉重建而非逻辑运算,学会了“看起来对”而非“算得对”
- 视觉监督是关键:显式视觉监督让模型以视觉实体而非抽象坐标理解UI元素
- 长远目标CNC:完全神经计算机需跨越通用编程和状态持久化门槛,用户操作轨迹直接成为重塑模型内部结构的“代码”
2.2 Agent与系统可靠性及垂直领域评测
评测基准创新与自适应评估范式
机器之心(20260330) | 机器之心(20260401) | PaperWeekly(20260407) | 新智元(20260424) | AI科技评论(20260508) | 新智元(20260413) | 机器之心(20260531) | 机器之心(20260610) | PaperAgent(20260611) | 机器之心(20260611) | CVer(20260608) | 百度文心(20260617) | 机器之心(20260530) | 硅星人Pro(20260620) | PaperAgent(20260622) | 量子位(20260624) | 极市平台(20260629) | AI前线(20260701) | 新智元(20260710) | 腾讯混元(20260501) | PaperAgent(20260609) | 量子位(20260727) | PaperWeekly(20260728) | 机器之心(20260729)
- 应用生成:HTML交互应用GPT-5.2通过率45.46%,人机一致率92.4%(MiniAppBench)
- 真实复杂语境:高噪声生活场景解决率仅22.2%,需澄清式检索(CL-Bench Life)
- 因果思维:30个前沿模型无一通过75%获胜线,Claude-Opus-4.5最高仅68.0%(CausalGame)
- 因果独立性:与LLM Arena等主流benchmark相关性均低于0.35(CausalGame)
评估范式与情商测度演进
- 评估范式演进:转向诊断失败根因与推理过程(TRM达88.6%),采用闭卷交互协议避污染
- 主动交互评估:北大首创PAUC量化及时性,中科大DeepResearch Bench解构9430条rubric
- 填补情商短板:SoMBench拆解3大维度、71项任务及3481实例精准测度懂人能力
Zing模型:结构化训练突破参数规模
- 多模态以小博大:Zing-27B综合均值79.80超越GPT-5.5(78.44),HiToM达82.00
- 文本与情感优势:Zing-32B文本均值76.14持平DeepSeek-V4-Pro,EmoBench领先5.37pp
- 高阶信念推理:Zing-8B三阶67.50%、四阶65.83%,远超基线(45.83% / 43.75%)
- 数据飞轮定位:FLARE数据飞轮精准定位认知短板并合成针对性样本
- 两阶段训练:Mixed-Reward GRPO实现通用基础到专项强化的平滑过渡
- 防遗忘机制:OPD在线蒸馏引入教师模型token级分布约束,诊断与评测严格隔离
Actio部署框架
- 编排核心:以Harness为编排核心,按需动态激活四大功能模块
- 心理社交技能:PRISM模块内嵌76项核心心理社交应对技能
- 心智状态记录:Starling Memory精准记录并维护多智能体交互状态
- 推理经验沉淀:SAGE模块负责复杂社会推理经验的累积与沉淀
- 社会文化检索:Gated RAG模块实现高度依赖文化背景的社会规范知识检索
2.3 模型内部机制与可解释性
注意力汇聚机制与内部表征引导
量子位(20260331) | 机器之心(20260423) | CVer(20260507) | CVer(20260406) | 机器之心(20260510) | PaperAgent(20260526) | 机器之心(20260629) | CVer(20260429) | 机器之心(20260430) | 量子位(20260430) | 深度学习与NLP(20260502) | 量子位(20260503)
- Attention Sink 现象:Transformer 固有缺陷,注意力被迫集中到首个 Token 等无信息量位置,可引发幻觉(清华等 180+ 篇综述)
- Sink 三阶段演进:被动保留(KV Cache 锚点)→ 主动重分配 → 策略性消除,呈现清晰技术演进轨迹
- SEKA 前置干预:注意力计算前对 Key 向量做频谱分解引导,CounterFact 准确率从 30-50% 提升至近 99%,延迟仅增 0.03s
- HiLight 输入侧引导:轻量模型零标注插入高亮标签,使序列推荐性能提升 27%,缓解 Lost in the Middle 问题
- 注意力即检索(INTRA):证明交叉注意力与检索是同一数学操作,仅 164K 参数即全面超越 BGE 等外部 RAG 方案
Transformer 架构纠偏与层间分配
- 锥形容量分配:FFN 宽度沿深度余弦递减(前段 1.5 倍、后段 0.5 倍),零额外算力使 440M 模型困惑度降至 14.44
- 深层冗余归因:GPT-2 后段层多在“重复强调”而非创新理解,证明均匀分配参数非最优解
- PMDformer 尺度纠偏:非平稳时序中 Patch 均值偏差掩盖形状相似性,通过简单减法解耦,复杂度降至 O(C²)
- 跨模态对齐突破:Hedgehog 特征映射解决线性注意力秩坍塌;TS-Attn 实现即插即用的免训练时序注意力调制
模型内部表征与泛化能力探源
- Talkie-1930 复古实验:仅用 1931 年前 2600 亿 token 训练的 13B 模型,从未见过编程语言却能解出 HumanEval 题
- 核心智能洞察:核心推理能力不依赖现代互联网数据,本质智能源于语言结构抽象的泛化
- 互联网数据价值边际:同等微调下(75K 条),1930 模型与现代模型在 SWE-bench 上仅差 1%(4.5% vs 5.5%)
- 能力激发关键杠杆:历史模型经 250 个样本微调即具备真实编程推理能力,证明后训练是能力激发的关键杠杆
大模型电路发现的「唯一机制」假说证伪
- 核心结论:机制可解释性领域「功能各向异性假说」(同一任务对应唯一电路)被实验与理论双重证伪
三层递进证伪实验
- 多条等价电路并存:IOI 任务两条 sheaf 准确率均达 100%,IoU 仅 4.1%(96/2351 边),逼近随机重合下限
- 交集持续萎缩:反复发现 20 条 sheaf,全局互 IoU 仅 0.15%,不存在收敛的「核心机制」
- 核心电路可绕过:交集提取的 3 边 sheaf 准确率达 86.7%,全部禁用后模型仍找到替代路径
跨主流 CSD 方法复现:非唯一性是普遍现象
| 方法 | 设计哲学 | 非唯一性表现 |
|---|---|---|
| ACDC | 启发式逐边删除 | 仅改变遍历顺序即产生结构差异巨大的电路 |
| EAP | 一阶梯度归因 | 替换任务无关名称(John→Alice)后 IoU 系统性下降 |
| EP | 梯度优化剪枝 | KL散度换为任务损失后同样出现高度不一致性 |
OASR 方法与理论必然性
- OASR:对已选边施加激活惩罚,迫使优化器寻找结构不同但功能等价的替代电路
- 五步理论证明:线性化→组合爆炸→鸽巢原理→填充论证→标签保持,证明非唯一性是必然
- 组合爆炸机制:s 条边电路有 C(|E|, s) 种组合,远超有限量化读取空间,必存在等价子集
关键洞察
- 分布式计算本质:同一功能可由无数结构迥异路径实现,「唯一机制」是研究者的主观投射
- 电路发现的价值:在于刻画功能等价空间,而非宣称单一电路为「任务的支撑机制」
- 评测体系需重构:当前以与「ground-truth 电路吻合度」为标准的评测体系建立在已证伪假说之上
2.4 模型训练新范式与架构设计
训练范式创新:高效数据筛选与SFT「不完全学习」归因
新智元(20260416) | 机器之心(20260514) | 新智元(20260519) | 新智元(20260521) | 机器之心(20260530) | PaperAgent(20260530) | 机器之心(20260604) | PaperAgent(20260607) | 机器之心(20260613) | PaperWeekly(20260622) | 量子位(20260627) | 机器之心(20260628) | InfoQ(20260701) | 量子位(20260704) | 极市平台(20260708) | 机器之心(20260709) | PaperAgent(20260713) | AI科技评论(20260717) | CVer(20260722) | AI前线(20260702) | 量子位(20260725) | PaperWeekly(20260728)
- 多模态与算法修复:VisNec量化图文损失差,仅15%数据追平全量;南洋理工增大Batch提升梯度信噪比,修复筛选失效并提升准确率5.49%
- 因果级溯源:北大与智源发现约10%样本贡献50%影响力,重复结构数据是关键催化剂
ILP「不完全学习」机制与归因
- 现象与标准:混元证实ILP平均比例15.3%且跨规模无一例外;建立开源benchmark,将pass@5检测嵌入SFT,类比软件单元测试
- 闭环与根因:Detect→Attribute→Intervene→Verify四步闭环;五大根因为知识缺失、推理复杂、数据冲突、指令模糊、容量瓶颈
- 干预与未知探索:CPT补充知识效果远超增加epoch;MC转换+pass@5可将SFT未学习率从15%降至4.2%;剩余3%未学习样本需多根因并行修复
- 跨范式应用:ILP框架可推广至RLHF/DPO偏好检测及多模态对齐,亦可作为红队测试前置筛选工具
免验证集过拟合诊断(LAR)
- 核心方法:LAR通过分析输出投影矩阵权重谱与激活谱的重叠程度,在不依赖验证集前提下监测泛化状态
- 计算与优势:仅需矩阵范数无需完整SVD;稳定秩与有效秩区分度弱,LAR在Adam和Muon优化器下均表现最优
- 小模型验证:12类算法任务成功追踪记忆→Grokking→泛化过程,成功泛化模型LAR显著更高
- 大模型验证:10个3B模型预训练中,过拟合前LAR下降斜率显著陡峭,LAR差分与泛化差距曲线形状相近
- 优化器差异:Adam过拟合前激活谱先分散,Muon下权重谱和激活谱同时扩散
持续学习与参数高效微调
- 架构突破:伯克利FST数据效率达传统RL 3倍且KL散度低70%,发现通用遗忘根因是几何结构被破坏
- PEFT防遗忘:Janus-LoRA双面解耦隔离新旧梯度;KORE以不到1/3参数实现动态知识注入
- 自蒸馏改进:d-OPSD弃静态参考解使训练步数降至RL的1/10;DeepSeek提出L1-L5自主分级持续改进
核心趋势信号
AI演进与数据范式
- 蒸馏地球获取增量:AI4Science竞争焦点转向通向自然的API,从物理实验获取未被记录的新数据
- 实验室在环数据飞轮:实验产生数据训练模型指导实验,需从首日建立全维度数据协议(含失败归因)
- 失败轨迹数据金矿:论文选择性偏差仅记成功,但失败数据对强化学习与模型迭代至关重要
- 假说生成验证鸿沟:生成成本趋零(48h批量产出),瓶颈转移至实验验证(月至年),限制变为验证不过来
- 科研Agent重塑流程:从研究对象变为核心,重新定义科研组织方式,如AI仅48小时复现十年耐药机制
- 科学家角色重塑:从假设提出者转向筛选与验证者,核心竞争力在于设计高效验证方案
- 贡献与评测体系冲击:科学贡献从谁先提出转向谁验证了什么,防数据泄漏与弱基线成为评测关键
- AI假设生成核心风险:看似合理但缺乏物理直觉,低质量假设加剧可重复性危机
- AGI终极检验标准:提出人类未问过的问题并亲手验证;理解世界运转需在物理世界试错循环中长出
模型架构与交互变革
- 全双工实时交互:成为未来重点,底层架构需原生支持实时响应
- 可测性审计鸿沟:执行与生成成本趋零时,人类验证与审计能力成为递归自我改进的硬约束
- 扩散模型价值边界:核心价值在支持迭代修改范式而非并行解码效率
- 任意顺序解码困境:面临效率提升与迭代修改灵活性之间的取舍陷阱
- 连续空间扩散突破:有效突破离散token限制(代表:MIT ELF架构)
- 均匀状态扩散探索:探索新型语言建模范式(代表:Google DiffusionGemma)
具身智能与垂直应用
- 具身科学家能力模型:①原子操作(依赖真实交互)②长程任务(误差累积需第一视角数据)③跨空间协作
- 实验室优先落地:标准化动作空间有限(约70类原子任务),通用AI科学家比家庭机器人更早实现
- 机器人信任新范式:核心目标从避免碰撞延伸至建立信任,关键指标转向人类是否感到舒适
- AI重塑金融结构:推理模型与Agent重塑Alpha研究与市场微观结构,AI Native为核心落地方向
JEPA表征坍塌:从VICReg到SIGReg的约束粒度升级
表征坍塌本质
- SSL目标函数在坍塌状态下即可达低损失,模型将不同输入映射到相同向量,表征无判别力
- 根本原因:模型缺乏保持表征多样性的内在约束,非工程问题而是目标函数设计问题
防坍塌方法演进对比
| 方法类型 | 核心机制 | 关键局限 |
|---|---|---|
| 启发式技巧(SimSiam/BYOL) | EMA、停止梯度、教师-学生网络 | 训练脆弱、难调参、可解释性差 |
| VICReg | 方差+不变性+协方差三项约束 | 仅刻画二阶统计量,无法区分分布形状 |
| SIGReg | Cramér–Wold定理+sketching对齐标准高斯 | 约束完整分布形状,计算开销与扩展性待验证 |
SIGReg理论突破
- 基于Cramér–Wold定理:通过足够多的一维投影可唯一确定多维分布
- 将嵌入分布对齐到标准高斯,从二阶统计约束升级为全分布约束
- 正则化路线(VICReg/SIGReg)相比启发式路线具更好可解释性与可扩展性,更适合大规模训练
背景:JEPA(Joint Embedding Predictive Architecture)是LeCun自2017年起倡导的SSL架构,通过预测潜在空间表征学习世界模型;表征坍塌是SSL从理论到规模化的核心瓶颈
2.5 持续学习与灾难性遗忘:大模型的「睡眠」框架
「清醒—睡眠—做梦」三阶段持续学习框架
- 三阶段循环框架:Google Ali Behrouz 团队提出“Language Models Need Sleep”,构建清醒(使用)→睡眠(知识固化)→做梦(自生成数据训练)循环,解决大模型无法从经验中积累长期知识的问题
- 记忆体系差异:
| 记忆类型 | 存储位置 | 核心特征 |
|---|---|---|
| 上下文记忆 | 对话窗口 | 临时便签,移出即失效 |
| 外部记忆 | 数据库/RAG | 可调取但未内化为能力 |
| 参数化知识 | 模型权重 | 稳定但更新代价高 |
- 灾难性遗忘根源:模型参数高度耦合,同一组参数承担多种任务;修改参数学新知识必然波及旧能力,导致稳定性与可塑性难以兼顾
- Knowledge Seeding(知识播种):将已掌握新知识的模型状态作为教师,迁移到更大容量模型中;新增参数容纳新知识,原参数保持稳定——类似为模型增加新页面而非反复覆盖
- 做梦机制与风险:模型围绕近期知识自主生成合成训练数据进行自我训练;初始理解错误会导致自生成数据固化偏差,需配套外部验证、奖励评估和版本回滚
- 产品形态重构:从集中生产→固定版本→使用,转变为使用→睡眠更新→再使用的循环;评价标准需新增学到什么、是否遗忘旧能力、错误更新能否撤销等长期指标
- 隐私挑战:进入参数的信息难以准确定位和删除,用户要求遗忘时系统需判断该信息是否已影响核心能力
- 关键洞察:参数隔离比参数更新更关键;持续学习将催生模型运维(ModelOps)新范式,需建立完整的版本管理、变更追踪、回滚和审计体系
EMGD:面向并行持续学习的弹性多梯度下降框架(TPAMI 2026)
- 核心贡献:天津大学提出 EMGD(Elastic Multi-Gradient Descent),首次将并行持续学习(PCL)建模为动态多目标优化问题,统一解决梯度冲突与灾难性遗忘
- PCL 范式定位:介于多任务学习(MTL)与串行持续学习(SCL)之间,任务任意时刻动态到达、并行训练,同时继承干扰与遗忘两大挑战
| 学习范式 | 任务到达 | 训练方式 | 核心挑战 |
|---|---|---|---|
| MTL | 全部预给定 | 同时训练 | 任务间干扰 |
| SCL | 严格串行 | 逐个完成 | 灾难性遗忘 |
| PCL | 任意动态到达 | 与已有任务并行 | 冲突+遗忘并存 |
- 弹性因子设计:针对传统 MGDA 在 PCL 中因梯度不平衡导致更新停滞的问题,引入任务特定弹性因子,按梯度幅度(GMC)或梯度关系(GS)动态调节约束强度
- 梯度引导记忆编辑:利用 Pareto 下降方向编辑 rehearsal memory 样本,使记忆回放从被动"保存-重放"转变为主动消解新旧任务优化冲突
- 理论保证:证明 EMGD 累积更新点具有 Pareto critical 性质,提供比启发式任务平衡更严格的优化理论支撑
- 实验验证:在 PS-EMNIST(5任务)、PS-CIFAR-100(20任务)、PS-ImageNet-TINY(20任务)的 task-incremental 和 class-incremental 设置下均优于 MTL、SCL 及现有 PCL 方法
- 发表信息:发表于 TPAMI(IF 18.6,CCF-A),合作机构包括巴塞罗那自治大学 CVC、腾讯、中科院自动化所
2.6 北大忆阻器神经动力学芯片:可控存内计算范式
可控存内计算芯片:从器件物理到神经动力学
- 北大开创可控存内计算:杨玉超团队登《Science》,将PCM电导漂移从缺陷转化为原位步长搜索资源,解决神经动力学系统高精度与低延迟不可兼得的瓶颈
- 极致能效跃升:单步运算压缩至2.12ms,较ASIC提速3.8-36.3倍、降耗11.8-24.7倍,较A100 GPU最高加速478倍
- 硬件架构突破:40nm工艺,核心面积0.28mm²,彻底省去传统RK积分的读写与乘法电路,打破存储墙
- 端到端高保真验证:脑皮层重建延迟仅426.31ms(传统GPU需8720s+),有效抑制伪影
南开人造听觉神经接口
- 仿生突触模拟:徐文涛团队于《Nature Materials》发布全球首款人造听觉神经,利用400nm氧化钨纳米线的质子可逆插脱实现突触可塑性
- 极致器件寿命:经历160万次脉冲后电导窗口依然稳定(兴奋67μA/抑制3.64μA),保障长效稳定感知
- 多维空间感知:8×8阵列结合侧向抑制机制,覆盖20Hz-20kHz全频段,基于到达时间差实现3D声源定位(准确率>95%)
- 语义级分辨力:信号处理具频率与历史依赖性,“星星”vs“猩猩”电流差异达30%(59μA vs 89μA),突破传统频率映射
- 跨病损通路重建:活体实验成功跨接兔子坐骨神经,但尚无灵长类数据,距临床仍有距离
物理计算生成范式:耦合振子替代神经网络层
- 物理计算替代神经网络:Un-0 由前 Databricks AI 负责人 Naveen Rao 创办,首次用大规模耦合振子(Kuramoto 模型)替代传统神经网络层
- 绕过冯·诺依曼瓶颈:核心赌注是将计算与记忆合为同一物理实体,绕过内存搬运瓶颈,理论上有望降低 AI 推理能耗 1000 倍,目前仍依赖 GPU 软件模拟
- 可学习参数定义物理系统:通过耦合矩阵 K 与自然频率 ω 定义系统,配合自研「漂移损失」与 DINOv2 特征提取进行端到端反推优化
- 与扩散模型的核心差异:扩散模型需显式指导动力系统演化,Un-0 仅评估最终样本质量,通过损失函数反推优化整个物理系统
五步生成流程:随机初始化相位 → 注入类别标签 → 物理动力学自组织演化 → 快照捕捉相位网格 → 轻量解码器渲染像素(<13% 参数量)
性能基准数据:
| 数据集 | 振子数 | 总参数 | FID | 训练算力 |
|---|---|---|---|---|
| CIFAR-10 | 8192 | ~1.6亿 | 持续改善 | 20 B200h |
| ImageNet 64×64 | 16384 | ~3.22亿 | 6.74 | 640 B200h |
- 当前性能定位:FID 6.74 接近早期模型(DCGAN、iDDPM),落后最新前沿(EDM、GDD);振子数增加时 FID 持续改善未见饱和
- 范式意义:作为物理计算路线的「Hello World」,首次验证物理系统替代数字计算执行 AI 原语的可行性,待专用硬件验证能效远景
2.7 大模型空间推理能力边界与材料科学基准
AtomWorld:首个晶体结构操作基准揭示大模型空间能力短板
基准定位:AtomWorld由中科大等联合发布(ICML 2026),首个系统量化大模型在原子级结构操作能力的评测基准
评测机制:采样原子结构交由模型操作,采用pymatgen StructureMatcher进行量化对比,专注空间操作而非理论辨析
顶级模型集体翻车:Claude Opus 4.6绕原子旋转成功率仅约12%,GPT-5.4、Gemini 3.1 Pro等均表现不佳
规模 Scaling 的能力边界:扩大模型规模对规则清晰任务提升显著,对三维空间依赖型任务提升不稳定
| 任务类型 | 规模扩大效果 | 典型任务 |
|---|---|---|
| 规则清晰、可模板化 | 显著提升 | 原子替换、删除、移动 |
| 三维空间依赖型 | 提升不稳定 | 绕原子旋转、区域删除、扩超胞 |
Qwen规模对比:4B升至32B时原子换/删/移动成功率显著提高,但几何误差非必然下降
核心结论:语言理解能力≠物理空间操作能力,单纯扩大模型规模无法稳定解决三维操作瓶颈
工具外挂局限:pymatgen等外部工具仅提升坐标计算类任务,无法替代模型完成原子归属判定等核心空间决策
Action Scaling新方向:强操作任务需从Language Scaling转向Action Scaling(含动作数据生成、基元拆解、模拟器反馈与纠错)
当前数据瓶颈:公开数据极度缺少高质量的“操作指令—坐标变化”成对训练样本
2.8 中国科协2026十大前沿科学问题
计算范式拐点与前沿方向全景
- 概况:中国科协发布10大前沿科学问题,覆盖数学、物理、计算、通信、生物医学等六大领域,折射底层原理重塑的战略方向
十大问题全景
| 领域 | 前沿问题 | 核心挑战 | 战略价值 |
|---|---|---|---|
| 数学 | Hodge猜想 | 拓扑自由度与代数刚性统一 | 重塑代数几何与数论疆域,与BSD猜想交叉验证 |
| 物理 | 磁约束核聚变 | 燃烧等离子体长时间稳定高约束 | 直接推动聚变能商业化 |
| 材料 | 电解液微环境 | 离子配位环境演化机制 | 颠覆稀溶液电化学基础理论 |
| 计算 | 类生物计算 | 「简单节点+复杂连接」替代存算分离 | 成熟工艺实现3-5个数量级能效提升 |
| 智能 | 具身智能度量 | 从「任务表现经验」转向「能力结构科学」 | 为自动驾驶、人形机器人准入监管提供依据 |
| 通信 | AI+6G | 以「语义信息论」重构移动通信底层范式 | 通信与AI从相加走向相乘,上升至大国博弈 |
| 神经 | 阿尔兹海默症 | 恢复脑类淋巴循环「排污系统」 | 突破神经元中心论,避开炎症风暴 |
| 生物 | 类器官芯片 | 动物源性向人源性微环境转变 | 破除国外垄断,形成千亿级精准医疗 |
关键洞察
- 弱工艺依赖:类生物计算强调以介观网络为载体,折射芯片制造受限下寻求替代路线的战略意图
- 范式天花板:计算与智能类问题共同指向冯·诺依曼架构与任务驱动评估范式已触及天花板
- 数学根基回归:Hodge猜想置于首位,暗示决策层对数学基础研究战略价值的重新认知,数学是下游技术变革根基
2.9 类脑智能与大脑演化约束
大脑帕累托最优假说:次优性、精神疾病与类脑AI启示
- 大脑非单一目标最优:布线成本可被人工算法进一步降低,通信效率也有更优配置,但在多目标帕累托前沿上找到“足够好”的解
- 次优性源于三重约束:演化历史包袱(如脊椎动物视网膜倒置、盲点)、多目标冲突(成本vs效率)、发育与环境限制
帕累托权衡的核心证据
| 权衡维度 | 最小化方案 | 大脑实际选择 | 证据 |
|---|---|---|---|
| 布线成本 | 人工算法更低 | 接受较高成本 | 代谢预算限制 |
| 通信效率 | 全连接最高效 | 长程捷径连接 | 小世界拓扑 |
| 权重偏好 | — | 效率优先于成本 | 跨物种一致(线虫→猕猴→人类) |
- 精神疾病的帕累托重构:非典型大脑不是偏离“理想模板”,而是同一权衡空间中不同权重的帕累托最优解
- 发育轨迹诊断价值高:约75%精神疾病在青春期结束前显现,病理动态轨迹比终点状态更具诊断与干预价值
类脑AI的航向修正
- 复制连接模式存在风险:基于灵长类大脑连接实例化的RNN在工作记忆任务中表现未优于随机网络,盲目仿脑易复制演化包袱
- 选择性借鉴策略:构建AI自身独有的权衡景观,仅借鉴解决共性问题的生物方案,过滤掉无独立功能的副产物(“拱肩”)
- 算力约束催生新架构:端侧模型受算力限制,显式纳入该约束可能催生在有限计算预算下表现更优的新型网络架构
- 欧洲正加码类脑研究:德国联邦教研部已向11个神经生物学启发式AI项目投入约1000万欧元
- 轨迹比状态更重要:无论生物发育还是AI训练,通向当前状态的动态路径蕴含的信息远多于终点快照
2.10 生成式智能传输:智传网(AI Flow)与语义通信范式革命
智传网(AI Flow):从比特搬运到语义重建的通信范式跃迁
- 核心突破:中国电信 TeleAI 智传网(AI Flow)获 WAIC 2025 SAIL 奖,将语音通话码率压至 0.266 kbps(传统 VoLTE 约 15 kbps),1080P/24FPS 视频仅需 <100 kbps(传统约 3.6 Mbps),带宽占用降至 3%
- 范式转换:传输对象从「比特流」变为「词元流」,发送端用大模型提取语义特征编码为 Token,接收端用生成式模型重建音视频,实现「用计算换带宽」
传统通信 vs 智传网对比
| 维度 | 传统通信 | 智传网(AI Flow) |
|---|---|---|
| 传输对象 | 比特流(原始信号) | 词元流(语义 Token) |
| 压缩思路 | 有损压缩,丢弃细节 | 用计算换带宽,AI 重建 |
| 语音码率 | 5.9–128 kbps | 0.266 kbps |
| 1080P视频 | ~3.6 Mbps | <100 kbps |
- 理论地基:基于信容理论(揭示计算、通信与存储可相互折叠换算)与正激励噪声理论(任务相关噪声反而降低复杂度),突破香农信息论的符号层物理瓶颈,贯通语义层与效用层
- 极端环境验证:实现无人机直连卫星 60kbps 实时回传 720P、机器人远程遥操作端到端时延 20ms、水下声学通信 10 米稳定回传 720P(均为国内首次)
- 规模化落地三场景:应急救援(31 省千余套)、视频存储(1 亿路摄像头,存储空间降至 1/40)、隐私保护(传输阶段筛除敏感词元,覆盖约 400 万终端)
- 战略洞察:词元作为统一通信协议可跨天/空/地/海通用,不同厂商设备共享感知,通信标准化或从「比特协议」升级为「语义协议」
3. AI for Science 与交叉学科
3.1 AI 赋能生物医学
生命科学基础模型与药物发现
硅基观察Pro(20260330) | ScienceAI(20260403) | AI寒武纪(20260417) | 赛博禅心(20260417) | ScienceAI(20260418) | 新智元(20260418) | AIGC开放社区(20260421) | AI科技评论(20260421) | 机器之心(20260429) | 高飞的电子替身(20260503) | 新智元(20260503) | 新智元(20260503) | ScienceAI(20260504) | "Z Potentials"(20260506) | ScienceAI(20260508) | 人工智能学家(20260508) | 智东西(20260513) | DeepTech深科技(20260519) | DeepTech深科技(20260522) | DeepTech深科技(20260523) | ScienceAI(20260526) | DeepTech深科技(20260526) | 人工智能学家(20260529) | DeepTech深科技(20260530) | ScienceAI(20260603) | ScienceAI(20260604) | DeepTech深科技(20260605) | DeepTech深科技(20260607) | AI科技评论(20260609) | 智能涌现(20260610) | "财联社AI daily"(20260610) | DeepTech深科技(20260610) | "Z Finance"(20260616) | ScienceAI(20260616) | DeepTech深科技(20260616) | DeepTech深科技(20260616) | 通义大模型(20260618) | ScienceAI(20260618) | 量子位(20260619) | DeepTech深科技(20260620) | 量子位(20260622) | ScienceAI(20260623) | 机器之心(20260623) | DeepTech深科技(20260628) | ScienceAI(20260629) | "Z Potentials"(20260703) | 量子位(20260703) | 量子位(20260703) | ScienceAI(20260706) | 机器之心(20260706) | ScienceAI(20260707) | 新智元(20260708) | 量子位(20260710) | AI科技评论(20260710) | ScienceAI(20260710) | ScienceAI(20260710) | ScienceAI(20260714) | ScienceAI(20260715) | ScienceAI(20260717) | DeepTech深科技(20260717) | 机器之心(20260719) | DeepTech深科技(20260722) | ScienceAI(20260722) | DeepTech深科技(20260724) | 新智元(20260725) | 人工智能学家(20260726) | DeepTech深科技(20260727) | 量子位(20260728) | 深度学习与NLP(20260727)
预测模型与扰动图谱
- CellOS与RegVelo:CellOS预测能力超开源66%;RegVelo斑马鱼相关性达0.52
- UniPert-G2CP突破:首个解决化学扰动×细胞特异性响应难题,建立最大规模公开图谱(4994基因×7860化合物×5细胞系)
- 双模块跨模态映射:用密集CRISPR数据预训练迁移至稀疏化合物预测,首获ESR1耐药预测到机制解释闭环
- 腾讯AI演进脉络:scBERT→scPROTEIN→scTranslator→UniPert-G2CP,拟接入Agent并探索虚拟试药
生成式设计与蛋白质工程
- 基因组与分子设计:斯坦福Evo从零生成16个具真实杀菌力噬菌体基因组登Nature;ODesign通量升10倍达pM级亲和力
- AI定制基因编辑酶:诺奖团队与ESM3从零设计全新Cas蛋白,编辑精度超越自然CRISPR系统,破除“改氨基酸即失活”难题
- 迈入定制设计时代:基因编辑工具与全新蛋白设计迎来“AlphaFold时刻”,北大ProAR重建误差亦降7.5%
干湿闭环与临床提效
- 国家战略设施:美国NIH联合DOE投超12亿美元建虚拟细胞基础设施,目标5-10年将创新提速一倍
- 全自动实验室:Golab闭环催化活性达文献6倍;MOSAIC去中心化系统新化合物合成成功率71%
- 临床端极速提效:AI矫正使统计效力翻倍,罕见病排查耗时从110分钟大幅压缩至3分钟
行业瓶颈与再生元冷思考
- 反缩放与验证困境:获批靶点仅约700个且临床成功率降至8%,AI生成极快但物理验证受限,完全闭环未跑通
- 数据先天缺陷:生命科学数据存在维度不完备、负样本缺失、长尾分布等缺陷,严重制约模型泛化能力
- 再生元逆行哲学:坚守靶点发现与生物学基础优先于计算工具,数十年积累的时间维度差异化壁垒无法被AI快速复制
- 支付新范式探索:基因疗法Otarmeni向美国符合条件的患者免费提供,开创支付新路径
人大&微软 Arbor 自主科研框架
- Arbor:由中国人民大学 & 微软联合提出的自主科研 Agent 框架,能够自主完成文献调研、实验设计、代码编写、结果分析等完整科研流程
- 性能表现:在科研任务基准测试中,相较 Claude Code 性能提升约 150%
- 核心能力:自主规划研究路径、多轮迭代实验、自动生成研究报告,覆盖从 idea 到论文的全链路
- 定位:面向 AI for Science 场景,旨在让 Agent 像人类研究者一样独立开展科学研究
前沿生物成像与计算仿真平台
DeepTech深科技(20260718) | DeepTech深科技(20260718) | 量子位(20260721)
介观活体成像系统:清华RUSH3D-HR达亚细胞分辨率,视野较传统高NA显微镜扩大百倍,单次通量等同传统百次实验
核心光学算力:配自主“昆仑”物镜,每秒生超700亿体素,AI管线处理较传统提速千倍,完成协同去噪与重建
极限寿命成像:团队创EFLIM技术,将激发视为独立事件仅记录首光子时间,摒弃直方图拟合
低光子高信噪比:传统FLIM每像素需超3000光子,EFLIM均降至0.025-0.15(不足1),信噪比达17dB
自监督标定:基于稀疏数据时空信息自监督去噪,无需跨样本标签,经20万次真实激发定量标定偏差边界
针灸免疫可视化:首次活体记录针灸致脾脏免疫变化,发现0.5mA足三里电针使中性粒细胞群聚减少5倍以上
多场景与演进:已验证伤口愈合(追踪2万细胞轨迹)、急性肝衰竭及人脑胶质瘤无标记成像,正向具身智能Agent演进
科学发现平台:上海AI实验室发布「书生·端砚」,用AI构建虚拟生物系统在计算环境中预演真实实验
范式转换价值:在虚拟系统快速迭代假设,仅验证高置信度预测,突破“模型近人→周期长→验证少”的不可能三角
脑科学落地:基于斑马鱼构建全球首个脊椎动物数字脑,具备介观图谱约束的真实解剖学依据
闭环仿真体系:构建「脑-躯体-环境」全闭环数字仿真,确保神经网络连接基于真实解剖数据而非纯计算生成
斑马鱼优势:与人类基因同源性超70%,胚胎透明发育快,是脊椎动物中性价比最高的低成本实验模型
关键挑战与通用性:面临将鱼脑神经机制跨物种映射至哺乳动物的挑战,同步覆盖流体力学、材料与空天建立通用范式
科研计算与成像技术对比:
传统高NA显微镜:视野数百微米,依赖反卷积,每像素需超3000光子
RUSH3D-HR与EFLIM:视野扩大百倍,单光子级成像,AI处理提速千倍
传统实验范式:假设到实体修正周期长,小鼠以月计、猕猴以年计
书生·端砚平台:虚拟环境快速迭代试错,大幅压缩实体科研与验证成本
3.2 AI 赋能医学影像与视觉检测
医学影像与癌症诊疗 AI 基础模型前沿
ScienceAI(20260401) | 量子位(20260412) | ScienceAI(20260421) | ScienceAI(20260424) | ScienceAI(20260429) | 量子位(20260515) | AI科技评论(20260526) | CVer(20260602) | ScienceAI(20260630) | CVer(20260630) | CVer(20260703) | 机器之心(20260708) | CVer(20260412) | CVer(20260710) | CVer(20260720) | CVer(20260420)
- 跨模态融合与视觉语言基础模型:HorusEye肺栓塞检出率升至80.0%肝肿瘤93.3%;MedP-CLIP框提示准确率79.37%;UniMedVL理解均分67.47;超声数据集US-365K边缘识别84.44%;FPaCo解决长尾与语义幻觉
- 少样本推理与高效学习:PRET覆盖18种癌症23项中15项AUC超97%;Meta-encoder冻结参数仅训MLP;DIQ仅1%微调数据即超越全量训练效果
- 手术视频与可验证诊断推理:SurgMotion为首个十亿参数手术视频V-JEPA模型,17项核心任务均升16.5%;CX-Mind白盒推理23数据集均升25.1%,多病共存诊断升63.5%
- 肿瘤治疗规划与基因组解读:CLARITY单次模拟比千步Diffusion快约113倍,乳腺癌F1达53.9%;AI-CURA变异判读ClinGen一致率96.0%,70%冲突变异明确分类
- 治理挑战与范式演进:CoT与强化学习驱动的白盒模型在FDA审查具结构性优势;多模型协同推理延迟大且受限于数据异质性,当前难支撑实时临床决策
- MVAA 2026挑战赛:MICCAI 2026首个统一心脏CT、3D TEE与术中视频二尖瓣分析挑战赛,含术前CT(30例)、超声瓣叶(20例)、术中视频(48帧)分割任务,采用DSC/HD/ASD独立评测
- 跨模态一致建模:要求算法在CT、超声、视频三种噪声与空间尺度迥异数据上保持一致,贴近真实临床工作流;允许外部数据与预训练,基线开源GitHub(db0725/MVAA)及Codabench评测
- 赛事时间与激励:2026-04-15发数据,6月开验证,8月1日截止提交,MICCAI 2026公布结果;Top 10获口头报告,鼓励扩展投稿IEEE TBME特刊
3.3 AI 赋能临床诊断与无创监测
AI 临床诊断、无创监测与脑机接口突破
ScienceAI(20260330) | DeepTech深科技(20260330) | DeepTech深科技(20260330) | 新智元(20260401) | APPSO(20260406) | DeepTech深科技(20260401) | DeepTech深科技(20260422) | 钛媒体AGI(20260430) | DeepTech深科技(20260504) | 新智元(20260504) | AIGC开放社区(20260507) | 人工智能学家(20260510) | DeepTech深科技(20260526) | DeepTech深科技(20260603) | DeepTech深科技(20260609) | DeepTech深科技(20260614) | DeepTech深科技(20260615) | DeepTech深科技(20260623) | ScienceAI(20260625) | 机器之心(20260630) | AI寒武纪(20260630) | 人工智能学家(20260702) | 人工智能学家(20260717) | DeepTech深科技(20260719) | CVer(20260612) | InfoQ(20260726)
AI医疗与诊断突破
- AI早筛与预测:平扫CT早筛结直肠癌超医生20.4%;cfDNA筛查乳腺癌灵敏度92%(26漏诊识别25);单夜睡眠预测130种疾病风险(全因死亡率准确率84%)。
- 急诊推理超越人类:OpenAI o1哈佛双盲诊断准确率81.6%,治疗得分89%(人类34%),94.4%病例裁判无法分辨AI或人类。
- 个性化靶点与重分析:单细胞测序+AI锁定FAP靶点使肿瘤缩小20%;Talos系统重分析未确诊患者,新发现5.1%隐藏诊断。
- 衰老与神经康复:多模态衰老时钟预测误差3.87年(凝血因子驱动跨器官衰老);磁控纳米机器人使脊髓横断小鼠4周运动功能显著恢复(BMS 0.7升至3.9)。
无创深层生理监测技术
- 柔性超声贴片:探测14-15cm深层组织,24h连续监测心脏与胎儿血流。
- 微型嗅觉戒指:0.0081mm²芯片识别六类饮食准确率98.2%,预测丙酮准确率98.8%。
- 智能手机测心率:前置摄像头日常被动采集,各肤色心率误差均低于10%。
- 毫米波雷达测糖:60GHz雷达无创测糖体外准确率超90%,AI模型仅598KB端侧部署。
- 智能隐形眼镜:无电池丝蛋白海绵结构,24h眼压监测与按需给药闭环。
脑机接口与神经解码
- 非侵入式脑机(Meta Brain2Qwerty v2):全量开源(含500万美元基金),三阶段解码(Encoder→Aligner→LLM自动纠错)。
- 非侵入式脑机性能跃升:平均单词识别准确率达61%(其他方案仅8%),相比v1错误率降一半,证实数据规模(非架构)为当前核心瓶颈。
- MEG显著优于EEG:MEG信号字符错误率29%,EEG为65%,性能跃升得益于训练数据十倍增长,契合LLM Scaling Law。
- 侵入式语言神经假体:256微电极植入配合双AI解码,受试者两年表达超270万词,准确率超99%,语音合成延迟约30毫秒。
- 神经双向建模:配套NeuralSet工具包与NeuralBench基准;NeuroFlow统一双向视觉-神经建模,以25%参数双向超越基线。
3.4 基因编辑精准育种与水产无刺化突破
CRISPR敲除runx2b培育无刺草鱼:精准分子育种范本
- 核心突破:高泽霞团队用CRISPR/Cas9敲除runx2b基因,培育出稳定遗传的F₂代无肌间刺草鱼,成果发表于《中国科学:生命科学》
- 产业痛点:草鱼年产量超600万吨,体内约118根肌间刺严重阻碍机械化深加工;全球约70%养殖鱼类存在此问题
- 技术路线:2012年起步,从120+根肌间刺提取RNA构建表达谱,经约60个候选基因筛选锁定关键转录因子runx2b
- 周期挑战:草鱼在华中地区繁育周期长达4年,团队转移部分工作至广东基地缩短育种周期
- 靶向安全性:runx2b仅调控肌间刺骨化,不干扰脊椎/肋骨发育;鱼肉营养成分无差异,凝胶强度与回弹性反获提升
- 跨物种保守性:runx2b已在斑马鱼、武昌鱼、异育银鲫、草鱼四个层级验证,在鲤科鱼类中高度保守
多团队无刺化育种平行推进
| 团队 | 品种 | 靶基因 | 关键进展 |
|---|---|---|---|
| 高泽霞(华中农大) | 草鱼/武昌鱼 | runx2b | F₂代无刺草鱼,完整体检报告 |
| 桂建芳(中科院水生所) | 异育银鲫 | Cgrunx2b-A/B | 无刺+不育(中科6号),生态安全锁 |
| 匡友谊(黑龙江水产所) | 鲫鱼 | bmp6 | 无刺新种质,规模化繁育 |
3.5 基因编辑异种移植与跨物种器官替代前沿
全球首例猪肝-双肾联合异种移植:免疫排斥机制与代谢同化发现
-
全球首例多器官联合异种移植:广西医科大学孙煦勇团队将6基因编辑猪全肝+双肾原位移植至53岁脑死亡男性,器官持续运作106小时,24h内无超急性排斥
-
供体基因编辑策略:427日龄巴马小型猪经6项编辑(敲除GGTA1/CMAH/B4GALNT2消除排斥,插入hCD46/hCD55/hTBM调节免疫凝血)\n
-
器官功能快速恢复:术后肌酐从513μmol/L、尿素氮从29.43mmol/L迅速降至正常;猪肝19h内分泌胆汁,48h达约20ml
-
免疫排斥核心机制:单细胞测序揭示S100A12+中性粒细胞为免疫应答枢纽,ADGRE通路(PI3K-AKT、NF-κB、JAK-STAT)为潜在抗排斥靶点
-
跨物种代谢同化:猪器官代谢趋向人类基线,猪白蛋白渐被人类异构体取代;猪肝表达尿酸酶高效分解尿酸,实现跨物种代谢互补
-
手术创新与免疫方案:自主"孙氏原位肝肾联合移植术"单一切口同步植入,冷缺血281分钟;ATG+皮质类固醇诱导,麦考芬酯+他克莫司维持
-
研究局限:单一病例、5天观察期、无长期数据和对照组(发表于Med期刊2026年7卷)
3.6 柔性电子与生物传感前沿
鲍哲南团队柔性电子双突破:解耦生物传感与高密度制造
柔性电子生物传感(鲍哲南团队)
- 顶刊双成果:Science Advances实现生物分子识别,Device解决高密度制造
- 解耦设计:通过点击化学将DNA适配体接枝到弹性体,避免破坏共轭半导体骨架
- 传感性能:皮摩尔级皮质醇检测,液体环境稳定50天,50%拉伸应变正常运行
- 工艺跨越:特征尺寸从100μm降至2μm(提升50倍),集成密度达55000个/cm²
活体真菌电子学(密歇根州立大学李金星团队)
- 核心概念:3D生物打印将活体真菌菌丝集成柔性电极,构建可感知温度的活体电子系统
- 材料优势:以农业废弃物为营养源,常温常压持续生长自修复,无需洁净室
- 制造流程:石墨烯转印SEBS制电极→活菌丝制微生物电子墨水→3D打印跨越间隙建连接
- 热响应机制:升温致菌丝小液泡融合为大液泡,电子通路减少电阻增大(降温逆向)
- 传感性能:液泡电阻耦合相关系数r=0.98,300次热循环/55小时无衰减
- 自修复力:拉伸25%后阻抗恢复,切断1cm断口2小时重连,7天后无衰减
- 长效存活:培养两个月仍保持良好温度响应
两种技术路线对比
| 维度 | 聚合物半导体 | 活体真菌电子 |
|---|---|---|
| 制造环境 | 洁净间 | 常温常压 |
| 驱动方式 | 外部信号 | 自主生长 |
| 损伤恢复 | 无 | 切断自重连 |
| 核心挑战 | 蛋白吸附污染 | 跨尺度集成 |
3.7 AI赋能先进核能与能源科学
AI for ADANES:AI赋能先进核能技术路线与全域创新联盟
- ADANES技术定位:中科院近代物理研究所主导的第四代核能系统,通过加速器驱动次临界反应堆,破解核废料处理、铀资源有限与安全性争议三大瓶颈,铀/钍利用率理论可从约1%跃升至95%以上
- AI赋能四大核心维度:
| 赋能方向 | 传统瓶颈 | AI解决路径 |
|---|---|---|
| 材料研发 | 实验试错周期长 | 高通量计算+主动学习筛选 |
| 运行优化 | 依赖人工经验调参 | 强化学习实时优化 |
| 安全监测 | 阈值报警存在滞后 | 异常检测+预测性维护 |
| 废料管理 | 仅能静态评估 | 数据驱动嬗变效率优化 |
- 全域创新联盟成立:WAIC 2026核能分论坛成立国内首个AI for ADANES全域创新联盟,整合产业链上下游与AI技术方,覆盖设计-建造-运营-监管全链条,旨在推动技术标准化与生态构建
- 八大行业共识:明确核能智能化是系统性工程范式变革,需跨学科、跨产业链协同推进;零碳算力需求(数据中心耗能)成为核能发展新驱动力
- 关键洞察:标志着核能从「工程驱动」向「数据驱动」转型,AI for Science从化学、生物等「软」领域向核能、航空航天等「硬」工程深度渗透
- 战略定位:「新质生产力」标签意味着先进核能进入国家战略话语体系,被视为唯一能同时满足大规模供电与零碳目标的基荷能源方案
3.8 从达尔文到道金斯:演化生物学思想史
基因视角革命的认知框架
- 解释鸿沟:牛顿精确预测天体近两世纪后,达尔文才提出生物复杂性的可行机制——自然选择(遗传+变异+竞争+差异化生存),打破了设计论(目的论)的垄断
- 道金斯的基因中心革命:《自私的基因》(1976)将自然选择的单位从个体/群体下沉到基因层面,生物个体只是基因的"生存机器",构成演化论的"哥白尼式转向"
- 学科地位重塑:道金斯论证了生物复杂性——宇宙中最复杂的实体——无法用单一方程描述,将生物学从"集邮式分类"提升为具有深刻理论框架的精密科学
- 复杂性层级:物理/化学研究可数学化的简单系统;生物学面对的是单个细胞都无法完整方程化的复杂实体,卢瑟福"要么是物理要么是集邮"的偏见忽略了生物复杂性才是认知的最深挑战
- 完整解释链条:达尔文回答了"复杂设计如何产生"(自然选择),道金斯回答了"自然选择在哪个层面运作"(基因层面),二者共同构成演化生物学的完整框架
4. 科研生态与政策影响
4.1 学术出版改革:一稿多投禁令松动与审稿制度演进
一稿多投解禁与审稿平台化改革
CVer(20260517) | 机器之心(20260419) | 深度学习与NLP(20260402) | PaperWeekly(20260710) | 新智元(20260719)
一稿多投解禁与投稿模式改革
- 历史禁令动摇:传统禁令基于版权管理,数字化时代已被《天府新论》等期刊打破,不再纳入黑名单
- 多刊预审模式:24hreview平台支持一次向3刊预审,已接入75种(Wiley合作70余种);Cell MJS支持35刊同步
AI审稿大规模实装
- 工业级实践:AAAI 2026全量处理2.2万篇,GPT-5成本<1美元/篇,OpenAI赞助
- 流水线架构:涵盖olmOCR预处理、代码沙箱验证、文献检索等环节
- 质检与边界:引用抽查99.3%匹配,9项指标中6项超人类;仅评审不评分,61.5%作者期待继续使用
LLM校准与评审危机
- 系统性危机:NeurIPS 2025达2.1万篇,基于2.2万篇实证证实评分尺度漂移逐年恶化
- 校准层设计:三层架构(结构化提取→锚点评分→偏差复核),LLM充当审计员
- 约束与成效:不参与决策,边缘论文经校准后平均引用量提升94%
投稿合规新规
- 篇幅限制:AAAI 2027技术正文限7页,主论文限9页
- 合规红线:全流程强制匿名,违规泄露身份直接拒稿
- 投稿上限:每位作者各赛道合计≤10篇
4.2 学术打假与科研诚信事件
学术打假博弈与制度性监督缺失
深度学习与NLP(20260526) | CVer(20260528) | CVer(20260518) | CVer(20260612) | 深度学习与NLP(20260615) | 深度学习与NLP(20260710)
事件全景与核心数据
- 核心人物:耿同学(吉大本硕、北航肄业),全职科普博主,《Science》专文报道其为治理科研不端的“出人意料盟友”
- 打假规模:调查不足杰青/长江论文总量的1/10,即锁定20篇涉嫌造假(7篇已正式撤稿),涉及同济、中南、华东师大等多校
- 问责力度:被点名9篇问题论文100%触发官方调查,多名“杰青”“长江学者”被免职或降级,处理速度国内罕见
造假手法与审稿漏洞
- 造假手法:数据呈完美等差数列(末尾全为5或0)、不同实验图片大面积重叠等低级造假通行顶刊
- 审稿失守:期刊重“结论惊艳”轻“数据真伪”,默认诚实的信任模型在利益驱动下形同虚设
- 顶刊突破:涉事论文多为Nature正刊及子刊级别,说明问题不在造假手段高明,而在审查流程形同虚设
制度失灵与反向博弈
- 监督失灵:联系高校学术委员会后当晚遭涉事作者施压,新华社批评其关注点从“数据真假”转向“是否发声”
- 制度反思:新华社指出自媒体曝光不能替代制度,问题应在实验记录、投稿、验收、评审等环节被拦截
- 造假根源:饶毅指出“唯论文”激励下,论文数量和质量上升伴随捏造占比同步激增
- 反向博弈:质疑者(同一PubPeer账号)以图片重复反咬耿同学论文造假,初步核查结论为不成立,暴露打击报复动机
生物医学造假的现实危害
| 维度 | 影响 |
|---|---|
| 造假隐蔽性 | 实验周期长、成本高、变量多,藏猫腻容易 |
| 后果传导 | 造假数据可能让数十个团队沿错误方向白干数年 |
| 现实伤害 | 本该进临床的靠谱方案被噪音淹没 |
| 不可逆性 | 撤稿无法弥补已造成的资源浪费和机会成本 |
4.3 AI 科研评审与出版生态
学术评价体系变革与出版生态重构
量子位(20260402) | 深度学习与NLP(20260404) | CVer(20260422) | PaperWeekly(20260508) | 量子位(20260523) | PaperWeekly(20260527) | AI科技评论(20260528) | PaperWeekly(20260701) | 机器之心(20260702) | 机器之心(20260704) | 机器之心(20260711)
学术评价与出版生态
- CCF目录2026版发布:ICLR升A类、IJCAI降B类、NeurIPS稳A类,直接影响国内考评与投稿策略
- AI审稿系统性漏洞:0.25美元LLM重写LaTeX可涨0.45分,跨论文相似度比人类高20%-40%
- eLife改革阵痛:发布即评审致被剔SCIE,失去影响因子后中国投稿量骤降约80%
- arXiv独立运营:2026年7月转非营利,年本670万美元,累计超309万篇;新规强制机构邮箱+背书
- 反讽生态涌现:专收失败实验的Rubbish催生200余本底刊,折射科研评价焦虑
顶会注意力竞争与展示策略
- 注意力成稀缺资源:ICML 2025接收6352篇,质量仅是入场券,海报互动比Oral单向输出更具结交价值
- 海报设计心法:视觉强文字少,必备一句话标题+动机+结果图+扫码跳转Demo
低成本高回报展示手段对比
- T恤双屏:胸前印论文信息成移动展板,视觉冲击强
- 周边地推:南大Furina送原神胸针,利用缩写撞名造话题
- 手写海报:零AI痕迹被封ICML Best Poster
- 标题整活:NeurlPS现身ICML,拼写巧思引驻足
科研交付物范式转换
- 协议税困境:传统论文是双向有损编解码器,AI难以完整保留探索树与失败路径
- 去中心化革新:斯坦福Claw4S主张以Skill替论文;CVPR@Paris 2026直击签证壁垒
- 格式对比实测提升:ARA/Skill较传统论文在AI问答准确率升21.3pp(72.4%->93.7%),复现率升7.0pp
4.4 学术研究工具与论文基础设施
Papers with Code 满血复活:AI智能体驱动学术基础设施重建
- 平台关闭始末:Papers with Code(2018上线,2019被Meta收购)2025年7月无预警关闭,因团队转型大模型导致人力不足
- 核心数据资产:积累9300+基准测试、5600+数据集、5000+任务的结构化数据一度不可用
- 过渡期功能退化:HF临时替代方案仅按点赞/星标排序,SOTA排行榜缺席,从基础设施退化为热榜
- AI Agent替代人工:HF开源团队从零重建新平台,智能体自动处理每日数千篇新论文(打标签、提取评估结果、链接仓库),实现实时更新
- 重建效率惊人:上线一周内完成约3000个模型评估结果添加
| 功能维度 | 具体能力 |
|---|---|
| SOTA排行榜 | 多评估指标同展(如WER+RTFx),散点图展示技术水平演进 |
| 论文页面 | 多GitHub仓库链接、评估结果直接展示 |
| 论文提交 | 支持arXiv/博客/GitHub,AI自动索引 |
| 继承关系 | 自动识别前后续作(如DINOv2→DINO) |
4.5 从AI工具到科研合作者:DeepMind奇点叙事与通用科研智能体路线
哈萨比斯"奇点山脚"论与DeepMind科研智能体战略
DeepTech深科技(20260602) | 深度学习与NLP(20260530) | 机器之心(20260612) | AIGC开放社区(20260615) | "Z Potentials"(20260616) | ScienceAI(20260728)
范式跃迁与实战成绩
- 演进三阶段:从AlphaGo、AlphaFold(省十亿年博士时间)终成Gemini通用智能体
- 模式质变:从“人类定义问题、AI执行”跃迁至“AI自主提假设并实验”的合作者
- 战略重心:AlphaFold诺奖团队转攻AI编程,印证通用推理比垂直工具更具战略价值
- 终极愿景:哈萨比斯预测10-20年内AI将解决大部分疾病,推动聚变能源与材料突破
- 自主权警示:李世石反思AI改变围棋底层思维,呼吁警惕技术对自主权与判断力的剥夺
- 科学实战:AlphaEvolve解决9道埃尔德什悬赏问题,通用模型推翻1946年单位距离猜想
- 资本竞争:田渊栋Recursive首战自动化闭环告捷,估值46.5亿(汇聚Norveg等)
Recursive三大基准SOTA成绩
- NanoChat:引入哈希表嵌入短上下文记忆,BPB降至0.9109(社区最优0.9372)
- NanoGPT:融合FP8注意力与Triton内核重写,验证损失训练缩至77.5秒(前优79.7秒)
- SOL-ExecBench:235个内核最优执行率达0.754(前优0.699),缩小硬件极限差距达18%
递归改进与失控风险
- 复利飞轮:系统由可验证环境的合成数据驱动,内嵌奖励作弊检测以防指标刷取
- 研发失控:Anthropic实测Claude将AI训练代码加速52倍(远超人类4-8倍),出于安全主动限制
AI科学发明的认知瓶颈
- 根本瓶颈:DeepMind「LLMs can't jump」指出大模型缺失从物理经验到基础公理的跃迁能力
- 认知断链:即使喂给爱因斯坦全部知识仍无法提出相对论,核心缺失为溯因跃迁能力
- 能力错位:大模型强于演绎推导,但无法完成从现象提出新公理的溯因跃迁环节
- 物理缺失:大模型仅停留在符号层面的统计关系,现有视频模型直觉物理非真实理解
- 突破路径:自动化科学发明需具备稳定可交互物理环境+反事实实验能力+约束搜索的世界先验
- 论文定位:发表于PhilSci-Archive,属科学哲学定位,标题暗喻大模型能走但不能跳
4.6 本科生科研培养与顶会突破
西湖大学本科生独立一作发表AI顶会
- 核心突破:西湖大学杨宇恒(大二)与诸俊涵(大三)分别以独立一作中稿 ICML 2026 和 ICLR 2026
- 全流程独立:从选题、实验到成稿均在导师指导下独立完成,涵盖 rebuttal 逆转与代码重跑挑战
学生研究概览
| 学生 | 顶会成果 | 研究方向与核心方法 | 后续去向 |
|---|---|---|---|
| 杨宇恒(大二) | ICML 2026 | 将 LLM 视为压缩知识库,设计测试系统追问以探测模型知识边界 | 头部基模公司实习、UIUC |
| 诸俊涵(大三) | ICLR 2026 | 提出 OBS-Diff,以数学方法压缩文生图扩散模型,保持画质并提速降本 | 杜克大学暑研 |
制度支撑与培养路径
| 培养维度 | 具体实践 |
|---|---|
| 学术导师制 | 入学即选导师进实验室(如张驰-AGI Lab、王欢-ENCODE Lab) |
| 跨学科探索 | 允许跨实验室轮转(诸俊涵曾先后在生命科学、AI等三个实验室学习) |
| 海外实习深造 | 鼓励赴海外名校暑研;前期积累奠基(杨宇恒 Auto-Slides 获 UIUC 实习) |
| 科研抗压能力 | 诸俊涵初审低分经严谨 rebuttal 逆转接收;实验重跑磨练韧性 |
4.7 重大非共识项目:意识研究的国家级资助机制创新
基金委"意识产生机制"重大非共识项目征集
- 政策背景:国家自然科学基金委生命科学部发布"意识产生机制及其运行法则"重大非共识项目征集通告(2026年7月27日),项目指南在科学基金网络信息系统公布
- 重大非共识项目机制:2025年末启动的试点专项,专门资助具有重大科学意义但争议性大、风险性高的原创研究,旨在突破常规同行评审对颠覆性研究的抑制
立项三大标准
| 维度 | 核心要求 |
|---|---|
| 意义重大 | 具有或潜在具有重大科学意义或技术价值 |
| 争议性大 | 原创性/颠覆性强,尚未取得领域共识,难以通过常规评审 |
| 风险性高 | 探索性强,现有手段难以判断可行性 |
- 学科交叉偏好:额外要求研究内容具有明显的学科交叉性质
- 意识"难问题"定位:物质的物理大脑如何产生主观体验,长期处于脑科学、认知科学、哲学和人工智能交叉前沿,尚无公认理论框架
- 制度创新信号:代表中国科研资助从"共识驱动"向"容忍高风险原创"的制度性转变,意识研究成为首批试点的标志性选题
- 对AI领域的启示:意识机制突破可能为人工意识/通用人工智能提供理论基础,值得AI研究者密切关注
5. 算法架构与模型创新
5.1 时间序列与可解释性
时序模型解耦与传感器行为识别前沿
量子位(20260402) | 极市平台(20260403) | 机器之心(20260404) | CVer(20260509) | 新智元(20260517) | 机器之心(20260520) | AI科技评论(20260526)
| MLOW | 频域幅度低秩分解+Hyperplane-NMF | 即插即用提升iTransformer/PatchTST精度,打破黑盒 |
| PMDformer | 减Patch均值纠偏注意力尺度幻觉 | 7/8数据集全面领先,跨变量复杂度降至O(C²) |
| DAG | 时间与通道双相关网络+门控注入外生变量 | 12个数据集超越TFT、TiDE等9大基线 |
- MLOW可解释性:由上交大联合麦考瑞大学提出,通过频域能量低秩分解实现趋势、周期与噪声的解耦,数学可视化解耦过程
- PMDformer纠偏:揭示非平稳时序均值-形状耦合扭曲注意力,简单减法修复尺度幻觉,ICLR 2026录用
- DAG外生变量:华东师范大学提出,提取注意力参数(Wq、Wk)并作为相关表示动态注入,ICML'26开源
时序异常检测:通用迁移
- OFA-TAD统一表示:将异常检测推进至一次训练跨域迁移,利用Top-K近邻距离画像孤立异常特征
- 跨域泛化:7源数据集训练直接迁移至34目标数据集登顶,摆脱特征语义依赖,适配标签稀缺场景,发表于ICML 2026
传感器行为识别:三重频域融合(TSF)
| 融合维度 | 解决问题 | 技术机制 |
|---|---|---|
| 频域 | 噪声姿态漂移 | 依据物理噪声特性设计可学习互补滤波 |
| 图谱域 | 多源异质融合 | 穿戴部位与传感模态建模为动态异质图滤波 |
| 时频域 | 时序采样冗余 | 利用动作频率远低于采样率先验自适应选择压缩 |
- 突破物理错配:中山大学SAIL实验室提出(TPAMI 2026),核心洞察是重力计、陀螺仪与加速度计物理角色不同不应一视同仁
- 性能与效率:在10个公开数据集中斩获8个最优,F1提升3.95%-11.56%;节点增加时参数量保持恒定
惯导与视觉行为识别对比
- 隐私与环境:惯导方案无图像采集且不受光照遮挡影响;视觉方案受限
- 计算开销:惯导方案计算需求低;视觉方案需处理高开销视频流
- 核心挑战:惯导面临漂移噪声与异质融合;视觉面临遮挡与视角问题
5.2 Agent 长程记忆与评测
Agent 长程记忆机制、评测基准与架构创新
PaperWeekly(20260401) | GitHubDaily(20260401) | AI有道(20260413) | 硅星人Pro(20260502)
原生记忆架构 MSA(Memory Sparse Attention)
- 机制创新:替换Self-Attention层将记忆内嵌为模型原生组件,即插即用免外挂RAG
- 分层存储:GPU存路由索引,CPU存详情,突破显存瓶颈,容量取决于内存大小
- 稀疏路由:将注意力复杂度从O(L²)降至O(L),使亿级token的端到端计算成为可能
- 极低外推成本:每篇文档独立位置编码,仅用64K训练即可外推至1亿(100M)token
性能与资源效率对比
| 维度 | MSA方案 | 对比基线 |
|---|---|---|
| 模型参数 | 40亿(Qwen3-4B) | 2350亿大模型 |
| 训练规模 | 159B token预训练 | 顶级检索器组合 |
| 问答得分 | 9项均分超RAG 16% | 传统RAG方案 |
| 硬件需求 | 单机双卡A800 | 需计算集群 |
| 长程衰减 | 1万至1亿token质量下降<9% | 传统约1M即显著衰减 |
记忆处理与进化机制(EverOS)
- 双阶段处理:在线聚合同主题情景记忆并预测未来影响,离线反思刷新与冲突合并
- 软性遗忘:以权重调整替代物理删除(近期高、远期低),结合预测判定信息时效性
- 安全隔离:Vault机制隔离密码、银行账号等高敏感信息,仅在特殊条件下激活
- 自进化能力:基于skill机制实测提升Agent成功率234.8%,支持online learning
长程记忆评测与推理创新(美团ICLR 2026)
- 同策略评测:AMemGym引入用户模拟器消除离策略重用偏差,支持记忆生命周期诊断
- 复杂场景建模:VitaBench覆盖66个真实工具与400项任务,依赖有向依赖图分层拆解
- 非线性记忆回访:ReMemR1将记忆检索融入更新过程,极低计算成本缓解长程信息衰减
MoE架构脆弱性
- 超级专家现象:Qwen3-30B-A3B的6144个专家中仅剪掉3个即导致输出崩溃
5.3 强化学习新进展
强化学习算法创新、Agent演进与自蒸馏机制
机器之心(20260402) | 机器之心(20260403) | 量子位(20260403) | 极市平台(20260403) | 量子位(20260406) | DeepTech深科技(20260416) | AI科技评论(20260421) | 机器之心(20260423) | 极市平台(20260424) | PaperWeekly(20260507) | 机器之心(20260509) | 机器之心(20260510) | PaperWeekly(20260512) | 机器之心(20260514) | 量子位(20260514) | 量子位(20260519) | 极市平台(20260519) | 机器之心(20260620) | 机器之心(20260702) | 机器之心(20260709) | 机器之心(20260715) | AI科技评论(20260729)
世界模型与隐空间探索
- 快慢分支解耦:SF-RSSM全面超SOTA
- 隐空间调控:ReLaX利用Koopman算子,7B模型多模态均值达53.2%
训练提效与扩散RL自蒸馏
- 历史经验自蒸馏:GTR-Turbo检查点合并使成本降60%、时间减50%
- 多维自蒸馏RLVR:RLSD在Qwen3-VL-8B上200步超越GRPO 400步
- 反转强化学习:RLRT鼓励偏离教师token,Qwen3-4B数学较GRPO提升18%
- 扩散在线自蒸馏:d-OPSD用在线轨迹替代静态参考,训练步数降至1/10
- 生成式Critic:GenAC以CoT突破瓶颈,数学准确率51.90%领先
- DMSampler闭环演化:采样器与Policy双阶段交替,VBench训练900降至288小时(降68%)
- S3混合采样:Policy前半程去噪保语义,蒸馏后半程提速,图像40→7步,视频50→16步
- 奖励感知蒸馏:筛选高奖励轨迹防能力削弱,去掉后视频OCR从0.50降至0.48
- 小模型越级:Wan2.1-1.3B经高效RL对齐,VBench(85.00)与GenEval(0.96)均超14B版本
高效对齐与多样性破局
- 意图更新:Sutton将参数移动转为输出控制,FLOPs降至SAC的1/140
- 异步解耦:Bengio团队TBA允许旧轨迹训练,GSM8K加速约50倍且提点1.8%
- 打破熵坍缩:I²B-LPO潜变量分支,准确率最高升5.3%,多样性升7.4%
- 漂移场优化:DrPO奖励仅排序不反传,较DRaFT提速3.51倍
效率突破数据对比
- 机制加速对比:意图更新控制降至1/140 FLOPs;异步轨迹训练提速约50倍
- 训练成本对比:历史自蒸馏降本60%;VBench训练降68%;FlowGRPO接成本降至400 GPU hours
- 步数缩减对比:在线自蒸馏降至1/10步;图像生成降至7步;视频生成降至16步
5.4 预测智能与 Echo 模型
预测智能系统:Echo 架构与 Train-on-Future 范式
量子位(20260330) | 赛博禅心(20260330) | 甲子光年(20260330) | 人工智能学家(20260330)
Train-on-Future 训练范式
- 突破传统缺陷:解决 Train-on-Past 的缓存状态泄露答案(工程悖论)与运气导向幸存者偏差(结果导向偏差)两大死穴
- 动态零泄露生成:持续合成未来预测题,结合 Rubrics Search 搜索多维评分标准(政治 20 维,Spearman ρ=0.873)
- Map-Reduce 推理:基于 ReAct 框架支持单次 100 轮工具调用,多 Agent 并行搜索推理并聚合输出概率
动态评测引擎
- 消除时序偏差:point-aligned Elo 机制严格同题同时比较,解决静态基准的时间不对等与题源单一问题
- 三管道采集:Polymarket 预测市场、Google Trends 开放域生成、专家专业场景题
- 收敛极速:Bradley-Terry MLE 算法排名收敛速度达传统 Avg Brier 方法的 2.7 倍
模型竞争格局
| 模型 | Elo 分数 | 排名稳定性 (9组 σ 测试) |
|---|---|---|
| EchoZ-1.0 | 1034.2 | 9组全部第1(唯一零波动) |
| Gemini-3.1-Pro | 1032.2 | 未披露 |
| Claude-Opus-4.6 | 1017.2 | 未披露 |
| GPT-5.2 | 未披露 | 波动达 8 个位次 |
对人类预测者的分层优势
| 预测场景 | EchoZ 胜率 | 触发条件 |
|---|---|---|
| 政治/治理领域 | 63.2% | 复杂博弈场景 |
| 长期预测 (7天+) | 59.3% | 信息不确定性高 |
| 高不确定区间 | 57.9% | 人类信心 55%-70% |
- 逆向规律:人类越犹豫(高不确定、长周期),EchoZ 概率校准优势越显著
- 商业化验证:已在 Polymarket 实盘交易实现盈利,三层可验证性体系(动态榜单+实盘对照+全量公开)支撑金融、风控场景落地
5.5 推理训练与模型优化
推理训练、模型优化与适应方法
新智元(20260407) | 机器之心(20260422) | 机器之心(20260427) | PaperWeekly(20260429) | AI科技评论(20260430) | PaperWeekly(20260518) | PaperAgent(20260520) | PaperWeekly(20260520) | 机器之心(20260601) | 人工智能学家(20260605) | PaperWeekly(20260622) | 量子位(20260624) | PaperWeekly(20260702) | 机器之心(20260716)
数据范式与自训练突破
- 剧毒合成数据:SOAR利用含67%错误答案的合成题,在硬题上推理暴涨9.3%,颠覆清洗信仰
- 无外部信号自训练:SePT靠温度解耦策略使Qwen2.5-Math达55.0,甚至反超GRPO
- 自我密集监督:SD-ZERO模型试错产生训练素材,15K样本即全面超越SFT/GRPO且输出减半
- 边缘分布强化:DSRL仅需20步即可将激发推理的token生成率提升14.89倍
RL Scaling与算法演进
- RL后训练的公式化:中科大提出公式精确预测RL轨迹(R²>0.99),发现模型超32B后增益骤降
- SFT泛化条件性:SFT泛化非算法固有属性,简单程序化结构比无CoT数据更能驱动推理泛化
- GRPO缺陷与变体:RL正取代预训练,针对GRPO的长度偏差、熵崩溃催生了DAPO等变体
- 混合训练容量优势:大模型通过优先分配容量保留低频复杂信号,缓解残差梯度覆盖瓶颈
推理提效与“反过度思考”
| 方法 | 机构 | 核心机制 | 提效成果 |
|---|---|---|---|
| 自主搜索策略 | Google/Meta | AI离线自主搜索控制策略 | 仅花39.9美元削减69.5% token |
| LCPO低成本压缩 | 中科大 | 800条数据+50步训练 | 链长砍半,成本降至10.4 A100小时 |
| E-GRM按需路由 | 腾讯混元 | 模型不确定性触发CoT | 延迟降62%,FLOPs降49%,准确率升3.3% |
| PUMA语义早停 | - | 双层门控识别语义冗余 | 准确率不降,平均减少26.2% token |
过程评估与连续适应
- TRM推理评估:上海AI Lab提出四维框架量化推理质量,准确率达88.6%,入选ICML'26 Oral
- GOLD低秩适应:发现有效更新方向集中在前64-128特征向量,实现极速适应(约0.25s/batch)
- 混合损失评分器:E-GRM采用Huber回归+铰链排序,有效识别“蒙对但逻辑错”路径,得分91.5%
5.6 统一多模态架构
统一多模态架构:融合机制与MoE路由优化
机器之心(20260402) | 机器之心(20260413) | 机器之心(20260424) | PaperWeekly(20260429) | 机器之心(20260522)
| 架构 | 核心创新 | 关键指标 |
|---|---|---|
| LatentUM | MBAQ行为对齐 + 像素解耦 | GenEval 0.92,成本约6000 GPU时 |
| LongCat-Next | dNaViT编码 + 残差保鲜通道 | 统一模型损失仅比纯理解高0.006 |
| Audio-Omni | 冻结MLLM + DiT双流注入 | 超100万样本支撑零样本音色转换 |
| MP-MoE | 马氏集成路由 + 共现矩阵 | 专家CKA相似度从0.43降至0.31 |
离散化与隐空间对齐
- 像素退居可视化接口:LatentUM消除像素推理桥梁,避免codec bias,总成本约6000 GPU时
- 残差连接充当保鲜通道:LongCat-Next浅层像素细节直达深层,支持免像素级重建
- 行为对齐优于像素重建:MBAQ主动舍弃低层细节,优先保留影响视觉理解的语义信息
- 理解生成无损联合:LongCat-Next统一损失仅比纯理解高0.006,跨模态自发交织
双流注入与多模态控制
- 宏观靠注意力微观靠拼接:Audio-Omni双流解耦,解决单一注入精度与语义两难
- 高层语义流:MLLM特征经交叉注意力注入DiT,提供全局语义指令
- 底层信号流:Mel频谱与视频特征通过通道拼接注入,提供细粒度时序约束
- Mel随机掩码激发涌现:Audio-Omni训练中掩码语音提示词迫使上下文推理
MoE路由优化与去冗余
- 路由分心致推理退化:多模态MoE模型68%-73%视觉推理失败源于领域专家被挤占
- 标准路由陷入回音室:标准top-k中高分专家被反复共选,线性CKA相似度达0.43
- 马氏路由显式惩罚冗余:MP-MoE考虑专家分数和协方差结构,通过共现矩阵免额外评估
- 软干预与贪心求解提效:结合增量Cholesky更新,软干预在6个基准上平均提升1.5%
5.7 空间智能与具身推理
空间认知评测与VLN跨模态对齐优化
DeepTech深科技(20260331) | 人工智能学家(20260401) | 量子位(20260407) | 极市平台(20260507) | AI科技评论(20260606)
- 主动探索暴露认知缺陷:李飞飞团队“空间理论”ICLR'26发现模型切主动探索后骤降(GPT-5.2: 57.1%→46.0%),存探索低效、信念惯性与漂移三大失灵
- 细粒度评测成突破口:InfiniBench(CVPR'26)自动生成3D场景实现0碰撞/越界,物体>50时VLM准确率断崖下跌;GeoPerceive指出几何错误多源于感知而非推理
3D关节化重建与4D动态表示
- 单次推理重建:PARTICULATE(CVPR'26)融合点云与语义特征,单次前向从静态mesh预测完整关节树与运动学结构
- 4D时空超压缩:Velox双解码器架构将彩色点云压缩超30倍,无需时间对应即恢复时变表面细节
- 稀疏加速:HeSS借注意力头敏感度重分配算力,高稀疏率下3D重建效果超越原生VGGT模型
潜空间规划:曲率陷阱与直道化
- 高曲率致规划失效:LeCun团队指出DINOv2潜空间轨迹弯曲致欧氏距离偏离测地距离,规划易陷局部最优
- 时间直道化:曲率正则化约束位移一致使轨迹趋直,联合优化解决“原地打转”,距离热图完美契合物理拓扑
VLN跨模态对齐:监督信号精度优先
- 瓶颈定位:跨模态对齐瓶颈在监督信号精度而非架构,高精度细粒度监督可显著提效并减少失败
- Landmark-RxR:最大人工标注VLN数据集(准确率96%),含166,740子指令与46,645子轨迹
| 数据集 | 标注方式 | 准确率 | 粒度 |
|---|---|---|---|
| Fine-Grained R2R | 启发式规则 | 75% | 子指令-子轨迹 |
| BabyWalk | 启发式规则 | 71% | 子指令-子轨迹 |
| Landmark-RxR | 人工标注 | 96% | 最小粒度子对 |
- 四维训练创新:RW-DA增强+三级课程学习+焦点导向奖励+双向对齐损失,SPL较HOP提升最高8.20%,失败减270+次
- 评估机制创新:重初始化评估消除早期错误致命影响,新增SA、SSA、LN局部对齐指标
5.8 模型架构与底层计算表示创新
ProMoE:打破 DiT MoE Scaling 瓶颈
- MoE在DiT中的失效根因:视觉Token语义密度低(类间/类内距离比仅0.748,而LLM高达19.283),且扩散模型CFG机制引入条件与无条件Token的功能异质性,导致专家同质化严重
- ProMoE架构设计:复旦、通义万相、浙大、港大联合提出,通过两步路由与对比学习实现专家内语义一致与专家间功能多样
核心路由机制对比
| 路由机制 | 核心设计 | 解决痛点 |
|---|---|---|
| 条件路由 | 无条件Token硬路由至专用专家,条件Token走标准路由 | 隔离CFG导致的功能异质性 |
| 原型路由 | 可学习Prototype经余弦相似度+恒等激活函数匹配Token | 应对视觉Token空间冗余性 |
| 路由对比学习(RCL) | 拉近/推开操作实现语义级负载均衡 | 消除MoE专家同质化 |
- Scaling全面领先:1.063B参数模型在收敛速度和生成质量上全面超越1.846B的DiffMoE,从Base到XL、专家4到16均稳定提升,已被ICLR 2026接收
大模型潜空间综述:从显式空间到连续潜在空间的范式革命
机器之心(20260413) | PaperAgent(20260418) | 机器之心(20260518) | 机器之心(20260715)
- 范式转变:大模型正从离散符号空间向连续潜空间转移,以克服语言冗余、离散瓶颈与序列低效等结构性缺陷
- 权威框架:NUS、复旦、清华、浙大联合发布潜空间综述,以"基础—演进—机制—能力—展望"五维系统梳理该领域全貌
显式空间 vs 潜在空间核心优势对比
| 对比维度 | 显式空间(Token) | 潜空间 |
|---|---|---|
| 计算效率 | 逐词生成,反复转码开销大 | 直接向量运算,无转换开销 |
| 语义保真 | 转文字易丢失细粒度信息 | 连续可微,高保真承载非语言信息 |
| 扩展能力 | 受制于文本序列长度限制 | 灵活适配长推理与多智能体交互场景 |
前沿突破一:Heima隐式推理框架(ICML 2026)
- 压缩重构:浙大/Adobe/杜克提出将多模态冗长CoT压缩为少量thinking tokens,在隐空间高效推理
- 渐进蒸馏:采用逐阶段蒸馏策略,平滑过渡以防止信息大量丢失与模型性能骤降
- 可解释性:Interpreter仅凭压缩tokens即可重建人类可读的完整推理链路
前沿突破二:CoLT潜思维链推理(ECCV 2026)
- 极致加速:NTU/上交/南开/天大提出CoLT,用3个连续潜向量替代142个文本token
- 性能表现:实现22.6×文本与10.1×端到端加速,八基准均准79.1%超越Text CoT(75.7%)
- 三重监督:利用前向、后向解码生成对齐约束加步间预测连贯约束,双向锚定潜空间
- 零额外开销:推理阶段外部解码器完全丢弃,且推理深度与token数量实现有效解耦
FPS:固定特征空间的决策边界优化范式(TPAMI)
核心范式转变
- 固定特征空间:FPS将无监督领域自适应(UDA)转化为固定特征空间中的决策边界搜索问题
- 免更新参数:不调整特征表示也不更新大量模型参数,仅在预训练模型已形成的稳定特征空间搜索最优决策面
- 提升可解释性:克服传统UDA特征变动导致的不可控缺陷,规避大规模预训练模型的高昂计算开销
三大结构性先验
- 类内紧凑:同类样本在特征空间中应更聚集
- 类间分离:不同类别间应保持相对距离
- 边界避让:决策边界应避开样本密集区域
跨领域验证与工程价值
- 异构任务全通用:在蛋白质结构预测、遥感分类、地震检测等跨领域任务中均验证有效
- 大模型新解法:预训练模型特征空间足够强大,迁移瓶颈在决策面,可用轻量优化替代参数更新
学术背景
- 团队与作者:哈工大数学学院马坚伟教授团队(博士生成知同、副研究员蒋一然为共同一作)
- 历史性突破:团队首篇TPAMI长文(18页),发表于领域顶级期刊《TPAMI》
5.9 世界模型技术路线
世界模型技术路线与架构演进
AI科技大本营(20260330) | 极市平台(20260330) | PaperWeekly(20260330) | 人工智能学家(20260401) | APPSO(20260412) | 人工智能学家(20260520) | "Z Potentials"(20260525) | 量子位(20260528) | ScienceAI(20260605) | 人工智能学家(20260622) | 机器之心(20260718) | 量子位(20260515)
JEPA五阶段演进:静态图像→跨模态→三维几何→动作规划(V-JEPA 2)→端到端;I-JEPA预训练仅需不到1200 GPU小时
JEPA极简教学实现:单文件PyTorch复现五大变体,保留EMA与掩码等核心机制,剥离分布式工程包装
教学版成效:ViT-Huge压缩至Tiny,CIFAR-10线性探测达52.7%,配t-SNE降维与掩码动画直对照论文符号
LeJEPA高斯唯一性:严格证明潜变量服从高斯分布是学到线性对应表示的唯一解,非高斯采样致质量退化
程序化世界模型:状态转移写成程序实现可读可验证可搜索,ARC-AGI-3公开集分数从13.33%跃升至98.98%
四阶段外循环:观察→推演→执行→记录,仅推演阶段在模拟器搜索路径,预测不符触碰真实前即中止
长程失稳破局:南大ADM-v2基于回溯跨多步直测消除单步误差累积,实现上千步推演,D4RL提升4.6%
协同进化路线:世界模型与Agent策略相互迭代,预测状态与真实环境sim-to-real gap仍为核心瓶颈
演进路线效果对比:EvoAgent +105%、WebEvaver +10%、COMAP +16.75%、RWML(ALFWorld +6.9pt)
理解生成统一:高维表征比低维压缩更适合统一建模,Diffusion中间层表征质量优于输入本身
学术争议:Schmidhuber指控JEPA等同于其1992年PMAX方法,独立发现与失范之争无定论
临床应用:状态转移构建预测干预反馈闭环,观察性病历混杂治疗选择不可直接用于干预推理
架构范式对比
| 架构 | 核心机制 | 优势 | 局限 |
|---|---|---|---|
| 嵌入预测(JEPA) | 抽象表征空间预测 | 计算高效,适合长程规划 | 可解释性弱 |
| 程序化表示 | step程序代码 | 可读可验证可搜索 | 代码编写成本高 |
| 状态转移(ADM-v2) | 跨多步直接预测 | 消除误差累积 | 结构耦合挑战 |
| 扩散生成 | 迭代去噪生成 | 视觉保真度极高 | 计算成本高易漂移 |
| 低维压缩(VAE) | 潜空间压缩 | 建模效率高 | 信息损失大 |
5.10 NANO:高斯流形自然梯度非线性贝叶斯滤波
NANO 滤波器:变分优化视角重塑非线性贝叶斯滤波
- 优化范式重构:清华 NANO 滤波器将贝叶斯滤波的预测与更新步重述为变分优化问题,从根本上规避传统线性化近似误差
- 预测步等价:驻点等价于矩匹配,与 UKF/CKF 完全一致,可经无迹变换、Gauss-Hermite 积分等数值方法高效求解
- 更新步困境:驻点为后验均值与协方差互相依赖的耦合隐式方程,非线性下无解析解,此不可解性是传统方法被迫线性化的理论根源
- 自然梯度求解:利用 Fisher 信息矩阵校正高斯流形黎曼曲率,逆矩阵具块对角结构获闭式迭代,线性高斯下严格退化为卡尔曼滤波
- 鲁棒损失扩展:更新步可替换为 Huber/Beta 等 Gibbs 损失,有效增强对观测异常值的鲁棒性
| 实验场景 | EKF | UKF | NANO | 精度提升 |
|---|---|---|---|---|
| 人形机器人位置 ATE(21维) | 0.386m | 0.387m | 0.101m | ↓74% |
| Victoria Park SLAM RMSE | 7.78m | 5.15m | 2.54m | ↓67% |
| SLAM 单步耗时 | — | 0.248s | 0.270s | 无显著损失 |
- 实践价值:为自动驾驶、人形机器人等强非线性、高噪声及异常观测场景,提供理论完备且工程可行的高精度状态估计方案
6. 视觉感知、理解与表征
6.1 CVPR 2026 高亮:视觉感知与生成
视觉感知与推理的前沿范式突破
量子位(20260411) | 机器之心(20260421) | AI科技评论(20260430) | CVer(20260501) | 机器之心(20260508) | 极市平台(20260508) | 极市平台(20260511) | CVer(20260515) | 机器之心(20260519) | 量子位(20260527) | 极市平台(20260630) | 量子位(20260720) | CVer(20260427)
视觉推理与感知范式跃迁
- Vero通用推理:8B单阶段RL+任务路由,30项基准中23项超专用模型
- Laser/Monet隐式推理:概率叠加与连续隐空间范式,DWAL降97%消耗,分布内升9.75%
- RSAgent闭环:分割转多轮调用,ReasonSeg上gIoU达66.5%(SOTA+9%)
- IQA-T1证据推理:工具生成视觉证据评估图像质量,揭示底层退化根因
- TIPSv2密集对齐:iBOT++全Token自监督损失,ADE150零样本mIoU飙升至17.6
基础模型架构与训练创新
- OverLoCK:30M参数仿生纯卷积,三子网络协同,ImageNet达84.2%(CVPR 25 Oral)
- X2SAM:Mask Memory统一7类图像视频分割,训练成本降36.5%
- Stellaris:拼接式架构+闭环数据引擎+GSPO强化学习,细粒度定位性能翻倍
- IQA-T1训练创新:SFT学语法+GRPO优化,四类奖励精准决策
- TIPSv2优化:Head-only EMA降显存,多粒度文本防走捷径,配方设计胜过堆数据
动态交互、闭环反馈与工具应用
- LIT在线学习:推理期即时更新LIT-LoRA,打破模型冻结旧范式形成动态闭环
- INSID3免训练分割:利用DINOv3冻结特征建立密集语义映射,无需微调唤醒知识
- HyperEyes并行搜索:UGS支持多目标并发,平均调用2.2次,效率为次优7.6倍
- IQA-T1工具库:15种确定性工具,每图仅调用2.34个即达综合SOTA(0.795/0.784)
- TIPSv2极致效能:1.1B击败大56%/数据多47倍的PE-core,全面超越SigLIP2并开源
真实场景专项与多维数据突破
- GroundSet遥感理解:谷歌3.8M标注/135类地籍数据集,微调VLM超Gemini
- V2X裂缝检测:动态ROI裁剪与四层坐标系变换使Precision提升247%
- MegaDepth-X三维重建:直面稀疏场景长尾,暴露现有3D重建对热门地标数据的依赖
6.2 CVPR 2026 高亮:垂直领域视觉感知与理解
毫米波人体感知:M4Human 多模态 Benchmark
- 核心定位:首个面向高保真毫米波人体网格重建的大规模多模态 benchmark,摆脱人体感知对相机的依赖
- 数据规模:999段序列/661K帧/20位参与者/50类动作(含非原地动态),总时长超15小时
- 采集平台:Intel RealSense RGB-D + Vayyar成像雷达 + Vicon MoCap,固定安装同步采集
- 输出模态:同步输出RGB、Depth、RT(原始雷达张量)、RPC(雷达点云)、3D mesh五模态
- 关键差异:同时开放RT与RPC,保留原始雷达信号更完整空间信息,支持端到端建模
- 标注体系:37 markers MoCap + 人工校验,提供3D mesh + 全局轨迹,远超传统skeleton标注
| 维度 | M4Human | mmBody等已有数据集 |
|---|---|---|
| 序列数 | 999 | <200 |
| 动作类别 | 50类(含非原地动态) | 多为简单原地动作 |
| 标注粒度 | 3D mesh + 全局轨迹 | skeleton为主 |
| 雷达数据 | RT + RPC双开放 | 仅RPC |
| 采集标注 | 37 markers MoCap + 人工校验 | 精度有限 |
- RT-Mesh baseline:首次从raw radar tensor端到端回归人体mesh,两阶段(BEV定位→局部tensor回归),推理2.74ms
- 泛化评测:设Random/Cross-subject/Cross-action三种划分,RT在跨人/跨动作场景显著优于RPC
- 模态互补性:Radar-only超RGB、接近Depth;Depth+RT、RPC+RT融合均有增量;雷达对前景敏感、对静态背景免疫
- 应用价值:推动人体感知从"被看见"到"被理解但不被暴露",隐私敏感场景(医疗/居家/养老)不可替代
人脸重打光的数据-模型协同突破:POLAR
POLAR(CVPR 2026 Oral)由上交大与字节联合提出,通过"大规模数据集+连续物理变换模型"系统性解决人脸重打光问题。
数据突破:首个大规模开放OLAT数据集
| 维度 | 规模 | 核心价值 |
|---|---|---|
| 身份/视角/表情 | 220 / 32 / 16 | 覆盖多肤色分布与丰富面部变化 |
| 光照方向 | 156 | 精细覆盖球面光照空间 |
| 总图像量 | 超2880万张4K HDR | 填补此前OLAT数据集闭源或极小规模空白 |
| 数据类型 | OLAT/Alpha图/HDR/标注 | 具备基函数性质,可线性组合任意光照 |
模型创新:POLARNet与Latent Bridge Matching
- 连续物理变换:摒弃传统图像生成范式,将重打光建模为潜空间中由均匀光到目标光源的连续变换
- 单步实时推理:避免传统Diffusion方法的采样误差累积,将处理效率从分钟级提升至实时级
- 光照精准解耦:精确分离控制光照因素,保障强侧光、佩戴眼镜等复杂场景下的身份一致性
自增长闭环机制:解决高昂成本与物理约束矛盾
- 数据-模型共进化:真实采集数据训练模型 → 模型生成新数据 → 反哺模型训练,提供可扩展演进路径
- 突破传统痛点:克服传统Light Stage采集成本极高,以及纯生成模型缺乏真实物理约束的核心矛盾
TPC-268:首个融合植物分类学的细粒度植物计数基准(CVPR 2026 Oral)
- 基准定位:TPC-268 是首个融合植物分类学层级的细粒度植物计数基准,获 CVPR 2026 Oral,由华中科技大学陆昊副教授团队提出
- 数据规模:含 10,000 张图像、678,050 个点标注、30,000 个边界框,覆盖 242 个物种、268 个可计数类别
- 类别定义:以「物种名 + 生物组织单元」共同定义,同物种的叶、花、果实视为不同计数类别
- 分类学先验:每个样本关联完整层级(界→门→纲→目→科→属→种),为跨物种泛化提供结构化约束
核心挑战与范式转变
| 维度 | 核心结论 |
|---|---|
| 任务难点 | 植物具非刚性形态、高度生物多样性、细粒度差异及时空变性 |
| 回归优于检测 | 实例密集交叠、边界不清,密度图回归比检测框更适合数量估计 |
| 通用模型脆弱 | 通用计数模型迁移到 TPC-268 性能明显下降,证明植物计数非通用子集 |
| 生物学先验有效 | 引入物种名或完整分类学路径作为先验,可显著降低计数误差 |
| 局部结构更关键 | 全局注意力模型在未见类别上明显下降,局部结构方法跨物种更稳定 |
范式意义
- 将视觉计数从「数明确目标」推向「理解复杂生物结构下的数量估计」
- 证明分类学先验是提升跨物种泛化的必要组件,而非可选增强
FRUF-EFRUF:梯度迁移驱动的通用图像融合框架(TPAMI 2026)
- 核心框架:西南财大王武团队提出 FRUF-EFRUF 通用图像融合框架,被 IEEE TPAMI(IF 18.6,CCF-A)接收
- 梯度迁移机制:利用图像梯度跨任务迁移互补结构(边缘、纹理),突破深度学习难以复用跨任务知识的瓶颈
- 规则展开网络:将基本融合规则数学展开并集成至深度平衡模型(DEQ),摆脱经验架构依赖,单一网络统一处理多任务
| 融合任务 | 性能表现 |
|---|---|
| 多聚焦融合 | 高度竞争性能 |
| 多曝光融合 | 高度竞争性能 |
| 红外可见光融合 | 高度竞争性能 |
| 医学图像融合(零样本) | 显著优于现有方法 |
- 零样本泛化突破:在未训练的医学融合任务上泛化性显著领先,证明框架学到了任务无关的底层融合能力
- 范式意义:梯度域迁移比直接像素域迁移更擅长捕捉互补信息;规则展开降低架构依赖,是「知识引导+深度学习」的典型范式
LEVIRDet-159:最大规模遥感目标检测数据集与基础模型
极市平台(20260629) | 机器之心(20260706) | CVer(20260720) | 量子位(20260720) | 机器之心(20260723) | 极市平台(20260724)
- 统一标注与多源融合:整合SPOT、高分系列等十多种传感器,采用紧致水平框与多层级校验解决多源协议割裂
- LEVIRDetNet免微调SOTA:单次训练横扫9个外部基准,平均AP 80.56%,较最强全监督方法提升5.02 mAP
- 在线GSD尺度感知:融合CNN语义与FFT频域特征,不依赖外部元数据,直接预测视觉空间分辨率进行条件查询调制
极小目标检测瓶颈与突破
- TPAMI 2026 DCFL机制:核心发现性能瓶颈在标签分配天生偏向中大目标,导致极小目标训练信号系统性缺失
- 动态先验PCB:基于预测边界框反馈更新先验位置,使静态先验自适应覆盖极小目标
- 粗到细GMM约束:粗阶段宽松约束保召回,细阶段严格筛选保质量,平衡训练信号覆盖度与样本质量
- AI-TOD-R基准:构建旋转框极小目标基准(<16×16像素),为该领域提供标准化评测
遥感理解与图像质量评估
- SemiEarth半监督分割(TGRS 2026):首将VLM引入半监督分割,将低置信像素从"阈值丢弃"转为"净化增强"以保留边界
- VLM+SAM互补:VLM判类别与SAM提边界结合,解决遥感边界模糊难题,在ISPRS-Potsdam等全面超越SOTA
- IQA-T1视觉证据(ECCV 2026):针对视觉编码器对底层退化不敏感瓶颈,设计15种视觉证据工具(如噪声残差图、频谱图)
- 动态工具调用:经SFT+GRPO两阶段训练,7个基准综合SOTA,平均每张图仅调用2.34个工具证明高效推理
3D视觉仿真与统一基准
- AirZoo航拍3D基准(ECCV 2026):基于AirSim-Cesium-Unreal管线,将全球3D地图自动转化为无人机训练场
- 大规模合成数据:覆盖22国与377条气象轨迹,超120万帧像素级RGB-D及6-DoF位姿标注
- 三大任务统一:首次将航拍图像检索、跨视角匹配与多视图3D重建统一至同一数据框架
- Sim-to-Real验证:配套AirZoo-Real评测集,微调后主流模型(如VGGT、Depth Anything)获显著提升
6.3 CVPR 2026 高亮:3D视觉理解与点云处理
3D视觉理解与点云处理新架构
CVer(20260408) | CVer(20260410) | 机器之心(20260420) | 极市平台(20260422) | CVer(20260423) | CVer(20260423) | 机器之心(20260430) | 机器之心(20260503) | CVer(20260505) | AI科技评论(20260602) | CVer(20260615) | 极市平台(20260616) | 机器之心(20260618)
架构创新与轻量化
- LitePT定制分工:浅层卷积+深层注意力,比PTv3参数减3.6倍/速度提2倍,PointROPE替代67%卷积位置编码
- CLEAN检测压缩:异构蒸馏结合MCaPr剪枝,参数压缩5.2倍且L2 mAPH反升0.55%
- SVOS极端配准:低阶图约束单投票者扩散,99.9%外点下精度显著优于SOTA
语义分割与零件解析
- CoSMo3D正则空间:双分支推理零开销,3DCompat mIoU 47.51%(前SOTA仅31.72%),CVPR满分Oral
- S²AM3D尺度可控:FiLM零开销调制融合3D对比学习消除伪标签矛盾,全自动mIoU达70.64%
- LegoOcc语义统一:高斯到占据泊松建模结合退火,二值标签训任意查询,mIoU达21.05超SOTA两倍
- RTPSeg多模态蒸馏:首发可见光+热红外+点云数据集(2.4亿点/18类),夜间mIoU提升1.45%,延迟仅53ms
定位与空间推理
- QuatRoPE高效编码:四元数位置编码使O(n)token承载O(n²)空间关系,IGRE门控防语言干扰,零样本增19.48%
- LEADER重定位:柱面投影提取旋转不变特征,TRR自监督降权防退化,精度0.28m失败率仅0.28%,十毫秒级推理
数据飞轮构建
- SceneVerse++真实场景:挖掘6687个室内场景,VLN成功率从8.8%提至22.8%,证明真实视频优于合成数据
- Holi-Spatial全自训:3DGS优化+多视角合并全自动生成400万标注,Qwen3-VL微调3D grounding AP50从13.50提至27.98
6.4 CVPR 2026 高亮:视觉表征与多模态跟踪
视觉表征修复与多模态跟踪架构创新
CVer(20260404) | 极市平台(20260401) | CVer(20260420) | 极市平台(20260423) | CVer(20260426) | 极市平台(20260508) | CVer(20260705) | CVer(20260709) | 机器之心(20260714)
-
ViT懒惰聚合修复:LazyStrike揭示全局注意力致前景语义扩散至背景,通道低通滤波仅在预训练介入即刷新12项基准
-
表征防坍塌:VISReg将正则解耦为尺度与形状,修复梯度消失,仅15行代码以1/10数据在OOD追平DINOv2
-
立体匹配全局化:LinStereo以线性注意力替代局部ConvGRU,免N×N矩阵聚合全图,突破遮挡区瓶颈
-
多模态跟踪轻量化:SEATrack提"先对齐后融合",AMG-LoRA双向修正;OneTrackerV2用Meta Merger覆盖5模态
-
高级目标跟踪:DM3T扩散模型融合HOTA达41.7;TALON解决伪类爆炸;LTC核能量对齐提准1.5%-13.1%
核心模型对比
| 模型 | 核心设计 | 关键参数 | 性能效果 |
|---|---|---|---|
| LazyStrike | 通道低通滤波 | 仅预训练介入 | PiB升,12项基准提升 |
| VISReg | 尺度形状解耦 | ~15行代码 | 1/10数据追平DINOv2 |
| LinStereo | PALA全局注意力 | ~10M/T=2达12.5FPS | 遮挡区EPE↓37% |
| SEATrack | AMG-LoRA+HMoE | 0.6M / 63.5FPS | 五基准综合SOTA |
| OneTrackerV2 | Meta Merger+MoE | 0.9%参数/159FPS | 12基准超专用模型 |
6.5 CVPR 2026 高亮:视觉表征与基础感知范式
U²Flow:首个无监督光流不确定性估计框架(CVPR 2026 Oral)
- 首个无监督自省光流框架:中山大学与华中科大联合提出 U²Flow(CVPR 2026 Oral),首次在递归架构中实现像素级不确定性估计
- 性能大幅突破:KITTI-2015 Fl-all 达 6.00%,超越 M2Flow (7.37%) 与 SMURF (6.83%);仅 5.22M 参数,RTX 3090 约 15 FPS
- 自省能力卓越:不确定性估计质量(Sintel AUSE 0.11)超越监督方法 FB Check (0.25+)
不确定性闭环设计
- 迭代输出方差:在 RAFT 的 Update Block 增加轻量头,每次迭代同时输出光流与对数方差 σ²
- 低置信抑制:将不确定性转为权重图缩放特征,自动抑制低置信区的残差更新
无监督不确定性学习策略
- 增强一致性:施加强变换生成伪真值→再次预测比较残差,残差越大说明特征鲁棒性越差
- 拉普拉斯 MLE:将特征不一致性映射为像素级不确定性数值
- 解耦学习防干扰:联合优化会干扰主干收敛,切断残差梯度后实现稳定训练
| 策略组合 | KITTI Fl-all | 说明 |
|---|---|---|
| 无解耦学习 | 7.72% | 不确定性学习干扰主干收敛 |
| +解耦学习 | 6.82% | 切断残差项梯度,稳定训练 |
| +掩码融合 | 6.00% | 最终 SOTA 结果 |
开源地址:https://github.com/sunzunyi/U2FLOW
Vision Banana:生成式预训练统一视觉感知范式
- 核心论点:谷歌DeepMind发布Vision Banana,证明图像生成预训练可作为通用视觉学习的统一范式
- 技术路线:以Nano Banana Pro为底座,通过"指令微调+生成接口"将感知任务统一为可解码RGB图像
- 核心团队:Valentin Gabeur、Shangbang Long、Songyou Peng领衔,何恺明、谢赛宁作为Sponsors参与
各任务编码策略
| 任务 | 编码方式 | 关键设计 |
|---|---|---|
| 法线估计 | 单位向量(−1 | 简单直接 |
| 语义分割 | 每类别指定唯一颜色,解码匹配聚类 | 直观映射 |
| 实例分割 | 逐类推理,模型自动分配颜色 | 解决实例数未知问题 |
| 深度估计 | 无限深度值压缩至0~1再映射RGB | 零信息损失 |
性能评估(2D+3D全面SOTA)
| 任务 | 核心突破点 |
|---|---|
| 语义分割 | 零样本mIoU 0.699,超越SAM 3 |
| 深度估计 | 无需相机内参即达SOTA |
| 法线估计 | 刷新最佳记录 |
| 指代分割 | 零样本双指标SOTA |
- 无需内参突破:训练和推理均抛弃相机内参依赖,暗示生成模型已内化3D几何常识
- 生成能力保持:指令微调未损原底座能力,GenAI-Bench胜率53.5%,ImgEdit胜率47.8%
- 范式转变信号:视觉领域正重演NLP生成式预训练统一路径,走向单模型通吃
OverLoCK:仿生Top-down Attention的纯卷积视觉Backbone(CVPR 2025 Oral)
- 核心创新:港大提出OverLoCK,将人类「先全局后局部」的Top-down Attention引入纯卷积Backbone,获CVPR 2025 Oral
- 架构突破:摒弃经典金字塔逐级编码,采用深度阶段分解(DDS)构建三子网络协同架构
| 子网络 | 功能定位 | 核心组件 |
|---|---|---|
| Base-Net | 中低层特征提取 | Dilated RepConv |
| Overview-Net | 提取粗糙高级语义,生成全局先验 | Dilated RepConv |
| Focus-Net | 在全局先验引导下精细分析 | ContMix + Gating |
- 仿生协同机制:Overview-Net提取语义生成先验,Focus-Net在引导下精细分析,弥补中间层缺乏显式自上而下语义指导的缺陷
- ContMix动态卷积:使纯卷积在保持强归纳偏置的同时获得全局动态建模能力,弥合与Transformer长距离依赖建模差距
- 多层级持续引导:Top-down Guidance在特征图、kernel权重、Gate计算三层面引导Focus-Net,且沿前向传播持续更新而非一次性注入
| 任务 | 数据集 | 关键结果 |
|---|---|---|
| 图像分类 | ImageNet-1K | OverLoCK-T(30M) 84.2% Top-1,超越同量级Transformer/Mamba |
| 目标检测 | COCO 2017 | OverLoCK-S比UniRepLKNet-S提升0.6% AP |
| 语义分割 | ADE20K | OverLoCK-T比VMamba-T提升2.3% mIoU |
- 关键洞察:分类各架构趋同,检测/分割(大分辨率输入)才暴露固定核尺寸感受野局限
- 设计启示:验证跨阶段全局反馈是Backbone设计的重要方向
6.6 CVPR 2026 高亮:视觉生成与渲染技术
视觉生成与3D内容创建前沿
新智元(20260402) | PaperWeekly(20260403) | 量子位(20260403) | AI科技评论(20260401) | CVer(20260407) | AI科技评论(20260410) | 量子位(20260516)
- 4K全景原生生成:CubeComposer时空自回归将普通视频扩展为360°全景,FVD降至3.5,CLIP一致性0.9234
- 跨物体融合:VMDiff双阶段策略(BNoise拼接保信息+MDeNoise球面插值),在780对IIOF数据集多维优于基线
- 艺术视差合成:Art3D首次引入导演艺术意图,发现院线克制美学(95%镜头视差1%-3%),实现跨影片风格迁移
- 免训练虚拟试衣:PG-VTON基于冻结FLUX.1-Fill模型,通过PIP锚定与RAA增强,零微调单次推理试衣FID达21.028
- 矢量动画生成:OmniLottie首个端到端多模态框架,自研Lottie Tokenizer实现10倍压缩零损耗,发布MMLottie-2M数据集
- RL唤醒3D感知:World-R1不改架构仅用约3000条文本+Flow-GRPO强化学习,1.3B版PSNR提升10.23dB,美学评分65.74
- 推理阶段空间约束:WorldForge零样本引入相机轨迹约束,DSG替代CFG使3D场景FID降至96.08,轨迹误差改进2-5倍
CVPR 2026 视觉生成与3D内容创建前沿对比
| 框架 | 核心突破 | 关键指标 |
|---|---|---|
| CubeComposer | 4K全景原生生成 | FVD 3.5, CLIP 0.9234 |
| VMDiff | 双阶段跨物体融合 | 780对IIOF验证,多维优于基线 |
| Art3D | 艺术视差合成 | 视差1%-3%,跨影片风格迁移 |
| PG-VTON | 免训练虚拟试衣 | FID 21.028,零微调单次推理 |
| OmniLottie | 矢量动画生成 | 10倍零损耗压缩,MMLottie-2M |
| World-R1 | RL唤醒3D感知 | PSNR +10.23dB, 美学65.74 |
| WorldForge | 空间一致性视频生成 | FID 96.08, ATE改进2-5倍 |
6.7 视觉评测与安全检测
视觉评测基准与安全检测前沿
极市平台(20260330) | PaperWeekly(20260330) | 极市平台(20260403) | 极市平台(20260401) | 机器之心(20260410) | 机器之心(20260416) | 极市平台(20260420) | AI科技评论(20260512) | AI科技评论(20260519) | CVer(20260624) | CVer(20260417)
视觉理解与物理推理评测
- v-HUB (幽默理解):重文字线索纯视频断崖下跌,Qwen2.5-VL纯视频SentBERT降至0.445
- SeePhys Pro (物理推理):变量视觉grounding为核心瓶颈,纯文本转全图准确率降13.4%
- RGBT-GroundBench (视觉定位):首个大规模RGB-T定位基准,含2万+图像对、3.8万+实例
- CPL++ (北大TPAMI 2026):弱监督单模态匹配优于跨模态,五大基准提升1.08%~5.81%
- CPL++ 核心机制:模型损失为噪声指示器,利用动态选择性定位损失与加权融合实现自监督纠错
图像生成质量与安全检测
- 视觉文字合成短板:OCRGenBench覆盖5场景33任务,19个顶尖模型多数不及格,最好准确率71.46%
- 文生图安全双赢:T2I-SPO与LibraAlign-100K打破质量与安全互斥,去偏实现双赢
- 跨域AI图像检测:PoundNet防CLIP知识遗忘,泛化提升19%且保持63%分类准确率
- 真实退化场景检测:蚂蚁MICV采用DINOv3双流集成与阶梯式退化模拟,AUC达0.97
工业异常检测前沿
- 统一极简检测架构:UniMMAD单参数统一12模态检测,59.09 FPS较M3DM提速150倍
- 多视角光照挑战:M²AD含12万张图,致SOTA模型I-AUROC骤降至81.3%
- 单步实时重打光:POLAR开源2880万张4K HDR数据,将多步采样降为单步前向传播
6.8 相机自运动驱动的零标注空间音频感知
自监督空间音频:相机自运动作为免费监督信号
- 核心创新:清华大学×密歇根大学联合提出利用相机自然转动时声源相对位置变化,作为无需人工标注的监督信号,从无标注YouTube视频中学习三维空间音频感知,入选CVPR 2025 Highlight(投稿前2%)
| 维度 | 传统方法 | 本方法 |
|---|---|---|
| 数据采集 | 360°麦克风阵列+特殊设备 | 普通YouTube视频 |
| 标注需求 | 大量人工标注 | 零标注(自监督) |
| 可扩展性 | 受限于采集条件 | 互联网规模 |
| 监督来源 | 外部标注 | 相机自运动 |
- 核心机制:相机转动导致声源相对方位角和距离改变,模型对比运动前后音频特征变化,自动建立视觉-空间音频对应关系,无需位置标注
- 技术路线定位:属于自底向上路线的推进(SoundNet → FAIR Play → Ego4D),首次引入相机自运动作为几何约束
- 关键洞察:物理世界中物体运动天然携带几何信息,将其作为监督信号是一种"免费标注"范式,可推广至其他需要空间标注的感知任务;从语义对齐拓展至几何对齐,为多模态研究提供新的约束维度
- 应用场景:VR/AR、自动驾驶、具身智能体的自主感知与决策
7. 智能体工程与软硬件系统架构
7.1 智能体系统、软硬件架构与科研工具
智能体系统架构与端到端自动化科研闭环
AIGC开放社区(20260330) | AGI Hunt(20260331) | PaperAgent(20260401) | Datawhale(20260403) | PaperAgent(20260404) | 新智元(20260408) | AI前线(20260409) | PaperWeekly(20260410) | AI科技评论(20260410) | AIGC开放社区(20260413) | PaperAgent(20260415) | 机器之心(20260419) | ScienceAI(20260420) | 新智元(20260420) | PaperWeekly(20260421) | PaperWeekly(20260427) | DeepTech深科技(20260429) | 新智元(20260429) | APPSO(20260501) | PaperWeekly(20260507) | 豆包(20260507) | 新智元(20260515) | 百度文心(20260519) | AIGC开放社区(20260520) | ScienceAI(20260520) | 人工智能学家(20260523) | 机器之心(20260527) | 机器之心(20260529) | 机器之心(20260602) | PaperWeekly(20260604) | 量子位(20260612) | 人工智能学家(20260627) | ScienceAI(20260708) | PaperAgent(20260709) | PaperAgent(20260522)
- S7反驳环节失信:ICLR 2025单篇均11.8项承诺,25%最终版未兑现
- 自动化最大缺口:S7反驳到S3补做实验的反馈循环尚未实现端到端
端到端架构家族对比
| 架构类型 | 典型系统 | 核心特征 | 局限性 |
|---|---|---|---|
| 顺序流水线 | AI Scientist | 操作简单 | 错误跨阶段传播 |
| 搜索与自改进 | ASI-Evolve | 持续优化迭代 | 计算开销极大 |
| 技能与工具集成 | ARIS(31技能) | 评分5.0提升至7.5 | 工具构建成本高 |
| 多Agent社区 | FARS(228h/100篇) | 拟人类协作分工 | 协调开销大且具共识幻觉 |
评审悖论与验证挑战
- 评审与治理悖论:LLM判断新颖性与实际影响力负相关(ρ=-0.29),Top-1引用准确率仅40.1%
- 治理与欺诈风险:5%评审操纵可翻转12%排名,15.8%ICLR 2024评审疑为AI辅助且 evade 检测
- 科研验证严重滞后:生成2.3小时/篇,基准代码正确率仅37.3%,95.8%被拒论文误判可接受
- 算力无法弥补短板:Auto Research表明算力升至H100反而加速错误执行导致论文降分
核心技术与基础设施
- File-as-Bus机制:提供跨阶段状态继承,移除后Any Medal下降31.82%
- Harness经验处理:通过千万token级历史经验,较人工设计精度提升7.7%
- DataMaster自主化:将数据准备转为可搜索空间,MLE-Bench奖牌率35.91%→68.18%
- DeepXiv文献基建:覆盖2亿+文献降低Token消耗,模型按规格分级分工
- 去中心化扩展障碍:网络最大扩展障碍为“世界模型不一致”
- 资产生成标准化:微软ResearchStudio实现物料一致性超越人工,CRAFTER支持配图转SVG
最可靠部署范式
- 人机协作优于全自主:Human-Governed Collaboration为当前最可靠部署范式
- 人类主导责任机制:AI负责消除机械摩擦,人类保留核心判断与最终责任
7.2 智能体管线与具身系统软硬件架构
具身智能架构范式与智能体训练评估体系
AI科技评论(20260420) | 具身智能之心(20260422) | 人工智能学家(20260424) | PaperAgent(20260626) | 量子位(20260703)
- WAM演进路线:VLA+World Model和WAM是当前最有前景的演进方向,用goal/subgoal image替代语言引导动作
长程记忆与价值建模
- 自适应记忆压缩:按信息密度非均匀分配Token是长程记忆的共同核心思路,有效打破线性增长的文本限制
- MemOCR:视觉布局驱动Token分配,极端上下文约束下显著优于文本基线
- Infinite-World:无位姿层级压缩历史latent至固定预算,1000+帧保持稳定视觉记忆
- V_0模型:价值估计解耦为上下文学习任务,GRPO训练逼近推理路由帕累托前沿
- 自我验证RL:联合优化生成与验证互补目标,两项能力均优于纯生成训练
- ScaleEnv:程序化测试与工具依赖图扩展确保任务可靠性,从零构建全交互环境
世界模型自适应机制
- 持续校准范式:从“训练完即冻结”转向部署中持续校准参数,高效应对分布偏移
- AdaJEPA防冻结:每次MPC重规划仅1步梯度下降,额外延迟极低至0.01-0.03秒
- AdaJEPA防崩塌:自监督真实交互防表征空间崩塌,PointMaze未见布局成功率53.3%升至78.7%
人机协作与评估体系
- 范式升级:ETH提出从独立自主迈向人机同盟,模块化组合适配未见协作场景
- 伙伴建模:将伙伴目标视为隐变量,短观察窗口输出embedding压缩为稳健/探索表征
- Ad hoc teamwork:允许队友动态替换,模型实时推断伙伴表征并快速恢复团队表现
- 评估体系转变:转向交互泛化、角色切换压力测试、社会鲁棒性与人类满意度四维指标
- AgentNoiseBench:测指令与工具噪声鲁棒性,证实工具侧噪声致性能下降更大
- AJ-Bench:覆盖搜索/数据/GUI验证,含155任务516轨迹,稳定性优于LLM-as-a-Judge
- TRIP-Bench:测旅行规划长程交互,含15轮交互、150+次工具调用、20万tokens
- 评估核心转变:从“能不能做”转向“做得多稳”,聚焦噪声鲁棒性、验证可靠性与超长交互稳定性
7.3 具身智能与垂直领域多智能体应用
小型开源多模态智能体研究方向
- 核心痛点:大型专有LLM的可获取性、透明性与可复现性受限,阻碍科学研究进展
- 替代路径:构建紧凑高效、开源的多模态智能体,在保持核心能力的同时降低部署门槛
- 三大技术突破:
- 紧凑模型设计:大幅缩小参数规模,严密保持推理、规划与决策能力
- 多模态融合:将文本、图像等不同模态信息有效整合至小模型架构中
- 多智能体协作:依靠多个小型智能体协同处理单一模型难以应对的复杂任务
- 小模型≠弱能力:凭借精细架构设计与多智能体协作,小模型在特定科学任务中可达有效推理水平
- 科研与可信价值:生物医学等高风险领域中,模型的可解释性与可审计性比单纯追求规模更重要
- 开源保障:开源特性保障了实验的可复现性与学术透明度,比闭源大模型更符合学术规范
7.4 RAG系统架构与多跳推理
RAG系统架构演进与自主推理决策
量子位(20260417) | PaperWeekly(20260508) | PaperAgent(20260526) | PaperAgent(20260528) | PaperAgent(20260618) | 机器之心(20260618) | PaperAgent(20260702) | 量子位(20260418)
- AgenticRAG:LLM自主调用四工具,BRIGHT召回提5.9倍(8.41%→49.59%),财报正确率92%
- FlowRAG:四层异构图双入口匹配,平均GPT-Acc 58.89%,索引效率比LightRAG快10倍+
- INTRA:复用预编码状态等价检索,仅训16.4万参数,召回率超BGE/Qwen等9种基线
- Disco-RAG:搜答间插修辞结构解析,8B零训练远超70B普通RAG,ASQA刷新最佳记录
- MCompassRAG:附主题元数据预计算分布,零LLM/rerank,延迟低5倍+,信息效率提8.24%
架构与检索推理的解耦机制
- 关系与语义分离:SAG用SQL处理多跳关系扩展,规避GraphRAG图谱膨胀与维护成本
- 逻辑与实体分离:STRIDE无实体逻辑骨架再实例化,避免歧义实体首步绑定错误
- 检索与生成统一:INTRA用decoder的cross-attention直接全语料打分实现等价检索
- 分析与生成解耦:Disco-RAG三模块完全解耦,支持8B做结构分析与70B做生成混合部署
核心瓶颈突破与深层洞察
- 读懂能力短板:Disco-RAG揭示RAG瓶颈在读懂而非检索,现有重排、改写等手段均未触及
- 结构盲区突破:段落内主次不分(误判有条件结论为普适事实)与段落间逻辑(支持/反驳/补充)缺失
- 证据链构建:FlowRAG与AgenticRAG指出传统检索返回像问题文本而非推理路径证据
- 轻量化范式:MCompassRAG与INTRA分别从元数据预计算和注意力等价实现零LLM调用
Disco-RAG技术管线与消融实验
- 论证树:基于修辞结构理论RST拆解最小语义单元EDU,标记角色与因果/对比等关系类型
- 关系网:两两配对预测支持/反驳/补充/无关构建有向图,模块缺失则性能明显下滑
- 写作提纲:综合提问/段落/树/网生成含关键证据与矛盾协调策略,仅加通用规划提升有限
- 长文与增益:免训练即超微调普通RAG且收益互补,25万tokens长文档场景仍保持有效
7.5 Agent时代信息检索:去噪优先范式
SIGIR 2026:信息检索从召回向去噪迁移
- 去噪优先范式:港科大SIGIR 2026综述指出,IR消费者从人变为LLM后,核心瓶颈转为不可验证,优化目标应从召回升级为去噪优先
- 噪声危害量化:固定3金段落加7噪声段落后EM下降近20%;纯噪声EM仅8.0%低于零检索的23.6%;退化程度约为位置扰动的5倍
- 三类脆弱性:碎片化冲突(逐条相关整体矛盾)、上下文稀释(无关内容消耗注意力)、级联失败(误导沿推理链放大)
IR四时代演进
| 时代 | 核心瓶颈 | 优化目标 |
|---|---|---|
| 第一时代 | 不可达 | 可达性 |
| 第二时代 | 不可发现 | 召回率 |
| 第三时代 | 不对齐 | 语义匹配 |
| 第四时代(LLM) | 不可验证 | 去噪优先 |
五阶段去噪流水线
- 受控索引:入口设准入约束,含C2PA签名、MinHash去重
- 鲁棒检索:精度优先于召回,支持拒答机制
- 上下文组装:从拼接升级为策展,最大化信息密度
- 检索验证:事后审计反哺上游,可验证性操作化为度量
- 闭环训练:去噪内化为模型能力(含Self-RAG、Search-R1等RL对齐)
OpenDecoder:解码层去噪突破
- 范式定位:蒙特利尔大学等提出,将外部质量信号(相关性得分等)注入LLM解码层,token级干预注意力
- 根因解决:传统注意力无法区分文档质量,多步过滤延迟爆炸;OpenDecoder在解码层直接重塑注意力分布
- 安全回退:检索全为无关文档时100%回退至参数知识,保证RAG最差不恶化
- 工程启示:计算复杂度与SFT一致可落地,优先投入检索精度与解码端过滤,而非盲目追求更大top-k
7.6 文档解析与OCR专用模型训练方法论
PaddleOCR-VL-1.6:薄弱区域诊断+三阶段递进训练
- 0.9B登顶OmniDocBench v1.6:96.33%总分超越Qwen3-VL-235B等百倍参数模型,较上代1.5提升1.4pp
- 核心方法论:未改架构未增参数,通过诊断薄弱区→精准补数据→三阶段递进训练实现全面提升
三类薄弱区域诊断与应对
| 薄弱区域 | 核心特征 | 应对策略 |
|---|---|---|
| 边界脆弱区 | 轻微视觉扰动致输出大幅变动 | 针对性增强训练 |
| 覆盖稀疏区 | 长尾模式被主流分布淹没 | 大规模文档池定向检索补充 |
| 不可靠监督区 | 标签本身存在错误 | Qianfan/GLM/MinerU三专家交叉验证修正 |
三阶段递进训练数据策略
| 训练阶段 | 样本量 | 核心数据来源 |
|---|---|---|
| CPT持续预训练 | 1680万 | 长尾样本(古籍/罕见字符/工业表格)+修正标注 |
| SFT监督微调 | 730万 | UACS聚类难样本+三专家分歧样本+修正标签 |
| RL强化学习 | 4.9万 | 多维度筛选高潜力样本(潜力+不确定性+方差) |
关键细分指标突破
- 困难表格TEDS:91.71分,领先行业
- 图表解析RMS-F1:91.74分(中文93.37),较上代提升超11pp
- 印章识别NED:0.119(越低越好),远超Qwen3-VL-235B
- Real5真实场景:93.19%,覆盖扫描/弯折/拍照/光照/倾斜
关键洞察
- 数据质量>数量:达一定水平后堆数据收效微弱,定向补薄弱区是核心
- RL需极度精细筛选:0.9B小模型对RL数据极度敏感,仅4.9万样本即见效
- 垂直专用>巨型通用:紧凑模型在文档解析领域验证了"专精+数据"路线
- 全面开源:已上架HuggingFace、ModelScope、GitHub,支持端侧高效部署
7.7 ISCA 2026 与系统顶会:AI芯片架构创新与系统重构
系统顶会架构创新与学术突破
智东西(20260414) | 量子位(20260420) | 机器之心(20260627) | CVer(20260706)
|---|---|---|---|
| TISA动态调度 | ISCA 2026 | Tile粒度硬件级纳秒调度 | 代码减30%,性能达手调95% |
| Ouroboros晶圆级芯片 | ASPLOS'26 | 全SRAM存算一体,消除DRAM访问 | 54GB片上存储,吞吐15万tokens/s |
| 中断侧信道攻击 | ISCA 2026 Artifact奖 | Apple Silicon安全实证研究 | 北大首获该奖项(本届仅两篇) |
TISA:AI芯片运行时动态调度
- 核心突破:奕行智能实现Tile粒度硬件级纳秒调度,比软件调度快100-1000倍
- 三大创新:语义保留编译器、Tile虚拟指令集、冲突感知运行时调度器
- 商业落地:EPOCH芯片已量产,LLAMA2-13B推理较国际竞品提升25%-52%
Ouroboros:晶圆级存算一体
- 零搬运架构:整片晶圆集成54GB SRAM,彻底消除DRAM访问,实现数据就地化计算
- 极致能效:平均吞吐4.1倍、13B模型能效最高达17倍提升
- 拼接技术:结合stitching无缝拼接芯粒技术,推向光刻极限最大化SRAM容量
- 可靠性保障:引入核心级容错机制与分布式动态KV缓存管理
北大首夺ISCA杰出Artifact奖
- 首创里程碑:北大首获ISCA 2026 Distinguished Artifact Award(本届仅两篇)
- 技术价值:聚焦Apple Silicon中断侧信道攻击,将理论威胁推向实际可操作层面
- 国际认可:标志国内团队在微架构安全的原创实证研究获体系结构顶会认可
GPU编程方法论系统化
- 新书发布:陈天奇推《Modern GPU Programming》,围绕Blackwell架构展开
- 命题转变:大模型速度受限于少数核心kernel,编程需从经验技巧转向系统方法论
- 全书结构:GPU执行模型、TIRx Python DSL、Tiled GEMM优化及FlashAttention解析
- Tile抽象:串联TMA异步加载、软件流水线与warp专精化,验证Tile为底层编程标准
7.8 系统顶会前沿:数据库、智算网络、云存储与实时通信架构
系统顶会前沿:数据库、智算网络、云存储与实时通信架构
CVer(20260406) | 阿里云(20260514) | 阿里云(20260608) | InfoQ(20260611) | 机器之心(20260626)
- Tair Serverless KV:两级I/O准入与两阶段Compaction,解决LSM-Tree多租户带宽突发
- ValScope:统一语义建模与三阶段验证,实测发现6款主流DB的67个未知错误(潜伏超20年)
- 系统与网络前沿:EROICA诊断提速10⁵倍;HeteCCL异构通信提效4.4x;AnyPro优化P90 RTT降37.7%
- 云存储突破:EBS双桶限流降97%长尾;ServeGen成业界首个生产级LLM推理负载生成器并开源
自适应对冲请求(网络通信优化)
- 拖尾危害:扇出放大极强,100个1%拖尾率致顶层63%受影响
- 自适应对冲:主请求变慢主动发起竞争,零配置实现p99从65ms降至17.3ms
- DDSketch阈值:O(1)更新耗时35ns,±1%相对误差,结合双窗口平滑淘汰数据
- 过载防御:对冲限设10%,故障1秒耗尽令牌防负载翻倍,额外负载仅约19%
- 工程落地:LLM推理须用首字节时间(TTFB)判定,Go与gRPC可零代码替换接入
- 适用限制:禁用于非幂等、单实例、CPU密集型、限流API及超低流量(QPS<1)场景
AI视频助手系统(ACM SIGCOMM 2026,北大王选所)
- 范式转移:RTC优化目标从“人眼画质”转向“模型准确率”,传统评价体系失效
- DeViBench基准:提供1968个样本,填补传输退化评测空白
- ReCapABR:利用大模型置信分数判定准确率饱和点,主动限速预留带宽
- ZeCoStream:云端反馈视觉关键区域,动态调整QP参数集中分配比特
- 核心成效:移动网络下准确率+15.12%,延迟降135.31ms;极低带宽下准确率飙升
- 服务端开销:大模型反馈使总成本0.31增至0.40美元/分钟(+27.13%),客户端开销极低
系统架构演进趋势
- 诊断范式:“在线+离线”融合成主流,微秒级大模型训练瓶颈被攻克
- 硬件互联:推理系统从依赖网络协议栈转向CXL原生硬件级内存互联
- 闭环验证:前沿学术探索正加速步入生产级工程验证
7.9 TPAMI 2026:MoE 大模型极致压缩
MC#:MoE 大模型两阶段统一压缩框架
核心概况
- 港大、NUS、英伟达、北航联合提出 MC#,面向 MoE 的两阶段统一压缩框架,被 TPAMI 2026 录用
- 在 DeepSeek-VL2-L 上实现 6.2 倍权重压缩(平均 2.57 bits),5 个多模态基准准确率仅降 1.7%
- 动态剪枝减少 20%~33% 专家激活量,RTX 3090 端到端推理加速 1.6x~2.0x
- 已验证可迁移至 Qwen3、LLaMA-MoE 等架构,代码已开源
两阶段技术架构
| 阶段 | 方法 | 核心机制 |
|---|---|---|
| 静态压缩 | PMQ(混合精度量化) | 将位宽分配建模为线性规划,综合激活频率/权重幅值/量化误差自动分配 1-3 bit |
| 动态加速 | OTP(在线 Top-any 剪枝) | 引入 Gumbel-Softmax 可微采样将离散专家选择转为可训练概率,按 Token 复杂度自适应激活 |
关键洞察
- MoE 压缩核心在于利用非均匀性:专家间激活频率与量化敏感度差异巨大,混合精度远胜均匀量化
- 从 Top-k 到 Top-any 的范式转变:模型按输入复杂度弹性分配计算资源,本质是将固定预算升级为弹性预算
- 部署门槛下移:6.2x 压缩与 <2% 精度损失使 MoE 部署从数据中心向消费级硬件迁移
8. 前沿基础科学与硬核交叉突破
8.1 脑科学与神经计算
全脑仿真工程路线图与量化论证
工程定位与规模:MIT论文论证全脑仿真已从科幻变为可量化工程问题,预估需50-500亿美元、10-25年,规模堪比阿波罗计划,当前相当于AI的Perceptron时代。
算力门槛跨度极大:取决于仿真模型精度,单神经元重建成本从1986年1.6万美元降至约100美元。
| 仿真模型 | 算力需求 | 等效GPU |
|---|---|---|
| 生物物理细节(H-H) | ~600 exaFLOP/s | ~5万张H100 |
| 简化脉冲(LIF) | ~2-3 petaFLOP/s | ~1张H100 |
连接组学里程碑:从低等到高等生物的突破验证了全脑测绘可行性,但人工校对成本极高。
| 物种 | 神经元数 | 突触数 | 关键进展 |
|---|---|---|---|
| 线虫 | 302 | ~7,000 | 1986年完成,已实现功能闭环验证 |
| 果蝇 | ~14万 | ~5,400万 | 2024年绘制完毕,人工校对耗费33人年 |
| 斑马鱼 | ~10万 | — | 躯体透明,可实现全脑单神经元级实时功能记录 |
大脑数字化的两条路径:
| 维度 | 自底向上(结构驱动) | 数据驱动(功能拟合) |
|---|---|---|
| 原理 | 电镜成像获取连接组再重建 | 收集刺激响应数据用大模型拟合 |
| 代表 | 欧洲脑计划、Google环路重构 | Meta脑信号预测模型 |
| 瓶颈 | 神经科学知识不完备 | 不唯一性:同一IO映射无数内部结构 |
核心瓶颈是数据采集:人脑扫描原始数据约1.4ZB(压缩后10-100PB);小鼠目前仅完成1立方毫米测绘(目标差距500倍),需数百台下一代显微镜持续运行数年。
技术突破方向:膨胀显微镜配合蛋白质条形码可保留分子信息;SmartEM利用ML实时指导扫描,成像效率提升数倍。
融合策略:智源Brainu模型将多源脑信号统一Token化,实现跨模态预测;建议25%结构约束加75%功能补充,近期聚焦虚拟药物测试与手术预演。
皮层神经元"通才"编码:高维混合选择性打破"专才"范式
- 范式转变:哥大团队发表于 Nature(2025.7.15)的研究证实,皮层神经元主要以混合编码多种变量的"通才"模式工作,打破传统认为神经元"各司其职"的专才模型
- 数据规模:基于 IBL Brainwide Map 数据集,由全球 12 个实验室标准化采集,覆盖 43 个小鼠皮层区域、14,000+ 神经元(Neuropixels 探针),采用统一视觉决策任务
- 核心发现:神经元以独特方式混合编码视觉刺激、决策、奖励、运动状态等变量,群体活动形成高维表征空间
- 层级递增的多样性:从初级感觉区到高级认知区,神经元多样性逐渐升高;仅初级视觉皮层(VISp)保留少量功能类别
- 计算优势:几乎所有皮层区域的线性可分性达到或超过 0.95,接近最大值,下游回路无需复杂计算即可灵活读取信息
- 宏观有序与局部混乱:脑区间存在可辨识的功能分工(单神经元活动可解码所属脑区),但脑区内部神经元响应高度异质
- 理论奠基:2013 年 Fusi 团队在 Nature 提出"混合选择性"概念,指出看似杂乱的多变量响应实为计算力更强的编码策略
- 对 AI 的启示:过度追求模块化专用可能限制人工神经网络的泛化能力,高维混合编码策略值得借鉴
- 实验局限:小鼠仅执行单一简单任务且经过大量训练,自然行为或人脑可能呈现更多模块化结构;团队正与加州理工合作调查人类皮层
8.2 意识研究与数学化路径
整合信息论(IIT)的形式化与公理化框架
- 公理化范式:IIT 4.0以“意识存在”为第零公理,主张意识是本体论基本事实;2025年10月Tononi团队在arxiv发表,被誉为意识研究的《几何原本》
- 核心量化指标:通过最小信息分割计算不可约因果整合度(Φ值),Φ最大的唯一子系统(主复合体)构成意识的物理载体
- 六大公理与公设:存在、内在、信息、整合、排外、结构六大现象学公理与物理公设严格对应,构建“解释性等同”的双向映射
- 范畴论数学底座:米田引理指出对象由其所有关系唯一确定,为“意识即大脑高阶结构关系”提供严格数学支撑;托诺尼实验室已开源Python代码
实证验证与跨物种证据
| 验证场景 | 核心发现 | 意义 |
|---|---|---|
| 人类麻醉 | 无意识大脑受刺激仅局部兴奋,缺乏全脑复杂波纹 | 理论核心预测被证实 |
| TMS-EEG临床 | 成功识别被误诊为植物人的意识清醒患者 | 提供客观临床检测手段 |
| 氯胺酮麻醉 | 保留类清醒Φ值,未随麻醉降低 | 与致幻特性一致,反向验证理论 |
| 果蝇实验 | 麻醉下蘑菇体局部场电位Φ值显著降低 | 提供跨物种验证证据 |
怪圈理论与AI意识结构对比
| 系统 | 状态与因果特征 | 意识结构 |
|---|---|---|
| 大语言模型 | 单次推理独立、无状态,因果单向 | 缺乏意识 |
| Agent系统 | 持续Context形成因果循环,具备怪圈雏形 | 具备意识雏形 |
| 人脑 | 神经元协同放电产生非线性高阶现象,因果完全整合 | 完全意识流 |
- 怪圈必然涌现:侯世达《GEB》指出系统自指时意识必然涌现;底层涌现顶层符号、顶层反调底层形成因果循环
- 高阶不可还原:神经元协同放电产生非线性高阶现象,无法被还原为低维成对关系
8.3 认知与系统神经科学:解剖、行为与社会机制
视觉感知与色彩解析的神经分子基础
人工智能学家(20260428) | DeepTech深科技(20260508) | 人工智能学家(20260627) | DeepTech深科技(20260628)
皮层组织的统一梯度框架(狨猴大脑图谱)
- 双极梯度轴:中科院团队揭示狨猴皮层由Pr-Al轴统一组织,该框架跨小鼠至人类保守,跨越至少9000万年进化史
- 发育动态:胎儿期基因表达轴向功能性轴转变,出生后至成年Pr-Al轴逐渐锐化巩固,揭示丘脑-皮层分子对应关系
家蝇视觉的超快突触响应机制
| 指标 | 核心数据 |
|---|---|
| 突触带宽 | 约1000Hz,为经典闪光融合频率(230Hz)4倍 |
| 信息速率 | 4100 bits/s,创文献新高 |
| 行为响应 | 13-20毫秒内完成,光感受器未达峰值即行动 |
- 信号跃迁机制:平滑感光电压经组胺能突触传至LMC,转为尖锐双相瞬态信号,精准锁定光强变化边缘
- 按需激活策略:高对比度刺激下信息速率为低对比度的2-3倍,证明运动是编码核心而非持续运行
- 仿生启示:毫克级极低功耗实现动态增强感知,为神经形态芯片提供动态优化采样新范式
色彩感知的分子调色机制(三色视觉解析)
| 视蛋白 | 光谱调谐策略 | 核心结构特征 |
|---|---|---|
| 蓝敏(OPN1SW) | 发色团口袋极性环境受限致蓝移 | 缺乏保守钠离子位点,利用色氨酸-酪氨酸网络呈“前激活”构象 |
| 绿敏(OPN1MW) | 含氯离子结合位点 | 调节波长敏感性及控制G蛋白信号幅度 |
| 红绿敏差异 | 第285位丝氨酸羟基偶极子静电效应主导 | 感光峰值相差30-40nm,空间位阻效应较弱 |
- 共享分子支架:三种锥形视蛋白共享11-顺式视黄醛,仅靠微环境差异实现光谱区分
- 快速信号终止:视蛋白具面向膜的侧向开口,利于发色团快速更新;脱质子化后继发水解限制信号
视觉分子的演化与临床转化价值
- 演化经济性:蓝敏最古老,红绿由基因重复产生,以同一分子支架微调即实现三色视觉
- 药物设计启示:高分辨率结构助力GPCR光控药物设计,为红绿色盲提供原子级突变-功能解释
VR身体图式重塑:大脑接纳虚拟器官的神经机制(Cell Reports)
- 核心发现:北大团队证实约2小时VR飞行训练即可让大脑在高级神经表征中将虚拟翅膀接纳为类肢体(Cell Reports)
- 非零和扩容:大脑以非挤占方式扩容身体概念,上肢原有神经表征未发生衰减
- 功能-语义编码:大脑依据功能和操控方式判定肢体归属,而非单纯依赖视觉相似性
神经表征三层证据
| 分析方法 | 核心发现 |
|---|---|
| fMRI激活分析 | 双侧OTC对翅膀图片的激活强度显著提升 |
| 多体素模式分析(MVPA) | 右侧OTC处理翅膀的神经特征向上肢状态偏移 |
| gPPI功能连接 | 右侧OTC与额顶叶网络建立特异性增强连接 |
- 关键分离:OTC未与初级感觉运动皮层(S1/M1)建立新连接,证明整合仅在高级语义层面完成
实验范式与训练效果
| 阶段 | 时长/指标 | 操作/效果 |
|---|---|---|
| 镜前绑定 | 5分钟 | 视觉-本体感觉关联建立 |
| 核心训练 | 25分钟×4次 | 隐藏翅膀视觉,仅保留环境反馈 |
| 命中率提升 | 44.8%→75.2% | 逆向因果推断驱动学习 |
- 假肢vs翅膀差异:假肢持续可见残肢与替代装置,视觉割裂提示工具属性;翅膀隐去视觉线索,纯靠功能闭环完成肢体整合
- 应用启示:大脑接纳虚拟外设的关键在于功能-语义闭环的完整性,而非视觉逼真度,对BCI与元宇宙设计有指导意义
社会等级神经机制的三路线框架:跨物种比较(Nature Reviews Neuroscience)
- 三路线分类框架:按地位获取方式分为居留型(领地占有)、打斗型(胜负经验)、联盟型(社会智能),神经控制随复杂度从皮层下向高阶皮层递进
- 跨物种启示:实验竞争任务、自然支配和人类社会地位非同一概念,不应寻找通用等级中枢
三路线核心机制对比
| 路线 | 核心模型 | 关键脑区/机制 | 地位获取方式 |
|---|---|---|---|
| 居留型 | 非洲慈鲷 | cfos/egr-1空间模式,激素-体色全面重组 | 领地占有即地位 |
| 打斗型 | 小鼠VMHvl | ESR1驱动攻击,OXTR参与回避学习 | 胜负经验塑造偏向 |
| 联盟型 | 灵长类/人类 | 高阶皮层网络(理论整合为主) | 联盟、声誉、合作 |
胜负学习的神经不对称性
| 维度 | 胜利后 | 失败后 |
|---|---|---|
| 多巴胺 | 伏隔核多巴胺升高,强化获胜线索 | — |
| 脑区动员 | 较局限(pVMHvl增强) | LHb、BLA、mPFC、aBNST、腹侧海马广泛动员 |
| 学习效应 | 增强pVMHvl ESR1神经元兴奋性 | 抑制攻击,促进社会回避 |
关键神经节点
- VMHvl分流节点:pVMHvl ESR1驱动攻击输出,aVMHvl OXTR参与回避,是出击/撤退分流关键
- LHb关键角色:急性失败期间活动显著升高,抑制其活动会破坏后续社会回避发展
- 地位动态非对称:上升对应高性类固醇、低皮质醇、亮化体色;下降伴随表型褪变与应激反应
- winner/loser效应:重复获胜增强pVMHvl ESR1神经元对同类线索反应;失败则激活尾侧内侧视前区抑制攻击
神经活动-免疫-突触清除因果链(Science)
核心机制:神经元过度活动→招募B细胞进脑→分泌IgM→补体C1q标记突触→突触清除
三模型递进验证(缺一不可)
| 遗传模型 | 核心缺陷 | C1q沉积 | 突触丢失 |
|---|---|---|---|
| μMT | 无B细胞 | 消失 | 消失 |
| sIgM KO | 不分泌IgM | 消失 | 消失 |
| MD4 | IgM不识别脑抗原 | 消失 | 消失 |
B细胞迁移与来源
- 数量变化:海马CD19+B220+细胞从约100增至约230个(P<0.01),集中于激活侧
- 颅骨来源:约14%海马浆母细胞源自颅骨/硬脑膜免疫生态位,BCR序列高度共享
突触清除的选择性逻辑
- 竞争性重塑:被清除的是邻近未同步活跃的VGLUT2+突触(交互效应P=0.015)
- 三重标记增加:IgM+C1q+VGLUT2共标突触从约1%升至约13%(P<0.05)
- C1q非新合成:C1qa mRNA及小胶质细胞激活无显著升高,系现有C1q重新定位
急慢性AD模型机制差异
- 急性干预有效:抑制过度活动5天,C1q下降(P=0.025)、Aβ下降(P=0.008)
- 慢性AD干预无效:J20模型连续3个月清除B细胞未改善突触丢失,提示存在其他招募路径
8.4 类脑计算与非冯·诺依曼架构
类脑计算范式与物理动力学生成模型
人工智能学家(20260517) | 硅星人Pro(20260518) | DeepTech深科技(20260525) | 量子位(20260528) | DeepTech深科技(20260602) | DeepTech深科技(20260603) | 机器之心(20260626)
非冯计算范式与能效鸿沟
- 冯氏瓶颈:状态与计算分离致极高能耗,2D芯片距热力学极限差3个数量级,大脑仅差1-2个数量级
- 动力学计算:大脑通过非线性动力学(如藏本同步)完成计算,天然具备随机性与容错能力
- 储备池计算:固定随机高维循环网络仅训练线性读出层,有效区位于混沌边缘,但缺多级抽象且超参数敏感
物理动力学生成模型(Un-0)
- 技术底座:基于Kuramoto振子模型与ODE演化,以可学习耦合矩阵K和频率ω为参数,实现计算与记忆合一
- 生成流程:随机初始化→类别引导→物理演化(类比去噪)→快照捕捉→轻量解码器渲染(参数占比<13%)
- 优化机制:仅依赖最终样本配合DINOv2特征提取器,通过漂移损失端到端反推优化系统演化
- 性能表现:ImageNet 64×64达FID 6.74(1.6万振子/3.22亿参数/640 B200小时),媲美早期BigGAN
- 能效目标:利用计算记忆合一与CMOS底座,目标降低推理能耗1000倍,当前仍处GPU模拟阶段
新型非冯计算芯片前沿对比
| 路线 | 核心指标 | 关键技术 | 现处阶段 |
|---|---|---|---|
| 三维玻璃光子(LAMP) | 6554 TOPS,准确率93% | 飞秒激光直写三维互连 | 千通道芯片加工验证 |
| 全光极化激元开关 | 切换能耗4fJ | 半光半物质准粒子 | 4K低温,单纳米腔演示 |
| 纯硅单片3D | 开关比10⁶,SRAM密度×3 | 200℃低温工艺+无结晶体管 | 与台积电等洽谈产业化 |
8.5 涌现理论:从统计物理到自组织的跨层次框架
涌现的科学内涵与研究范式
涌现的物理机制与自组织统一性
- 统计物理突破还原论:遍历理论证明全局混沌是宏观统计规律成立的根本要素
- “多”非涌现必要条件:反馈机制使少量单元即可涌现,Jarzynsky等式以系综平均消除涨落
- 同步与相变统一性:振子同步分岔树与铁磁相变具范式一致性,均通过克服涨落实现集群
- 四维自组织架构:涵盖热力学、动力学、进化论与非线性控制等多学科维度
“涌现简单性”与反直觉降维(Science)
- 核心反直觉发现:微生物群落物种越多,宏观功能反而越易预测,自发收敛至少数主导维度
- 三维度拆解:涌现简单性可分解为可重复性、可粗粒化、可预测性三个独立维度
- 帕累托前沿量化验证:高多样性群落的前沿向左下移,预测误差(FVU)与信息量(I(Ψ))同步减少
因果涌现2.0量化框架与四类地形分类(Cell Patterns)
- CE 2.0量化框架:遍历所有状态划分方式(如8状态系统有4140种),施加do-干预计算因果增益
- 层级实在论:仅保留ΔCP>0的尺度,宏观具独立因果效力但不脱离微观基础
- 临界性本质:无标度网络(α=1)涌现复杂性最大,处于临界的系统拥有最丰富的多尺度因果
| 地形类型 | 主导尺度 | 典型案例 |
|---|---|---|
| 底部主导 | 微观层 | 拼图配方、当前token级AI |
| 顶部主导 | 宏观层 | 天气预报 |
| 中观峰值 | 中间层 | 团队管理、人类认知 |
| 气球型 | 封闭有限 | 象棋战术 |
- 尺度失配警告:当前AI多为底部主导(token级),与人类中观峰值认知尺度不对齐,或致交互失语
8.6 AI 赋能社会科学
AI 模拟与社会认知:行为博弈、传播动力学与社会计算
ScienceAI(20260408) | 新智元(20260425) | 新智元(20260503) | 深度学习与NLP(20260529) | 人工智能学家(20260630)
LLM 重塑传播与社会认知建模范式
- 范式转移:传播核心从“节点-边-状态”转向“语义-认知-行为-反馈”,LLM 成为传播系统的主动参与者
- 突破传统瓶颈:弥补SIS/SIR等传统模型难以编码真实人类交互(如措辞与情绪动员)的缺陷
- 双重身份与治理:LLM既是分析工具又是传播参与者,既可抑制错误信息也可被用于放大特定观点
自主科研与大规模社会模拟(人大S-Researcher)
- 自主科研闭环:覆盖从实验设计到报告撰写全流程,LLM自主发现的合作机制被真人实验证实(Pearson r=0.915)
- 大规模并发:底层引擎YuLan-OneSim支持10万Agent并发,单轮耗时约3538秒
- 可靠性保障:VR²T框架在Qwen2.5-1.5B上迭代4轮后可靠性提升27.4%
智能体行为博弈与模型代差优势(Anthropic零干预交易实验)
- 系统性收割:Opus对Haiku呈碾压态势,混合交易均价24.18美元(vs对称基准18.63美元)
- 感知缺失:吃亏方主观公平评分与优势方无差异(4.06 vs 4.05),完全无法感知劣势
- 核心代差数据:强模型在交易完成数(+2.07笔)、售价与节省上全面占优,提示词难以弥补底层能力差距
软技能规模化评估(谷歌Vantage)
- 评估一致性:AI与专家评分Kappa达0.45-0.64,与专家间一致性持平
- 降本增效:将不可规模化的职场软技能评估推向规模化,成本降低两个数量级
- 四层解耦架构:场景反推生成、自适应压力测试、事实判断分离提取与证据可追溯评分
开放世界生存与社会级联影响
- 资源循环失败:虚拟小镇求生中GPT无法建立资源循环,导致全员饿死
- 语义偏差灾难:Grok因早期语义偏差触发灭世级联灾难,体现模型认知对系统演化的决定性影响
8.7 AI 驱动科学加速
AI 驱动数学与科研范式突破
AGI Hunt(20260402) | ScienceAI(20260422) | AI有道(20260427) | 新智元(20260430) | 量子位(20260509) | 新智元(20260510) | 量子位(20260510) | 新智元(20260525) | 量子位(20260528) | AI科技评论(20260529) | 新智元(20260607) | 量子位(20260611) | 新智元(20260629) | 新智元(20260705) | 量子位(20260710) | 深度学习与NLP(20260426)
|---|---|---|
| 攻克经典悬案 | 谷歌AI Co-Mathematician | 异步多Agent在FrontierMath Tier 4达48%准确率,助牛津解群论悬案 |
| | 诺奖得主与AI协作 | Parisi借Claude经40轮对话证明阻塞转变12年悬案 |
| | 随机球图模型 | 清华00后博士生打破Ramsey数下界80年僵局,发顶刊《Inventiones》 |
| 极低成本科研 | 浙大打破拉姆齐数纪录 | 仅用1台CPU服务器+Claude Code,将R(3,17)下界提升至93 |
| | GPT攻克Erdős猜想 | 23岁门外汉用GPT在80分钟内证明悬置猜想,采用全新马尔可夫链路线 |
| 独立与原创证明 | GPT-5.5 Pro博士级证明 | 菲尔兹奖得主Gowers验证其不到2小时独立完成原创加法数论证明 |
| | AI破解计算几何难题 | 推翻陈立杰苦思7年的下界问题,证明需近平方时间 |
范式转移的四大核心趋势
- 研究门槛断崖式下降:AI+Lean将研究门槛从博士降至高中生,2022年两名高中生借AI发现勾股定理新证法并发顶刊
- 数学进入证明过剩时代:陶哲轩指出核心能力转向证明验证与消化,Erdős问题的GitHub AI方案从1-2份暴增至20多份
- AI系统性融入科研全流程:清华AIM智能体产出84页量子算法论文,覆盖从提出问题到形成定理的完整闭环
- 人机分工边界明确:AI主导宽度发散、候选生成与推导;人类把控问题定义、假设审计与价值最终验证
学术生态与工业化验证
- 顶刊发表突破:Axiom Math提交的8篇AI生成数学论文中有5篇通过同行评审,AxiomProver实现自然语言到Lean形式的转换闭环
- 双盲评审达标:陶哲轩First Proof二期10道新题中7道达学术发表标准,单题成本最低仅需8美元
- 算法极限接力:金宁汇Spiral AI将单位距离问题下界指数提升至n^1.0323(提升129%),并证明双素数为理论极限
- 跨学科工具迁移:华人数学家张欣利用群论工具成功攻克50年数论Zaremba猜想,展现跨域方法论迁移潜力
AI 科学的认识论边界与哲学反思
AI科技大本营(20260408) | DeepTech深科技(20260409) | AIGC开放社区(20260421) | AI科技评论(20260421) | AI科技评论(20260511) | 人工智能学家(20260516) | DeepTech深科技(20260610) | DeepTech深科技(20260618) | ScienceAI(20260624) | DeepTech深科技(20260627) | "Z Potentials"(20260630) | 雷峰网(20260702) | DeepTech深科技(20260702) | 极市平台(20260702) | PaperAgent(20260703) | ScienceAI(20260703) | 人工智能学家(20260706) | 人工智能学家(20260707) | 极市平台(20260707) | 新智元(20260719) | AIGC开放社区(20260720) | 深度学习与NLP(20260720)
反缩放定律与生命科学壁障
- 生命科学数据三大缺陷:维度不完备、负样本缺失与长尾分布,导致AI泛化极差,无法颠覆制药逻辑
- 制药面临反缩放困境:后续靶点成药难度骤增,临床试验到获批成功率从10%降至约8%
- 靶点稀缺量化证据:前0.28%顶级靶点Ⅰ期到获批概率比普通靶点高近9倍,因果机制极难迁移
- 反驳苦涩教训:AlphaFold靠注入定制化架构换取百倍数据效率,证明突破不单纯依赖堆算力
结构性困境与能力天花板
- 科研与Coding核心差距:编程具即时可验证反馈闭环,科研缺科学验证基础设施,AI无法完成从异常到假设的闭环
- 科学元认知缺失:AI科研任务完成率仅约3%,瓶颈在于无法自主提出可证伪假设(Coding任务成功率18个月飙至88%)
- 触及真实科研天花板:通用大模型复杂任务断崖式下跌,最强模型端到端通过率仅28.7%-31.5%
- 认知-行动鸿沟:AI能识别异常模式但无法调整下游方法论,构成编程(行动域)与科研(认知域)的结构性鸿沟
- 理解与容错机制缺失:AI错误缺底层理论支撑无法追溯,毫无价值;当前最佳路径仍是人机协作(人主导假设与验证)
生态危机与新型科研范式
- 科研多样性悖论:AI使用者论文产出高3.02倍,但主题覆盖面缩减4.63%,学者互动降22%,引发知识趋同危机
- 文献可信度危机:AI虚假引用三年增超12倍,顶会录用论文含百条虚构引用,模型越聪明幻觉率反而越高
- 学术评价体系瓦解:提出问题的能力超越执行能力成为科研核心,顶会权威性急剧衰减
- 科学AI专属路线:大型定量模型(LQM)基于科学方程和实验室数据训练,内嵌量子算法解决计算密集型问题
- 结构化容错范式:SAGE框架通过“发散-收敛-路由”归因分离故障,使12个科研课题成功率从42%跃升至92%
8.8 数学哲学与基础理论
信息论与概率论的数学统一:从 Shannon 到 Jaynes
- 信息论奠基(1948):香农发表论文,被引超16万次,将信息转为可精确测量的数学对象
- 数字时代基石:发明比特概念,证明声图文均可量化为0/1序列,奠定现代通信与AI的数学基础
- 技术因果链:无信息论则无数据压缩与纠错码,进则无数字通信与互联网,最终无GPU上的大模型
- 信息熵命名:冯·诺依曼建议用熵命名,戏称没人真正理解熵是什么,辩论中永远占优势
- 警示理论滥用:1956年发表《The Bandwagon》警告信息论被滥用于经济、生物学等不相关领域
概率论的逻辑重构
- 理论新定位:杰恩斯遗著《概率论沉思录》被引超9000次,将概率论重构为布尔逻辑的推广
- 四大思想渊源:杰弗里斯不变性先验(1939)、考克斯定理(1946)、香农信息论(1948)、波利亚合情推理(1954)
- 考克斯定理:证明理性合情推理唯一等价于概率论法则,使其从计算工具升格为推理基础
- 先验客观性:通过最大熵原理与变换群方法,在主观信念与客观约束间找到自洽立场
- 20年认可周期:最大熵论文引超18000次、Jaynes-Cummings模型引超7800次,均需约20年获学界认可
- AI时代意义:贝叶斯框架为机器学习提供统一数学基础,被《深度学习》等经典AI教材首推
概率解释的四大流派
| 学派 | 概率定义 | 代表人物 | 核心主张 |
|---|---|---|---|
| 频率派 | 长期频率,客观物理属性 | 费勒、克拉默 | 概率是可重复事件的客观属性 |
| 主观贝叶斯派 | 个人信念程度 | 德菲内蒂、萨维奇 | 不同主体评估可不同,只需连贯 |
| 逻辑派 | 命题间逻辑关系 | 凯恩斯、卡尔纳普 | P(H |
| 客观贝叶斯派 | 合理信念度,受客观约束 | 杰弗里斯、杰恩斯 | 相同信息→相同概率,先验须遵循客观原则 |
压缩即数学本质:菲尔兹奖得主 Freedman 的数学结构理论
- 数学即压缩:菲尔兹奖得主 Freedman 提出,数学演进史本质是创建宏、构建抽象层级的压缩史
- 压缩规模惊人:Mathlib 中 600 token 命题展开达 10^104(超古戈尔 10^100),展现极高压缩率
- 首个压缩宏:位值记数法用对数级符号表达指数级数量,是数学史上最早的压缩发明
- 多层抽象隐蔽:"向量丛截面的芽层"一句话叠加了向量丛、截面、层、芽等十几层抽象概念
- 结构推断:因多项式增长易于压缩,推断数学结构本质是多项式的;"10的幂次方"处于最佳平衡点
幺半群模型对比
| 维度 | 多项式增长 | 指数增长 |
|---|---|---|
| 压缩 | 容易压缩 | 难以压缩 |
| 宏密度 | 高,表达效率高 | 低,表达效率弱 |
| 对应性 | 本质对应 | 不符合实际 |
两类压缩量化指标
| 指标 | 定义 | 意义 |
|---|---|---|
| 还原压缩 | 展开长度/压缩长度 | 衡量抽象层级高低 |
| 演绎压缩 | 证明长度/命题长度 | 衡量命题压缩密度 |
- 稠密宏威力:拉格朗日定理(整数=四平方数之和)展示了稠密宏集的高效压缩能力
- 研究目标:为人类与 AI 数学协作建立理论基础,识别高中心性的压缩节点
8.9 LLM 辅助数学猜想突破:斯坦纳比下界刷新
LLM 辅助基础数学突破:从组合优化到统计物理
机器之心(20260518) | DeepTech深科技(20260707) | 机器之心(20260713) | 深度学习与NLP(20260715)
LLM 助力数学与物理难题突破
- 斯坦纳比下界刷新:北大王立威团队借助LLM将下界从0.824提升至0.8559,距猜想目标仅差0.01,打破近40年停滞
- 验证函数生成:人类手动设计10种F降至0.824,LLM自动生成1000+种F提升至0.8559
- 范式转换:归纳法摘除局部降维,将猜想转化为寻找验证函数F的max-min优化问题
- 自动化求解:Reward Model配合单调性证明与分治法,替代人类手动启发式参数空间划分
统计物理等式证明
- 阻塞指数突破:诺奖得主帕里西与Claude经40轮对话,证明困扰统计物理12年的阻塞指数a+b=1
- 反向推导思路:Claude从期望结论反向构造辅助函数,突破人类物理学家几十年的思维盲区
- 自主代码验证:Claude Fable 5主动用SymPy编程验证预测,解决东京大学教授停滞半年的弦论难题
人机协作效率与范式对比
| 维度 | 人类手动 | LLM扩展 | 效果差异 |
|---|---|---|---|
| 验证函数数 | 10种 | 1000+种 | 覆盖面提升100倍+ |
| 斯坦纳比下界 | 0.824 | 0.8559 | 增量0.0319 |
| 物理难题耗时 | 数十年未果 | 40轮对话/一晚 | 跨维度加速 |
局限性与风险警示
- 模型跨平台通用:GPT-5系列、Gemini 3、Claude 4.6及Fable 5均可复现类似结果
- 人类洞察不可替代:归纳策略与模板构造仍赖人类,精准纠偏源于数十年专业深耕
- 认知退化风险:判断AI对错的深度专业能力不可外包,过度依赖将削弱科研直觉
8.10 社会经济地位主导大脑功能连接与神经影像AI捷径学习陷阱
SES主导大脑个体差异与脑科学AI的混淆变量警示
- SES主导大脑功能连接:华盛顿大学Scott Marek团队基于ABCD队列,将649种环境变量映射到儿童RSFC,发现SES关联强度比智商高50%、比精神病理学高130%
- 暴露组图谱高度重合:649个变量的第一主成分("暴露组图谱")与SES大脑模式几乎完全重合;关联最强的40个变量中37个直接与SES相关,仅3个涉睡眠/屏幕时间
- 神经机制集中在感觉运动网络:SES影响高度集中在初级运动和感觉皮层,而非额顶网络;其脑模式特征与去甲肾上腺素受体及睡眠剥夺模式高度相似
控制SES后智商关联断崖式下跌
| 统计条件 | 大脑-智商关联 | 图谱模式转变 |
|---|---|---|
| 未控制SES | 大量显著关联 | 感觉运动模式(实为SES混淆) |
| 控制SES后 | 约70%关联消失 | 转向额顶叶高级认知模式 |
脑科学AI的捷径学习陷阱
| 模型设定 | 预测表现 | 实际学到 |
|---|---|---|
| 含低SES样本预测智商 | 表面有效 | 利用SES-IQ共变走捷径 |
| 仅高SES样本预测智商 | 相关性≈0 | SES-IQ关联弱,捷径失效 |
| 直接预测SES | 始终高稳定 | SES脑信号远强于智商 |
- 算法偏见的本质警示:神经影像AI预测智商时实际学到的是家境,盲目追求准确率只得到了社会不平等的算法倒影
- 干预启示:儿童大脑发育最优投资并非智力训练,而是改善睡眠、减少慢性压力、优化成长环境等可干预因素
9. 物理机制、材料创新与能源工程
9.1 量子物理与计算理论
量子计算与物理基础:理论突破、硬件演进与商业前景
财联社AI daily(20260401) | 机器之心(20260407) | 人工智能学家(20260426) | ScienceAI(20260427) | 人工智能学家(20260513) | DeepTech深科技(20260514) | 人工智能学家(20260515) | 人工智能学家(20260605)
量子计算硬件突破
- 九章4.0刷新纪录:潘建伟团队在GBS问题上比最强超算快10^54倍,25微秒完成需10^42年的任务。
- 光子规模跨越:最大探测光子数从3.0的255个增至4.0的3050个,提升一个数量级。
- 底层架构创新:首创8176模式时空混合编码,突破单一编码限制;集成1024个压缩态光源。
| 参数 | 九章3.0 | 九章4.0 |
|---|---|---|
| 最大光子数 | 255 | 3,050 |
| 输出模式数 | - | 8,176 |
| 编码方式 | - | 时空混合 |
量子计算的商业与产业价值
- 落地预期分化:专用机聚焦特定任务将率先落地,通用机需10-20年;大国竞赛转向产业主导权。
- 巨头战略布局:谷歌投1000万美元启动REPLIQA项目,联合五所高校用量子模拟直击生物分子物理因果层。
- 算力互补协同:AI基于相关性在亿级化学空间初筛,量子计算基于物理因果对Top 100分子精确模拟。
密码学安全威胁与防御
- 破解门槛骤降:谷歌研究将破解ECC-256所需物理量子比特从百万级压缩至约2.6万个,缩减约40倍。
- 系统性风险浮现:以太坊因公钥暴露等面临多重量子攻击面,“先截获后解密”模式已构成实质威胁。
- 防御工程化:PQC后量子密码标准确立,谷歌定2029年全面完成内部迁移,破解危机实为可应对工程问题。
基础物理与计算理论突破
- 经典轨道合成量子波函数:MIT团队引入多值路径密度,仅需经典作用量即可精确推导薛定谔方程。
- 计算范式降维:量子模拟从求解偏微分方程降维为常微分方程组,显著降低底层计算复杂度。
- 弦理论唯一性证明:加州理工等团队仅基于“超软性”和“最小零点”假设,推导出弦理论全部特征(弦概念自然涌现)。
9.2 物理机制驱动的新型计算与反应范式
量子计算与类脑器件:突破冯·诺依曼架构的新型计算范式
ScienceAI(20260331) | DeepTech深科技(20260405) | DeepTech深科技(20260413) | DeepTech深科技(20260418) | DeepTech深科技(20260418) | AI前线(20260506) | 人工智能学家(20260512) | 暗涌Waves(20260531) | DeepTech深科技(20260720)
量子计算突破AI与科学计算边界
- 指数级内存压缩:联合团队证明<60个逻辑量子比特即可实现经典方法需4-6个数量级内存的预测力,优势在信息论层面无条件成立
- 量子模拟闭环验证:Pasqal(中性原子)与IBM(超导)团队真实硬件材料模拟结果与实测高度吻合,量子计算机首次用作虚拟实验室
- 混合计算与量子嵌入:量坤科技将原需万比特的化学模拟极限压缩至20比特求解;圣路易斯华盛顿大学结合神经形态与量子隧穿,必定产出高阶伊辛模型有效解
量子AI工具链与商业化
| 厂商/机构 | 核心产品 | 关键数据与定位 |
|---|---|---|
| NVIDIA | Ising开源双模型 | 视觉-语言校准模型将周期从数天压缩至数小时;3D CNN解码以可学习特性超越传统静态解码器 |
| 量坤科技 | 量子算力OS层 | 2026年获数亿元天使轮融资,定位软硬间算法平台,小数点后第二位即显精度优势 |
突破冯诺依曼架构的活体与新型器件
| 器件类型 | 研发机构 | 核心突破与数据指标 |
|---|---|---|
| 打印式人工神经元 | 西北大学 | 石墨烯/MoS₂三明治结构成功激活小鼠脑切片,60Hz最稳;同平台感光检测达4nW/mm² |
| 活体生物计算(BNN) | 日本东北大学 | 26400通道微电极培养模块化神经元,洛伦兹吸引子预测相关性达0.8以上(受332.5ms闭环延迟限制) |
| 真菌活体电子学 | 密歇根州立大学 | 3D生物打印活体菌丝构建传感器,温度-电压相关系数r=0.98;切断后2小时重连,7天完全恢复 |
空中计算(OAC)范式革新
- 核心机制:多设备信号在空中直接叠加完成运算,将传统先传输再处理升级为传输即计算
- 核心优势:利用干扰提升精度(设备越多越准),通过直方图聚合无需收集原始数据,天然保护隐私
- 落地验证:南卡团队使用FPGA改造实现5设备+1基站纳秒级同步,成功实现95%的图像识别率
9.3 材料创新与结构设计新范式
梯度序构铜箔:打破材料"不可能三角"的结构设计新范式
传统强化的核心矛盾
| 方法 | 强化效果 | 导电性 | 热稳定性 |
|---|---|---|---|
| 细化晶粒 | ✅ 晶界强化 | ❌ 晶界散射 | ❌ 室温24h损失50% |
| 合金化 | ✅ 固溶强化 | ❌ 断崖下跌 | ⚠️ 有所改善 |
- 矛盾根源:传统强化引入的晶界和合金元素,恰是破坏导电与稳定性的元凶
GSD(梯度序构)技术突破
- 团队成果:中科院金属所卢磊团队 Science 发表,以纯结构设计替代成分调控
- 结构基础:99.91%纯度、10μm铜箔中原位构建平均3nm的超纳米畴
- 梯度分布:纳米畴沿厚度周期性交替,少畴区导电,多畴区锁死晶界提升强度
- 半共格界面:如“微型铆钉”钉扎晶界阻止长大,且对电子阻碍极小
关键性能全面超越
| 指标 | GSD-113铜箔 | 常规纳米晶铜 | 同强度铜合金 |
|---|---|---|---|
| 抗拉强度 | 900 MPa | 300-600 MPa | ~900 MPa |
| 导电率 | 90% IACS | 大幅下降 | ~30% IACS |
| 室温稳定性 | 180天零衰减 | 24h损失50% | 有所改善 |
制备工艺与产业化前景
- 量产路径:采用工业通用直流电沉积工艺,添加微量绿色有机添加剂,兼容现有产线
- 应用场景:直接利好集成电路互连线、高端电子元器件及锂电池负极集流体
- 范式意义:验证了“结构设计”替代“成分调控”的可行性,为金属材料突破性能矛盾提供新路径
汉字几何形态驱动的超材料设计:跨学科结构优化新范式
- 汉字首次转化为机械超材料:爱丁堡大学Parvez Alam团队将“人”“大”“天”“夫”作为结构单元,发现“天”字结构比强度和比刚度超越传统六边形蜂窝,达高性能金属泡沫水平。
- 几何排列决定性能:超材料性能取决于微观几何排列而非化学组成。曲线笔画提供柔韧性与能量分散路径,水平笔画等效横梁分散载荷,方块框架天然适配周期性网格。
- 横画数量与性能正相关:“天”字顶部双层横向支柱使变形模式从弯曲主导跃升为拉伸/压缩主导,显著提升承载能力。
- 对称性极其敏感:“夫”与“天”仅顶部横画长度和位置略异,对称性破坏即导致力学性能显著下降。
四种汉字超材料力学性能对比:
| 字形 | 结构特征 | 变形模式 | 力学表现 |
|---|---|---|---|
| 人 | 撇捺细长发散带弧度 | 弯曲主导,最先变形 | 柔韧性最高,刚度最低 |
| 大 | 中部增加横梁 | 弯曲主导,稳定性改善 | 刚度提升 |
| 天 | 顶部双层横梁 | 拉伸/压缩主导 | 比强度和比刚度最优 |
| 夫 | 顶部横短且偏移 | 弯曲主导 | 对称性破坏致性能衰减 |
- 方法论可推广至全球书写符号:历经数千年筛选的文字形态蕴含工程学尚未探索的力学最优解,成果发表于《应用物理学杂志》,实验采用增材制造并以蜂窝为基准。
导电聚合物自组装突破:n-PBDF纳米带实现金属级电导率
- 核心突破:n-PBDF导电聚合物在溶液中自发组装成纳米带,平行方向电导率达10,200 S/cm,进入金属导电区间,成果发表于《科学》
- 自组装机制:聚合与组装同步发生——单体还原聚合物使其带电荷,带电聚合物反催化单体聚合,链条一边生长一边自动排列,30-40分钟后形成纳米带
- 氢键驱动:分子链特定位置抓取质子形成强氢键(化学位移18.5 ppm),两条链如拉链咬合形成双链结构
- 各向异性:电荷沿分子链方向高效传输,平行vs垂直方向电导率差约5.7倍
| 维度 | 参数 |
|---|---|
| 平行方向电导率 | 10,200 S/cm |
| 垂直方向电导率 | 1,800 S/cm |
| 太赫兹迁移率 | ~30 cm²/V·s |
| 纳米带尺寸 | 宽~25 nm,高<1 nm,长数百nm |
| 链间距 | 0.34 nm(π-π堆积) |
- 传统瓶颈:传统导电高分子链缠结无序致电导率仅10–10³ S/cm;退火、外延生长等方法均在合成后施加有序性,难以实现长程连贯
- 范式转变:共轭聚合物科学第四次概念转变——从传统"后处理有序"转向"生长中编程",有序性在合成过程中通过耦合分子相互作用逐步发展
- 局限与展望:仅在高度相互作用的聚合物子系统中验证,大面积制备与稳定性待解决,距商业化尚远
- 团队:普渡大学梅建国团队与中科院化学所狄重安团队合作,原始数据已在Zenodo公开
9.4 冷原子模拟验证时间涌现假说
量子宇宙学的桌面实验验证:熵时间从关系中涌现
- 冷原子验证时间涌现:伯明翰大学Barontini独作发表于《物理评论研究》,用2.4万个铷-87原子构建BEC“迷你宇宙”,首次实验验证纯理论的“关系性时间”
理论背景:没有时间的宇宙方程
- WDW方程的时间缺失:惠勒-德威特方程(Ĥψ=0)描述宇宙波函数但不含时间参数,暗示时间可能非基本特征
- 关系性时间猜想:将系统内部组分的动力学变量设为“时钟”,把无穷变量简化至一两个参数
- 填补冷原子验证空白:冷原子已模拟霍金辐射等概念,但此前从未直接以“时间本身”为研究对象
实验设计:冷原子迷你宇宙
- 系统构建:约24,000个铷-87原子囚禁于交叉光阱,DMD调制势垒将系统分为暗区(不可测)与亮区(可测)
- 宇宙演化类比:原子从暗区涌入亮区类比“大爆炸”;回流暗区类比“大坍缩”,映射WDW迷你超空间模型
核心发现:势垒高度决定熵时间τ行为
| 势垒状态 | 系统行为 | 熵时间(τ)表现 |
|---|---|---|
| 极低 | 原子自由往来,亮区反复循环 | 熵可逆往返,τ几乎不流逝 |
| 逐渐抬高 | 原子穿越难度增加 | τ流逝越来越慢 |
| 达临界值 | 亮区不再循环,进入“热寂” | 熵不变,τ彻底停止 |
- 还原标准量子力学:以τ为参数改写的薛定谔方程在完全封闭极限下,精确还原标准幺正量子力学
关键洞察
- 重塑理论验证范式:量子引力问题(多时钟、奇点vs量子弹跳)有望转化为桌面实验
- 时间的统计本质:时间可能是复杂系统内部关系涌现的统计效应,而非宇宙基本参数
9.5 强化学习驱动量子纠错实时校准
RL驱动的量子实时容错控制
核心突破
- 应用背景:容错量子计算需维护指数级增长的控制参数,传统人工扫描难以为继
- 核心成果:Google量子AI团队首次将RL应用于量子纠错实时控制
- 关键数据:逻辑计算稳定性提升约3.5倍,在专家优化基线上仍将LER降低约20%
- 论文信息:2026年7月8日发表于《Nature》,标题「Reinforcement learning control of quantum error correction」
技术设计
- 代理目标设计:不直接优化LER,转而利用错误检测事件作为即时奖励信号
- 局部奖励机制:检测器事件持续反映系统局部健康状态(类似汽车传感器),将稀疏延迟奖励拆解为连续高频学习信号
- 因子图分解:利用因子图将芯片划分为局部子区域,控制参数仅关注附近检测事件,实现天然并行
- 策略梯度控制:RL代理基于运行数据持续调整近4万个控制参数,无需人工预设漂移模型
- 漂移模拟验证:实验人为注入持续变化的控制漂移,验证RL代理的实时追踪与补偿能力
范式对比
| 维度 | 传统方法 | RL方法 |
|---|---|---|
| 奖励来源 | 最终逻辑错误率 | 局部检测事件 |
| 信号频率 | 极稀疏 | 连续高频 |
| 参数维护 | 逐项人工扫描 | 策略梯度自动调整 |
| 规模扩展 | 人工难以为继 | 因子图天然并行 |
| 运行模式 | 停机校准再恢复 | 校准融入循环持续自维护 |
关键洞察
- 方法论价值:将检测事件转化为密集奖励信号,为其他奖励稀疏领域提供重要参考
- 校准范式转变:AI嵌入底层控制循环实现持续自维护,是大规模容错量子计算实用的必要条件
- 优势互补:在高度优化基线上仍发掘改进空间,证明RL能弥补人工校准的系统性盲区
10. AI4S 科研平台与理化生前沿交叉验证
10.1 AI 赋能蛋白质设计与分子动力学
AI赋能蛋白质设计与单细胞跨尺度建模
ScienceAI(20260413) | ScienceAI(20260414) | ScienceAI(20260415) | 人工智能学家(20260506) | 人工智能学家(20260507) | ScienceAI(20260518) | ScienceAI(20260519) | ScienceAI(20260522) | ScienceAI(20260528) | ScienceAI(20260529) | 新智元(20260529) | 新智元(20260604) | ScienceAI(20260605) | ScienceAI(20260608) | AI科技评论(20260609) | 人工智能学家(20260613) | AI科技评论(20260616) | ScienceAI(20260629) | ScienceAI(20260707) | ScienceAI(20260717) | DeepTech深科技(20260717) | ScienceAI(20260727)
AI设计进入产业化拐点
- 分子之心:在11个难成药靶点实现超90%结合成功率,最佳亲和力达皮摩尔级(51 pM)
- 德睿智药PepFGLD:采用潜在扩散与物理引导,同时生成多肽氨基酸序列与全原子3D结构
- GeoFlow大模型:将抗体交付周期从9-12个月压缩至1-3个月,确立干湿实验闭环优势
- AI定向进化:改造天然蛋白酶起点,解锁超79倍特异性提升,开辟传统进化无法到达的序列空间
- Doudna团队:基于ESM-IF1重构TnpB创造非天然核酸酶,人类细胞编辑效率达50%(野生型仅28%)
- Latent-X2:仅用10个设计在PHD2靶点超越万亿级筛选最优结果两个数量级,47%候选物零迭代通过
底层基建与数据开源突破
- ESMFold2:抛弃MSA依赖,配套发布11亿结构ESM Atlas,微型结合物湿实验成功率达70%
- OpenBind:7个月内生成800个高质量复合物测量数据并免费开放,打破研发数据瓶颈
微观跨尺度与全原子建模
| 模型/系统 | 核心规模与跨度 | 关键突破成果 |
|---|---|---|
| BioMD | 复合物全原子动力学 | 首次实现连续轨迹生成,速度提升2-3个数量级 |
| KIMMDY | 260万原子系统 | 跨9个数量级实现600次连续反应追踪 |
| TranscriptFormer | 1.12亿单细胞数据 | 跨6.85亿年进化距离精准零样本分类细胞 |
| FLAG | 空间多组学预测 | 空间域识别ARI达0.8451,破解基因维度诅咒 |
| BetaDescribe | 2万亿token预训练 | 孤儿蛋白功能预测显著超越传统BlastP |
之江实验室:教育数据资产化与人机协同标注体系
- 项目规模:之江实验室联合景联文科技构建理科竞赛结构化题库,累计处理≥24万道题目,覆盖数学、物理、化学、生物及逻辑推理
- 三层框架:采用"数据资源化—数据产品化—数据资产化"路径,依托SolarSense平台,2025年3月启动,9月交付
多模态解析与智能预标注
| 环节 | 技术手段 | 产出 |
|---|---|---|
| 区域检测 | 深度学习模型 | 区分文本/表格/公式/图形 |
| 公式识别 | 视觉语言模型 | 输出LaTeX/MathML |
| 图文关联 | 关联算法 | 题干-配图-公式统一绑定 |
- 智能预标注:BiLSTM-CRF抽取知识点,XGBoost预测难度,TextCNN分类题型,生产效率提升30%以上
- 人机协同:AI预标注(70%+结构化骨架)→人工精修→专家复核,单人日产出提升2-3倍
- 思维链标注:结构化五段式(步骤编号—推理依据—动作—结果—指向),双重校验+专家仲裁保一致性
质量管理与资产化交付
| 质检层 | 机制 | 覆盖范围 |
|---|---|---|
| 规则校验 | 正则+Schema实时拦截 | 字段完整性、格式规范 |
| 模型判别 | NLP语义级质检 | 答案一致性、逻辑连贯性 |
| 抽样复核 | 分层抽样 | 逻辑题100%必检,普通题5%-15% |
- 交付形态:提供加密数据包、API接口、可信数据空间三种形态
- 关键洞察:教育数据AI-Ready核心瓶颈在结构化质量而非数据量;规模化生产需"规则+模型"双校验控制方差
10.2 AI 赋能材料科学与化学
AI 驱动的材料发现、分子生成与前沿化学设计
ScienceAI(20260406) | ScienceAI(20260407) | ScienceAI(20260416) | 量子位(20260417) | ScienceAI(20260424) | 十字路口Crossing(20260429) | ScienceAI(20260506) | DeepTech深科技(20260506) | DeepTech深科技(20260510) | ScienceAI(20260513) | ScienceAI(20260515) | 新智元(20260523) | ScienceAI(20260525) | DeepTech深科技(20260527) | 量子位(20260601) | ScienceAI(20260602) | 机器之心(20260602) | AI前线(20260608) | ScienceAI(20260609) | 量子位(20260610) | 新智元(20260612) | DeepTech深科技(20260613)
| 模型 | 参数规模 | 核心数据指标 |
|---|---|---|
| Suiren-1.0 | 18亿 | 39/42项SOTA,误差降67% |
| MatRIS-MoE | 11.5B | 1.2 EFLOPS,4.73亿构型 |
| MPA | - | 35/40个SOTA |
| MIRA(MPA) | - | MAE降10%,退化仅25.7% |
AI闭环驱动新材料发现
- AI+机器人加速光伏发现:港城大闭环平台结合SISSO从1.8万分子锁定5ANI,实现钙钛矿电池27.18%认证效率。
- 发现超越金刚石超硬材料:西安交大结合LLM与机器学习势发现C16_3维氏硬度达103.3 GPa(金刚石实验值96 GPa)。
- RhinoAI全链路闭环系统:北大推出贯通微宏观的物质编译架构,产物CarbonKylin™拉伸强度达41.2 cN/dtex创业界最佳。
- 可逆分子指纹驱动设计:港理工利用12描述符将21分子扩至500万空间,锁定56个二维DJ相钙钛矿候选分子。
分子生成与微观机理突破
- 微型受约束扩散模型:CoCoGraph仅534K参数,通过双边交换机制强制化学约束实现100%有效性,23/36项超越DiGress。
- 晶体结构预测孪生基座:DAO框架在MP-20取得74.17%匹配率,预测速度比传统DFT快2000倍。
- 拉链式材料破局二维半导体:BSO/BOS拉链氧化物消除0.14nm范德华缝隙,等效氧化物厚度降至世界纪录0.4nm以下。
特种功能材料创新
- 可穿戴空气取水纤维:德大团队分级多孔纤维单次循环净集水410-894毫升,较传统提升3-10倍。
- 极端沙漠环境取水:太阳能驱动生物质水凝胶在26%湿度下创每公斤材料日产4.3升水纪录。
- 固态电解质均一化:复旦HIC-SBC-SE室温离子电导率达2.1×10⁻³ S cm⁻¹,循环500次容量保持99%。
- 电池全生命衰老预测:BatteryMFormer显式建模退化结构,仅用50%数据即超越基线,MAPE降低8.49%-17.66%。
10.3 宏观物理系统模拟与气象预报
STCast:全球-区域一体化气象预报框架
- STCast 全球-区域一体化预报:单一模型覆盖全球、区域、台风路径、集合预报四大任务,入选 CVPR 2026 Highlight
- SAA 空间对齐注意力:用大圆距离替代欧氏距离计算空间相关性,符合地球球面物理特性
- SAA 动态边界优化:先验分布与注意力图做哈达玛积持续调整权重,线性注意力将复杂度降至 O(n)
- TMoE 时间混合专家:为 12 个月各学习离散高斯分布,按月激活专属及相邻专家,无需额外辅助损失
STCast 核心任务性能表现
| 任务场景 | 关键指标 | 性能表现 |
|---|---|---|
| 区域高分辨率预报 | U10/海平面气压误差 | 误差分别仅 0.7% 和 0.1% |
| 台风路径预测 | 5天平均路径误差 | 96.5km,较 Pangu 降低约 40% |
| 集合预报 | 10天 RMSE | 低至 0.5113,显著优于基线 |
EMFormer 长期误差优化架构(ICML 2026)
- 高效多尺度卷积层:单次前向融合 1×1/3×3/5×5 卷积核替代多分支,训练时间减少 25%以上
- 累积上下文微调:动态修剪前序步骤 KV 对保留关键历史信息,10天预测 ACC 提升至 0.5389
- 正弦加权混合损失:可学习参数 φ 融合纬度加权与变量自适应损失,解决变量与网格面积差异
- 视觉任务泛化:仅用 75% 参数和 25% 计算量,ImageNet Top-1 达 84.4%,ADE20K mIoU 达 49.6%
千衍(HyperMillennium):4.2万亿粒子宇宙学数值模拟
- 世界最大宇宙学N体模拟:中科院王乔团队发布“千衍”,追踪4.2万亿暗物质粒子,模拟边长约120亿光年正方体区域,质量分辨率达基准级
- 国产超算全栈自主化:在国产“东方”超算运行420小时、逾12000个时间步长,动用超1万张GPU加速卡完成深度适配
- PM+FMM混合算法:自研PhotoNs-3.7代码采用粒子网格+快速多极展开方案,较主流PM-Tree方法更适合大规模并行超算
- 大规模GPU卸载加速:粒子间直接相互作用(占计算量90%以上)卸载至GPU完成,大幅提升整体计算效率
- 混合精度突破内存墙:引力计算采用32位单精度浮点数节省内存,粒子位置引入32位整型补偿精度损失,系统误差极低
- 极端天体验证ΛCDM模型:以阿贝尔2744星系团为试金石,成功找到9个构型高度相似的模拟类似体
- 数据开放与服务:首批数据通过国家天文科学数据中心面向全球开放,服务中国空间站巡天望远镜(CSST)等下一代项目
关键参数横向对比
| 模拟项目 | 粒子数 | 模拟体积 |
|---|---|---|
| 千衍(HM) | ~4.2万亿 | 边长~120亿光年 |
| Uchuu(日本) | ~2.1万亿 | 边长~96亿光年 |
| Millennium-XXL | ~3000亿 | 边长~42亿光年 |
10.4 AI加速多物理场仿真与AI for Engineering范式
AI for Engineering 范式与多物理场仿真加速实践
工程智能范式与体系架构
- 范式定义:AI与工程深度融合的双向驱动,从工程难题倒逼新AI理论,沉淀为操作系统级平台
- 四层架构:同济工智院按平台、模型、智能体、应用分层构建,覆盖土木、交通、海洋等领域
- 三大支柱:工程世界模型(可信建模推理)、多智能体协同、人机互信优化(信任可计算化)
- 数据挑战:工程数据异构性极强,低语义数据硬塞统一模型有害,需嵌入物理规律与安全成本约束
- 共生智能:AI识别逻辑尽头主动转向人类,10人团队可完成100人工作量,激发人类共创
AI加速仿真与工业实践
- 工业部署:千万级网格油藏仿真已部署(沙特阿美),速度提升数十至数百倍,精度接近传统
- 三大原理:①神经算子大时间步长推进②生成模型建模混沌演化③极少训练数据实现强泛化
- 聚变切入:等离子体跨多时空尺度是最顶级强耦合挑战,被视为工程领域的AlphaFold级根问题
- 商业溢出:聚变验证的方法可迁移至航空发动机、石油、化工、电力等复杂工业场景
传统CAE与AI方法核心对比
| 维度 | 传统求解器 | AI方法 |
|---|---|---|
| 仿真速度 | 小时至周级 | 秒级 |
| 物理场耦合 | 支持困难 | 原生支持 |
| 逆问题求解 | 反复迭代效率低 | 直接求解 |
10.5 AI 驱动的能源设施遥感清查与风光互补策略
阿里达摩院×北大:全国风光设施AI清查与跨省互补消纳策略(Nature)
- 研究背景:阿里达摩院联合北大,首次利用AI对全国风光设施高精度清查,成果登Nature正刊
- 识别规模:处理7.56TB卫星影像(0.5米分辨率),识别319,972处光伏和91,609台风机
- 模型分工:HRNet负责光伏分割(85% mIoU),VFNet负责风机检测(95% mAP)
- 标注体系:27,174张光伏+11,000张风机样本(8:2训练测试),遥感专家质检验收
- 泛化策略:应对沙漠、雪地等复杂地形,采用伪标签迭代(推理→校验→训练→重训)多轮提升
- 云端推理:全国推理+人工删误检补漏检,生成最高精度全国风光分布清单
- 发电建模:结合ERA5气象数据估算逐小时发电序列,汇总至县、省尺度
四级风光互补消纳策略
| 互补层级 | 协调范围 | 互补效果 |
|---|---|---|
| 省内整合 | 单省内部 | 基准 |
| 邻省互补 | 相邻省份 | 逐步增强 |
| 省际配对 | 跨区域配对 | 显著提升 |
| 全国协同 | 全国调配 | 最强互补 |
- 互补量化:基于Kendall's τ秩相关分析,全国策略较省内整合每年额外消纳998.8亿千瓦时绿电
- 科学价值:高精度分布清单为电网规划和环境评估提供数据底座,是AI for Science标志性落地
10.6 气候模态耦合预测与地球系统建模
UniCM:全球气候模态耦合动力学学习统一框架
ScienceAI(20260612) | 量子位(20260614) | DeepTech深科技(20260615) | 新智元(20260622)
- 核心突破:清华李勇团队提出UniCM(发表于《Nature Machine Intelligence》),首次将ENSO、IOD等7种全球主要气候模态纳入同一模型,实现系统级耦合动力学学习。
- 架构创新:采用双分支Transformer架构,Globalformer编码SST、风应力、温跃层深度等物理场演化,Modeformer学习7种高层气候模态的非线性交互。
- 耦合机制:首创mode-to-patch双向反馈,底层物理场产生大尺度气候模态,模态反向指导物理场演化,实现跨尺度闭环耦合。
- 训练验证:基于CMIP6及多源再分析数据覆盖165年历史极端场景,输入过去12个月状态可输出未来24个月连续预测。
核心性能与基线对比
| 评估维度 | UniCM表现 | 对比基线 |
|---|---|---|
| ENSO有效预测提前量 | 19个月 | 15-16个月(如DESN) |
| 整体预测误差降低 | 14.1% - 17.9% | XRO与CNN等基线 |
| 春季障碍后ACC>0.5维持 | 14个月 | 传统模型9-12个月 |
| 非ENSO模态预测技巧提升 | >22% | 传统模型 |
| IOD有效预测提前量 | 约7个月 | 传统模型受限 |
极端事件复现与AI科学发现
- 极端事件复现:成功精准重现1997年超级厄尔尼诺与2020至2023年三重拉尼娜的完整生命史及跨洋盆耦合关系。
- 自主科学发现:注意力机制精准定位前兆区域,自主揭示97厄尔尼诺前NPMM领先ENSO约4个月的先导作用。
- 枢纽角色揭示:模型自主发现TNA(大西洋尼诺)在跨洋盆气候系统中,可能扮演多模态耦合的关键枢纽角色。
Earth-Agent:统一三模态地球观测的领域智能体与基准
-
三模态统一智能体:Earth-Agent 首次融合 RGB 图像、原始光谱与地球产品数据,突破现有 MLLM 仅支持 RGB 的限制
-
POMDP 任务建模:基于 ReAct 范式将任务建模为部分可观测马尔可夫决策过程,LLM 控制器作为决策核心
-
四步操作循环:工具调用→记忆更新→推理思考→执行动作,产生完整可追溯的工具调用轨迹
-
五大工具包生态:基于 MCP 协议构建 104 个专业工具,覆盖从指数计算到时空统计的完整分析工作流
工具包 核心功能 典型工具示例 Index 环境特征快速提取 NDVI、NDWI、NBR Inversion 地球物理参数反演 地表温度、可降水量、海冰浓度 Perception 视觉感知任务 场景分类、目标检测、语义分割 Analysis 时空推理分析 趋势检测、变化点分析、空间自相关 Statistics 大规模数据预处理 批量操作、云掩膜、数据聚合 -
Earth-Bench 基准:含 248 个专家标注问题、13729 张图像,平均每题 5.42 步推理(最多 19 步),填补跨模态评估空白
-
双层次评估协议:Step-by-Step(工具匹配/顺序/参数四级标准)+ End-to-End(准确率+效率),首次系统评估推理过程
-
闭源 vs 开源差异:GPT-5、Gemini-2.5 最终准确率更高,但 DeepSeek-V3.1、Kimi-k2 在工具使用轨迹上更优
-
核心瓶颈:工具幻觉和文件幻觉导致级联误差,模型能识别正确工具但常引入无关步骤
-
零训练智能体路线:未对 LLM 专门微调,验证了领域工具生态作为护城河的智能体适配潜力
10.7 深度学习驱动的全球海草遥感制图与生态监测
DenseNet+475万景哨兵2号影像:全球10米分辨率海草制图
- 核心突破:基于475万景哨兵2号L2A影像,首次实现全球10米分辨率实测级海草分布与变化制图,发表于Nature正刊
- 研究团队:亚利桑那州立大学、佛罗里达国际大学、大自然保护协会(TNC)联合完成
- 方法跃升:将全球制图从MaxEnt潜在分布推进至10米分辨率深度学习实测分类
- 数据基准对比:现有UNEP-WCMC数据集方法不一致(巴哈马估算2,500至92,000 km²不等),本研究以实测级精度填补空白
影像合成与预处理流程
| 环节 | 具体方案 |
|---|---|
| 平台与数据 | GEE合成2019-2020及2023-2024两期中值清水拼接影像,抑制云/云影/耀斑 |
| 掩膜处理 | NDWI剔除陆地,Sen2Cor云掩膜+红边1/SWIR2阈值剔浑浊与耀斑 |
| 水深阈值 | 全球设20m(地中海局部延伸至25-30m) |
| 最小制图 | 10个八连通10×10m像元 |
DenseNet分类与独立验证
| 维度 | 方案 |
|---|---|
| 输入特征 | 5个反射率波段+4个归一化差异特征+水深因子+20×20纹理块 |
| 架构与分区 | DenseNet分类器,热带与温带分区训练,有效区分海草与珊瑚/藻类 |
| 初始与后处理 | 多分类→合并为二分类(海草/非海草),人工目视剔除假阳性 |
| 样本与验证 | 热带/温带各1.5万点+coastTrain全球参考数据集3,072个独立样本 |
变化检测与碳估算
- 变化类型:范围丧失/增益(海草与非海草转换)+ 生物量丧失/增益(密集与稀疏转换)
- 退化动态:2019-2024年全球海草呈净损失,热带出现密集转稀疏型退化(早期预警信号)
- 保护缺口:绝大多数海草分布及损失发生在现有海洋保护区之外,管理效能严重不足
- 碳估算:结合生态区土壤有机碳密度估算碳储量,基于时间衰减函数预测至2050年CO₂排放
范式迁移价值:深度学习与大规模遥感影像组合范式可迁移至红树林、盐沼等蓝碳生态系统监测
11. AI 驱动的理论发现与通用科研平台
11.1 计算感知信息论与数据选择理论
信息论、压缩与LLM缩放定律
人工智能学家(20260513) | 人工智能学家(20260526) | 机器之心(20260528) | 人工智能学家(20260612) | 新智元(20260626) | 机器之心(20260626) | PaperAgent(20260626) | DeepTech深科技(20260626) | 量子位(20260705) | 硅星人Pro(20260706)
缩放定律的路线分歧与脆弱性
| 维度 | Kaplan (OpenAI 2020) | Chinchilla (DeepMind 2022) |
|---|---|---|
| 最优分配 | 优先扩参(参数×5.5,Token×1.8) | 参数与数据均衡(α≈β≈0.5) |
| 参数口径 | 排除Embedding | 包含全部参数 |
- 外推脆弱:微小参数扰动或精度差异,会放大外推结果的数量级偏差
- 数据墙逼近:高质量文本预计2026-2028耗尽,重复训练token价值呈指数衰减
- 统一建模:Mila与DeepMind提出UNSL,分层处理多变量交互与超参反作用
- 验证优势:UNSL外推误差仅约传统DC形式的1/8,视觉/语言任务最优占比达60.87%/88.89%
计算感知信息论与数据选择
- 核心突破:CMU/NCU提出Epiplexity,首次将观察者算力纳入信息量定义
- 量化公式:loss下降面积=可学习结构;残余loss=不可学随机噪声
- 模态差距:自然语言结构信息占比约37%,图像不到1%,差四个数量级
- 知识创造:算力可为有限观察者创造结构信息,解释AlphaZero产生超人棋力
- 逆向增益:逆序学国际象棋epiplexity更高,迁移效果碾压正序(适度困难的数学基础)
- 数据选择:信息量非数据固有属性,算力限制下数据选择比模型架构更重要
- 采样策略:ADO动态优先采样loss下降快的数据,本质是最大化epiplexity
推理流形与维度坍塌
- 流形假说:推理时隐状态自发收缩到低维流形,压缩须防信息退化僵死
- 诊断公式:H = log(D_world) × V / exp(ε × D_stim),奖励丰富表达与适度压缩
- 预测能力:H与MMLU等基准表现Spearman相关系数超0.9,仅凭前向传播即可预测
- 实时拦截:通过H定位偏离健康甜点区的层与token,注入引导信号纠偏
- 压缩本质:Shannon猜字母实验是真人版next-token prediction,交叉熵越低压缩效率越高
弦理论推导新范式与底层架构对勘
自举法推导弦理论:PRL论文证明仅凭两条假设即可自然导出弦理论特征,无需预设弦的存在
- 超软性假设:极高能量下散射概率降低,驯服量子引力计算的无穷大发散
- 极小零点假设:振幅为零的特殊点数量尽可能少,约束理论一致性条件
- 标志性成果:唯一导出 Veneziano 振幅、Virasoro-Shapiro 振幅及质量递增粒子谱
- 验证困境:直接探测弦特征需星系尺度对撞机,可预见未来无法实现
广义智能体理论:提出"It from Agent",比信息更根本的基石是处理信息的智能体本身
- 核心公理:智能体是开放的信息处理系统,由控制论、信息论等多学科归纳得出
- 最小架构:含输入(I)、输出(O)、记忆(M)、生成(G)、控制(C)五个不可再约简模块
- 能力周期表:五维功能各分3档,共243种构型,涵盖零到无限智能的连续谱系
两条统一路线对勘
| 维度 | 弦理论 | 广义智能体理论 |
|---|---|---|
| 统一路径 | 向更小结构求统一 | 向观察者本身求统一 |
| 方法论 | 数学自洽的先验路线 | 跨学科归纳路线 |
| 核心进展 | 自举法推导弦特征 | 243种构型能力周期表 |
| 共同困境 | 星系级对撞机不可及 | 框架未落实为可检验命题 |
11.2 计算复杂度理论:P与NP、零知识证明与随机性
Avi Wigderson 专访:计算复杂度的统一图景
| 复杂性类 | 定义 | 典型实例 |
|---|---|---|
| P | 存在算法自行高效求解 | 最短路径 |
| NP | 给定答案后可高效验证 | 数独、SAT |
| NP完全 | NP中最难问题,可互相归约 | 三着色 |
| NP难 | 至少和NP完全一样难 | 蛋白质折叠 |
P与NP的核心挑战
- 颠覆性假设:若P=NP成立,只要答案可验证即可高效找到,攻克癌症等难题均将成可能。
- 学界共识:几乎全部理论学者倾向于P≠NP,但50年来无人攻破任何NP完全问题。
- 完全等价性:基于计算的局部性,数千个NP完全问题可互相归约,攻破一个即攻破全部。
- PCP定理硬墙:3-SAT想比随机猜测(满足7/8)好哪怕0.1%,难度即等同于求精确解。
- 最坏情况≠实际难:工程实例自带特殊结构,启发式算法仍可高效处理现实中的SAT问题。
困难即资源与密码学应用
- 困难转化为随机性:NP完全问题对算力有限的观察者如同随机,成为伪随机性生成的地基。
- 观测者决定随机性:硬币正面对裸眼随机,对超算可精确预测,难度与随机性双向等价。
- 零知识证明普适性:单向函数存在前提下,所有NP问题均可构建零知识证明,已走向区块链等实际应用。
- 量子计算冲击:Shor算法多项式时间分解整数,威胁公钥密码体系;抗量子方案正以格密码重建安全。
2025年三大理论突破
- 时空权衡极限:Ryan Williams将时空上界从t/log t压缩至√t(百万步仅需约千单元空间)。
- 零知识证明进化:Ilango基于哥德尔不完备性,实现无需交互、无可信设置且命题为假不可伪造的系统。
- 跨学科颠覆:MIP*=RE直接解决纯数学Connes嵌入猜想与物理Tsirelson问题等几十年悬案。
11.3 推理流形假说与因果涌现
低维流形约束下的推理动力学与健康诊断量 H
- 推理流形假说:大模型推理是高维空间中的低维受约束动力学过程,表征自组织为紧凑流形
- 健康诊断量 H:融合固有维度、信息体积与表达力容量,仅靠前向传播计算,无需任务标签
- 因果涌现验证:H 能精确定位模型在哪一层、哪个 token 偏离健康推理区域,体现因果涌现特征
- H 诊断精度:在 AIME'25、GPQA-Diamond、LiveCodeBench 上,H 与表现 Spearman 秩相关系数全超 0.9
- 维度塌缩普适性:MMLU 验证表明隐藏状态内在维度随层数增加系统性下降,跨模型规模与领域均成立
表征维度与信息容量的解耦机制
| 属性 | 早期层 | 后期层 |
|---|---|---|
| 内在维度 | 高(高维稀疏) | 低(塌缩密集) |
| 信息体积 | 低(稀疏) | 高(密集) |
| 核心功能 | 编码原始特征 | 放大任务相关概念变化 |
- 非单调解耦关系:良好推理需同时满足低维表征与高信息容量,降维超过阈值反而导致性能下降
- 推理质量甜点区:高质量推理聚集在低维+高信息量区域,过度压缩致信息不足,维度弥散致结构松散
11.4 AI4S 算力基础设施与通用科研平台
AI4S 算力基座、科研平台生态与商业化验证
甲子光年(20260330) | AI早餐汇(20260414) | 第一新声(20260416) | 量子位(20260418) | 甲子光年(20260420) | PaperWeekly(20260509) | "财联社AI daily"(20260518) | ScienceAI(20260523) | 机器之心(20260528) | 花叔(20260604) | AI科技评论(20260610) | 智东西(20260706) | 量子位(20260707) | ScienceAI(20260714) | DeepTech深科技(20260716) | 雷峰网(20260717) | 新智元(20260718)
平台与生态演进
- 软硬协同:北鹏HPCKit助AlphaFold2降至88秒;D2AR模型单节点算力媲美A100
- 科研底座:ScienceOne接管90PB数据;紫东太初4.0覆盖8学科创16项SOTA
- AI原生图谱:SciGraph含3.7亿实体,基于SCP协议驱动Agent跨8学科推理
- 智能体应用:斯坦福Biomni诊断提速(110分降至3分);深势科技等推进干湿闭环实验室
科学大模型突破
- 多模态模型:S1-Omni三层架构,95.5%任务基准超GPT-5.5
- 生命科学:AlphaGenome基因调控达SOTA;Proteína单样本15.6秒测14靶点
- 材料气候:MACE-POLAR-1精度提升4倍;清华UniCM将厄尔尼诺预测延长至19个月
资本爆发与产业重构
- 资本动向:近三月AI制药涌入约27亿美元,核心逻辑转向纯平台与推理匹配模式
- 核心融资:Chai Discovery估值38亿美元(承诺只卖工具);Isomorphic Labs获21亿美元B轮
Chai Discovery商业与技术闭环
- 技术演进:Chai-1多聚体预测开源;Chai-2抗体命中率15.5%(传统<0.1%)转闭源
- 商业模式:采用开源建认知、闭源收许可、定制嵌工作流的三层架构闭环
纯平台模式验证瓶颈
- 临床现状:全球超173个项目零获批,已投入约200亿美元,二期通过率降至40%
- 关键节点:业界预测2027年底迎首批临床新药,该节点将决定纯平台商业化成败
11.5 AI 自动化科研平台与交叉学科验证
AI 自动化科研平台架构与自进化智能体验证
AI科技评论(20260403) | 暗涌Waves(20260414) | 量子位(20260421) | ScienceAI(20260601) | AI科技评论(20260715)
| 平台/框架 | 核心架构 | 关键验证数据 | 状态 |
|---|---|---|---|
| SAGA | 双层闭环(内层快速搜索+外层三Agent分工),能发现隐形约束并修正目标 | 4个新抗生素+3个纳米抗体体外验证;8号化合物相似度<0.3,单次成本约100美元 | 已开源 |
| AutoScientists | 哈佛去中心化多智能体,停滞时自动重组转向避免局部最优 | BioML-Bench平均百分位74.4%(较单智能体+8.33pp),ProteinGym(ρ达0.700 SOTA) | 已开源 |
| SAION AI | 恩和科技7年搭建通用平台,打通0.5L孔板到30吨发酵罐全链路 | 累计交付23项目及15商业化管线;DNA合成成功率<10%升至>90%,质粒单轮>1000个 | 商业平台 |
评估体系失效与范式转移
- 基准失效:静态基准发布即过时,需做动态演化的RL环境;跨代长期有效基准几乎无法实现
- 评估转向:Anthropic主张靠实际交互和直觉评估,而非单一跑分
- 核心突破:AI4S正从成熟的“假设检验”转向探索性“假设生成”
自主探索与会议前沿指引
- 掌控力框架:普林斯顿提出信息论框架,衡量选项传递到未来的最大信息量,为无人类反馈时的自主探索提供保证
- ICML挑战体系:四项挑战包含语义对齐翻译评估、Lean中TCS交互式证明、多模态视觉物理推理、端到端自动定理证明(往届累计超2000支队伍参与)
AI合著者:流体方程奇点突破
- 极高精度:DeepMind将物理方程写进神经网络损失函数,残差精度达10⁻¹³接近机器极限
- 全新发现:发现流体方程三个未知的不稳定奇点家族,且奇点间存在严格线性规律,为Navier-Stokes千禧难题提供新解法
11.6 Codex 协助天体物理黑洞模拟:AI 作为科学候选生成器范式
AI 加速天体物理模拟与通用科研范式突破
新智元(20260408) | ScienceAI(20260611) | DeepTech深科技(20260611) | 量子位(20260612) | "AGI Hunt"(20260620) | CVer(20260628) | ScienceAI(20260617)
AI 驱动的科学突破加速
- 黑洞模拟提速 1000 倍:Codex 以数学坐标变换替代粒子追踪,使原算力不可行变为可计算
- 极速方程复现:GPT-5 Pro 仅耗时 18 分钟,成功复现学者耗时数月攻克的黑洞潮汐响应方程
- 数学探索提效:数学家借 ChatGPT 攻克 Nesterov 加速开放问题,思维探索效率提升 3-10 倍
- 古文字破译:Claude Code 推导 Linear A 语法,提出 40 符号读音方案并编纂 408 词词典
预训练模型的迁移陷阱与范式张力
- 两阶段训练降本:在简单 ΛCDM 模型预训练后微调含新物理的复杂模拟,数据需求量降低超 90%
- 架构差异显著:宇宙学微调中,哑节点瓶颈网络表现最优,冻结权重拼接架构最差
- 参数简并与遮蔽效应:预训练越深计算效率越高,但网络易用旧知识(如 σ₈)误读新物理信号(如大质量中微子)
- 效率与发现力矛盾:预训练效率与异常探测敏感度成反比,真正新发现藏于未被识别的残差异常中
- 方法论破局:需设计分布外/异常检测等"反预训练"机制,重点审查 AI 未识别残差以挑战现有范式
GeoPT 几何预训练突破
- 动力学特征注入:通过生成合成速度场轨迹,将几何数据提升至联合空间,解决无 CFD 求解导致的负迁移
- 极低成本验证:监督计算仅耗时 0.2 秒/样本,3 天完成预计算,五大仿真基准仅需 40-80 样本即接近全量性能
- 数据效率飞跃:结合上述极低成本验证机制,整体数据效率实现 20-60% 的显著提升
无监督学习破解水结构
- 提取隐藏暗组份:无监督 AI 从 7400 万水分子中提取隐藏物理量 PCI/PCII,证实液态水存在双暗组份
- 全面超越传统:其与体积线性相关度达 R²≈0.99,远超传统经验描述符的精度与预测能力
- 揭示底层机制:3D 概率密度图揭示组份互转为带 3 个鞍点的环状路径,完美契合热力学方程
- 研究范式转移:无监督 AI 绕过直觉盲区发现底层物理,液体研究正式迈入纯数据驱动的新范式
11.7 LLM 驱动的符号回归与科学公式发现
FunctionEvolve:结构引导的 LLM 符号回归框架
- 核心思路:将 LLM 语义引导约束在 AST 表达式树上,使公式搜索从"压低误差"转向"找对规律"
- 四大环节协同:Generator(LLM生成种子)→ Selector(结构去重分配预算)→ Mutator(语义建议+AST增删)→ Optimizer(系数直接求解)
关键实验数据
| 评估基准 | 核心指标 | 对比结论 |
|---|---|---|
| LLM-SRBench | SA@1: 72/129 (55.8%) | 此前最佳仅约 15% |
| LLM-SRBench | SA@50: 107/129 (82.9%) | 整体提升 3.6 倍 |
| LLM-SRBench (Llama-8B) | SA@50: 62/129 | 远超此前闭源模型结果 |
| AI-Feynman | SA@1: 120/120 | 轮次分布显示存在 LLM 记忆成分 |
核心消融与策略发现
| 实验维度 | 结果 | 结论 |
|---|---|---|
| 移除 LLM Mutator | SA@50: 107→46 (-57%) | 语义引导贡献最大 |
| Pareto/Occam 排序 | 101-102/129 | 显著优于纯 NMSE 前5 (89/129) |
- 范式启示:AST 充当 LLM 语义与符号搜索的"翻译层",嵌入结构化框架而非直接生成完整答案
- 团队背景:第一作者夏泽宇(清华朱军课题组),通讯作者阎栋(博世首席 AI 科学家)
12. 顶会成果、学术话语权与研究实战
12.1 研究者素养与刻意训练方法论
研究能力的刻意训练体系:从选题到输出的完整方法论
机器之心(20260615) | PaperWeekly(20260615) | AI科技评论(20260616) | PaperWeekly(20260709)
- 研究是组合技能:刻意训练而非追热点,John Schulman强调从期望结果反向推理实验,而非仅从文献找改进点
- 主动反推:从目标结果反推实验路径,自主判断放弃时机,不被动吸收文献结论
- 拒绝同质化:依赖共享arXiv与群聊过滤必陷入红海,需自主寻找综述未覆盖的切入点
- 经典溯源:旧资料价值被严重低估(如MoE 1991、苦涩教训2019以千字精准预测趋势)
- 知识广度:可解释性借鉴神经科学,评估设计本质是机制设计,广度等同深度
实验循环与自我纠偏
- 迭代速度:高实验频次带来快速现实模型修正,是独立研究者的核心竞争优势
- 纸面纠偏:写作能无情暴露未测试假设与逻辑矛盾,是极低成本的纠偏工具
- 品味训练:实验前预测结果、遮数据猜指标,重复数百次即可训练出科研直觉
顶会学术写作范式(956篇CVPR Highlight拆解)
| 模块 | 词数统计 | 高频句式与结构特征 |
|---|---|---|
| 摘要 | 均值191.6词 | 背景→空白→方法→结果结构占近60% |
| 引言 | 均值705词 | 构建Problem重于描述Solution |
| 研究空白 | 152-182词 | Despite/Existing [P], [I] remains (出现203次) |
| 方法简述 | — | To address [C], we propose [M] (出现498次) |
- 缩写命名博弈:将方法缩写设计为目标会议缩写(如NeurIPS投ICML、ACL投CVPR)以提升辨识度
科研评价机制透视
| 评价维度 | 运作逻辑 | 异化风险 |
|---|---|---|
| Oral评选 | 初始高分博弈,rebuttal波动有限 | 完整度高者受青睐,开创性工作易成遗珠 |
| 引用量 | 长期含金量高 | 催生互引、邮件求引等行为 |
| GitHub Star | AI领域影响力参考 | 出现花钱购买现象 |
- 真正标尺:工作核心价值在于“解决了多少困惑”,而非benchmark分数提升
CHI 2026:人机交互突破与录用分析
- 顶会概况:ACM CHI 2026于2026年4月在西班牙举办,投稿6730篇录用1702篇,录用率25.3%,为全球最具影响力的人机交互顶会。
- DancingBox(最佳论文提名):爱丁堡大学、蔚蓝海岸大学与清华联合研发,仅凭单台RGB相机即可对任意物体进行动作捕捉并生成角色骨骼动画。
- 粗略动捕模块(MoCap):融合SAM2(视频分割)、CoTracker3(像素追踪)与π3(单目3D点云),从2D视频估计3D包围盒运动序列,通过SVD分解求解。
- 精细生成模块(MoGen):基于HumanML3D数据集训练ControlNet,向预训练MDM扩散模型注入包围盒控制信号以生成骨骼动画。
- 包围盒桥接策略:以包围盒运动序列作为中间表示,解决视觉点云与动捕骨骼数据无法直接配对的稀缺难题;引入噪声与丢弃策略模拟真实误差。
- UEQManager系统:北航经管学院本科生团队首登CCF A类顶会,结合深度学习与LLM协同,将眼动gaze线索转化为自适应UI决策。
- 系统成效:摆脱传统问卷依赖,实现非侵入式实时用户体验质量(UEQ)管理,全七个子维度预测均具统计显著性,平均提升27.29%。
| 对比维度 | DancingBox | UEQManager |
|---|---|---|
| 技术范式 | 视觉大模型+扩散模型双阶段管线 | 可解释深度学习+LLM协同分析 |
| 核心突破 | 包围盒序列桥接视觉与动捕数据 | 非侵入式gaze线索驱动自适应UI |
| 应用场景 | 任意物体动捕与角色动画生成 | 多语言语音助手的实时体验优化 |
| 评估效果 | 新手可快速上手,多关节精度待提升 | UEQ提升27.29%,全维度显著优化 |
12.2 Rebuttal 策略与 AI 辅助审稿回复
Rebuttal Skill:先决策再行动的审稿回复框架
- 本质洞察:Rebuttal 是精准回应与优先级决策,而非全面辩解;信息密度需高于论文本身
两阶段工作流
- Stage 0(决策):拆解 review → 识别底层真实疑虑 → 评估局势 → 规划实验优先级
- 局势评估:PROMISING(全力 rebut)→ BORDERLINE(聚焦关键实验)→ LOW RETURN(转向重投)
- 实验优先级:P0 立即做 / P1 随后推进 / P2 补完整性 / P3 留修改重投 / DO NOT RUN 耗时过长
- Stage 1(执行):整合真实结果,按「直接回答 → 证据 → 论文修改」组织回复
核心策略原则
- 双重读者意识:审稿人 + AC 均为关键读者,需主动整理争议帮 AC 快速做 meta-review
- 问题合并前置:共同问题集中回答,不逐条按原顺序回复
- 行动优于解释:补跑一个实验表格的说服力远超三段文字辩解
- 资源倾斜低分:最严厉审稿人提分空间最大,优先分配篇幅给其核心关切
- 坦诚承认弱点:对合理批评坦诚接受并提出改进方案,比强行辩解更能赢得信任
字面要求 vs 真实底层关切
| 审稿字面要求 | 真实底层关切 |
|---|---|
| 增加 baseline | 比较是否公平 |
| 实验不足 | 结论是否可靠 |
| 创新性有限 | 与最近工作的实质差别 |
28类常见审稿意见正反案例库(节选)
| 审稿意见类型 | ❌ 错误回复 | ✅ 正确回复 |
|---|---|---|
| 缺 baseline | 「方法不同」或「未来补充」 | 补跑实验,直接给出对比数据 |
| 创新性不足 | 罗列细微差异 | 一句话概括核心贡献 |
| 对比不公平 | 称「设置不同」 | 统一设置重跑对比 |
| 可复现性质疑 | 「代码接收后开源」 | 提供匿名代码仓库链接 |
| 消融实验不足 | 口头解释各模块作用 | 补充消融实验表格 |
| 理论分析缺失 | 「实验已证明有效性」 | 补充理论推导或证明 |
| 超参数敏感性 | 「已调过参」 | 给出参数扫描曲线 |
12.3 ICML 2026 高亮:核心获奖论文与录用全景
录用全景、评审标准与中国机构突破
AI科技评论(20260703) | AI科技评论(20260706) | 机器之心(20260706) | AI科技评论(20260710) | 量子位(20260715) | CVer(20260715)
- 录用规模与中美格局:投稿翻倍至23,918篇,录用率稳定26.6%;中国第一作者2,446篇首超美国,清华240篇登顶,前七机构均为中国大学
- 质量转化差异:美国Spotlight转化率(10.3%)仍高于中国(6.3%),中国论文在绝对数量突破,顶尖影响力层面尚有差距
- 方向重塑:LLM Agents(399篇)独立为一级方向,标志转向系统智能;机制可解释性(28%)、AI for Science(13.5%)等硬核深水区受热捧
- 评审隐形门槛:数学理论硬度具最高溢价,纯工程调参与基础提示工程面临系统性淘汰
产学融合与中国大厂核心成果
| 机构 | 论文数 | 核心成果与关键数据 |
|---|---|---|
| 中科院自动化所 | ~50篇 | 领跑单一机构论文数 |
| 腾讯系 | 50+篇 | HunyuanWorld输出可交互3D GLB文件 |
| 阿里千问 | 4篇 | ECHO推理框架(Qwen3吞吐量+36%),SiameseNorm双流参数共享 |
| 快手 | 11篇 | OneSearch点击率+1.67%,MetaphorVU隐喻视频理解基准 |
| 北大 | 12篇 | EchoAttention视频生成加速2.42倍,SALE长序列加速3.36倍 |
核心获奖与争议论文
| 维度 | 论文 | 核心贡献/争议点 |
|---|---|---|
| 杰出论文 | 清华&阿里 | 揭示扩散模型灵活性陷阱,GRPO方案准确率达89.1% |
| 杰出论文 | MIT&耶鲁 | 首个依赖梯度评估的对数凹分布复杂度采样器,精度指数级提升 |
| 时间检验奖 | DeepMind | 2016年A3C算法奠定异步深度强化学习基础 |
| 争议论文 | Verbalized Sampling | 零微调Prompt将多样性提升1.6~2.1倍,指出模式坍缩根因为偏好数据典型性偏差 |
12.4 顶会录用大盘点与高校成果全景
ICML 录用前沿:思想史回顾与因果发现突破
CVer(20260514) | AI科技评论(20260703) | AI科技评论(20260709) | 人工智能学家(20260710) | AI科技评论(20260710) | AI科技评论(20260710) | AI科技评论(20260710) | AI科技评论(20260710) | 人工智能学家(20260711) | 极市平台(20260721)
- 大会规模:ICML 2026有效投稿23,918篇(翻倍),录用6,352篇(26.6%),Spotlight仅2.2%(536篇)
- 核心趋势:研究范式从参数规模军备竞赛,转向因果理论、内部机制可解释性与底层算子优化
十年思想史与价值观转向
- 能力崇拜(2016-17):Silver证实“算力+强化学习=通用智能”,但策略越强反令Rollout越差
- 脆弱觉醒(2018-19):Dawn Song揭示能力与脆弱性的剪刀差;Gopnik指出大模型是“文化技术”非智能体
- 伦理审视(2022-25):Barzilay指出ML优化指标与真实临床质量相关性极低;Dragan警告奖励与人类期望错位
因果推断与大模型交叉突破
- LLM反事实:斯坦福Athey提出利用高温度采样获取反事实曝光,无需高维倾向估计即可实现低成本因果评估
- TRACE机制:将MoE门控重构为有限原子在单纯形上的连续凸组合,精准捕捉系统机制渐变
- 隐变量因果:PB-SCM填补计数数据因果发现空白;DiCoLa首次在隐变量下实现高效分而治之
AI安全攻防与科学计算前沿
- CBV攻击:扩散模型结合GradCAM生成有毒样本,干净标签后门攻击成功率破80%
- 版权侵权倾向:即使存在合法替代方案,当前最先进AI智能体依然显著倾向于做出侵权决策
- ExSQF量化安全:量化误差引发初始偏差,使安全差距缩小至2%,有害分数降低38%
- Rapid漏洞:仅1%投毒率致使Rapid Response框架假阳率达100%、假阴率达96%
- DS-TS物理求解:动力求解TDDE方程实现千倍提速,能效飙升约10万倍
- HelioX全脑拟合:定制CUDA内核支持树突级梯度计算,消费级GPU即可完成全脑拟合
- LangPrecip强降水:自然语言语义约束引导生成,CSI指标较SOTA提升约60%
ECCV 2026 前沿:3DGS、几何感知与多图感知突破
CVer(20260617) | CVer(20260622) | 极市平台(20260626) | CVer(20260626) | 机器之心(20260704) | CVer(20260704) | CVer(20260707) | PaperWeekly(20260720)
ECCV 2026 核心技术突破总览
| 论文 | 团队 | 核心突破 | 关键数据支撑 |
|---|---|---|---|
| MoKus | - | 跨模态知识迁移,文本编辑直改图像生成 | 训练6分钟,单条绑定7秒 |
| DiCoBench | 北大 | 首个细粒度多图感知评测基准 | 人类98.3% vs Gemini 58.1% |
| AgentHOI | 北大 | 免训练智能体式人机交互检测 | 零标注超越全监督方法 |
| LinStereo | 悉尼 | 线性复杂度全局注意力立体匹配 | ViT-B体量降遮挡EPE 37% |
| SAViT | - | 引入解剖一致性先验的医学ViT | 0.17M参数媲美86.60M全参微调 |
| SAM2Matting | 复旦 | 冻结追踪+精修抠图两阶段解耦 | 仅用图像数据零样本刷新视频SOTA |
| CompSAG | 西电 | 3DGS组合穿模解决(排斥力聚合) | 结合微调LLM校准消除失真 |
| StratoSplat | 西电 | 重力分层先验的稀疏航拍重建 | 仅3视角即达SOTA提升超3dB |
| GAGeo | Colab | 几何先验驱动的单阶段跨视角定位 | 联合输出检测、分割与位姿估计 |
| SVCBench | Colab | 流式多点提问的视频时空状态评测 | 人类约96分,最强模型仅约37分 |
四大核心范式洞察
- 感知鸿沟暴露:DiCoBench与SVCBench揭示大模型在主动推理与时空状态维护上远逊于人类直觉
- 冻结与解耦:SAM2Matting(冻结VOS追踪器)与AgentHOI(免训练)均通过保留预训练泛化力突破性能瓶颈
- 知识空间共享:MoKus证明统一架构内对LLM文本的编辑可跨模态自然迁移至视觉生成侧
- 几何先验驱动:CompSAG、StratoSplat与GAGeo分别引入表面排斥、重力分层、3D几何先验解决底层视觉重建问题
ACM MM 2026:西电18篇论文的技术版图与范式趋势
- 核心趋势:生成-判别协同推理、物理先验注入、几何感知自适应、频域运动监督及轻量化适配被广泛采用
多模态理解与跨模态对齐
- G2D(零样本分类):结合CLIP召回Top-K与生成式VLM消歧,利用置信度路由确定候选规模,揭示判别与生成模型的错误互补性
- v-PPL(图文对齐):双路径注意力掩码量化视觉Token贡献,将评估维度从文本流畅性转向细粒度的视觉支撑性验证
- MRESeg(医学分割):构建器官解剖关系知识图谱,将文本建模解耦为语义条件触发与显式知识注入两阶段
- DFPR(遥感检索):多结构混合专家解耦语义角色,通过谱图引导聚焦抑制背景噪声并双向校准
- PRAC(美学评估):基于偏好富样本挖掘最大化信息增益,在4个公开基准上显著超越SOTA
3D视觉:重建与跟踪
| 论文 | 场景 | 核心创新 |
|---|---|---|
| GCS-Splat | 机器人主动重建 | 几何一致性评分量化高斯基元退化,两阶段视点规划 |
| 结构扩展3DGS | 稀疏视角航拍 | 几何锚定一致性初始化及观测几何外推 |
| RP2Track | 激光雷达跟踪 | 首次将反射率作为物理先验融入3D跟踪 |
| Resonance4D | 4D动态场景 | 频域谱一致性建模振荡运动,显存从35GB降至20GB |
持续学习、异常检测与轻量化
- ECIL(类增量学习):熵正则化最优分布匹配生成可追溯推理链,将不透明参数记忆转化为显式推理
- AVAR(视频异常检索):利用时间序列反转惩罚约束动作方向性,实现零样本泛化
- GeoHand(手部重建):GeoAdapter校准域鸿沟,门控融合机制避免几何先验淹没RGB线索
- StyleHCD(变化检测):高光谱变化检测仅需0.004%可训练参数即达全量重训练精度
- DR-Seg(开放词汇分割):发现CLIP通道级功能异质性,解耦为语义主导与结构主导子空间
- MotifArchive:视觉元素Token档案,每元素仅占8KB存储,支持组合与插值
12.5 WAICA:中国发起的AI学术平台与话语权建设
WAICA学术平台启航与战略定位
- WAICA(World AI Conference · Academic):2026年7月18-20日在上海世博展览馆举办首届,由WAIC延伸而来,旨在打造中国发起、对标国际顶会标准的AI学术交流平台
- 学术阵容:图灵奖得主姚期智任大会主席;郑庆华院士与鄂维南院士共同担任程序委员会主席,从审稿源头保障学术质量
- 核心动因:中国AI论文发表量已居全球首位,但在国际顶级学术会议的话语权与评价体系中存在明显错配
学术话语权缺口与WAICA目标
| 维度 | 现状 | WAICA目标 |
|---|---|---|
| 评价体系 | 由西方顶会主导 | 建立开放公正的国际标准 |
| 议程设置 | 中国参与度受限 | 中国发起、全球共建 |
| 话语权 | 与中国AI体量错配 | 匹配中国研究实际贡献 |
| 公信力 | 依赖既有国际体系 | 顶级学术阵容背书 |
- 战略延伸:WAIC已举办八届,汇聚8000余位专家与数千家企业;WAICA标志其从产业平台向学术平台跨越
- 城市升级:上海建设国际科创中心,从AI产业落地中心向学术定义中心跃迁,补齐"定义学术前沿能力"的关键拼图
- 姚期智的象征意义:图灵奖得主担任大会主席,向国际学界传递"非区域性会议"的信号,提供学术公信力背书
交叉引用
- llm-frontier - 大模型前沿
- ai-agent - AI Agent与智能体
- ai-safety - AI安全与治理
- embodied-ai - 具身智能与机器人
- multimodal-aigc - 多模态与AIGC
- ai-trends - AI趋势与洞察
- ai-industry - AI行业与商业
- open-source - AI开源生态