Wesum AI

🦾 具身智能与机器人

人形机器人、自动驾驶、世界模型
收录数:1861 篇


目录


1. 人形机器人


1.1 量产与产业突破


量产进展与商业化突破

量子位(20260330) | 硅星人Pro(20260330) | 财联社AI daily(20260330) | 第一新声(20260330) | AI早餐汇(20260330) | 雷峰网(20260330) | 机器人前瞻(20260330) | 财联社AI daily(20260331) | AI蓝媒汇(20260331) | 机器人前瞻(20260331) | AI科技评论(20260401) | 机器人前瞻(20260402) | 智能涌现(20260402) | 雷峰网(20260402) | 具身智能之心(20260401) | 机器人前瞻(20260402) | 暗涌Waves(20260403) | 具身智能之心(20260403) | 智东西(20260403) | AI科技评论(20260406) | 机器之心(20260407) | 具身智能之心(20260407) | AI科技评论(20260408) | 雷峰网(20260408) | 机器人前瞻(20260409) | 雷峰网(20260410) | 具身智能之心(20260410) | AI科技评论(20260411) | AI科技评论(20260413) | 机器人前瞻(20260413) | 机器之心(20260415) | 数据猿(20260416) | 前沿在线(20260417) | 机器人前瞻(20260417) | 财联社AI daily(20260417) | 新智元(20260417) | 机器人前瞻(20260417) | AI科技评论(20260417) | AI科技评论(20260418) | 具身智能之心(20260418) | 智能涌现(20260418) | 光锥智能(20260418) | 智能涌现(20260419) | 机器人前瞻(20260420) | 机器之心(20260420) | 具身智能之心(20260420) | 机器人前瞻(20260420) | 雷峰网(20260422) | 机器人前瞻(20260423) | APPSO(20260426) | AI科技评论(20260427) | 具身智能之心(20260427) | 具身智能之心(20260427) | 机器之心(20260428) | 前沿在线(20260428) | 前沿在线(20260428) | CVer(20260429) | 机器人前瞻(20260429) | 钛媒体AGI(20260429) | "财联社AI daily"(20260429) | "财联社AI daily"(20260429) | 硅基观察Pro(20260429) | 阑夕(20260430) | 新智元(20260430) | 雷峰网(20260430) | 机器人前瞻(20260430) | 智东西(20260430) | APPSO(20260430) | 新智元(20260430) | 具身智能之心(20260501) | 机器之心(20260502) | 新智元(20260504) | DeepTech深科技(20260505) | "Z Finance"(20260505) | AI科技评论(20260505) | 划重点KeyPoints(20260506) | AI科技评论(20260506) | 量子位(20260506) | 前沿在线(20260506) | AI科技评论(20260506) | 第一新声(20260507) | "财联社AI daily"(20260507) | 机器人前瞻(20260507) | 机器人前瞻(20260508) | 九章智驾(20260508) | 机器人前瞻(20260509) | ScienceAI(20260509) | DeepTech深科技(20260509) | "Z Potentials"(20260511) | 机器人前瞻(20260511) | 机器人前瞻(20260511) | DeepTech深科技(20260511) | 机器人前瞻(20260511) | 智能相对论(20260511) | 智东西(20260512) | DeepTech深科技(20260512) | 机器之心(20260512) | APPSO(20260512) | 新智元(20260512) | DeepTech深科技(20260513) | "Z Potentials"(20260514) | 第一新声(20260514) | 量子位(20260514) | AI科技评论(20260515) | "Z Finance"(20260515) | 机器人前瞻(20260515) | 暗涌Waves(20260515) | 具身智能之心(20260515) | AI大模型工场(20260515) | AI科技评论(20260515) | 智能相对论(20260515) | "财联社AI daily"(20260516) | 机器之心(20260516) | 第一新声(20260517) | 量子位(20260517) | 新智元(20260517) | AI科技评论(20260518) | "财联社AI daily"(20260518) | 机器之心(20260518) | 机器人前瞻(20260518) | 机器人前瞻(20260518) | 智能涌现(20260518) | 前沿在线(20260518) | DeepTech深科技(20260518) | 前沿在线(20260519) | 机器人前瞻(20260519) | 机器人前瞻(20260519) | 机器人前瞻(20260519) | 机器人前瞻(20260520) | AI科技评论(20260520) | 机器人前瞻(20260520) | 机器人前瞻(20260521) | DeepTech深科技(20260521) | 机器人前瞻(20260521) | 雷峰网(20260521) | 机器之心(20260522) | AI科技评论(20260522) | 甲子光年(20260522) | "财联社AI daily"(20260522) | 硅基观察Pro(20260522) | 甲子光年(20260523) | 钛媒体AGI(20260524) | AI科技评论(20260525) | AI科技评论(20260525) | 具身智能之心(20260525) | 机器人前瞻(20260525) | 机器人前瞻(20260525) | 甲子光年(20260525) | 前沿在线(20260525) | AI蓝媒汇(20260525) | 机器人前瞻(20260525) | 硅星人Pro(20260526) | 具身智能之心(20260526) | 光锥智能(20260526) | 奇绩创坛(20260526) | CVer(20260526) | AI科技评论(20260527) | 机器人前瞻(20260527) | 新智元(20260527) | 具身智能之心(20260528) | 机器人前瞻(20260528) | 光锥智能(20260528) | 机器人前瞻(20260528) | 有新Newin(20260528) | 机器人前瞻(20260529) | AI科技评论(20260529) | 智东西(20260529) | AI蓝媒汇(20260530) | 钛媒体AGI(20260530) | 钛媒体AGI(20260530) | 机器人前瞻(20260601) | 甲子光年(20260601) | 量子位(20260601) | 新智元(20260601) | 机器之心(20260601) | 智东西(20260601) | DeepTech深科技(20260601) | 机器人前瞻(20260601) | "财联社AI daily"(20260601) | 机器人前瞻(20260601) | 甲子光年(20260602) | AI科技评论(20260602) | 具身智能之心(20260603) | 机器人前瞻(20260603) | 硅基观察Pro(20260603) | 雷峰网(20260603) | AI科技评论(20260604) | 具身智能之心(20260604) | 雷峰网(20260605) | 机器之心(20260605) | 量子位(20260605) | 第一新声(20260605) | 新智元(20260605) | 雷峰网(20260605) | "Z Potentials"(20260607) | 机器人前瞻(20260607) | AI科技大本营(20260608) | 具身智能之心(20260608) | 量子位(20260608) | 具身智能之心(20260608) | AI前线(20260609) | DeepTech深科技(20260609) | 机器人前瞻(20260609) | InfoQ(20260610) | CVer(20260610) | "财联社AI daily"(20260610) | 机器人前瞻(20260610) | 硅基观察Pro(20260610) | "财联社AI daily"(20260611) | 机器人前瞻(20260611) | 新智元(20260611) | 机器人前瞻(20260611) | AI蓝媒汇(20260611) | AI科技评论(20260612) | AI科技评论(20260612) | 机器人前瞻(20260612) | 硅星人Pro(20260614) | CVer(20260614) | 具身智能之心(20260615) | 硅星人Pro(20260615) | 机器人前瞻(20260615) | 量子位(20260615) | 具身智能之心(20260615) | 机器人前瞻(20260615) | 钛媒体AGI(20260616) | AI科技评论(20260616) | 机器人前瞻(20260616) | AI异类弗兰克(20260616) | 机器之心(20260616) | AI早餐汇(20260617) | 具身智能之心(20260617) | "财联社AI daily"(20260617) | 机器人前瞻(20260617) | 机器人前瞻(20260617) | 量子位(20260617) | AI前线(20260618) | 钛媒体AGI(20260619) | DeepTech深科技(20260619) | 智能相对论(20260620) | 光锥智能(20260622) | DeepTech深科技(20260623) | 钛媒体AGI(20260623) | 具身智能之心(20260623) | 机器人前瞻(20260623) | 机器人前瞻(20260623) | 机器人前瞻(20260623) | "Z Finance"(20260624) | 机器人前瞻(20260624) | 具身智能之心(20260624) | 机器人前瞻(20260624) | 具身智能之心(20260625) | 新智元(20260625) | 机器人前瞻(20260625) | 机器人前瞻(20260625) | 新智元(20260626) | 甲子光年(20260626) | 甲子光年(20260626) | 机器之心(20260626) | 机器人前瞻(20260626) | 奇绩创坛(20260627) | 机器之心(20260628) | 甲子光年(20260628) | AI科技评论(20260628) | 机器人前瞻(20260629) | 机器之心(20260629) | InfoQ(20260629) | 量子位(20260629) | 机器人前瞻(20260629) | 人工智能学家(20260629) | 具身智能之心(20260629) | AI大模型工场(20260629) | AI科技评论(20260629) | 新智元(20260629) | 智东西(20260629) | AI前线(20260630) | 数字生命卡兹克(20260630) | 智能涌现(20260629) | 暗涌Waves(20260630) | 机器人前瞻(20260630) | 机器之心(20260630) | 量子位(20260630) | 智能相对论(20260630) | 机器人前瞻(20260630) | 光子星球(20260630) | "财联社AI daily"(20260701) | 雷峰网(20260701) | 甲子光年(20260701) | 量子位(20260701) | 机器人前瞻(20260701) | 机器人前瞻(20260701) | 智能涌现(20260701) | 机器人前瞻(20260701) | 机器人前瞻(20260701) | 机器人前瞻(20260701) | 雷峰网(20260702) | 智能涌现(20260702) | 脑极体(20260702) | 前沿在线(20260703) | 机器人前瞻(20260703) | 雷峰网(20260703) | 机器人前瞻(20260703) | 机器人前瞻(20260703) | 具身智能之心(20260704) | "财联社AI daily"(20260704) | "财联社AI daily"(20260705) | 数智前线(20260706) | 具身智能之心(20260706) | 机器人前瞻(20260706) | 暗涌Waves(20260705) | DeepTech深科技(20260706) | 机器人前瞻(20260706) | 量子位(20260707) | 机器之心(20260707) | DeepTech深科技(20260707) | 机器人前瞻(20260707) | AI科技评论(20260707) | 智东西(20260707) | 具身智能之心(20260708) | AI科技评论(20260709) | 量子位(20260709) | 机器之心(20260709) | 具身智能之心(20260709) | 智能相对论(20260709) | 机器人前瞻(20260710) | 新智元(20260710) | 具身智能之心(20260416) | DeepTech深科技(20260416) | 量子位(20260712) | 机器人前瞻(20260713) | 机器之心(20260713) | 甲子光年(20260713) | 机器人前瞻(20260713) | 具身智能之心(20260714) | 量子位(20260714) | 钛媒体AGI(20260714) | 量子位(20260714) | 机器之心(20260715) | 机器人前瞻(20260715) | 机器人前瞻(20260716) | 光锥智能(20260702) | 甲子光年(20260718) | "Z Potentials"(20260718) | 奇绩创坛(20260718) | "Z Potentials"(20260719) | 硅星人Pro(20260719) | 硅星人Pro(20260719) | 机器人前瞻(20260719) | 前沿在线(20260719) | 光锥智能(20260719) | 雷峰网(20260720) | 量子位(20260721) | 甲子光年(20260721) | 新智元(20260721) | 机器之心(20260722) | 机器人前瞻(20260722) | 光子星球(20260724) | 甲子光年(20260724) | 机器人前瞻(20260331) | 量子位(20260402) | 机器人前瞻(20260415) | 机器人前瞻(20260512) | AI科技评论(20260513) | DeepTech深科技(20260520) | "Z Potentials"(20260520) | 机器人前瞻(20260520) | 光子星球(20260526) | 前沿在线(20260713) | 量子位(20260725) | AI科技评论(20260724) | 机器人前瞻(20260727) | 机器人前瞻(20260727) | 机器人前瞻(20260727) | 智能涌现(20260727) | 前沿在线(20260728) | 雷峰网(20260729)

  • 模块化与端到端路线博弈:模块化出Demo快但泛化有天花板,端到端跨场景复用成本低
  • 物理规律自主理解突破:自变量WALL-B整合多感知进同一神经网络,实现物理规律自主理解
  • 物理AI基础设施化新范式:正奇未来QUORRA DoorMind实现语义级环境理解与决策,区别传统SLAM
  • 行业价值链重构:行业焦点从造硬件转向提供认知底座,模型层战略价值超越硬件
  • 数据与系统极速升级:Magic-MMix日采万条合成数据,星海图VLA延迟190ms,阶跃实现0.1秒本地调用
  • 端侧爆发与算力变形:聆听投近5亿研存算一体NPU,上纬T1首发内置本地世界模型

量产壁垒与开源生态

  • 量产能力成核心壁垒:星炽动力平移家电质控,不良率<1%实现24天千台级量产
  • 全栈开源抢占心智:科沃斯开放三层架构对标安卓填补产研鸿沟
  • 开源加速端侧全链条降本:自变量WALL-OSS将于2026年迭代至消费级显卡可运行,全链条开放
  • 落地合规路线:B端无ROI>1案例,行业需遵循先量产再变聪明的合规路线
  • 终端量产与出海验证:QUORRA X5启动2026年全球量产,智谷天厨海外转化率超50%

落地场景与商业范式

  • 先难后易场景策略:自变量先切入家庭非标场景跑通,再降维覆盖物流(1200件/时)、养老与制造
  • 医疗与工业落地引爆:宇树G1微创手术降本至6.7万美元,国网68亿引爆云深处巡检
  • 商业新范式演进:具身智能从方案订阅演进至Token销售与RaaS,泛化能力天然适配C端
  • 烹饪机器人商业突破:智谷天厨获近亿融资且营收破亿,2026年预计保持300%增速
  • 安防巨头转型智能物联:海康机器人业务半年收40.28亿居工业头部,感知技术底座高度协同

人才流动与团队生态

  • 大厂高管投身物理AI:前百度及中关村科金总裁喻友平转向物理AI创业,补齐大模型ToB规模化交付经验
  • 物理AI三类核心玩家:海外实验室、英伟达/OpenAI前员工及国内自动驾驶团队,共同短板为技术强落地弱
  • 大厂高管入局价值:直接补齐政企资源、产品运营与商业化体系,将ToB平台化交付方法论迁移至产业化

垂直领域全栈突破与差异化硬件路线

机器人前瞻(20260717) | 具身智能之心(20260720) | 机器人前瞻(20260721) | 前沿在线(20260723) | 机器人前瞻(20260727) | 机器人前瞻(20260728) | "Founder Park"(20260728)

  • 分层智能架构:大脑秒级决策、小脑毫秒级控制、底层实时力位混合控制
  • 软硬件全栈闭环:首发英伟达Jetson Thor兼容Isaac Sim,打通训完即部署至数据秒级回流
  • 数据基建飞轮:数采提效10倍、万卡集群训练加速5-7倍,真实场景长尾问题补全数据

极致仿生与跨本体验证

  • 跨本体验证网络:自研SMASH及原生模型已在宇树、智元、乐聚等完成工业与SMT场景适配
  • KAI Bot人形旗舰:全球最高115自由度,具备80%触觉覆盖及0.1N极致感知力
  • KAI Hand灵巧手:1:1真人尺寸,37自由度且指尖力超30N,现已全球开售
  • 4D世界模型:百万级视频预训练,支持4D建模与超仿生情绪交互

工业特种产品矩阵

  • 路线选择逻辑:锁定电力/消防等高刚性工业场景,以模块复用实现规模化量产交付
  • 核心特种产品:DR02(IP66/275TOPS)主攻变电站,山猫S10(自重<20kg)专攻地下管廊
  • 野外与电网旗舰:山猫M20S(IP67/负载35kg)野外应急,绝影X30主攻电网防汛防台
  • 新型特种作业:Hypertron-T01直击电力巡检安防,Hypertron-SW01专攻消防火场作业

个人出行与具身渐进路线

  • ev¹智能出行终端:定价29999元,四轮独立驱动+主动转向+智能导航,抛弃传统轮椅被动范式
  • 智能等级L2:Co-Pilot(摇杆+避障)与Waypoint(室内导航)模式,断网可安全驾驶
  • 渐进发展逻辑:移动底盘具独立商业价值,locomotion与manipulation天然耦合且增量成本可控
  • 团队核心壁垒:约200人研发,伯克利博士/前大疆负责人领衔,兼具四轮智驾与AI量产能力

商业化规模与资本认可

  • 规模与效益:年产扩至10万台覆盖45国超500客户,电力故障识别率高达96.5%
  • 融资里程碑:德塔半年6轮累计近5亿元;2025完成数亿元A1/A2轮融资(吉利/中信领投)
  • 硬科技创投节点:获高瓴、联想等追投,UCLA博士团队引领,模型层公司成产业链关键节点

脑机接口与具身智能前沿突破

具身智能之心(20260401) | 机器之心(20260406) | 人工智能学家(20260401) | DeepTech深科技(20260414) | 人工智能学家(20260424) | DeepTech深科技(20260428) | "财联社AI daily"(20260505) | "Z Potentials"(20260602) | 脑极体(20260717) | 有新Newin(20260420)

侵入式脑机与神经调控突破

  • 意念语音解码:Neuralink N1植入运动皮层解码音素并合成语音,AI还原ALS患者病前音色,目前仍有数秒延迟
  • 抑郁症微创治疗:Motif DOT获FDA批准,9mm无电池无线供电植入硬脑膜上方,单次10-20分钟,已启动10人临床试验
  • 双向视觉重建:SiClink主攻读写闭环,同时解码视觉信息与精准写入皮层,支持近实时校准,获蓝驰高瓴投资
  • 活体神经机器人:塔夫茨大学成功培育含自组织神经网络的活体机器,钙成像证实神经元具电活动性,体积变大且运动更复杂

非侵入式脑机与产业平台

  • 脑控科研平台:强脑科技发布全球首个一体化脑机平台,兼容湿干电极(250-1000Hz/32通道),全流程从数月缩短至10分钟
  • 平台填补产业空白:统一采集、多范式解码与机器人指令映射,提供图形化事件映射替代手写代码
  • 商业化四级火箭:假肢→医疗康复→C端消费→底层技术,目标5-10年帮助百万残疾人,仿生手已获FDA认证
  • 清醒梦消费干预:Halo头带经颅超声在REM期诱导清醒梦,质量升至5.5-6.5分,Morpheus-1模型(1.03亿参数)算法驱动,定价约2000美元

遥操作与具身数据采集

  • 主流方案对比:SO-100同构映射操作直觉但受限,Ringo低成本TCP重定向不要求结构一致,HumDex全身动捕成本低至200美元
  • HumDex效率突破:遥操作成功率升至91.7%(提升17.1%),轻量级MLP端到端映射训练不足20分钟
  • 两阶段跨越鸿沟:大规模人类数据预训练ACT提取先验,少量机器数据微调使自主执行成功率升至80%
  • 数据格式标准化:须对齐LeRobot或RT-X格式,以适配π0、GR00T等主流VLA模型

物理世界AI飞轮

  • 五大技术基元:VLA模型、世界动作模型、通用机器人策略、自驱实验室、脑机接口同步走向成熟
  • 飞轮协同机制:共享感知-决策-执行架构,物理交互数据反哺世界模型形成正反馈,多处早期部署阶段
  • 模型能力验证:π₀零样本泛化折叠50种未见衣物,Gemini机器人实现自主读取压力表

深圳机器人谷:硬件供应链驱动的产业聚集

"财联社AI daily"(20260701) | 机器人前瞻(20260713) | 具身智能之心(20260418) | 具身智能之心(20260526) | "财联社AI daily"(20260725) | "财联社AI daily"(20260726) | 具身智能之心(20260727) | InfoQ(20260729)

产业格局与梯队:政策默许软硬件分离,形成深圳场景验证与京沪底层模型依赖;行业分化为本体派(宇树/智元/逐际)、大脑派(星海图/千寻)与数据派(光轮/简智)

  • 梯队断层:截至2026年4月70家中26家破百亿(200亿+共7家),头部两家占全行业近40%估值,多数缺规模化营收
  • 头部矩阵:超级头部含优必选(约500亿)、群核科技(443亿港元)、宇树(约420亿);二梯队含卧安(约255亿港元)、银河通用(30亿美元)等
  • 资本迁移:徐新重仓星海图标志顶级VC从软件大模型层向物理世界迁移;博世与银河通用合资近3亿,维他动力完成5亿Pre-A
  • 地缘靶心:2025全球出货约1.3万台中国占近九成,出海路径面临系统性收紧,成地缘打压目标

技术演进与生态:宣称全栈自研多为融资叙事,机械臂/关节多来自少数供应商,产业正参照手机与汽车向模块化分工过渡

  • 五大模块:拆分为本体结构、核心零部件、执行系统、控制计算系统(小脑运动+大脑模型)、辅助系统
  • 蓝海缺口:仿真与触觉传感器玩家极少,光轮智能(20亿美元)成数据层标杆,高质量数据采集正从配角转主角
  • 生态裂变:智元等加速供应链拆分,行业步入规模化商业阶段,真正壁垒在深度,从业者应在1-2关键模块建立优势
  • 智元突破:成立三年赴港IPO,2025出货超5100台(份额约39%)为全球最大;产品含远征/灵犀/精灵/酷拓覆盖全场景
  • 逐际动力:半年融资约27.2亿估值150亿,推TRON系列及Luna全尺寸,架构含运动控制、VLA感知协同与世界模型OS

出口管制与打压:2025年7月FCC将人形/四足机器人与联网逆变器纳入受管制清单,新型号无法取得设备授权认证

  • 监管新规:美国将其重新定义为移动网络设备,复用针对华为大疆的通信监管框架,机器人与逆变器对应AI物理出口与能源入口
  • 精准封堵:限制仅针对未认证新型号,已获批存量暂不受影响;但软硬件高频升级,限制新型号等于封堵迭代能力,比即时禁令更具长期杀伤力
  • 中企受挫:宇树6月已被列入国防部1260H清单,智元北美扩张亦面临FCC授权阻碍

WAIC展会观察:大模型底座与Scaling路径探索

量子位(20260613) | 量子位(20260719) | 阑夕(20260720) | 机器人前瞻(20260720) | 光锥智能(20260720) | 光子星球(20260720) | 具身智能之心(20260721) | 雷峰网(20260721) | 光子星球(20260721) | AI异类弗兰克(20260719) | 雷峰网(20260722) | 新智元(20260722) | 极市平台(20260722) | 机器人前瞻(20260722) | AI前线(20260723) | 量子位(20260723) | 前沿在线(20260723) | 前沿在线(20260723) | InfoQ(20260726) | AI科技评论(20260719)

架构演进与技术互补

  • 多路线架构解耦:底层VLA冻结结合上层Agentic Planner编排,纯VLA与低成本数据等五大路线走向互补
  • 三层脑架构:腾讯Hy体系按物理时间尺度分层,混合频率解耦单频VLA延迟瓶颈
  • 三模型协同:VLM-1.0低频理解、RxBrain-1.0中频规划、VLA-0.5高频动作,自研框架将响应压缩至2-3秒

认知分离与泛化突破

  • 认知执行分离:openJiuwen开源Symbiosis架构创态势感知环,产出结构化世界状态并校验物理可行性
  • 跨本体自主泛化:openJiuwen实现Zero跨本体与环境自主泛化,解决长程任务痛点,已引入华为云AgentArts商用

具身智能自进化生态

  • 在线自进化:中国团队构建在线学习自进化体系斩获17项全球第一;面壁智能MiniCPM-Robot标志端侧向物理世界延伸
  • 空间与异构计算:3D Scene Graph支持变化检测与情景聚类,端云协同由昇腾NPU高频推理、鲲鹏CPU负责任务编排

多技能跃迁与Scaling验证

  • 技能数量跃迁:苏度科技WAIC首秀单技能向10+技能跃迁,探索通用机器人Scaling路径
  • Sim2Real泛化:苏度拓展纯仿真迁移优势(抓取首抓98%、综合99%+),验证技能随数据/算力规模扩展持续增长

WAIC具身大模型底座概览

厂商/机构产品/模型核心数据与技术亮点
阿里RynnBrain 1.1122B参数,支持跨本体操作
京东JoyAI系列感知执行闭环,预计2年采1000万小时数据
宇树UnifoLM统筹全身运动与精细操作协同
普渡PuduAgent OS13万台运转,年产超5000万小时数据
清华/正行Harness VLA底层VLA冻结,Agentic Planner编排实现解耦

World Labs空间智能全栈战略

机器人前瞻(20260722) | AI前线(20260723) | InfoQ(20260726) | 量子位(20260729) | 划重点KeyPoints(20260729)

  • 多维投资矩阵:覆盖空间模型(World Labs)、机器人整机(FieldAI)、物理基础模型(Perceptron)、数据标注与3D工具链等
  • 行业演进趋势:AI全面转向“感知→预判→执行”闭环,仿真平台成为大厂与创企必争之地与核心商业基建

World Labs商业定位与落地

  • 基础设施思维:定位为“机器人领域的PyTorch”,不造硬件,建设与机器人形态及模型架构完全解耦的训练基建
  • 模型与形态无关:兼容单臂/双臂/移动式机器人及各类夹爪;支持从零训练或对现有VLA与WAM模型进行后训练
  • 渐进落地路径:已跑通工厂全结构化场景,当前主攻仓库/餐厅等半结构化场景,终极挑战为非结构化家庭环境
  • 硬件形态批判:定制化硬件解决特定痛点比强行推行昂贵的通用人形躯体更具商业可行性

R2S2R仿真闭环与全能架构

  • R2S2R双阶段闭环:Real-to-Sim生成可交互虚拟世界,Sim-to-Sim自动针对策略弱点生成新交互经验
  • 高通量与跨平台验证:单checkpoint支持2000次批量仿真筛选;纯仿真策略成功迁移至5种平台并连续1小时无失败接管
  • 对齐与因果溯源:经GR00T N1.6等验证仿真保持策略相对排名;不仅复现成败,更能还原因果过程
  • 全栈技术闭环:自研3D生成(Marble)+ 收购熟人创企SceniX(具身智能数据工厂)+ 物理部署打通完整链路
  • 全能模型架构演进:向前拆分为前向模拟器(预测变化)与策略模型(输出动作),向多模态输入输出集成的全能模型演进

纯视频模型批判与仿真不可替代性

  • 四维一致性对比:R2S2R具备时空视角交互四维一致,纯视频预测仅靠像素统计缺乏物理约束,易生幻觉导致错误学习
  • 系统化随机化:仿真无成本演练极端高危事件,可系统化控制光照、摩擦力、几何等参数,突破现实数据无法穷举的瓶颈
  • 仿真评估提速:现实中极难区分90%与92%的策略成功率,仿真可快速对比,其评估提速效应比训练加速更具商业价值
  • 自动驾驶先例:Waymo等使用数十亿小时仿真数据,对仿真依赖度已远超真实数据

觅蜂科技:一站式物理AI数据平台与蜂巢数据共创行动

具身智能之心(20260416)

  • 数据荒漠量化:物理AI真机交互数据量不足大语言模型的两万分之一,数据瓶颈严重制约具身智能产业化
  • 全范式覆盖:觅蜂平台实现真机遥操、无本体采集、仿真数据三种范式全覆盖,打通硬件-软件-平台-运营全链路

MEgo系列硬件矩阵

产品形态核心能力
MEgo Gripper采集夹爪毫米级精准捕捉
MEgo View头戴式采集设备超300°全景感知
MEgo Engine数据治理引擎亚毫秒级同步
  • 硬件同构破局:MEgo系列与精灵G2 Air原生同构,基于同构传感器和夹爪一致性数据训练的模型可无缝部署到G2 Air,从源头解决Sim-to-Real鸿沟
  • 产能目标:2026年目标千万小时级数据产能,蜂巢行动目标2030年达百亿小时级
  • 蜂巢数据共创行动:联合上电科、国家数据标委会、工信部赛迪研究院发起,核心目标是打破数据孤岛、统一数据标准、链接全球供需;与京东云、百度云、阿里云等完成战略签约
  • 行业共识:具身智能的核心竞争是数据采集与转化效率的竞争,2026年被定位为「具身智能数据元年」

Zeno AI:CMU系全身协同端到端新锐与第三人称视频学习路径

雷峰网(20260421)

公司概况:Zeno AI(芝诺机器人)2025年6月成立,总部杭州+悉尼研发中心,由CMU RI博士后、悉尼大学长聘助理教授William Zhi联合创办;团队均出身CMU/浙大/悉尼大学/UIUC,95后为主,尚未披露融资

创始人学术网络:师从英伟达首席研究科学家Fabio Ramos,博士期间在英伟达西雅图机器人实验室从事灵巧操作研究(与Dieter Fox、Nathan Ratliff合作),CMU博士后师从Matthew Johnson-Roberson;获L4DC Best Paper、RSS Pioneer,担任ICRA 2026/RSS 2026 AE

三大差异化技术架构

  • 全身协同端到端控制:统一模型协调底盘位姿与上肢操作,取代传统感知→移动→操作分模块串联,提升全身协调性与动态稳定性
  • 第三人称视频学习路径:从海量第三人称人类视频提取行为先验进行预训练,学习通用物理直觉与任务结构,再用少量机器人示范高效后训练,直击数据稀缺瓶颈
  • 部署中自省与持续改进:机器人执行中主动识别能力边界,不确定时自省请求帮助,利用部署反馈持续修正策略

竞争格局定位:CMU RI已孵化Skild AI、Field AI、Genesis AI等公司;Zeno AI以中澳双节点+差异化技术路径切入,定位海外市场,杭州对接供应链与资本,悉尼对接学术资源


PhyAgent OS:具身智能开源操作系统升级

AI科技评论(20260722)

  • PhyAgent OS 重磅升级:定位为新一代具身智能开源操作系统,旨在为机器人提供统一的操作系统底座
  • 开源生态战略:对标 Android 模式,通过开放操作系统层降低具身智能开发门槛,加速产学研协作
  • 行业定位:与索塔物理OS、PuduAgent OS等共同构成具身智能操作系统赛道,标志行业从单点模型竞争走向系统平台竞争

1.2 技术与生态


具身智能评测体系与可信度分级框架

机器之心(20260330) | AI科技评论(20260330) | 数据猿(20260330) | 具身智能之心(20260401) | 前沿在线(20260404) | 智能相对论(20260401) | 钛媒体AGI(20260408) | 极市平台(20260408) | 雷峰网(20260410) | AI早餐汇(20260420) | 机器之心(20260422) | 量子位(20260422) | 具身智能之心(20260423) | AI科技评论(20260428) | 机器人前瞻(20260430) | AI科技评论(20260430) | 量子位(20260502) | CVer(20260502) | 机器之心(20260507) | 量子位(20260507) | 具身智能之心(20260507) | "Z Potentials"(20260509) | 具身智能之心(20260509) | 机器人前瞻(20260509) | 甲子光年(20260509) | 机器之心(20260510) | 十字路口Crossing(20260510) | 具身智能之心(20260510) | 具身智能之心(20260511) | 硅星人Pro(20260511) | AI科技评论(20260511) | 具身智能之心(20260512) | 光锥智能(20260512) | "Z Potentials"(20260513) | 量子位(20260515) | 具身智能之心(20260514) | 具身智能之心(20260516) | APPSO(20260516) | APPSO(20260518) | 新智元(20260518) | 具身智能之心(20260521) | 量子位(20260525) | DeepTech深科技(20260525) | 智能涌现(20260526) | 雷峰网(20260527) | DeepTech深科技(20260529) | "Z Potentials"(20260601) | 量子位(20260601) | InfoQ(20260601) | 机器之心(20260602) | DeepTech深科技(20260602) | 具身智能之心(20260602) | AI科技评论(20260602) | 具身智能之心(20260603) | 量子位(20260604) | 机器人前瞻(20260605) | AI科技评论(20260605) | AI科技评论(20260605) | 机器之心(20260607) | AI科技评论(20260608) | 量子位(20260608) | CVer(20260608) | 甲子光年(20260609) | AI前线(20260610) | AI科技评论(20260610) | 机器人前瞻(20260610) | 甲子光年(20260610) | AI科技评论(20260612) | 商汤科技SenseTime(20260615) | 新智元(20260615) | 智能涌现(20260614) | AI前线(20260615) | AI科技评论(20260616) | "财联社AI daily"(20260616) | 量子位(20260616) | DeepTech深科技(20260616) | 甲子光年(20260618) | 具身智能之心(20260618) | 苍何(20260622) | 新智元(20260622) | 数据猿(20260623) | AI科技评论(20260623) | AI科技评论(20260624) | 智东西(20260624) | 甲子光年(20260625) | 量子位(20260625) | 机器人前瞻(20260625) | AIGC开放社区(20260626) | 具身智能之心(20260627) | 具身智能之心(20260629) | AI科技评论(20260629) | 甲子光年(20260629) | 机器人前瞻(20260629) | APPSO(20260630) | 智东西(20260630) | 机器人前瞻(20260630) | 机器人前瞻(20260630) | 数智前线(20260701) | 优设AIGC(20260702) | 机器人前瞻(20260702) | 前沿在线(20260703) | 机器人前瞻(20260703) | 新智元(20260703) | 商汤科技SenseTime(20260707) | 机器人前瞻(20260709) | 机器人前瞻(20260709) | 雷峰网(20260710) | 具身智能之心(20260710) | 机器之心(20260712) | 腾讯研究院(20260713) | 智能涌现(20260713) | 光锥智能(20260713) | 前沿在线(20260713) | 智能涌现(20260715) | 具身智能之心(20260716) | 新智元(20260717) | "财联社AI daily"(20260717) | AI科技评论(20260717) | 具身智能之心(20260717) | AI科技大本营(20260717) | 机器之心(20260717) | 智能涌现(20260717) | InfoQ(20260718) | 具身智能之心(20260719) | 新智元(20260719) | 甲子光年(20260719) | 光子星球(20260719) | 新智元(20260719) | 赛博禅心(20260719) | AI寒武纪(20260719) | 前沿在线(20260719) | 具身智能之心(20260717) | 量子位(20260720) | 机器人前瞻(20260720) | 新智元(20260721) | 量子位(20260721) | 深度学习与NLP(20260719) | 机器之心(20260722) | "Z Finance"(20260722) | AI大模型工场(20260722) | 量子位(20260723) | 量子位(20260723) | 智能相对论(20260723) | 机器人前瞻(20260723) | 深度学习与NLP(20260722) | 甲子光年(20260724) | 机器之心(20260725) | 量子位(20260725) | CVer(20260727) | 具身智能之心(20260729)

TEI可信赖具身智能体系

  • 体系提出:Xspark AI联合清华等高校提出T0-T5分级,确立可信度是端到端系统属性
  • 五维木桶规则:评估任务/安全/保障/证据/治理,TEI等级受限于最薄弱的安全关键维度
  • 等级限制:大模型若工程保障不足仅T1-T2,窄能力工业机器人经严苛验证可达T4
  • 动态降级:证据过期、监控失效或事故未闭环时,TEI等级必须下调

四层支撑与跨层失效

  • 模型层PROPOSE:VLA、世界模型与规划器生成动作提案,输出校准不确定性与安全偏好
  • 系统层EXECUTE:传感控制与硬件隔离防护,将授权动作可靠转化为物理行为
  • 证据层SUBSTANTIATE:通过形式化、统计与实证检验测试提供可信证明
  • 部署层GOVERN:运行监控、人工介入与事故响应闭环,周期常长于模型迭代
  • 跨层失效:存在语义-物理鸿沟、动作-后果鸿沟,及各组件单独可靠但组合失效风险

商业场景与落地矩阵

  • 落地演进:2026年长程任务厂商具先发优势,遵循工业到商服再到家庭的降维迁移
  • 工业产线(Moz1):宁德时代PACK线成功率超99%,严苛降本并合作京东/博世等头部
  • 商服场景(Moz2):32DOF+全向舵轮+7DOF臂,验证桌面整理与药片分拣等多任务泛化
  • 多场景变现:RaaS模式破亿营收,深耕工业降本、家庭陪伴及垂类高溢价服务市场
  • WAIC场景验证:蚂蚁灵波30+SKU识别率99.8%,银河通用验证多机协同烤面包全链路

开源生态与技术跨界

  • 类脑融合加速:融合世界模型与NeuroVLA,依托脉冲网络实现0.4W低功耗与<20ms响应
  • 跨界经验平移:自动驾驶人才外溢,注入端到端量产与数据闭环的结构化经验
  • 开源生态破局:清华系企业开源Jetson-PI核心技术底座,加速具身生态降本与发展
  • 团队优势:具备完整工程交付能力团队比纯模型团队更早实现高等级商业部署

行业赛事与活动

  • IROS 2026:Workshop于8月10日截稿,10月1日匹兹堡举办
  • WorldArena 2.0:设三大赛道,总奖金7500美元

优必选商业化与人才争夺

雷峰网(20260403) | 机器人前瞻(20260727)

  • 具身智能抢人白热化:优必选开出1500万至1.24亿元年薪创全球公开招聘最高纪录,凸显顶尖“从0到1”技术人才严重供不应求
  • 优必选量产数据:2025年营收20.01亿元,人形机器人销量1079台居全球首位,其中工业场景应用占比超80%,标志加速走向产业化
  • 上游供应链拉动:广东某机器人零部件核心供应商(主供优必选)获千万级融资,反映人形机器人量产爬坡期对上游资本的强劲拉动效应
  • XREAL冲刺第一股:向港交所递表,2025年营收5.16亿元,毛利率35.2%,超70%收入来自海外,亏损持续收窄至4.56亿元
  • 芯原股份递表港交所:2025年收入31.48亿元,技术壁垒深厚,旗下NPU IP授权达91家客户,GPU IP累计出货超20亿颗

核心行业数据对比

  • 优必选(机器人):营收20.01亿元,销量1079台(全球第一),工业占比超80%
  • 芯原股份(芯片IP):营收31.48亿元,NPU客户91家,GPU出货超20亿颗
  • XREAL(智能眼镜):营收5.16亿元,毛利率35.2%,海外收入占比超70%

1.3 运动控制与全身协调


全身控制分层架构与跨本体数据迁移

具身智能之心(20260402) | 具身智能之心(20260409) | 具身智能之心(20260411) | 具身智能之心(20260413) | 具身智能之心(20260422) | 具身智能之心(20260501) | AI科技评论(20260507) | DeepTech深科技(20260514) | 量子位(20260519) | 机器之心(20260529) | AI科技评论(20260603) | AI科技评论(20260603) | 量子位(20260605) | 具身智能之心(20260606) | 具身智能之心(20260608) | AI科技评论(20260609) | 机器之心(20260610) | 具身智能之心(20260610) | 具身智能之心(20260612) | 量子位(20260616) | 机器之心(20260619) | 量子位(20260619) | AI科技评论(20260619) | 具身智能之心(20260624) | 机器之心(20260625) | 量子位(20260626) | 机器之心(20260628) | 机器之心(20260629) | AI科技评论(20260701) | 新智元(20260706) | AI科技评论(20260708) | 机器之心(20260708) | AI科技评论(20260712) | 机器之心(20260712) | 量子位(20260712) | 具身智能之心(20260713) | 新智元(20260713) | "Z Potentials"(20260714) | 机器人前瞻(20260714) | 量子位(20260716) | 机器人前瞻(20260716) | 机器人前瞻(20260717) | AI科技评论(20260717) | 机器人前瞻(20260719) | 具身智能之心(20260718) | 硅星人Pro(20260719) | 具身智能之心(20260723) | 具身智能之心(20260724) | 深度学习与NLP(20260626) | 机器之心(20260724) | 机器之心(20260726) | 量子位(20260726) | 具身智能之心(20260726) | 量子位(20260726) | 硅星人Pro(20260727) | 具身智能之心(20260728) | CVer(20260727) | 量子位(20260728) | 机器人前瞻(20260728) | 深度学习与NLP(20260726) | 深度学习与NLP(20260726) | 机器人前瞻(20260729) | 甲子光年(20260729)

核心路线与商业模式

  • 专做模型:北大卢宗青团队坚持只做模型不做本体,获市场认可
  • 产品矩阵:Being-H主攻末端灵巧操作(离商业化最近,授权+工业POC),Being-M预研全身移动操作(未来接入人形)
  • 跨本体泛化:适配仅需少量真机数据,模型已具零样本泛化能力,需针对场景后训练以达商用
  • 数据降本:S-300K蒸馏至8B模型,发布超千小时真机数据大幅降低成本

模型架构与演进

  • 隐式世界动作模型(WAM):预训练即携带动作预测,学习动作→后果的因果链,不走显式生成路线
  • 多模态预训练:Being-H0.8在预训练融入触觉(接触+临近距离),汇聚50万小时第一人称视频
  • 视触统一空间:将视/触/动作统一至同一隐空间,NeoData含3万小时视触交互覆盖450项长程任务
  • TWAM与精细控制:72亿参数三异步专家架构使仿真成功率达84.5%,T-Rex视触分离使真机成功率达65%

触觉管线与感知范式

  • 统一触觉表征:金字塔架构+统一接口将二值接触、连续力值等多类传感数据映射为阵列点六维力
  • 跨传感器融合:NeoForce建立跨凝胶/电容/力设备的统一时序表征,解决设备不兼容难题
  • 数据处理瓶颈:攻克50万小时数据去重与配比工程难点,UniHand过滤超92%错轨,TactoHand从视频推断接触
  • 触觉 Scaling:触觉是低估的维度,从滞后反馈转向前瞻预测(VTLA预测未来50步),赋能跨平台迁移与灵巧力控

近场安全与雷达标准

  • 分层感知体系:小于5cm交触觉,5cm-1m交固态雷达,大于1m交相机,各司其职
  • NOVA20雷达:覆盖5cm-1m盲区,20点×40°扇形测距,<5g/<1W且抗100Klux强光,可拼成全身感知圈
  • 确定性安全冗余:高层VLA决策“做什么”,底层确定性传感保障“不伤人”,弥补纯视觉时延与合规短板
  • 安全标准倒逼:ISO 10218-1:2025已纳入速度与间隔监控,纯视觉方案在合规层面存结构性缺陷

主动感知与扩散策略驱动的运动规划加速

AI科技评论(20260605) | 具身智能之心(20260609) | CVer(20260613) | DeepTech深科技(20260614) | PaperWeekly(20260617) | DeepTech深科技(20260624) | 新智元(20260727)

轨迹规划与导航

  • MIGHTY规划器:五次Hermite样条融合局部控制与时空优化,森林测试100%成功,位置误差0.0041m
  • SIDP视觉导航:自模仿扩散闭环三相位训练,5步DDIM压缩至110ms,零样本迁移真机成功率达90.25%
  • OctMem-Agent:自适应八叉树3D token化构建层次记忆,结合FiLM+Q-Former实现指令引导检索,SR提升7.5%
  • 动力学泛化扩散策略:显式理解物理动力学参数,解决换地面或机器人本体后策略失灵痛点,实现跨动力学零样本迁移

主动感知机制

  • 信息增益最大化:将换视角、移遮挡物纳入感知闭环,形式化为信念分布的不确定性消减问题
  • 信念演化预测与传播:度量语义地图同编码占据概率、语义及不确定性,允许概率扩散至未观测区域应对物体移动
  • 三类搜索先验:LLM+3D场景图生成语义先验,几何尺寸约束过滤位置,重定位先验学习人类移物习惯

端到端极限穿越

  • 苍蝇灵感穿越:单目相机+IMU直出推力与角速度,摒弃状态估计避免级联误差
  • 两阶段解耦训练:低维oracle MDP中RL训练,经策略蒸馏建立像素到动作直接映射
  • 极限穿越性能:穿越20×60cm缝隙(机身仅5cm余量),横滚角>60°时成功率仍达90%

微型机器人建图芯片Gleanmer(MIT)

  • 基础与流式架构:4mm²面积与622KB存储,单遍扫描生成高斯表示后丢弃原始帧,消除片上存储瓶颈
  • 极致功耗与高效查询:实时处理640×480深度图,功耗仅6mW(比TX2低341倍);相邻坐标打包查询降耗74%–81%
  • 空间生成与近似计算:构建障碍物高斯椭球反推可通行区域降耗22%–63%;降低数值精度使加速器面积减少38%
  • 高精高频性能:建图精度保持96%–99%,每秒完成88–331次更新,可查询54万–132万个空间坐标点

大规模预训练与推理上下文Scaling验证

硅星人Pro(20260716) | 智东西(20260716) | 卡尔的AI沃茨(20260716) | 量子位(20260717) | 量子位(20260719) | 机器之心(20260719) | 人工智能学家(20260727)

  • 小米与黎曼双线突破:小米10万小时+黎曼20万小时数据预训练,首次系统验证具身智能Scaling Law
  • 模型代际演进:从单任务策略(1.0)、VLA模型(2.0),演进至动作视频联合建模的WAM(3.0)
  • 架构合流共识:VLA(直觉快响应)与世界模型(深思稳健)走向融合,成为基础模型两大主路线

数据引擎与自动标注

  • VLM自动标注流水线:将长轨迹切分并描述状态变化,实现十万小时级数据的自动语义对齐
  • 多源数据结构:小米构建UMI便携采集突破本体限制;黎曼构建人类视频(20万h)+UMI(1.2万h)+真机混合数据
  • 人类视频预训练优势:消融实验证明人类视频数据贡献增益达14.4pp,超机器人数据(5.2pp)与UMI数据(4.8pp)之和
  • 合成数据自进化:小米U0生成数据使OOD场景任务成功率从36.9%升至63.2%,生成效率提升82.9倍

Sim2Real与底层优化

  • 数字遥操作范式:达摩院用世界模型替代真机,深度骨骼渲染(近暖远冷)解决空间模糊
  • 极少数据验证:仅300条合成数据训练Pi-0,Block Pushing成功率达82.86%,突破真机数据依赖
  • 实时推理突破:流式自回归蒸馏转因果模型,速度从2.8FPS升至40FPS,满足200ms延迟

核心评测与工程指标

  • 小米断档登顶:RoboCasa365达57.4%验证数据规模收益;实测工厂自攻螺母上件成功率98%
  • 黎曼全维霸榜:RoboCasa-365 62.6%(超SOTA 8.4pp)、LIBERO 99.0%、RoboTwin 2.0 94.3%
  • 极致工程指标:Matrix-Game 3.5以5B参数实现单卡720P@~20FPS实时流式生成并开源
  • 核心概念:Jim Fan与李飞飞团队提出机器人「上下文scaling」新方向,将LLM领域的上下文长度扩展思路迁移至机器人领域
  • 技术定位:区别于训练阶段的Scaling Law(数据规模扩展),上下文Scaling聚焦推理阶段的上下文信息利用效率提升
  • 研究意义:探索机器人在推理时利用更长时序上下文(历史交互、环境信息等)实现更好泛化与决策能力

UniPR:端到端Real-to-Sim物体级感知与重建

具身智能之心(20260401)

核心突破:端到端并行推理取代串行pipeline

  • UniPR(NTU+腾讯Robotics X,CVPR 2026):首个端到端Real-to-Sim立体感知与重建框架,仅需双目图像单次前向即并行输出多物体的检测、位姿与3D几何
  • 速度提升100倍:全场景多物体并行推理仅需0.63秒,彻底消除"检测→分割→重建→位姿估计"串行误差累积
  • 物理尺度精确:形状比例误差(SPE)降至0.109(提升3倍),可直接指导真实机械臂抓取操作

核心技术:位姿感知形状表示(PASR)

  • 特征解耦:通过VAE将点云压缩为64维隐式特征嵌入Object Query,实现感知与重建闭环
  • 球面体素归一化:摒弃传统标准空间人为定义"正方向",直接在观察空间编码带旋转姿态的物体
  • 无监督泛化:隐空间经KL散度正则化展现跨类别几何插值能力,仅依靠Occupancy监督无需类别标签

LVS6D数据集与性能表现

维度核心数据
数据规模192个日常类别,6,300+个物体实例
难度划分Easy/Medium/Hard三级评估体系
前置依赖摆脱2D边界框、分割掩码和相机位姿依赖
性能表现在AP、APE、ACD指标上显著领先基线
  • 生态开源:代码与数据集已开源(github.com/xingyoujun/unipr),支持学术研究与工程复现

共享具身智能:人体模型驱动的联合设计范式

ScienceAI(20260720)

  • 核心框架:意大利理工学院提出 Shared Embodied Intelligence(共享具身智能),将人体生物力学模型纳入机器人设计全流程,发表于《Nature Machine Intelligence》
  • ergoCub 机器人:专为验证该理念开发的新一代人形机器人,在硬件结构、控制系统与人体模型间进行联合优化(Co-design),而非传统「先设计再适配」
  • 联合设计三要素:机器人硬件(机械结构参数化)、控制系统(高层规划→底层全身控制)、人体模型(骨骼、关节、肌肉动力学数字模型)在同一优化框架中求解
  • 对称信息交互闭环:人体状态持续影响机器人动作规划,机器人运动反过来改变人体受力,形成双向闭环;优化目标从「机器人保持平衡」升级为「人机整体高效安全舒适」
  • L5-S1 腰骶关节实时监测:针对职业下背痛高发区域,机器人实时计算人体 L5-S1 关节最大压缩力,主动调整姿态、发力方向与移动节奏,降低人体机械负荷
  • 外部干扰恢复:人机共同运动中施加推力模拟碰撞或突然变向,机器人结合人体状态重新调整全身平衡,在保持协作关系的同时恢复稳定
  • 范式转变:从「设计机器人→适配人类」转向「人机联合建模→联合优化」,人体需求在机器人诞生前即写入硬件和算法;安全性从被动避障升级为主动负荷管理

Uni-LaViRA:免训练三级翻译具身导航框架

具身智能之心(20260624)

核心论点:导航不一定需要训练VLA

  • 具身导航本质是无接触空间移动,动作语义(往哪走、看哪个目标)已落在预训练MLLM能力分布内,无需再用机器人数据训练
  • 训练型VLA瓶颈:数据从<100万增至1600万+条,成功率仅从<40%升至~70%边际递减;56×H100连续72小时训练,多数高校无法承担;换场景/机器人需重训

三级翻译架构(Language→Vision→Robot)

层级模型功能可替换性
语言层Gemini-3.1-Pro读取指令+观察,输出高层决策(前/左/右/后转、上下楼、停止),维护全局规划决策中枢
视觉层Qwen3.5-27B第一视角图像框出目标,输出边界框+描述,支持开放词汇无需预训练路点预测器
几何层确定性控制器2D框+深度+相机内参→3D坐标,地面用快速行进算法,无人机用体素网格+可视性图唯一硬件相关层,换机器人仅替换此层(~6-8人时)

两个推理期关键机制

  • TDM(待办清单记忆):指令拆成待办/已完成清单,每步回看更新再决策,对RxR等120词长指令贡献最大
  • SCB(二次机会回溯):走进死胡同时回溯到出错前航点,将失败轨迹作为上下文交给模型分析再重新选择方向,错误成为判断依据而非被丢弃
  • 两者相互独立:回退后清单保留,可协同工作

实验结果

  • 四项反超训练型SOTA:HM3D-v2、HM3D-OVON、MP3D-EQA、OpenUAV
  • 两项仍落后:VLN-CE R2R/RxR(R2R SR 60.7%为零样本最优)
  • 消融:TDM+SCB全开均分57.4%,全关仅48.6%
  • 失败归因(1800条轨迹):误判目标提前停止45.8%,到达后未触发停止24.7%,问答细节识别错误19.5%

关键洞察

  • 以结构换数据是可行路径:任务核心能力已落在基础模型能力分布内时,任务拆解可替代大规模训练
  • 硬件解耦关键在架构分层:硬件相关逻辑隔离到最底层确定性控制器,上层完全复用
  • 当前瓶颈在停止判断而非移动:70%+错误与停止时机相关
  • 局限:闭源骨干无对等开源替代;大范围走廊类目标全局定位不够稳定;超长指令仍略逊定制VLA
  • 仿真与真机代码均已开源

具身操作数据金字塔:异构数据分层策略与组合范式

具身智能之心(20260728)

五层数据金字塔(北大/NTU/港科大等11单位72页综述)

  • 核心张力:可扩展性与机器人对齐度天然互斥——越贴近真机成本越高规模越小,越易规模化离物理反馈越远
  • 塔尖到塔基五层:真机数据(最高保真,成本极高)→UMI风格数据(保留末端执行器,丢失关节感知)→人类视频(无场地限制,无动作标注)→仿真数据(零边际成本,物理近似)→网络通用数据(语义覆盖,与机器人无绑定)
  • 每往下一层本质是在用保真度换规模,当前尚不存在同时实现「高保真+低成本」的数据源

三类具身基础模型的数据逻辑

  • 大脑模型:通用多模态负责语义理解,交互信号数据负责物理落地
  • VLA模型:直接靠动作标注将多模态理解映射为可执行动作
  • 世界动作模型(WAM):训好后可当模拟器/评估器/合成数据引擎,反哺仿真层形成闭环,可能是未来1-2年最值得关注方向
  • 动作建模转向:从离散token转向连续扩散或流匹配建模,因离散token在灵巧手精细控制场景丢信息过多

跨机器人动作维度对齐三方案

方案核心思路局限
具身特定投影每机器人保留自己的动作接口,靠适配器接入扩展性受限
定长零填充统一固定维度填零加掩码物理语义模糊
语义动作槽每维度赋予固定物理含义(如Qwen-RobotManip 80维向量)需行业共识
  • 语义动作槽可能是下一代大规模跨具身预训练标配,类似NLP中token标准化的地位

系统性风险与关键判断

  • 失败与恢复数据被系统性低估:几乎所有数据集偏向成功轨迹,策略学会了执行任务却没学会检测失败和恢复
  • 触觉传感至今未标准化:接触力、打滑、材料属性等信息视觉只能间接猜测
  • 最优数据配比目前无答案:不同模型的数据组合和采样比例基本靠经验试错,缺乏受控消融实验
  • 数据金字塔本质是成本-保真度的帕累托前沿:突破点不在「混合更多数据」,而在找到能将前沿向外推的新数据形态

1.4 人形机器人移动与奔跑性能


人形机器人极限奔跑性能与竞速赛事突破

财联社AI daily(20260411) | 智东西(20260412) | 第一新声(20260413) | APPSO(20260419) | 财联社AI daily(20260419) | 机器人前瞻(20260419) | 财联社AI daily(20260419) | 甲子光年(20260419) | 量子位(20260420) | CVer(20260420) | AI异类弗兰克(20260423) | 脑极体(20260509) | 量子位(20260615) | DeepTech深科技(20260619) | 机器之心(20260401) | 具身智能之心(20260721) | 机器人前瞻(20260724) | PaperWeekly(20260728)

极限速度突破

  • 宇树H1速度极限:2024年底达10m/s(36km/h),创人形纪录,达博尔特峰值速度的80%
  • 半马成绩跃升:2026年北京亦庄半马冠军缩至50分26秒,较2025届缩短超68%,超越人类纪录(约56分42秒)

核心硬件降维打击

  • 手机供应链赋能:手机业工程能力迁移大幅缩短研发周期,跨界实现降维打击
  • 散热与扭矩极限:液冷深入电机(跑10km仅31.5℃),自研关节电机峰值扭矩达400牛·米
  • 电机驱动成主流:依托供应链优势全面放弃液压改用电驱,兼顾高控制精度与响应速度

赛事演进与自主决策

  • 赛事规模翻倍:2026年半马参赛机器人超300台,纯自主导航占比从个位数跃升至近40%
  • 场景验证智能:赛事全面禁遥控并引入真实痛点,双足构型(占比5.79%)在越障中展现极高潜力

技术瓶颈与挑战

  • 热管理与平衡:硬件成熟后长距离热管理及高速平衡成短板,头部机型均出现终点冲刺失衡
  • 虚实鸿沟制约:3D仿真策略向真机部署存在鸿沟,物理硬件执行极限制约了算法策略变现

构型与生态探索

场景/构型代表突破与数据
极高海拔改装版G1登顶6310米火山,72小时VR学习验证极寒生存
轮足融合宇树As2-W结合轮式速度与足式越障,实现侧空翻及高负载跟随
野外探测替代传统传感器覆盖97%轮式禁区,执行野生动物监测与反盗猎
系绳锚定空中机器人TreeSpider通过系绳锚定树枝替代悬停,停靠能耗最高降2.5倍并降噪
  • 空中机器人范式转变:TreeSpider从自由飞行转向附着式作业,完成室外全流程叶片采样链路
  • 核心创新机制:环形系绳机构实现解耦,兼顾停靠稳定性与局部姿态调整作业灵活性
  • 模块与作业能力:具备仿生机械臂(保持力10N)与原型切割采样工具,标志其从感知向操作平台演进

智元远征A3自主乒乓对抗与AIMA生态

前沿在线(20260617) | 具身智能之心(20260703) | 新智元(20260722) | 前沿在线(20260424)

  • 智元远征A3突破:无脚本全尺寸自主乒乓对抗,5m/s球速下实现毫米级击球预判
  • 硬件与感知:搭载全球首款人形乒乓控算法SpikePingpong与20kHz高频脉冲相机(响应提升10倍)
  • 仿生复刻路线:采用WBC与kHz级高频力矩闭环,毫秒级全链路延迟与关节阻抗实现柔顺接触
  • 多维能力验证:此前已通过凌空飞踹、空中漫步等动作验证速度、力量、协调性与多维控制能力

软硬件核心模块与数据指标

核心模块技术方案关键指标
视觉感知20kHz高频脉冲相机响应提升10倍
运动控制SpikePingpong / WBC毫秒级全链路延迟
仿真系统Genie Sim 3.0 / GE-Sim 2.0超10万场景,误差<10%
数据集AGIBOT WORLD217项任务,87种技能,近3000小时

Genie Studio Agent零代码部署平台

  • 战略跃迁:从提供技术能力向应用产品化跃迁,竞争焦点从模型强弱转向部署效率与生态开放度
  • 核心能力封装:VLA、强化学习等全组件化,非工程人员拖拽节点编排,应用定义权回归场景层
  • 三维仿真与RL闭环:内置三维重建支持部署前虚拟预演,上线后结合力控反馈与视觉持续优化精度
  • 双平台协同闭环:联合Genie Studio模型开发平台构建训练加部署闭环,向集成商开放二次开发

工业验证场景与关键指标

场景关键指标
半导体Tray盘上下料成功率99.999%+,掉盘率<0.001%,MTBF>168h
汽车安全带卷收器上料成功率99.9%+,单次节拍<13秒,定位误差<1mm

生态效率与规模化部署

  • 极速编排调试:生态伙伴半小时完成应用编排,设备布局变化2小时自适应,任务调整10分钟生效
  • 安全稳定运行:实现安全避让与断点恢复100%全面覆盖,降低具身智能规模化核心部署门槛
  • 规模化与开发者:累计出货超10000台定义2026为部署态元年,元苼计划5年投20亿扶持资金

EBiM Challenge 2026:全球首届移动双臂操作挑战赛

具身智能之心(20260625)

  • 全球首届移动双臂操作竞赛:EBiM Challenge 2026 由汉堡大学、波恩大学、CMU、清华等8所高校联合主办,总奖金超 30000 美元,旨在建立国际标准化评测基准
  • 三大赛道全面考察操作能力:覆盖线缆插接(精密协同)、可变形材料处理(柔性操控)、居家辅助喂食(人机交互安全),衔接学术与产业
赛道任务场景核心能力考察
Track 1线缆整理与插接双臂协同精密操作、接触感知、长时序规划
Track 2可变形材料处理柔性物体操控、视觉感知、工业装配
Track 3居家照护与辅助喂食人机交互安全、泛化能力、真实环境部署
  • 统一硬件平台:采用 Franka Mobile FR3 Duo 作为参考平台(FR3 为旗舰力控机械臂,Duo 为双臂移动配置),确保评测标准化与可复现
  • 两阶段 Sim-to-Real 赛制:先仿真验证(6.29–8.3),优胜者进入真机阶段(8.10起),完成从虚拟到真实的跨域能力测试
  • 跨大洲同步真机测试:在中国上海、德国慕尼黑/汉堡、美国匹兹堡三地同步进行,保证同硬件+同任务下评测的公平性
  • 完整时间轴:6.22报名 → 8.3仿真截止 → 8.10真机开放 → 8.20线下赛 → 10.1公布结果 → 11月CoRL Workshop颁奖

1.5 开源人形机器人平台与硬件平民化


Hugging Face LeRobot Humanoid:全栈开源双足平台与2636美元硬件破局

DeepTech深科技(20260531) | 具身智能之心(20260712) | GitHubDaily(20260714)

硬件平民化:整机成本仅2636美元,包含电机1880+主控235+3D打印56+标准件465,12自由度纯双足平台

降本核心支柱:中国灵足时代电机供应链结合桌面级3D打印(75个零件),打破传统高昂硬件壁垒

端到端训练闭环:树莓派5+Ubuntu+Python,弃用WBC,用MuJoCo+PPO强化学习训练步态,导出ONNX部署

v0.6.0工具链整合:贯通训练→评测→上线→失败记录→纠正数据回喂微调,集成奖励模型API与6个仿真环境

三大核心模型

模型核心创新优势
VLA-JEPA潜空间预测式预训练避外观偏差
Fast-WAM推理砍视频分支提速4倍
LingBot-VA自回归预测边推演边行动

训练算力极限压缩:MimicLite仅需8×RTX 4090约3小时完成训练,将SONIC级别策略算力需求压缩至1/875

无监督RL突破:UFO框架8×RTX 4090不到12小时训完BFM-Zero,性能优于原版

动作重映射极速化:hhtools双后端(Newton IK + Interaction-Mesh MPC),30秒完成任意URDF全身重映射

数据统一管线:any4hdmi统一LAFAN等数据源,mjhub保训练与sim2sim一致,Pico/XR遥操作延迟0.1秒

全栈开源底座:Party OS贯通本体至开发者全栈工具链,本质是将LLM开源逻辑复制到机器人领域


1.6 ICRA 2026 华人学者获奖全景:从数据生成到触觉仿真的链路突破


顶会前沿突破与具身学术争鸣

机器人前瞻(20260417) | "Z Finance"(20260511) | "Z Potentials"(20260511) | AI科技评论(20260527) | AI科技评论(20260603) | AI科技评论(20260605) | 新智元(20260606) | 机器之心(20260607) | AI科技评论(20260607) | "Z Potentials"(20260608) | AI科技评论(20260608) | AI科技评论(20260608) | 人工智能学家(20260609) | 具身智能之心(20260611) | 机器人前瞻(20260613) | AI科技评论(20260616) | 量子位(20260623) | 量子位(20260624) | 具身智能之心(20260702) | 具身智能之心(20260707) | AI科技评论(20260712) | AI科技评论(20260714) | AI科技评论(20260714) | 具身智能之心(20260714) | AI科技评论(20260714) | AI科技评论(20260714) | AI科技评论(20260714) | 量子位(20260716) | AI科技评论(20260717) | AI科技评论(20260717) | AI科技评论(20260717) | 量子位(20260720) | 机器之心(20260723) | AI科技评论(20260727)

产业趋势与学术争鸣

  • 学术与人才动向:华人学者密集获奖且苏昊加盟复旦,ICRA 2026录用率38.04%且VLA占近20%
  • 顶会具身辩论实况:徐丹飞激辩致PI连输三轮与谷歌大佬倒戈,标志技术路线进入反思与争鸣阶段
  • 核心行业判断:Sim-to-Real Gap本质是物理问题,在错误物理前提数据上Scale等于系统性放大错误
  • 底层范式转换:数据生产转向物理真值先行,物理计算正确性成比模型架构更底层的核心竞争维度
  • 基础设施演进:高精度物理仿真正从学术工具演变为必要基础设施,其行业地位类比EDA之于半导体
  • 系统化研究范式:研究从算法单点突破转向数据-训练-评测-部署协同设计,且正式认可失败案例价值
  • 四大核心议题:全面涵盖数据扩展(Sim2Real/合成数据)、训练(VLA的SFT/模仿学习/RL)、评测与部署
  • 全身智能与安全:WBI需百亿参数与海量算力,Agentic Coding打通多机闭环,SELV系统实时屏蔽违规token

高精度物理求解器突破

  • Uncharted Dynamics:获险峰长青领投数百万美元种子轮,由CEO贺哲文联合工业物理博士团队创立
  • 求解器能力边界:针对现有模型刚柔耦合迅速失真与柔性接触失效痛点,亟需高精度求解器实现底层破局

核心方案与关键指标

  • FlashSAC (训练加速):通过底层架构创新,将模型训练时间从数小时大幅压缩降至数分钟
  • 苏度科技 (纯仿真迁移):实现极高精度的Sim2Real迁移,抓取首次成功率约98%,综合成功率达99%+
  • VLA端到端 (柔性挑战):从容应对柔性物体挑战,全流程成功率稳超90%,单任务执行耗时约20秒
  • BiDemoSyn (少样本学习):仅需1-2次演示即可生成数千数据,实现零样本跨本体成功率约90%
  • 零次方 (数据沉淀):重资产自建具身智能数据工厂,目前已积累沉淀超1000小时真实机器数据

其他底层软硬技术突破

  • 算力与硬件突破:DISC架构性能反超33亿参数π0,cuNRTO最高提速139.6倍,APEX HAND单手提30kg

1.7 脑机接口:超声路线与商业化路径


脑机接口商业化与技术平台突破

硅基观察Pro(20260703) | 脑极体(20260717) | 硅基观察Pro(20260727) | DeepTech深科技(20260728)

|---|---|---|---|
| 核心优势 | 高分辨率 | 无创脑网络读写 | 伦理及手术风险低 |
| 竞争格局 | 中美差距约4年 | 中美差距约1.5年 | 已正式获批进入市场 |

  • 超声换道超车:首次在脑网络层面实现无创读写,AI多模态将1秒延迟压缩至0.5秒
  • 视觉赛道提速:因伦理和手术风险可控,视觉恢复赛道的商业化进度可能快于运动控制

医疗与商业化进展

适应症市场规模研发/商业进展
慢性疼痛数百亿美元疼痛下降约50%,年底国内临床
焦虑/抑郁等各百亿级管线推进中
阿尔茨海默等千亿级远期布局
  • 超声拿证预期:目标2年左右拿证,海外同行Merge Labs已完成约2.5亿美元种子轮
  • 视觉临床突破:暖芯迦国内首例植入,失明患者一月内实现精准抓取,验证真实生活可用
  • 获批商业落地:Science Corp.视网膜植入物获CE Mark,将进行商业植入验证审批可行

脑控科研与具身智能数据

架构层级核心参数与功能
采集层兼容干湿电极,最高1000Hz采样率,32通道WiFi 6实时传输
解码层内置SSVEP等范式,参数开放支持自研算法
执行层事件-指令映射替代手写代码,打通多款主流机器人接口
  • 科研平台整合:强脑科技发布全球首个一体化平台,将脑电采集到执行缩短至10分钟
  • 填补产业空白:作为意图理解层打通软硬件,解决换机器人即重写代码痛点,进入工程化阶段
  • 物理数据瓶颈:物理世界缺乏等价文本数据源,深度、触觉、意图等信息必须主动采集生产
  • 脑电数据增强:被动式BCI将脑电与第一人称视频时间同步,为训练数据添加"意图时间戳"标签
  • 百倍训练价值:脑电标记的训练价值预估是普通录像的100倍,标注异常发生概率但非完整想法
  • 同步硬件方案:Zypher便携式脑电(耳周+前额24通道)与肌电传感器辅助还原手部三维姿态
  • 物理AI大爆发:Encord物理AI收入增10倍,平台数据量从1PB增至5PB+,服务全球300+团队

1.8 人形机器人活体手术突破:通用人形平台首次完成腹腔镜胆囊切除


通用人形机器人手术突破与达芬奇对比

DeepTech深科技(20260709) | 机器人前瞻(20260710) | ScienceAI(20260713) | CVer(20260719)

UCSD团队用宇树G1通用人形机器人完成全球首次活体微创手术(猪腹腔镜胆囊切除),2025年7月登《Nature》,一作为00后中国博士生梁泽楷。

核心手术数据

  • 单机主刀:耗时56分钟,出现轻微胆汁溢出等并发症
  • 双机协同:主刀+扶镜牵拉,无并发症,耗时缩至32分钟,重新部署降至4次
  • 精度对标:加权误差4.53(G1) vs 4.59(达芬奇),通用人形首次具备精密手术潜力

通用人形 vs 专用手术系统

维度宇树G1达芬奇
成本含配件约6.7万美元50万至数百万美元
重量27kg800kg+
器械外接商用标准腹腔镜专有配套器械
部署走进手术室即可工作需专门改造手术室
灭菌仅用无菌手套,不达标可高温高压灭菌

硬件适配与遥操作架构

  • 末端定制:本体未深度改造,仅设计伺服驱动指连接装置外接腹腔镜钳
  • 遥操作系统:立体高清头显显示+双主手手柄缩放映射+网络通信控制
  • 人类辅助:床旁医生协助调整器械、组织牵引及摄像头

核心技术:虚拟RCM

  • 痛点:缺乏达芬奇硬支点,需靠视觉算法虚拟维持穿刺口约束
  • 方案:套管口贴ArUco标记码 → 头摄实时定位 → 逆运动学求解器调整手臂姿态

现存短板与未来挑战

  • 速度与延迟:FLS比人类慢43秒,跟随延迟超150ms理想值
  • 0到1验证:核心证明可行性而非技术突破,距人类临床应用仍需长期研发
  • 自主化路线:优先自动化降认知负荷子任务(镜头定位/器官牵拉),非替代医生
  • 微型机器人瓶颈:能量供给、机载计算、体内安全回收(依赖可降解材料)三大难关未破

1.9 灵巧手硬件突破与力透明传动


灵巧手硬件架构突破与量产竞争格局

量子位(20260710) | 机器人前瞻(20260710) | APPSO(20260712) | 光锥智能(20260713) | 机器人前瞻(20260717) | 机器人前瞻(20260718) | 新智元(20260719) | 机器之心(20260720) | "Z Potentials"(20260720) | 具身智能之心(20260722) | 机器人前瞻(20260723)

  • 核心产品线:高负载Flex 1(25DOF/30kg+)、精密Flex 2(0.05N力控)、工业Std16A(16DOF/≥60N)、轻量Eco12(12DOF/≥45N)
  • 电控性能极限:微型伺服电缸最轻31g/推拉力250N,指令延迟≤10ms,闭环≤1ms,重复定位精度±0.2mm
  • 四层技术架构:底层执行器、机械结构、嵌入式系统与上层类小脑算法协同,融合多传感构建闭环控制
  • 全栈自研量产:打通核心零部件,获万台级订单,5400㎡工厂年底目标1万台灵巧手+20万电缸
  • 场景验证跨越:从WAIC现场精细演示拓展至2026年真实仓储分拣,实现与视觉机械臂的任务闭环

底层零部件与材料突破

  • 传动与反向驱动:1X NEO打破常规,将传动比降至5:1~15:1实现“力透明”与完全反向驱动
  • 全驱仿生设计:1X NEO具备25自由度,定位精度±0.2mm,峰值扭矩17.75Nm,整机IP68防水
  • 动态顺应防呆:低远端惯性遇冲击自动退让;视触觉传感感知滑落瞬间切换“捏”为“托”防碎
  • 微型驱动极限:第三代电机外径低至9.9mm/重3.5g,采用稀土永磁与Halbach阵列逼近磁通极限
  • 材料工艺创新:强磁场微米级自动化装配与工程塑料替代金属,大幅降本并攻克散热壁垒

量产竞争与商业格局

厂商产能/出货自由度技术路线与核心优势
灵心巧手月产4000台(峰)最高42全自研供应链,ASP较海外低50%
拾玥科技100-200套11/17/23Lumi-Tac视触觉,微型电机主动散热降超50℃
1X (NEO)1万台(2025目标)25低传动比“力透明”传动,整机约2万美元
  • 真实需求存疑:高盛指出工业多依赖二三指,高自由度灵巧手实际需求覆盖率仅10%-30%
  • 行业研判终局:执行器占BOM成本40%-50%,竞争转向综合工程量产能力,国内预计留存4-5家
  • 资本催熟独角兽:新锐企业7个月完成四轮亿元级融资,聚集巨头产业股东总市值超5万亿

2. 自动驾驶与出行


2.1 智驾产业困境


智驾产业困境与人才迁徙潮

财联社AI daily(20260401) | 老冯云数(20260401) | 雷峰网(20260402) | 雷峰网(20260402) | 雷峰网(20260401) | 雷峰网(20260406) | AI蓝媒汇(20260401) | 雷峰网(20260401) | 雷峰网(20260414) | 雷峰网(20260423) | 雷峰网(20260502) | 前沿在线(20260507) | 雷峰网(20260520) | CVer(20260521) | 智能相对论(20260528) | 雷峰网(20260616) | 智东西(20260617) | 光锥智能(20260617) | 光锥智能(20260630) | 雷峰网(20260716) | 智能相对论(20260723) | 雷峰网(20260723)

智驾企业困境盘点

企业营收/亏损核心痛点
纵目科技3年净亏15.86亿错失行泊一体与高速NOA转型,赛力斯、理想等核心客户流失
毫末智行体系崩塌京保团队互不共享源码丧失长城信任,双领导制致决策迟缓
禾多科技资金链断裂贱卖总部致融资受阻,高阶项目前4月仅售2156台入不敷出
地平线营收37.58亿/亏104.69亿毛利率骤降,遭英伟达(占49.36%)与华为强烈挤压

技术演进与路线博弈

  • 供应链范式转变:大众采用十亿级白盒授权替代黑盒采购,中国供应商升级为技术底座构建者。
  • 端到端成分水岭:卓驭删除规则代码转向端到端,一年狂揽34家车企,数据驱动成获单核心。
  • 车企自研重塑格局:长城算力达5 EFLOPS,L2++渗透率居传统车企第一;吉利自研耗资40亿零产出。
  • 纯视觉路线受挫:Waymo多传感器融合行驶破2亿英里,特斯拉纯视觉陷入软硬件双重商业化死循环。
  • FSD硬件遇瓶颈:HW3内存带宽仅HW4的1/8无法实现无监督,400万车主被弃,落地推迟至2026年Q4。
  • FSD入华挑战大:受制法规与数据合规,国内招90人9城测Robotaxi,实际无人车仅约20辆受限软件瓶颈。

降本增效与合规要求

  • 舱驾融合降本:地平线高通推融合芯片,单车省1500-4000元(整车降约30%),研发周期缩至8个月。
  • L2强标重塑硬件:2027年1月强制国标实施,毫米波雷达成刚需,纯视觉方案因复杂工况易失效面临淘汰。

人才流动与基础研究

  • 智驾人才回流学界:前奇瑞CTO曹光植(苹果-百度-奇瑞)离职任中山大学教授,打破车企间流转模式。
  • 行业进入沉淀期:新势力智驾负责人相继离职,反映端到端与模块化路线分歧、架构调整及商业化错配。
  • 产学融合加速:自动驾驶从工程红利期进入基础突破瓶颈期,突破技术瓶颈促使产学研双向流动加速。

英伟达Halos:机器人全栈安全系统与行业认证生态

量子位(20260623) | 钛媒体AGI(20260625)

英伟达推出业界首个覆盖芯片到系统认证全链路的机器人安全系统 Halos,复用自动驾驶 18600 工程人年与 700 万行验证代码,首批生态合作伙伴超 40 家。

全栈安全架构解析

层级核心组件关键特性与数据
硬件层IGX Thor晶圆级物理隔离安全岛,主系统宕机可独立接管急停;独立 GPU 达 5581 FP4 TFLOPS
软件层Halos OS基于 QNX 通过 IEC 61508 SIL 3 认证,Hypervisor 隔离 AI 与安全关键任务
感知层Sensor Bridge统一多源异构传感器接入,达 SIL 2 级安全保证
认证层ANAB实验室全球首个物理 AI 安全 ANAB 认可实验室,TÜV 等六大机构直接认可

算法与感知安全挑战:VLA/VLM 模型存在语义误判(如将纸箱当人),AI 概率性与传统确定性安全标准存在根本冲突,导致企业陷入“出 Demo 易、拿认证难”困境。

开源冗余与生态准入:开源 Outside-In Safety Blueprint,引入第三方外部摄像头监控解决边界误停问题;传统认证需 4-5 年(占预算 15%-25%),预认证快车道有望压缩至约 2 年。

商业化落地:Agility 的 Digit 已整合 Halos,并在亚马逊、GXO、丰田等工厂实际运行。


技术底座迁移与战略路径

AI蓝媒汇(20260428)

  • 事件核心:追觅在硅谷 Dreame Next 发布会上推出智能汽车概念超跑 Nebula NEXT 01 JET Edition("火箭车"),以航天级理念融入造车设计,正式公布汽车业务"星空计划"(Nebula Plan)
  • 创始人造车溯源:俞浩的造车构想可追溯至 2013年 清华"天空工场"时期,当时已完成造车概念视频,涵盖模块化底盘、智能交互、四轮独立控制、轻量化车身、家族矩阵等超前构想
  • 核心技术架构:四轮独立控制(每个车轮如独立关节灵活可控)、模块化底盘(2013年概念现已落地为工程方案)、电池组与车架一体化布局、航天级轻量化车身设计
  • 技术底座迁移路径:高速数字马达→动力系统;智能算法(清扫路径规划)→自动驾驶/智能交互;仿生机械臂→车身控制/底盘调校;全域智能芯片→车载计算平台
  • 战略特征:非跨界突袭而是十余年技术储备的延续;通过家电产品完成马达、算法、芯片等核心技术的迭代验证;选择硅谷首发瞄准全球高端市场
  • 关键挑战:概念超跑到量产车之间存在巨大鸿沟,底盘调校、安全认证、供应链管理是关键考验;评估跨界造车企业应关注技术底座的可迁移性而非品牌热度

2.2 无人配送与出海


无人城配出海策略与市场格局

雷峰网(20260408) | 雷峰网(20260728)

  • 行业拐点:新石器与九识2025交付破万台,融资超10亿美金,出海转向“找路权+绑伙伴+本地合规”

四大市场进展与障碍对比

  • 中东(可行性最高):新石器与九识获数百台部署及牌照,2026目标1万台;核心障碍为政策准入
  • 美国(通道基本关闭):新石器因高管拒签转由张凯磊设本地公司,重构代码与合规体系;障碍为签证与监管
  • 欧洲(可行性较低):九识处评估战略备份阶段,面临数据监管红线与场景错位双重阻力
  • 东南亚(仅新加坡可行):九识绑定邮政国家队切入封闭场景,受制于当地低人力成本与混乱路况

中东市场:资本与路权双驱动

  • 新石器资本与订单:获超6亿美金D轮领投,联合Noon完成订单验证,阿布扎比实现98公里无接管配送
  • 九识牌照与运营:获阿布扎比运营牌照,RoboVan投入常态化运行
  • 耐高温定制适配:新石器联姻K2集团,九识推液冷Z5车型,共保底盘电池及算法在60℃高温与沙尘暴稳定

美国市场:近乎“重启”的本地化

  • 控制权重构:由张凯磊负责本地公司并掌握核心控制权,国内主体仅留部分股份
  • 人才与合规搭建:选址Nuro附近招揽人才,核心系统架构和代码彻底重写以满足美国监管合规

国内市场:主机厂入局与经济账松动

  • 交付爆发预期:2025交付同比增长七八倍,预计2026再增2至3倍,2030预测年销86万台、保有超200万台
  • 成本断崖骤降:单车成本两年降超50%(新石器低于1万美元),单票成本比人工低25%-35%,无图化使地图成本降至近零
  • 三大合作模式:Tier1供应(知行科技→吉利)、技术+制造(九识×东风)、合资公司(白犀牛×鑫源)
  • 主机厂入局阵痛:多数主机厂交付几十台后停止投入,发现场景理解比制造能力更关键
  • 客群结构升级:由单一头部物流转向大客户+中小商户+个人小微多层结构,九识车队订单年底预计占比50%
  • 竞争焦点分歧:九识重真实数据壁垒,易咖押注无图化算法,新石器指统一标准体系缺失是规模化最大瓶颈

波士顿动力Spot四足机器人末端配送

机器人前瞻(20260715) | 雷峰网(20260717)

末端配送市场

  • 市场规模:美国承运商年支出900亿美元,占物流链总成本50%以上
  • 国内预期:中国无人车2026年Q1预计达4.7万台,超100城开放路权
  • 自动化痛点:“最后50英尺”非结构化环境,是物流自动化最难环节
  • 协同共识:形成“空中(无人机)-路面(无人车)-入户(足式/轮足)”多形态分工

经济模型对比

维度中国无人车美国Spot
成本月均两三千元,约一年回本约7.45万美元/台
路面适应平整路面为主越野、台阶、冰雪等复杂地形

Spot配送方案

  • 硬件规格:重33.8kg载重14kg(覆盖超60%常规货车包裹),速度1.6m/s
  • 自主递送:背部传送带前移托板平稳放置,通过整箱鸡蛋测试,全过程无人干预
  • 地形跨越:可爬±30°坡及30cm台阶,处理路沿、碎石、冰雪等复杂地形
  • 商业目标:计划日均派送200件,每周运营5天
  • 战略转型:从工厂巡检向通用机器人转型,验证其在非结构化环境中的适应性

路线对比

  • 无人机局限:无法到达门廊,只能将包裹丢在院子中间
  • 轮式机器人局限:遇台阶、泥泞、陡峭车道即失效,难以入户
  • 四足优势:适应郊区非结构化地形(冰雪、碎石、不规则门廊等)

卡车-无人机协同配送:优先级时序约束下的三阶段启发式算法

CVer(20260404)

  • 核心问题:带优先级时序约束的多卡车-多无人机协同包裹配送任务分配,目标是最小化最晚服务时间
  • 算法架构:深大李坚强教授团队提出三阶段启发式算法,逐步实现约束满足与路径优化
阶段核心算法功能
扩展最小边际成本算法生成满足时序约束的纯卡车路径
拆分算法+无人机续航检查生成卡车-无人机混合协同路径
变邻域下降算法(VND)扰动优化纯卡车路径,提升解质量
  • 性能验证:仿真与真实数据集实验表明,较ALNS方法性能提升7.2%
  • 学术贡献:首次系统性整合优先级时序约束于卡车-无人机协同配送,填补领域空白
  • 发表平台:深大团队发表于IEEE TRO(机器人学顶刊),系深大建校43年来首次以第一完成单位发文

百万级超表面光镊芯片:中性原子量子计算的芯片化范式

DeepTech深科技(20260622)

  • 规模纪录:璇相科技在4mm直径区域生成超百万光镊位点(1130×1130),超哥伦比亚此前36万位点纪录
  • 实测验证:联合中器无量完成中性原子平台适配与光场验证,太一量生独立测量确认;尚未实现原子装载
  • 核心洞察:超表面将光镊从「精密光学」转向「可制造器件」,标志中性原子量子计算芯片化范式转变

光镊生成三路线对比

方案像素尺寸规模上限核心瓶颈
SLM4-20μm~5万高均匀陷阱需300像素/陷阱,依赖中继光学
AOD万级后吃紧光束几何受限,功率均匀性下降
超表面数百nm百万级被动器件,动态重排仍需AOD配合

芯片核心参数

参数数值
工作波段1064nm
器件口径接近厘米级
有效NA~0.65
激光功率数百瓦量级
  • 超表面优势:像素远小于工作波长,有效NA更大、焦点紧致;跳过中继光学直接投射至原子区域,消除relay难题
  • AI辅助设计:GPU集群完成数亿纳米柱的电磁设计、版图生成与全片一致性优化
  • 四道门槛:原子装载(当前50%-60%)→阵列维护→双比特门保真度(行业瓶颈)→纠错架构兼容
  • 现实差距:光场均匀性约90%(含系统级),百万位点≠百万量子比特,距实用化仍有距离

2.3 理想汽车AI转型:从增程之王到AI公司的战略博弈


理想汽车AI转型:从自研算力到具身智能的全景战略

雷峰网(20260513) | 雷峰网(20260515) | 甲子光年(20260516) | 光锥智能(20260518) | 雷峰网(20260601) | AI产品黄叔(20260615) | 智东西(20260615) | AI大模型工场(20260617) | 雷峰网(20260618) | 机器人前瞻(20260713) | 量子位(20260715) | 雷峰网(20260512)

战略转型与核心挑战

  • 战略转向:2025年113亿研发(AI占过半),943亿现金支撑转型,从“冰箱彩电大沙发”升级为以AI操作系统为核心的具身智能平台
  • 底层逻辑:CTO谢炎强调“软硬一体是终极路线”,自研硬件是深度优化协同、打破性能天花板及维持数据闭环的工程必然
  • 核心挑战:两年无增程新品致市占率从42.3%跌至24.6%,单车均价从32万降至25万,深陷50万级“9系混战”
  • 评估标准:具身智能三要素为保护人类安全、独立完成任务、效率高于人类(失败后能继续想办法)

全栈自研技术矩阵

维度核心参数与战略突破
马赫M100芯片5nm数据流架构跳出冯诺依曼,双芯2560TOPS,有效算力达英伟达Thor-U 3倍,利用率82%(行业约30%)
马赫VLA模型全球首款量产,端到端响应0.28秒(人类0.45秒),涌现识别交警手势、预判爆胎等能力
Mind模型矩阵云端Mind-Pro Token消耗降38%;端侧Mind-Edge全本地运行防隐私泄露
底盘与补能全线控延压至200-300ms;配72.7kWh 5C电池,CLTC纯电续航420km,10分钟充至80%
数据闭环76.7亿公里真实路况构筑壁垒;纯视觉3DViT等效1080线雷达

具身智能底层经验基建

  • 基建痛点:具身智能卡在数据阶段,资本错配重“大脑”轻底层,至少需千万小时级高质量交互数据
    | 维度 | 团队A(清研精准) | 团队B(景烁科技) |
    | :--- | :--- | :--- |
    | 核心架构 | TsingLoop多模态数据工程管线 | WorldEngine数据闭环底座 |
    | 产品验证 | Robot-in-Loop机器人在环,不占产线验证动作策略 | GENESIS模型与SkillForge引擎含200+跨本体技能 |
    | 硬件与背景 | 清华斯坦福团队,设备出货超万台覆盖30多国 | 文远知行孵化,首创仿真器批量生成L4级长尾场景经验 |

2.4 智能汽车产品与品牌


中国智能汽车品牌战略、技术演进与补能生态

雷峰网(20260401) | 量子位(20260410) | 量子位(20260425) | 脑极体(20260425) | 光锥智能(20260427) | 划重点KeyPoints(20260428) | 雷峰网(20260515) | 雷峰网(20260518) | 雷峰网(20260526) | 智能相对论(20260603) | 雷峰网(20260603) | 雷峰网(20260605) | 雷峰网(20260608) | 火山引擎(20260609) | 摸鱼小李(20260609) | 雷峰网(20260610) | 十字路口Crossing(20260612) | 脑极体(20260612) | APPSO(20260613) | 甲子光年(20260613) | 智东西(20260613) | 量子位(20260615) | 智能相对论(20260627) | 光子星球(20260701) | 硅星人Pro(20260703) | 量子位(20260706) | 光锥智能(20260402) | 智能相对论(20260719) | 雷峰网(20260727)

品牌战略与竞争分化

  • 三品牌矩阵协同:蔚来确立占比模型(高端旗舰35%、乐道55%、萤火虫10%),Q1毛利率达19.0%创四年新高
  • 纯电细分迎拐点:乐道L80切入大五座SUV(原渗透率仅6.4%),2025年Q1纯电与增程比例由1:23缩小至1:2.2
  • 爆款结构性错配:小鹏GX 12小时大定近2.5万台,顶配占比超60%(预期10%-15%),预售价直降13万至26.98万

硬核技术与底座演进

  • 智驾芯片:比亚迪璇玑A3(4nm)3颗协同算力达2100 TOPS
  • 车端算力:蔚来自研神玑NX9031(7nm),内存带宽546GB/s,单块抵4块Orin
  • 电驱系统:吉利16合1智能电驱综合效率93.8%,电耗8.20kWh
  • 补能网络:华为兆瓦级超充覆盖70+高速,重卡5分钟续航百公里
  • 核心零部件:线控制动/空悬国产化突破,份额分别超30%与65%

智驾内卷与责任破局

  • 底层逻辑:配置竞争护城河极浅,高阶智驾下沉至10万级走量车型成为系统性壁垒
  • 责任兜底:比亚迪推城市领航全额兜底政策,泊车使用率由21%飙升至93%;华为ADS 5.0宣布激活时与车企共担责任
  • 燃油反击:全新奥迪Q5L首发搭载华为乾崑智驾,首次实现燃油车城区与高速领航辅助

蔚来智驾演进与瓶颈

  • 三年三阶段:Mobileye合作(2017-2020)→全栈自研(2020-2023)→端到端+自研芯片(2023至今),2020年转向自研为核心决策节点
  • 硬件预埋:NT2平台全系标配激光雷达与Orin芯片领先行业,但早期车主为未兑现软件买单,换电站被试图用作地图与数据节点
  • 战略挑战:李斌将智驾定性为“生死线”累计投入超百亿,但团队多轮更替致路线摇摆且融合成本高
  • 数据瓶颈:月销1-2万辆致保有量基数小,数据积累与飞轮启动慢于预期,制约智驾迭代速度
  • 闭环成效:模型部署周期压缩至1-2天,周主动安全验证超4000万公里,出险赔付较2023年降40%
  • 竞争定位:技术成熟度中游偏上落后华为与小鹏,NOP+城区接管率显著下降但覆盖城市数仍少于竞品

启元机器人(上纬新材)渠道布局与量产进展

AI科技评论(20260630) | 有新Newin(20260720)

  • 战略转型:智元系入主上纬新材后确立「新材料+具身智能」双轮驱动,从B端工业向C端家庭场景延伸
  • 研发投入:2026 Q1研发投入4585万元(同比+504%),具身智能占3778万元,战略重心明确
  • 产品矩阵:两款核心产品以差异化场景切入消费市场
产品定位关键特征
启元Q188cm消费级人形机器人亲肤材质+柔和线条,开放结构件支持3D打印改装
启元T1可变形轮足人形机器人室内轮足↔户外四足切换,支持运动相机联动拍摄
  • C端场景预判:3-5年内集中于陪伴、科教、个人创作与家庭辅助,由科技玩具逐步演变为新智能终端
  • 设计哲学:主动规避高度仿真,建立「友好但不越界」的安全感,适配人类生活动线
  • 渠道布局:量产前完成「渠道+门店+曝光」三线并行,颠覆传统先成熟再商业化模式
  • 跨界合作矩阵:覆盖3C数码、汽车、潮玩、家居,定位接近高端消费电子
合作方领域
尚品宅配家居
上海永达汽车
璞康3C数码
  • 线下门店:已在沪深西厦广等核心城市一线商圈推进十余家体验店
  • 高层集体亮相:6月29日渠道闭门会,CEO田华、营销总裁张鹏、CFO章彪首次集体站台
  • 品牌曝光:启元Q1于6月28日亮相央视世界杯直播复刻C罗「Siu」动作;WAIC 2026以「会客厅」生活化空间展出双星

WAIC 2026:具身智能从表演走向真实产线

"财联社AI daily"(20260717) | 光子星球(20260717) | 前沿在线(20260718) | 甲子光年(20260718) | APPSO(20260719) | 前沿在线(20260719) | 机器之心(20260720) | 具身智能之心(20260720) | 夕小瑶科技说(20260720) | 量子位(20260722) | 前沿在线(20260722)

展商与赛道巨变:2026 WAIC具身智能(23.6%)与算力芯片(20.1%)占近半展商,242家机器人企业展出300多台真机动态运行
Agent主导大脑:大模型参展商中63.8%转向AI Agent,矩阵超智WAVE以千万级样本推泛化,它石智航AWE 3.5原生架构支持跨任务与集群协作
技术跨越鸿沟:重心从单次抓取升级为多步骤长程连续任务(如线束插接、洗衣烘干),展台表现与真实场景稳定运行仍有巨大工程化差距
落地深水区攻坚:行业关注点从“能做什么”转向“如何规模化做好”,数据获取与热管理成最大瓶颈,康养(养老护理)等新兴垂直场景开启工程化探索
逆向攻坚策略:切入汽车制造中自动化最低的线束装配,从最难场景证明技术壁垒并重塑传统换线成本
本体竞争突围:厂商按场景推多形态矩阵,力控下沉至传感器;核心部件从外采转向全栈自研(关节、电机等)降本
量产成本下探:星尘智能T1绳驱量产机售8.99万起(负载5kg),零次方成立1年即营收破亿且订单超3亿
商业化场景验证

企业落地场景关键指标
千寻智能电池柔性产线成功率99%+
蚂蚁灵波智慧药房90秒取药,1.5-2年回本,目标1000店
银河通用仓储搬运Galbot S1负载50kg,连续运行8-10h
它石智航汽车线束装配1:1环形产线,亚毫米级插接,失误率低于人工

2.5 自动驾驶与出行


自动驾驶商业化落地与体系化安全框架

财联社AI daily(20260401) | 财联社AI daily(20260401) | 财联社AI daily(20260401) | AI早餐汇(20260412) | DeepTech深科技(20260419) | 雷峰网(20260421) | 新智元(20260422) | 光锥智能(20260422) | AI早餐汇(20260426) | 光子星球(20260427) | 硅星人Pro(20260429) | 前沿在线(20260430) | 雷峰网(20260430) | 智能相对论(20260502) | 雷峰网(20260506) | 人工智能学家(20260506) | 极市平台(20260519) | 新智元(20260520) | CVer(20260520) | AI科技评论(20260525) | 机器之心(20260528) | 雷峰网(20260602) | AI早餐汇(20260613) | 雷峰网(20260616) | 机器之心(20260623) | 新智元(20260623) | 百度文心(20260624) | 量子位(20260624) | 光子星球(20260624) | AI前线(20260626) | 智能相对论(20260629) | AI前线(20260629) | AI前线(20260630) | 甲子光年(20260630) | 光锥智能(20260701) | 雷峰网(20260707) | 甲子光年(20260708) | 雷峰网(20260417) | 雷峰网(20260716) | 脑极体(20260522) | 雷峰网(20260720) | 雷峰网(20260727) | AI科技大本营(20260727) | 雷峰网(20260728) | 极市平台(20260728) | 雷峰网(20260729) | AI蓝媒汇(20260729) | 新智元(20260729) | 量子位(20260729) | 人工智能学家(20260729)

资本与市场趋势

  • 资本与市场预测:2026前4月私募融资233亿美元,高盛预测2035全球市场达4150亿美元,核心转向成本、右舵复制与信任
  • Waymo安全数据佐证:每百万英里事故1.28起,多传感器路线破2亿英里,事故率远低于人类均值,持续验证安全性优势

右舵破局与全球交锋

  • 中英右舵交锋:英国试点提前至2026春,Waymo与萝卜快跑展开全球首次同右舵市场正面对决
  • 萝卜快跑平台验证:同时接入Uber和Freenow测伦敦,两大美国平台首次在同市场选择同家企业
  • 伦敦市场时间线:首期测布伦特区,审批后预计2027年向市民服务,当地仅Waymo、Wayve和萝卜快跑布局
  • 右舵交通与工程:覆盖70+国20亿人口,涉环岛反转等语义重构,难点为单代码库同步左右舵预测决策
  • 香港放行与先例:运输署放行提供全球监管先例,左舵的高精地图与感知定位等底层工具链可跨市场复用
  • 香港递进与破零:2024年11月获牌后五次扩区,2026年7月启动全球首次右舵左行全无人路测,逐步撤安全员

法规演进与量产智驾对比

  • 法规与平权:L3受限以L2.9运行致城区搭载率翻倍至8.1%,引望规划2027商用,工信部2026出台国标
  • 核心玩家壁垒:Momenta量产80万台份额超60%;华为ADS装车140万套;小马单车盈利整车成本降至23万内
  • 车企下沉战略:比亚迪高阶智驾下探至7万元级别,加速推动城区高阶智能驾驶的全民普及化
  • 底层基建架构:联想AD1双Thor算力达2000TOPS;华为建物理因果模型;DriveTeach降时延至3.18s

封闭场景与终局推演

  • 封闭场景突围:驭势占全球机场91%;文远量产下线缩至10分钟;希迪部署1700台矿车营收8.85亿双向盈利
  • 长尾商业天花板:西井科技获1.64亿大单但受港口天花板持续亏损,OEM合作周期长达5-10年
  • 终局赢者通吃:通用机器人需千亿级投入,极高试错壁垒注定长尾问题下创企须99分聚焦垂直场景

2.6 华为智驾史前史:三线并行的暗线孵化(2015-2019)


华为智驾组织起源与三条暗线技术博弈

雷峰网(20260531) | 雷峰网(20260617) | 雷峰网(20260723)

  • 海思线:苏箐借昇腾预算造出昇腾310芯片(12nm, 16TOPS),2018年以工控机+普通奥迪在MMD击败顶配大疆与百度,徐直军当场拍板转正

核心团队与矩阵式管理

角色定位核心风格与贡献
苏箐技术领袖从0到1的猛将,高压冲刺,对客户极度挑剔
陈亦伦首席科学家架构大脑,清华密歇根背景,2022年称遥遥领先
陈奇研发部长招聘伯乐,与苏箐搭档主政,当爹当妈
王官军质量主管工程化大管家,保障交付质量
王新宇规控专家负责运动规划与控制
  • 双轨制管理:技术专家有绝对话语权,资源主管负责招聘协调,争执只看真理不看层级
  • 全面拥抱AI:用数据模型替代规则代码,新架构一出80分碾压老方案60分,打破白盒魔数迷信
  • 高精地图成本惊人:单城建图10~20亿、年维护2~3亿,两年半仅覆盖2.5城,倒逼RoadCode预研

商业化试探与三种合作模式

合作模式内容代表案例
Tier 1提供基础零部件传统供应商角色
HI模式全栈智能驾驶方案极狐阿尔法S、阿维塔
智选车深度参与定义与销售问界系列(率先跑通变现)
  • "小儿抱金闹市":拥有顶尖智驾但缺乏成熟护城河,技术越强车企越警惕,凸显供应商结构性矛盾
  • 战略边界博弈:内部放弃L4,倾向以L2+/L3级ADAS实现量产变现,"不造车"承诺期限为核心变量

高光与转折(2021-2022)

  • 2021上海车展高光:极狐阿尔法S HI版约19公里城区零接管震惊行业
  • 苏箐免职事件:因公开评价特斯拉被免职,暴露华为对外沟通与内部管理张力,成智驾对外形象转折点
  • 巅峰转瞬即逝:陈亦伦称若无特斯拉2023端到端可至少领先三年,但掌声最响时距苏箐罢免令不到一百天

3. 世界模型与物理仿真


3.1 世界模型突破


世界模型理论框架、架构演进与技术路线之争

甲子光年(20260402) | AI科技评论(20260402) | 钛媒体AGI(20260403) | 极市平台(20260403) | 机器之心(20260414) | AI科技评论(20260414) | 智能涌现(20260414) | 具身智能之心(20260414) | 雷峰网(20260414) | 人工智能学家(20260414) | 深度学习与NLP(20260414) | 机器之心(20260419) | 甲子光年(20260420) | Z Finance(20260420) | 机器人前瞻(20260420) | 前沿在线(20260422) | AI寒武纪(20260423) | CVer(20260424) | 第一新声(20260427) | 机器之心(20260429) | 数智前线(20260429) | 极市平台(20260429) | PaperAgent(20260430) | CVer(20260430) | 量子位(20260501) | 划重点KeyPoints(20260504) | CVer(20260504) | AI寒武纪(20260509) | 量子位(20260509) | CVer(20260512) | AI科技评论(20260513) | 机器人前瞻(20260515) | "Z Potentials"(20260515) | 机器之心(20260516) | 机器之心(20260517) | 具身智能之心(20260518) | 人工智能学家(20260520) | 具身智能之心(20260522) | 量子位(20260522) | 十字路口Crossing(20260523) | 钛媒体AGI(20260523) | 量子位(20260525) | 机器人前瞻(20260525) | 新智元(20260526) | 具身智能之心(20260526) | PaperWeekly(20260526) | 量子位(20260530) | 机器之心(20260530) | "Z Potentials"(20260530) | 新智元(20260531) | 量子位(20260531) | Datawhale(20260531) | "财联社AI daily"(20260601) | 量子位(20260601) | 机器之心(20260601) | AIGC开放社区(20260603) | 机器之心(20260603) | 公子龙(20260603) | 机器之心(20260603) | 人工智能学家(20260604) | 钛媒体AGI(20260604) | "Z Finance"(20260604) | CVer(20260604) | AI前线(20260604) | AI前线(20260604) | DeepTech深科技(20260604) | 机器之心(20260604) | 智东西(20260604) | "财联社AI daily"(20260604) | 极市平台(20260604) | 具身智能之心(20260605) | AIGC开放社区(20260605) | 机器之心(20260605) | 人工智能学家(20260605) | InfoQ(20260605) | 人工智能学家(20260606) | 人工智能学家(20260606) | 具身智能之心(20260607) | InfoQ(20260608) | 机器之心(20260609) | 新智元(20260609) | 机器人前瞻(20260610) | "Z Potentials"(20260610) | AIGC开放社区(20260612) | AI前线(20260612) | 机器之心(20260612) | 新智元(20260612) | 量子位(20260612) | 机器之心(20260613) | 人工智能学家(20260613) | 前沿在线(20260614) | 机器之心(20260614) | 昆仑万维集团(20260614) | 具身智能之心(20260615) | 甲子光年(20260615) | 前沿在线(20260615) | AI早餐汇(20260616) | 具身智能之心(20260616) | AI前线(20260616) | 智能涌现(20260616) | 新智元(20260617) | 具身智能之心(20260617) | 机器人前瞻(20260617) | 人工智能学家(20260617) | AI前线(20260618) | 甲子光年(20260618) | 机器人前瞻(20260618) | 暗涌Waves(20260618) | 机器之心(20260618) | 量子位(20260620) | AI前线(20260623) | "Z Finance"(20260623) | "Z Potentials"(20260624) | 机器之心(20260624) | 量子位(20260624) | 极市平台(20260624) | 具身智能之心(20260626) | 机器之心(20260627) | 具身智能之心(20260627) | 机器之心(20260629) | 机器之心(20260629) | DeepTech深科技(20260629) | 量子位(20260629) | AI科技评论(20260629) | 具身智能之心(20260630) | 机器之心(20260630) | "Z Potentials"(20260701) | 量子位(20260701) | 十字路口Crossing(20260701) | 奇绩创坛(20260701) | 机器人前瞻(20260702) | 甲子光年(20260702) | 甲子光年(20260702) | DeepTech深科技(20260703) | 量子位(20260703) | 具身智能之心(20260703) | 人工智能学家(20260704) | 机器之心(20260707) | AI科技评论(20260707) | "Z Potentials"(20260708) | 具身智能之心(20260708) | 量子位(20260708) | 新智元(20260708) | APPSO(20260709) | 量子位(20260709) | 极市平台(20260709) | "Founder Park"(20260710) | AI科技评论(20260710) | 极市平台(20260714) | 机器之心(20260715) | 深度学习与NLP(20260712) | 老冯云数(20260718) | 机器之心(20260720) | 新智元(20260720) | 具身智能之心(20260720) | 雷峰网(20260722) | AI大模型工场(20260722) | 机器之心(20260722) | PaperWeekly(20260722) | DeepTech深科技(20260723) | AI前线(20260723) | 机器人前瞻(20260723) | 前沿在线(20260614) | 深度学习与NLP(20260707) | 机器之心(20260723) | 机器之心(20260727) | "Z Finance"(20260727) | InfoQ(20260728) | "Z Potentials"(20260728) | CVer(20260729)

  • 实时交互新纪元:Flash World Model实现50FPS降本70%,综合MoE与Token缓存低至3.61ms/step
  • 实时性是分界线:交互与机器人拒绝批处理,需持续接收双向数据、保存状态并低延迟输出
  • 长时程时序突破:WAM打破50步极限达200-300步稳定;LoopWM采用循环动力学,770M参数匹配1.3B性能

核心模型对比

  • Physis-v0.1(智源):首个通用基座,统一物理规则与环境运动
  • Orca(智源):12.5万小时视频预训练,0.8B模型未见Loss饱和
  • Matrix-3.5(昆仑万维):约50亿参数实现720P实时交互,覆盖约1200类游戏场景
  • Riemann-1.0(昆仑万维):20万小时数据训练,统一动作生成与视觉预测于单一扩散Transformer
  • DreamZero(NVIDIA):联合生成较π0.5成功率提升超2倍,LIBERO基准达96.68%
  • Cosmos 3(NVIDIA):全模态MoT架构,采用AR+DM双通道,训练周期压缩至数天
  • V-JEPA 2(LeCun):隐空间预测,仅用62小时无标注轨迹即实现零样本操作泛化
  • GE-Sim 2.0(智元):闭环交互仿真,内置通用奖励模型实现免人工标注自训练
  • VideoRebirth模型:BACH主打高真实感物理场景生成,Olympus支持游戏场景实时可交互演示

PhysMani与动态操控

  • PhysMani模型:物理约束3D高斯世界模型,用散度为零的3D速度场预测目标未来运动并注入动作策略
  • 速度场设计:每个高斯速度由六组件线性组合,去形变场改在线优化,复用CUDA Graph将延迟降至198ms
  • 预测质量领先:50ms后目标轨迹误差仅0.008m(ManiGaussian为0.388m),下一帧PSNR达26.90 vs 14.32
  • 操控性能表现:仿真成功率45.9%,真实机器人(5Hz)62.5%,对高速任务提升最大(移动篮筐投放9.2%提至46.7%)
  • 动态操作核心:操作核心是预测而非反应速度,3D几何关系比2D光流检测运动更关键(3DFA-OF未赢)

群核科技(Manycore):空间智能的结构化物理数据飞轮

Z Finance(20260420)

  • 路线分歧:AI下半场核心焦点转向物理世界建模,分歧在于像素拟合(看起来对)与结构化物理参数(物理上对)。
  • 语言模型物理瓶颈:大模型基于符号概率,无法从文本推导体积×密度等参数;且三维空间训练数据极度匮乏。
  • 数据飞轮壁垒:群核积累超5亿个三维场景与4.8亿个模型,深度包含材质、密度、重力等结构化物理信息。
  • 双向商业覆盖:依托酷家乐覆盖创意内容产业,同时为具身智能提供物理正确的合成数据训练环境。
  • 生态与合作壁垒:与英伟达在具身智能领域深度合作,长期产业嵌入的结构化数据比算法本身更难复制。
  • 商业化与市场表现:群核科技上市后市值达638.6亿港元(较发行价上涨约393%),公开发售获1590倍超额认购。

空间智能两条技术路线对比:

对比维度像素拟合路线结构化物理路线
数据基础像素统计规律结构化参数(重力、密度等)
代表产品Sora等视频生成模型群核空间模拟平台
典型缺陷违背物理常识(如物体穿墙)需极长期产业嵌入积累
适用场景娱乐、内容生产机器人训练、工业数字孪生
地域倾向美国偏重中国偏重(依托发达制造业)

极佳视界产品矩阵与自适应世界模型降本路径

人工智能学家(20260710) | 机器人前瞻(20260713) | 新智元(20260716) | 量子位(20260716) | 智能涌现(20260719) | 深度学习与NLP(20260719) | AI科技评论(20260722)

双层产品体系

  • 世界生成模型:一粟YiSu(实时多模态)、DriveDreamer(自动驾驶仿真)、GigaWorld(具身智能交互)
  • 世界行动模型:GigaBrain(跨本体通用大脑)、GigaWorld-Policy-0.5(物理预判与动作策略,已开源)
  • 核心价值:从生成画面跃升至执行行动,预测动作后果,打通感知-预测-执行闭环
  • 协同闭环:生成模型提供数据/预训练底座,行动模型通过真实场景反馈持续反哺迭代

落地验证与商业化

  • 家庭场景(拾光S1):完成取餐备餐等长程任务,验证具身大脑泛化上限
  • 工业场景(MakerH01):完成上下料搬运,提出“机器人造机器人”,验证商业化下限
  • 极佳视界(WAIC 2026):展示通用世界模型,定义物理AGI为最佳打开方式
  • 逐际动力进展:半年融资27.2亿(估值150亿),累计获数千台订单,预判2026为落地元年
  • 产品版本规划:TRON1/2及Luna人形机器人;AstraBrain系列(2026年推出)

数据降本与自适应范式

  • 真机成本困境:真机数据采集极高(500-1000元/时),成为具身智能规模化核心瓶颈
  • 低成本路线:利用海量互联网RGB视频预训练,100条人类视频约等于100条遥操数据
  • 测试时自适应:WAM-TTT打破冻结惯例,部署阶段利用交互数据持续校准,实现参数动态更新
  • 防遗忘机制:冻结主干网络,仅更新末端或记忆模块,单次重规划仅1步梯度下降
  • 极低决策延迟:每次重规划额外开销仅0.01-0.03秒,几乎无损系统实时性

核心性能对比

  • 跨环境泛化保持率:传统ICL为14.7%(π0.5为47%),WAM-TTT达75.6%(为π0.5的3.1倍)
  • 扰动任务胜率:在9项真实扰动任务中取得8胜1负成绩
  • 未见场景泛化:固定模型PointMaze成功率为53.3%,自适应方案升至78.7%(近乎翻倍)

3.2 仿真与重建


物理仿真引擎与结构化空间重建

具身智能之心(20260330) | 机器之心(20260402) | 机器之心(20260402) | AI前线(20260410) | CVer(20260415) | 量子位(20260415) | 人工智能学家(20260416) | 量子位(20260417) | 甲子光年(20260420) | 量子位(20260420) | 第一新声(20260422) | 具身智能之心(20260427) | 具身智能之心(20260429) | 量子位(20260501) | 量子位(20260503) | 机器之心(20260507) | 具身智能之心(20260508) | 具身智能之心(20260510) | 甲子光年(20260512) | 机器之心(20260512) | 十字路口Crossing(20260516) | 量子位(20260519) | 智东西(20260519) | 具身智能之心(20260520) | "Z Potentials"(20260520) | 具身智能之心(20260521) | 量子位(20260521) | 阑夕(20260525) | 钛媒体AGI(20260527) | 量子位(20260602) | "财联社AI daily"(20260602) | 量子位(20260603) | 具身智能之心(20260603) | AI科技评论(20260604) | AI科技评论(20260605) | 量子位(20260605) | AI科技评论(20260605) | 机器之心(20260606) | "Z Potentials"(20260606) | 具身智能之心(20260608) | AI科技评论(20260609) | AIGC开放社区(20260611) | 具身智能之心(20260611) | AI科技评论(20260622) | 具身智能之心(20260630) | 极市平台(20260630) | CVer(20260701) | 量子位(20260703) | 甲子光年(20260703) | 前沿在线(20260708) | AI科技评论(20260714) | AI科技评论(20260715) | 具身智能之心(20260715) | 量子位(20260720) | 具身智能之心(20260408) | 机器之心(20260727)

  • 开放生态确立:NVIDIA开源Newton引擎,超80%头部具身团队使用;群核科技SPEAR渲染达1亿像素/秒(5亿+3D场景)
  • 大场景重建范式转移:大规模3DGS重建瓶颈从“如何拍”转向“如何分”,为户外具身智能与世界模型提供新思路
  • 全景3DGS重建:PanoLOG首创以梯度贡献替代空间可见性作为分区判据,解决全景360°视角下传统分区失效难题
  • 全景基准SOTA:开源Pano360数据集,在三大基准上实现最优渲染质量且模型体积更小;硬件闭环采用Insta360 X5+无人机采集
  • 大晓(开源)数据底座:构建全交互家庭场景与轻量推理模型,含30万套真实住宅,推理速度较Cosmos快72倍

核心技术平台与商业化进展

  • 苏度科技 R1:采用世界模型+RL纯仿真训练,实现首抓98%、综合任务99%+成功率
  • 北大/智元 Real2Edit2Real:打通三维重建-编辑-生成流水线,仅需1-5条数据即可达81.3%成功率
  • 上海AI Lab SIM1:构建Scan-Simulate-Scale闭环,使数据成本降低27倍,训练提速6.8倍
  • 光轮智能:通过可执行代码生成结构化仿真空间,服务超80%头部团队客户,估值破10亿
  • SimFoundry:支持单段RGB视频生成数字孪生,仿真与真机表现相关度高达0.911
  • 影身智能:完全依赖原生3D数据训练,依托360系统实时采集,8小时即可造3000双鞋
  • 智元 Genie Sim 3.0:一句话/图生成可交互三维世界,生成进入分钟级并支持1000Hz物理模拟(已开源)

Genie Sim Benchmark 评测体系

  • 五大评测维度:全面覆盖语言指令理解、空间关系认知、原子技能操作、扰动适应及跨域零样本迁移验证
  • 广泛模型适配:支持Genie Operator、π系列、GR00T等主流基座一键评测,Sim2Real差异严格控制在10%以内
  • 开源生态地址:评测框架与基准已完全开源,访问地址为 github.com/AgibotTech/genie_sim

3.3 具身世界模型商业产品与数据飞轮


具身世界模型商业产品矩阵与数据飞轮

量子位(20260330) | 机器之心(20260330) | 具身智能之心(20260331) | 机器之心(20260403) | 机器之心(20260411) | 量子位(20260411) | 具身智能之心(20260411) | 新智元(20260412) | AI科技评论(20260412) | 机器之心(20260414) | 具身智能之心(20260416) | 机器人前瞻(20260417) | Z Potentials(20260419) | 量子位(20260419) | 机器之心(20260419) | 新智元(20260419) | 机器人前瞻(20260422) | AI科技评论(20260422) | 机器之心(20260423) | 具身智能之心(20260430) | AI科技评论(20260430) | 机器人前瞻(20260430) | 暗涌Waves(20260510) | DeepTech深科技(20260511) | AI科技评论(20260512) | 机器人前瞻(20260513) | 机器之心(20260514) | 机器之心(20260518) | 机器之心(20260522) | 极市平台(20260522) | 硅星人Pro(20260524) | 雷峰网(20260526) | 量子位(20260528) | 量子位(20260531) | AI科技评论(20260602) | "Z Potentials"(20260605) | 商汤科技SenseTime(20260608) | AI科技大本营(20260612) | AI科技评论(20260615) | DeepTech深科技(20260615) | AI早餐汇(20260615) | 机器人前瞻(20260615) | AI科技评论(20260617) | 具身智能之心(20260617) | 奇绩创坛(20260617) | AI科技评论(20260618) | 机器人前瞻(20260618) | 智东西(20260618) | 智能涌现(20260619) | DeepTech深科技(20260624) | 机器之心(20260624) | CVer(20260624) | "Z Finance"(20260629) | AI科技评论(20260701) | 量子位(20260702) | 智能涌现(20260706) | 机器之心(20260707) | 新智元(20260708) | 量子位(20260708) | 特工宇宙(20260709) | AI异类弗兰克(20260715) | 机器之心(20260715) | 机器之心(20260715) | 机器人前瞻(20260715) | 雷峰网(20260716) | 量子位(20260716) | 具身智能之心(20260716) | 硅星人Pro(20260716) | 机器之心(20260717) | 新智元(20260717) | 机器之心(20260723) | 机器之心(20260727) | 机器之心(20260727)

  • 空间智能新基准:首发ESI-Bench要求AI主动探索,揭示模型被动感知强但主动探索极差
  • 行动盲视与3D局限:模型缺乏寻找证伪视角的元认知;不完美3D重建强引反致负向失败
  • 长程误差累积:随步数增加性能衰减,真机操作得分从两步0.69降至八步0.55
  • 感知行动鸿沟:具身核心瓶颈非模型规模,突破点在于行动策略学习与元认知机制构建

核心架构与数据训练

  • 统一认知基座RxBrain:单模型统一语言规划、目标生成与视频预测,打破多模块串联漂移
  • 分阶段数据喂养:mid-train用1800万+条QA打底,post-train用4.8万条指令强化复杂推理
  • 四粒度训练体系:2.1亿样本(5万+小时)驱动,从L0连续动作想象逐级递进至L3目标

前沿产品与模型战力对比

  • 极佳视界:WAM路线提效10倍横扫三大榜首,B端冲刺千台
  • 智元(τ0系列):1.7万小时真机打底,以10%参数量登顶WorldScore,引入思考系统攻克长程任务
  • 灵初智能:累计10万+小时数据降本90%,EgoSteer打通灵巧操作全栈闭环
  • 高德:可微分物理引擎替代渲染,含9500小时数据集横扫15项SOTA
  • 蚂蚁:MoBA+DMD蒸馏防误差累积,突破长时运行瓶颈(>1h)并开源14B模型
  • 小米:五维解耦控制,数据扩增提速82.9倍,38B参数规模登顶RoboCasa
  • 英伟达(Cosmos):三层Physical AI金字塔,算力换数据使仿真成功率达98.5%
  • 原力灵机(DW0.5):三大模块闭环,真机数据需求降60%、训练成本降40%
  • 超脑未来:横扫多权威榜单,提出“群体智能”迈向多智能体协同演进
  • Hy-Embodied-VLM-1.0:A3B参数耗同级1/10算力得65.6分,联合规划与视频预测超越Cosmos3-Nano
  • 开源生态建设:VLM与RxBrain双模型全面开源,配套含1381组VQA的Bench赋能社区
  • 真机操作表现:视觉生成GenEval达82.4分,真机平均成功率87%超越π0.5及π0

3.4 世界模型评测基准与榜单


世界模型与具身评测体系前沿

机器之心(20260412) | 量子位(20260420) | 机器之心(20260427) | AI科技评论(20260429) | 具身智能之心(20260430) | 具身智能之心(20260507) | 具身智能之心(20260516) | 具身智能之心(20260518) | AI科技评论(20260525) | 量子位(20260526) | 具身智能之心(20260526) | PaperWeekly(20260528) | CVer(20260529) | 机器之心(20260529) | 具身智能之心(20260529) | CVer(20260530) | 具身智能之心(20260531) | 极市平台(20260601) | 机器之心(20260603) | 量子位(20260603) | PaperAgent(20260605) | 前沿在线(20260614) | 前沿在线(20260615) | 量子位(20260616) | 极市平台(20260618) | 极市平台(20260618) | 数智前线(20260625) | 量子位(20260702) | 具身智能之心(20260514) | 硅星人Pro(20260705) | 量子位(20260708) | 具身智能之心(20260712) | 人工智能学家(20260713) | 量子位(20260724) | 深度学习与NLP(20260428) | 深度学习与NLP(20260601) | 商汤科技SenseTime(20260719) | 机器之心(20260728) | 人工智能学家(20260729)

  • 多榜单格局:WorldScore双榜(Static 81.08/Dynamic 73.37)、WorldArena(16指标+3任务)、R-Bench(0.96高相关)、TriWorldBench(50任务)
  • 空间交互短板:WBench多轮交互暴跌33分,OmniNavBench最高仅8.74% SR,暴露模型三维空间认知缺陷
  • 真机落地鸿沟:RoboDojo最强策略真机仅12.8% SR,Qwen-RobotManip高精度操控仅18.8% SR,长尾与最后一厘米极具挑战
  • 认知剥离测试:RoboBench(6092个QA)具身大脑得分有效预测下游VLA成功率
  • 多视角与诊断:多视角按相机可靠性分配避免腕部遮挡,STATE时序约束严打异常冻结,拒唯画质提供“体检表”

物理推理与因果认知

  • Apple-π基准:首拆“感知→表述→推导”三阶段,400个经典力学视频覆盖重力、碰撞与惯性
  • 推导能力短板:11个SOTA模型推导最高仅0.473,感知强(GPT Image 2领先)≠推理强,视频生成仅靠表层视觉模式匹配
  • 评测局限:仅覆盖经典刚体力学,类型单一,依赖首帧,MLLM裁判无法完全判物理过程

技术演进与系统短板

  • 三大共性通病:精细高接触操作、长时序规划一致性丧失、三维空间穿模是当前模型结构性缺陷
  • 原生架构:摒弃先视频后补物理路线,感知-推演-动作(VWA)联合训练成主流
  • 数据与压缩:Manifold WorldScape(仅10%参数)超20B竞品,Z-WM(88.5分)验证合成数据提升策略
  • 安全护栏:RoboSafe(ICLR'26)转逻辑代码,危险执行率压至4.78%(降36.8%),但仍存物理幻觉鸿沟

清洁机器人赛道:从蓝海到红海的内卷与出海

财联社AI daily(20260331) | 光子星球(20260408) | 机器人前瞻(20260511) | 智东西(20260430) | 雷峰网(20260604) | 数智前线(20260609) | 雷峰网(20260617) | 雷峰网(20260626) | 雷峰网(20260711) | 雷峰网(20260723)

室内清洁:技术内卷与全球化出海

  • 石头:G-Rover双轮腿上下楼梯、G30S底盘越障8.8cm;连续两年全球销量/销额双第一
  • 追觅:仿生机械臂外扩18cm、160°C蒸汽洗;2026Q1全球量额双第一,70%营收来自海外
  • 大疆:机械足越障8.5cm、面阵散斑雷达2mm级感知;ROMO 2售价4299元起,提升边角清洁
  • 云鲸:逍遥001搭载NarGPT多模态大模型;2026迎经营拐点,北美Flow 2首日销量增305%
  • 智元:视觉+点云融合感知,推550mm超宽幅C5;具身智能独角兽跨界入局商用清洁

庭院割草:四大阵营交汇与技术博弈

  • 市场空间广阔:全球约2.5亿庭院,欧美渗透率低;扫地机、泳池、传统园林、消费电子四阵营交汇
  • 导航方案博弈:RTK遇遮挡易丢失(退货率约10%);3D雷达全局稳定(退货率<3%)省售后成本
  • 商业化大爆发:2023年单颗3D雷达降至3999元,推动大规模量产;耐士劳优化算法实现硬件降本
  • 全球化成绩:耐士劳双品牌矩阵,2026年5月全球出货超50万台,德/波/意市占率超35%

擦窗机器人:下一个增长点与范式转换

吸附方式优势劣势
真空风机技术成熟、成本可控噪音大、能耗高、挑玻璃平整度
负压履带式贴合度好、覆盖率高结构复杂、价格昂贵
磁吸式吸力强、稳定仅适用双层玻璃,场景受限
  • 市场现状:中国渗透率不足1%(500-3000元),全球数亿美元,体量远小于扫地机
  • 竞争格局:科沃斯、HUTT具品牌认知,深圳白牌ODM同质化严重,尚无绝对头部
  • 底层差异:地面清洁为重力辅助,擦窗为垂直面重力对抗,技术路线无法简单复用
  • 核心痛点:安全焦虑(防跌落绳为刚需)远超清洁不满;垂直面运动控制复杂度倍增
  • 增长路径:商用幕墙清洁潜力大于家用,向瓷砖/大理石多表面演进,AI视觉成关键壁垒

3.5 VLA与世界模型融合架构


VLA与世界模型融合架构:统一范式与关键技术突破

具身智能之心(20260330) | 具身智能之心(20260409) | AI早餐汇(20260421) | 具身智能之心(20260422) | 具身智能之心(20260423) | 机器之心(20260424) | 机器之心(20260429) | 量子位(20260429) | "Z Potentials"(20260429) | 数智前线(20260429) | AI科技评论(20260429) | 量子位(20260429) | 具身智能之心(20260429) | 机器人前瞻(20260429) | 新智元(20260429) | 夕小瑶科技说(20260430) | 机器之心(20260430) | 具身智能之心(20260430) | 十字路口Crossing(20260430) | 智东西(20260430) | 量子位(20260509) | 具身智能之心(20260509) | 机器之心(20260510) | CVer(20260510) | 具身智能之心(20260511) | 极市平台(20260511) | 机器之心(20260516) | 机器人前瞻(20260516) | 机器之心(20260521) | 量子位(20260526) | 具身智能之心(20260526) | 智能相对论(20260601) | AI科技评论(20260604) | 量子位(20260604) | 机器之心(20260421) | 具身智能之心(20260614) | AI科技评论(20260617) | 具身智能之心(20260623) | 机器之心(20260623) | 极市平台(20260624) | CVer(20260630) | 机器之心(20260703) | InfoQ(20260706)

  • 统一建模范式创新:北京人形Pelican用共享潜变量联合去噪登顶WorldArena(66.03);上交大WLA用文本意图替代像素预测,延迟仅40ms
  • 异步延迟突破:AHA-WAM采用低频规划器+高频动作专家双DiT架构,推理压至17.56ms(56.95Hz),RoboTwin 2.0成功率达92.80%,破解WAM无法闭环控制痛点

核心模型性能对比

模型/架构核心创新性能表现
银河通用 LDA-1B隐空间统一动作策略,3万小时数据成功率55.4%超越π0.5
生数科技 Motus视频/轨迹融合,14倍效率23Hz响应,RoboTwin 96.1分
小鹏 DIAL原生ViT特征嵌入隐式世界模型10%数据达70.2%成功率
智元 LWD边部署边学习数据飞轮(DIVL)成功率0.95(远超SFT 0.76)
NUS Goal-VLA物体目标状态解耦规划与执行RLBench 59.9%远超基线
VLA-JEPA未来状态作为监督而非输入OOD鲁棒性78.1%超越pi0-Fast
AIM空间价值图解决表征错配RoboTwin 93.1%成功
智平方 NeuroVLA类脑架构Video2Act融合碰撞20ms内反射,超硅谷标杆30%
  • 数据飞轮后训练:智元LWD构建“部署→回流→训练”闭环,利用分布式RL将失败轨迹转化为学习信号,突破“出厂即巅峰”静态限制
  • VLA视觉捷径修复:标准VLA存在视觉依赖偏差,移除视觉做纯Language-Action预训练(LA4VLA),真实成功率从38.3%飙至81.7%
  • 跨维度统一框架:2D/视频/3D/4D生成被统一为“外观+几何+动力学”递进建模,视觉被明确为AI学习物理因果的最完整信息源
  • 跨领域动力学迁移:时空注意力与时间MoE(STCast)在全球气象预报全面刷新SOTA,验证了注意力机制在复杂物理动力学建模的通用性

3.6 4D生成与视频仿真前沿


4D生成与视频仿真前沿

量子位(20260330) | 具身智能之心(20260401) | 具身智能之心(20260403) | 具身智能之心(20260408) | CVer(20260408) | AI科技评论(20260424) | 量子位(20260703)

  • 4D范式转变:CVPR 2026多篇论文推动从2D像素拟合转向统一空间、时间与物理规律建模,评测从单一视觉指标转向多维度衡量
  • 单目直出4D:NeoVerse无位姿前馈重建;LongStream关键帧相对建模在线处理千帧防漂移;GeoWorld引入双曲空间减少长时序误差

前馈物理与端到端感知重建

框架核心创新关键指标
PhysGM双解码器预测3D高斯与物理参数(杨氏模量等)单图生成从12小时缩至1分钟
UniPR端到端Real-to-Sim单次前向并行多物体感知重建0.63秒处理(提速100倍),误差降至0.109
HAT-4D交互知识图谱与多Agent协作,支持局部回滚纠错仅需3次人工介入,变形分数由3.90升至5.47

具身交互闭环与自动化生成

框架核心创新关键指标
ORV4D语义占据场桥接动作与视觉FVD降至16.525,RoboVLM成功率升至33.9%
Hand2World解耦3D mesh与Plücker射线防背景漂移FVD降至218(降幅76%),无需人工标注自动化
Kinema4D运动学锚定控制与环境反应解耦,构建Robo4D-200k数据集首次实现生成模拟器零样本泛化

数据反哺与评估基准

  • 资产微调:HAT-4D修正资产反哺L4GM,微调PSNR从21.29升至24.22dB
  • 评估基准:构建MVOIK-4D基准,覆盖112场景/77任务/39类交互

3.7 3D/4D生成与空间重建前沿


空间智能与3D/4D场景重建前沿

赛博禅心(20260415) | AI寒武纪(20260416) | 新智元(20260421) | 量子位(20260424) | 机器之心(20260425) | DeepTech深科技(20260523) | 具身智能之心(20260523) | 极市平台(20260602) | 具身智能之心(20260611) | 量子位(20260613) | DeepTech深科技(20260616) | CVer(20260618) | CVer(20260618) | CVer(20260619) | InfoQ(20260528) | 具身智能之心(20260707) | 新智元(20260707) | 量子位(20260707) | 机器之心(20260707) | 机器人前瞻(20260707) | CVer(20260708) | 前沿在线(20260708) | 赛博禅心(20260709) | 机器之心(20260709) | 特工宇宙(20260709) | 新智元(20260709) | 赛博禅心(20260709) | InfoQ(20260709) | 具身智能之心(20260709) | 具身智能之心(20260416) | 深度学习与NLP(20260709) | 机器之心(20260727)

  • UniWorld-View:登顶WorldScore榜单,统一支持单图→3D与视频→4D生成,昇腾算力适配且完全开源,推动视觉AI向世界理解演进
  • LingBot-Depth 2.0:1.5亿数据训练,16项评测12项夺冠,透明物深度补全误差低至0.010
  • 流式重建新范式:LingBot-Map单RGB实现20FPS万帧不衰减;HorizonStream恒定8.5GB显存实现万帧3D重建,VBR领先30%
  • 纯RGB空间推理:华为SpaceMind以70.6%登顶VSI-Bench;Niantic积累300亿张众包实景图支撑厘米级VPS
  • 视频模型反哺3D:VEGA-3D多视角一致性达97.04%,LIBERO操作成功率97.3%;Holi-Spatial构建400万级全自动标注集
  • LightWorld开源突破:全球首个小时级长视频生成世界模型,突破时间延伸瓶颈,已完全开源
  • 小时级稳定生成:LingBot-World 2.0连续实时生成超1小时(720p/60fps无衰减),MoBA+DMD技术根治长时序画面崩溃
  • 自演化交互构建:内置双Agent协同架构,无需人类操作即可自主推进场景与事件演化
  • Web端大规模渲染:李飞飞Spark 2.0开源引擎流式渲染超1亿splats,连续LoD与渐进加载全平台兼容
  • 4D动态体视频:单目视频/文本生成可漫游动态场景,消除时空不一致性

核心模型性能对比

  • 蚂蚁LingBot-Vision:空间原生视觉基座,1B超越7B(RMSE 0.296)
  • 兔展UniWorld-View:统一3D+4D生成,登顶WorldScore榜单,昇腾算力全开源
  • 港科广HorizonStream:恒定显存流式重建,8.5GB显存,万帧不崩溃
  • GemDepth:视频深度估计,0.58B超越1.10B+模型
  • 华为SpaceMind:纯RGB空间推理,VSI-Bench 70.6%准确率
  • LingBot-World 2.0:具身世界模型,1小时稳定生成(720p/60fps)
  • 其域灵视P1:多融合空间相机,NAB Show横扫四项大奖

4. 具身数据与训练方法


4.1 VLA模型进展


VLA基座模型前沿架构与核心缺陷突破

机器之心(20260330) | 机器之心(20260403) | 海外独角兽(20260403) | 量子位(20260406) | 具身智能之心(20260408) | 量子位(20260408) | 具身智能之心(20260408) | 具身智能之心(20260409) | 机器之心(20260411) | 量子位(20260411) | 机器之心(20260411) | CVer(20260411) | AI异类弗兰克(20260412) | 智东西(20260415) | 机器人前瞻(20260415) | 量子位(20260415) | AIGC开放社区(20260416) | 具身智能之心(20260416) | CVer(20260416) | 前沿在线(20260417) | 具身智能之心(20260417) | 量子位(20260417) | 机器之心(20260417) | DeepTech深科技(20260417) | AI科技评论(20260420) | 量子位(20260422) | 具身智能之心(20260427) | 具身智能之心(20260504) | 具身智能之心(20260505) | 具身智能之心(20260511) | 量子位(20260513) | 机器之心(20260528) | "Z Potentials"(20260528) | 量子位(20260529) | 通义大模型(20260529) | 具身智能之心(20260601) | 机器之心(20260601) | 具身智能之心(20260606) | AI科技评论(20260607) | 机器之心(20260610) | 机器之心(20260612) | 具身智能之心(20260612) | 通义大模型(20260616) | 机器人前瞻(20260616) | 机器之心(20260617) | AI大模型工场(20260623) | 量子位(20260624) | PaperWeekly(20260627) | 量子位(20260627) | PaperWeekly(20260630) | 智东西(20260701) | 具身智能之心(20260704) | 具身智能之心(20260706) | 具身智能之心(20260706) | 具身智能之心(20260706) | 机器之心(20260708) | 具身智能之心(20260708) | 智东西(20260708) | 量子位(20260709) | 具身智能之心(20260709) | AI科技评论(20260709) | 具身智能之心(20260710) | 具身智能之心(20260710) | 机器之心(20260710) | 新智元(20260710) | 量子位(20260710) | 甲子光年(20260710) | 具身智能之心(20260714)

头部VLA模型与核心性能

  • Generalist GEN-1:99%从零训练,成功率99%且仅需1/10数据
  • 智元GO-2:动作思维链+异步双系统,LIBERO 98.5%,迁移82.9%
  • Pi(π0.7):组合泛化+多模态提示,零样本组合新技能,利用次优数据
  • 灵初Psi-R2:双系统闭环,10万h人类数据,支持反事实推理
  • 谷歌ER 1.6:Agentic Vision多步推理,仪表读数从23%升至93%
  • 星海图G0.5:统一自回归,六榜第一,超π0.5达24%
  • ACE-Brain-0.5:8B慢脑规划+快脑执行,四项评测超GPT-5.4及π0.5

观测泄漏缺陷与解耦创新

  • 观测泄漏风险:参数融合致网络走「见灶台即开火」捷径,引发旗舰模型动作失效
  • DISC两阶段解耦:RSS 2026录用,语言指令经超网络生成参数,执行期纯视觉隔离语言
  • DISC以少胜多:3000万参数从零训练,LIBERO-90达94.3%反超33亿参数π0
  • DISC泛化与收敛:长程任务92.7%超基线8.4pp,真机泛化86.4%,10-20条演示即收敛
  • 简约性理念:语言在架构中「从哪进入」比「如何编码」更重要,正确偏置替代堆参数

架构前沿与跨本体泛化

  • 可控可解释解耦:MINT动作词元化理解意图,GuidedVLA达90.6%,StableVLA以0.5B媲美14倍模型
  • 记忆与世界模型:KEMO提升长程任务23.6pp,Event-VLA低光照达95.6%,WALL-WM升级为语义事件
  • 端侧与跨本体:Om VLX端侧延迟0.1s,Qwen-VLA统一11平台,灵波适配20+构型解决跨实体瓶颈

战略范式与数据飞轮

  • 分层与目标驱动:谷歌定位“机器人界Android”专做大脑,业界呼吁转向无动作标签自监督
  • 数据采集降本:灵初外骨骼降本90%并开源千小时,自变量进入100家庭闭环采集真机数据

SymSkill:模仿学习与符号规划的统一框架(ICRA 2026 双奖)

新智元(20260705)

SymSkill 框架(ICRA 2026 双奖)

  • 历史性突破:同时斩获ICRA 2026大会最佳论文奖及规划与控制方向最佳论文奖,一篇双奖在历史上较为罕见
  • 核心创新:首次统一模仿学习与经典符号规划,解决前者组合泛化弱、后者实时响应慢的矛盾
  • 离线共创:无监督联合学习谓词、操作符和技能,无需人工标注或分割演示数据,每任务仅需约5次演示
  • 在线执行:符号规划器动态组合和重排已学技能,运动层与符号层均支持实时故障恢复
  • 实验表现:RoboCasa单步任务成功率达85%;多步复杂任务(最多6次技能重排)可从失败中稳健恢复
  • 训练效率:真实Franka机器人仅用5分钟无标签玩耍数据即可完成训练

仿真数据 vs 世界模型:三方博弈与融合趋势

具身智能之心(20260708)

  • 核心分歧:视频生成模型将三维物理世界“坍塌”为二维,丢失质量、摩擦力等物理信息,学到的是“世界长什么样”而非“世界如何运转”
  • 三阵营立场:工业界主张融合互为先验;学界认为仿真本质“偏假”只适合预训练;自驾行业判断仿真价值随真实数据成本下降而持续走低

工业界三条融合路径

路径代表核心做法
仿真当梯子群核科技视频基模负责画面知识,仿真负责物理记忆,互为先验;联合Adobe等推出仿真器入选ECCV
架构层融合大晓机器人共享注意力机制,理解/生成/预测一体;“开悟”三阶段:百万小时全量→万小时以人为中心→真机+仿真联合训练
深度参与闭环51World仿真从评测工具升级为合成数据和闭环流程核心组件
  • 学界定位:仿真数据是“第1.5层”——预训练阶段高价值,微调阶段不推荐(最后一公里必须用真机数据),场景过于理想化易致过拟合
  • 自驾行业反向曲线:冷启动期高价值→数据爬坡期走低→极端场景回升;遵循“模型负责上限,规则负责下限”,曾用生成式逻辑两周产出5000帧海外corner case
  • 终极判断:3-5年内路线之争终点大概率是生成式接管传统物理仿真大部分场景,形成“仿真提供物理先验+生成提供规模和多样性”的混合范式

4.2 具身强化学习与训练机制


具身强化学习与数据引擎前沿

具身智能之心(20260330) | 具身智能之心(20260401) | 具身智能之心(20260414) | 具身智能之心(20260422) | CVer(20260426) | 具身智能之心(20260428) | DeepTech深科技(20260430) | 量子位(20260511) | 新智元(20260511) | 具身智能之心(20260513) | 具身智能之心(20260513) | 具身智能之心(20260515) | 具身智能之心(20260519) | 具身智能之心(20260521) | 具身智能之心(20260521) | 具身智能之心(20260521) | AI前线(20260522) | 具身智能之心(20260528) | AI前线(20260529) | 具身智能之心(20260608) | 具身智能之心(20260610) | 机器之心(20260615) | AI科技评论(20260616) | DeepTech深科技(20260618) | 机器之心(20260623) | 具身智能之心(20260625) | 具身智能之心(20260701) | 机器之心(20260702) | AI科技评论(20260703) | 机器之心(20260704) | 新智元(20260707) | 具身智能之心(20260709) | 具身智能之心(20260713) | 机器之心(20260717)

  • HyVLA-0.5(腾讯):亚毫米指套+FlowPRO后训练,1万小时数据真机接近100%
  • 执行闭环平台:上交开源Evo-RL,RoboClaw统一控制闭环并自复位减干预
  • 能力解耦分析:清华Fast-WAM系统性解耦性能来源,提供内在机制改进方法

4D世界模型与遥操作引擎

  • 4D架构设计:单扩散框架同步生成RGB/深度/光流,克服2D缺乏深度及物理幻觉
  • 三分支协同:RGB/Depth/Flow各持独立FFN,用联合注意力与帧级3D RoPE对齐
  • 条件融合机制:采用分布对齐加法,避免拼接导致FVD从585崩至2598
  • Rynn4D数据集:超2.54亿帧融合EgoVid/RoboMIND等,支撑模型4D泛化能力
  • 遥操作动作链:Vive采集到54维输出,81帧重锚定抑制漂移,控制频率约9Hz
  • 3D骨架感知:21关节点按深度调节颜色粗细,使2D骨架显式携带3D空间提示

核心性能对比

  • 视频生成质量:4D模型FVD 550(优于InterDyn 655、Mask2IV 1650)
  • 4D几何精度:深度δ1达0.610(基线最优仅0.327)
  • 推理效率表现:因果student模型达40FPS(超相机30Hz更新频率)
  • 零真机数据验证:仅300条4D生成数据训练,Block Pushing达82.86%
  • 双手传递任务:成功率28.57%,远超π0(2.86%),破局2D无法编码3D致失败
  • 双臂举升验证:仅生成数据训练下,Bimanual Lifting成功率达77.14%

纠错与安全泛化

  • 纠错与干预:RECAP升叠毛巾至55.6%;E2HiL提成功率24.9%且介入减9.3%
  • 极端介入优化:UniIntervene统一干预机制,介入率压至14.6%
  • 安全探索均衡(SEE):零约束违反,独轮车仅10次迭代召回率95.78%
  • 破捷径学习:动/固定视角1:3混合,抗相机偏移成功率最高提升26.8%
  • 破虚假依赖:浙大EgoTSR(4600万样本课程)破除统计捷径,双向准确率92.4%

4.3 VLA推理与执行加速优化


VLA 推理加速、执行优化与系统级工程实战

具身智能之心(20260330) | 具身智能之心(20260408) | AI科技大本营(20260408) | AI科技评论(20260408) | 量子位(20260411) | 具身智能之心(20260413) | 具身智能之心(20260417) | 机器之心(20260418) | 机器人前瞻(20260427) | PaperAgent(20260509) | 具身智能之心(20260514) | 机器之心(20260514) | 极市平台(20260514) | 具身智能之心(20260515) | 具身智能之心(20260519) | AI科技评论(20260522) | 极市平台(20260522) | 具身智能之心(20260419) | 机器人前瞻(20260605) | 极市平台(20260615) | CVer(20260623) | 具身智能之心(20260702)

  • 按需语言生成:博世 BLUE 发现仅 14.5% 路线需语言推理,训练轻量 Gate 模块让 80% 帧跳过语言生成,推理提速 2.54 倍且 Bench2Drive 通过率达 76.18%。

主流推理加速与系统优化方案对比

方案/模型核心机制关键性能提升
Fast-dVLA (港科大广州)Block-wise Attention + 离散扩散强制 (解锁块级并行)加速 2.8×-4.1×,稳定维持 30Hz 真机控制
A₁ (中大×MBZUAI)预算感知自适应截断 + 层间热启动流匹配延迟降 72.3%,计算量砍 76.6%,登顶 RoboChallenge (29.0%)
AC²-VLA (同济大学)动作上下文替代视觉复杂度作为算力分配信号推理 FLOPs 降至 29.4%,Google Robot 成功率 76.8%
StreamingVLA (清华大学)动作流匹配 + 显著性预测器 (观测/生成/执行异步并行)卡顿时间从 230.8ms 压缩至 36.0ms
Realtime-VLA FLASHLLM 投机推理机制迁移至扩散式 VLA单轮延迟从 58.0ms 降至最低 7.8ms (最快 125FPS)
Realtime-VLA V2 (原力灵机)轨迹预放大补偿 + DAgger 风格“油门采集”RL应对系统 200ms 总延迟,执行速度从 0.5x 跃升至 2x
ActDistill (同济大学)动作引导蒸馏,按需激活模型层计算量压至原模型 50%,真机执行从 10.2s 降至 6.3s
Xiaomi-Robotics-0 (小米开源)异步推理与动作前缀机制,Λ型掩码破解惯性依赖仅需 20 小时真机数据掌握精细操作
  • 系统级工程与协同:星动纪元 Era0 采用动作插值消除误差累积登顶 RoboChallenge;小米 my16 引入 S2 大脑+S1 小脑双系统架构及显式长短期记忆机制,解决长程任务的状态遗忘问题。

4.4 具身基础模型与通用架构


具身基础模型架构路线与通用平台范式

量子位(20260409) | 腾讯混元(20260409) | 新智元(20260423) | 甲子光年(20260423) | 智东西(20260423) | 机器之心(20260424) | 极市平台(20260429) | AI科技评论(20260502) | 甲子光年(20260512) | 具身智能之心(20260514) | 脑极体(20260519) | 机器之心(20260522) | 机器之心(20260522) | 具身智能之心(20260528) | 具身智能之心(20260529) | 量子位(20260604) | 具身智能之心(20260609) | 机器之心(20260609) | 具身智能之心(20260610) | 量子位(20260616) | AI科技评论(20260617) | 硅星人Pro(20260618) | 机器之心(20260618) | 具身智能之心(20260618) | 十字路口Crossing(20260619) | DeepTech深科技(20260620) | 十字路口Crossing(20260620) | 极市平台(20260623) | 具身智能之心(20260625) | 具身智能之心(20260627) | 机器之心(20260627) | 具身智能之心(20260630) | 具身智能之心(20260703) | 具身智能之心(20260703) | 机器之心(20260716) | 具身智能之心(20260717) | 机器之心(20260718) | 数据猿(20260718) | 机器之心(20260718) | 机器之心(20260718)

| WLA/混合 | 语言推理+物理动态统一 | LaST₀, Being-H-Flash | 兼顾推理与延迟,技术门槛最高 |

  • VLA的物理缺陷:Action属于连续空间,语言映射无法穷尽状态,高频伺服带宽失配(3-10Hz vs 需求>100Hz)
  • WAM泛化碾压:DreamZero在未见任务进度达39.5%(VLA<1%),较SOTA VLA零样本泛化提升33%
  • 融合趋势确立:纯VLA在双盲测试反超(j2-vla Elo 1847),验证极致工程化比路线选择更关键

架构底层创新与降本增效

  • 模态解耦突破:腾讯MoT-2B复制专属参数给视觉Token,以2B激活参数获16/22项评测最佳
  • 触觉跨传感器统一:FTP-1将多传感输入映射为24个功能token,未见传感器成功率提升31.6个百分点
  • 潜空间隐式推理:北大LaST₀用隐式时空思维链绕开语言高延迟;Being-H-Flash月算力成本仅150元
  • 稀疏Motion表征:HiF-VLA提取低维向量替代多帧堆叠,延迟降50%(117.7ms),显存省一半

数据引擎与闭环壁垒

  • 物理真实数据驱动:自变量等建立家庭场景数据飞轮闭环,Curr-0基于2.1万小时真实行为数据训练
  • 闭环经验降本:π*0.6模型产出数据回流训练已超人工,真机采集最大成本在管人而非硬件
  • 反SOP长尾探索:过度标准化削弱泛化,高价值数据必须包含失败恢复与分布外(OOD)探索

通才大模型与跨本体平台

  • 通才模型正迁移:NVIDIA Vesta端到端全链路统一,平均超最强专才20+分,消除多模块级联失败风险
  • 跨本体极速切换:RoboScience Visics引入轨迹解耦,换灵巧手30秒恢复操作,抓取成功率超99%
  • 大厂全链路矩阵:京东JoyAI开源2000小时EgoLive数据集,规划两年内采1000万小时建运营中心
  • 因果推理引入:Aether AI将因果变量(形状/摩擦力等)嵌入Transformer底层,跨任务成功率提升25%-50%

4.5 VLA感知表征与动作控制优化


VLA感知表征与动作控制优化前沿

机器之心(20260331) | 具身智能之心(20260331) | 具身智能之心(20260409) | PaperAgent(20260413) | 具身智能之心(20260416) | 极市平台(20260417) | 具身智能之心(20260424) | 量子位(20260428) | 新智元(20260513) | CVer(20260519) | 具身智能之心(20260520) | 机器之心(20260524) | 量子位(20260526) | 机器之心(20260527) | 具身智能之心(20260603) | 具身智能之心(20260603) | AI寒武纪(20260618) | 量子位(20260620) | 量子位(20260623) | 机器之心(20260626) | 具身智能之心(20260628) | 具身智能之心(20260704) | 具身智能之心(20260708) | 量子位(20260708) | 量子位(20260712) | AI科技评论(20260713) | AI科技评论(20260716) | AI科技评论(20260717) | 机器之心(20260717) | 机器之心(20260717) | 机器人前瞻(20260718)

  • 数据供给与评测困境:具身大模型核心瓶颈转向高质量数据。可用第一视角数据不足4%,评测基准揭示当前能力远未成熟(Pi 0.5在GM-100仅得13分,RoboDojo真机最优成功率仅12.8%)
优化维度代表方案核心机制与技术突破关键数据/表现
语言指令对齐Point-VLA图像叠加视觉定位,解决纯文本空间描述鸿沟成功率从25%升至92.5%
FineVLA十维细粒度动作指令(抓取点/方向等)仿真成功率86.8%,指令词数提升10.4倍
LA4VLA移除视觉预训练,强制学习语言约束破解“视觉捷径”真实成功率从38.3%升至81.7%
3D空间表征Evo-Depth0.9B参数隐式深度编码(无需额外传感器)真机成功率90%,推理12.3Hz
3D World Policy直接生成原生3D表征,解决2D空间关系局限跨视角零样本泛化超π₀.₅约6%
FTM/FLA极小参数(4K)空间表征校准新视角成功率从48.5%提升至87.1%
动态与物理预测PUMA耦合历史光流与隐式未来状态,克服单帧静态偏置动态场景成功率从7.5%升至17.2%
Lumo-2潜在空间先预测未来世界状态再生成动作推理速度提升2.71倍,超越Pi0.5
长程任务记忆Chronos将历史作为潜在状态建模,根本解决非马尔可夫问题0.3B参数,真机单RGB相机成功率78%
KC-VLA关键帧链架构结合三模态负采样50条演示实现92.0%成功率(基线57%)
  • 系统架构与执行分离:AgentChord将失败恢复动作提前预编译入任务图免重规划(双臂成功率77.5%);OMEGA通过三层架构实现多机器人跨节点并行调度
  • 高效训练范式:解耦训练成破局关键。Ψ₀以30小时真机数据+人类视频预训练,长程任务成功率提升超40%,证明正确scale数据优于盲目堆量

4.6 跨具身迁移与人类数据利用:中间表示突破


人类视频到机器人操作的跨具身迁移方法

具身智能之心(20260504) | 具身智能之心(20260507) | CVer(20260526) | 具身智能之心(20260526) | 具身智能之心(20260526) | 具身智能之心(20260623) | 具身智能之心(20260705) | 新智元(20260713)

  • 根因诊断:具身差异与视角变化导致人类动作轨迹不可直接迁移,需转化为中间表示(如交互关系、统一隐空间)
  • 数据规模化优势:人类第一视角视频超百万小时,远超真实机器人数千小时量级,预训练泛化效率显著更高
  • Scaling Law确立:EgoScale在2万小时视频上验证数据量与Loss呈对数线性关系,且可预测真机表现
  • 视频动捕突破:ACE-ViDiHand利用视频扩散模型实现严重遮挡下99.7%帧准确率,轨迹抖动降低4.0-4.8倍

核心迁移路线与代表框架

框架核心机制关键突破与数据
BridgeACT抽象工具-目标相对关系复杂交互任务传统方法0/10,该方法达4/10
UniT视觉锚定统一离散隐空间人与机器人行为特征收敛至同一共享流形
SUGAR视频提取→RL物理修正→蒸馏克服穿模与重心漂移,支持互联网视频规模化训练
Uni-Hand手-头协同双分支扩散预测将人手轨迹直接转化为夹爪动作,提升多任务成功率
HumanScale预训练(覆盖)+后训练(对齐)分工OOD成功率90.0% vs 无预训练基线0.0%
EgoScale人类视频Scaling Law分析量化评估数据规模与下游任务收益的关系

梅卡曼德:跨本体"眼脑手"组件体系与工业级数据飞轮

量子位(20260718) | 甲子光年(20260718)

跨本体迁移核心理念:不押注单一机器人形态,打造可跨形态通用的感知-理解-规划-执行标准组件,通过实际部署验证智能跨本体迁移的可行性。

眼脑手组件分层协作机制

模块核心职责能力体现
眼(3D视觉)空间感知重建透明物体因折射产生的深度空洞与不连续轮廓
脑(Mech-GPT)意图理解结合日常常识推断真实意图(如听“下雨”推断需伞)
大脑(行动规划)任务分解多步骤任务自主分解规划,非刻板按名取物
手(Mech-Hand)物理操作世界动作模型驱动,从预测下一帧进化到预测下一步动作

工业场景验证关键指标

  • 高精度柔性装配:柔软易形变线束插头装配达亚毫米级柔顺插接精度。
  • 复杂空间推理:货架取货需自主规划手臂进入角度、避障路径与安全退出策略。
  • 动态环境适应:桌面物品被替换后,机器人可重新判断环境并完成任务。

规模化部署与数据飞轮效应

  • 全球落地规模:全球累计部署超27000台,服务超100家《财富》500强企业,连续6年国内市占率第一(2020-2025)。
  • 数据反哺泛化:大规模真实部署数据并非优化单一熟练度,而是持续扩大模型可处理的物体与场景边界。
  • 政策规模化催化:工信部与国资委定调年底实现万台级落地与百个高价值场景,WAIC将具身智能列为核心赛道。

4.7 RoboAgent能力驱动具身规划范式(CVPR 2026)


RoboAgent:3B VLM能力链分解超越GPT-4o的具身任务规划

AI前线(20260601)

  • 核心洞察:VLM 本身已具具身推理能力,瓶颈在调用机制。用能力链替代端到端规划,单一 3B 模型无需外部工具即可端到端完成
  • 性能突破:3B 模型在 ALFWorld 视觉模式达 77.6%(GPT-4o 仅 24.0%),仅用 ALFRED 6.4k 训练任务即零样本泛化至 4 个未见基准,入选 CVPR 2026

五能力模块与统一调度机制

  • 基于 Qwen2.5-VL-3B,Scheduler 按需动态生成能力链,五模块由同一 VLM 实现以复用基础能力
  • EG(探索引导):利用常识推断目标物体最可能位置,避免盲目搜索
  • OG(物体定位):开放词汇检测,识别未见物体,实现跨概念泛化
  • SD(场景描述):精确描述目标物体当前状态,提供细粒度感知
  • AD(动作解码):将指令解析为原子动作(如导航、抓取、放置等)
  • ES(经验总结):评估执行结果并分析失败原因,驱动自我纠错

三阶段渐进式训练路径

  • 阶段一(640k):专家轨迹监督微调,生成能力调用序列与思维链
  • 阶段二(690k):模型自运行,利用模拟器特权信息(如真实位姿)提供纠正监督
  • 阶段三(25k):EIPO 专家策略优化,利用专家优势函数规避 RL 高方差与奖励稀疏问题

关键基准测试对比

基准测试RoboAgent(3B)次优模型GPT-4o
ALFWorld文本(未见)94.0%DynaMind 89.1%
ALFWorld视觉77.6%SEEA-R1 36.0%24.0%
EB-ALFRED平均67.0%WAP 62.7%46.0%
EB-ALFRED视觉78.0%46.0%

跨场景泛化与迁移能力

  • 跨模拟器泛化:仅 ALFRED 训练即零样本泛化至 EB-Habitat、LoTa-WAH 等未知环境
  • 跨模态迁移:视觉模态训练的能力链可无缝迁移至纯文本场景,证明学到的是规划策略而非视觉特征提取

4.8 全模态统一端侧大脑:UnisonMind的物理AGI路线


UnisonMind:全模态端侧统一大脑与物理AGI验证

袋鼠帝AI客栈(20260624) | 甲木未来派(20260625) | 量子位(20260713)

  • 模型定位:清华一念UnisonMind(11B/30B+),大脑与身体解耦,定位为“物理世界的AI Runtime”
  • 「3+1」框架:统一多模态大脑、理解与生成同脑、流式持续运行(18ms对齐)、完整端侧部署
  • 统一模态:视频、语音、文字及动作进入同一世界Token空间,非多模型拼接
  • 端侧运行:11B参数直接部署于NVIDIA Jetson AGX,断网独立可用,支持任务随时被打断与重组

UnisonMind与主流具身方案对比

维度主流方案UnisonMind
模型结构视觉/语音/动作多模型拼接单一模型处理全模态
部署方式依赖云端推理完整端侧运行(Jetson AGX)
感知方式抽帧识别与固定触发实时视频流持续理解
任务执行预写脚本与规则串联实时感知与自主决策

无脚本实测与跨本体验证

  • 跨本体迁移:同一大脑无遥控无缝驱动机器狗、人形机器人、电动轮椅等四类设备
  • 哮天机器狗:无脚本即兴完成看图走迷宫(理解三维空间并主动求走捷径)
  • 物理与社会智能:指挥人类使用天平给随机物品称重,展现跨物种社会协作
  • 物理推理验证:估算剩余水量时,要求先撕掉水瓶标签以排除视觉干扰
  • 非受控展示:20余人现场实时互动,团队未剪辑轮椅异常转圈故障,直面当前局限

评估新范式与商业化挑战

  • 评估新范式:提出以人类智能为天然标尺定义Physical AGI,转化为可逐项验证能力清单
  • 当前局限:受端侧算力限制行动略迟缓,跨本体迁移深度与安全边界定义仍是未解难题

5. 商业化与产业进展


5.1 企业治理与团队组织


平台化战略:训练-仿真-运行三层架构与资本锁定

具身智能之心(20260707)

全栈平台战略

  • 三层架构:不造本体,以「训练-仿真-运行」三层计算架构嵌入头部机器人公司技术栈
  • 生态闭环:技术栈、评测标准与资本三管齐下,比单纯技术领先更难撼动

模型迭代与数据引擎

模块核心进展数据支撑
GR00T 基础模型System 2(VLM规划)+System 1(关节执行);N1.6多本体泛化超越上代开发周期由近3月压缩至36h,11h生成约78万条轨迹
Cosmos 世界模型首个全开放全模态模型;EgoScale拟合第一视角scaling law训练消耗20万亿token
强化学习DreamZero大幅提升任务完成度进度从VLA基线27%提升至62%

仿真与评测基建

  • 精度突破:Isaac Sim 5.0机械臂抓取达0.1mm级;Newton物理引擎联合Google DeepMind及迪士尼开源
  • 规模化评测:Isaac Lab-Arena对接Hugging Face LeRobot,8张RTX 6000D开4096个并行环境
  • ⚠️标准争议:Cosmos 3在7+自建benchmark自称第一,缺独立复现参考价值受限

算力入口与资本锁定

  • 芯片采用:Jetson Thor已进入Figure、宇树、Meta、谷歌DeepMind等主流人形公司
  • 投资绑定:NVentures参投Figure(估值390亿美元)与Skild AI(估值140亿美元),形成资本闭环
  • 卖水人定位:做平台将本体竞争风险留给客户,将算力与工具链收益锁定自身

企业治理失败案例:股权、战略与组织崩塌

雷峰网(20260405) | 雷峰网(20260413) | AI科技评论(20260405) | 机器人前瞻(20260722)

三家崩塌企业全景对比

维度达闼科技千挂科技Vicarious Surgical
融资/估值7轮,估值223亿近4亿(天使8亿→Pre-A 20亿)约3亿美元(SPAC上市)
股权致命伤67个股东极度分散,无LP接盘丁飞代持绝对控股权,CEO陶吉无书面股权SPAC注资加速烧钱,忽视造血
组织痼疾一言堂、邀功文化致人才流失广深/北京拆分搞派系,扁平化异化仅26人团队烧光巨资未定稿
终局2024年资金链断裂2024年10月破产清算2026年Q1资不抵债遭清算

股权与治理崩塌核心教训

  • 利益分配首日落纸面:千挂资本方凭绝对控股权推翻口头承诺,将持股CEO投票踢出局
  • 防范极度分散的股权结构:达闼穿透67个股东(含57个国资LP),资本循环断裂致3530万执行款拖垮全局
  • 明星背书不等于商业落地:比尔·盖茨等押注Vicarious,达闼有软银富士康加持,技术领先与融资无法替代造血能力

战略与组织管理致命陷阱

  • 警惕路径依赖:达闼创始人强行移植“运营商思维”,造手机填营收致核心业务停滞
  • 扁平化不等于无层级:千挂拒设技术委员会,基层凭代码审核权阻碍关键重构,演变为内耗
  • 过早地域拆分制造派系:千挂广深团队各自为政,技术竞争演变为立场斗争
  • 独断决策逼走顶尖人才:达闼技术路线由创始人独断,优必选前台柱谢铮因“谁也不能改”离职创业

深水区生存警示

  • 压降开支难阻死亡螺旋:Vicarious砍60%开支仍持续亏损,达闼手握百亩园区仍因现金流断裂崩盘
  • 超前技术判断需匹配匹配现实造血:达闼2020年即提出人形降本,领先行业5年,却死于商业模式错位

激光雷达芯片化与量产智驾商业化博弈

钛媒体AGI(20260415) | 量子位(20260417) | 雷峰网(20260423) | 雷峰网(20260618) | 机器人前瞻(20260629) | 有新Newin(20260630) | 机器人前瞻(20260708) | "Z Potentials"(20260710) | 具身智能之心(20260710) | 量子位(20260715) | DeepTech深科技(20260715) | 新智元(20260715) | 具身智能之心(20260717) | AI科技评论(20260717) | APPSO(20260718)

  • 多智能体异构协同落地:阶跃WAIC演示6台异构机器人连续作业15小时,每台每12秒完成一次亚毫米级精度操作
  • 端侧多模型协同交互:通过Agentic模型+语音+视觉协同,交互跃升为“意图理解→任务拆解→工具链调用”的自主闭环
  • 商业落地优先工业场景:具身企业多切入半导体、汽车装配等半结构化高容错场景,以高质量数据反哺后向公共服务及家庭场景渗透
  • 资本向大脑与全栈聚集:它石智航估值达50亿,智平方累计融资近50亿(估值超200亿),行业从硬件比拼全面转向通用智能全栈较量
  • 中美市场格局差异化竞速:中国企业依托制造场景优势小步快跑迭代(60分即发布),但在资本深度与底层模型上仍面临结构性挑战

核心技术与架构演进对比

企业/机构核心技术/架构关键数据与商业化进展
Xspark AI慢脑(VLM)-快脑(WAM)-脊髓(VTA)三层强调安全约束、触觉融合与跨任务泛化
灵境智源原生计算架构(感知到动作闭环)延迟<5ms,获超70%具身企业订单,2027年流片
速腾/禾赛激光雷达SPAD-SoC芯片化禾赛自研芯片出货超2.3亿颗,实现车载与机器人复用
阶跃星辰实车部署MoE大模型196B总参/11B激活,推理400 TPS,编程达Opus 97%
逐际动力真机RL与全身平衡跟踪(WBT)任务失败率压降至11.33%,全身误差12.85mm超越SOTA
它石智航原生统一架构AWE 3.0真人采集超10万小时数据,估值50亿

具身智能产业链延伸路径

  • 底层算力延伸:灵境智源自研原生计算架构(延迟<5ms),拿下超70%企业订单,规划2027年具身芯片流片
  • 传感器芯片化分水岭:速腾、禾赛推动SPAD-SoC量产,禾赛自研芯片出货超2.3亿颗,实现车载与机器人双场景复用
  • 物理可信系统架构:Xspark AI提出“慢脑(VLM规划)—快脑(WAM操作)—脊髓(VTA兜底)”三层架构,强化安全与泛化

具身智能企业融资、IPO与商业化转型评估

智东西(20260622) | 奇绩创坛(20260623) | "Z Potentials"(20260629) | 新智元(20260629) | "财联社AI daily"(20260702) | AI科技评论(20260704) | 奇绩创坛(20260717) | 雷峰网(20260719) | 具身智能之心(20260721) | 硅星人Pro(20260724)

  • 市场预期:具身智能估值定义为“手机数量×汽车价格”,跨领域人才大量涌入,多家已启动IPO
  • 评估三角:融资能力定生存底线,产品工程化决天花板,场景选错沉没成本极高
  • 底层基建壁垒:应用层极度内卷,但具备全栈底层技术能力的团队极度稀缺,壁垒极高

底层基建与硬件融资动态

  • 光轮智能:获10亿元融资,主攻仿真数据与评测设施,打造EgoSuite数据飞轮闭环
  • 奇塑科技:近亿元天使轮,主打桌面级CNC与AI CAM降门槛,自建柔性工厂
  • 北大杨超团队:首轮过亿,构建物理AI底层基建,涵盖HPC+仿真+AI全栈体系
  • 擎羽智能:成立半年完成3轮融资(顺为与五源领投),团队均龄26岁且有Nature一作背景
  • 柔性机械臂:擎羽推出重750g-2300g全球最轻量产级绳驱连续体机械臂,构成本体+数据飞轮+通用模型技术栈

大模型与AI企业财务表现

  • 营收结构对比:Anthropic超80%靠B端API且成本低预计2026年盈利;OpenAI 85%依赖C端且算力消耗大
  • 商业化危机:AI行业ARR增至450亿美元,但面临Agent计费危机及中国免费模型出海双重毛利威胁
  • 某AI企业财务:三年复合增长率138.9%,2024财年总收入5.23亿实现扭亏,研发开支增至0.51亿
  • 毛利率分化:2025财年感知终端降至17.7%,大模型服务30.4%,订阅服务升至71.3%

特斯拉战略转向与财务困境

  • 以价换量代价:Q2交付48万辆致单车收入降至4.27万,汽车毛利率跌至1.4%,营业利润大降57%
  • 资金流向转变:核心业务利润正被消耗,自由现金流转负,全面转向烧钱支撑Robotaxi与AI基建
  • Optimus量产:原Model S/X产线转为第三代专用线,目标年产百万台,面临万级零部件与工艺挑战

团队动荡与工程化合规困境

  • 人事动荡:千万年薪挖角骨干不到一年离职,灵巧手赛道频现高管洗牌与团队内耗
  • 产品缺陷:硬件存在散热冒烟及高达20%退货率问题,且过度依赖人工采集数据
  • 合规风险:高校成果商业化面临泄密风险,初创公司存高价卖硬件冲业绩现象

仿真器对硬件设计的反向约束:S.T.U.P.P.I.D. 困境

机器之心(20260624)

  • 核心矛盾:仿真器反向定义硬件设计,机械优势结构因仿真困难被主动删除
  • S.T.U.P.P.I.D. 困境:40年从业老兵 Scott Walter 提出,指“被仿真器掐住脖子的低效集成设计”,引发 Agility 等业内共鸣
  • DFS 本末倒置:NVIDIA Jim Fan 提出的 DFS 作为训练原则合理,但升级为设计原则则违背工程常识

被牺牲的机械优势

机械结构优势被放弃原因
并联关节结构紧凑、分担扭矩仿真建模复杂
线性驱动性能可能更优旋转执行器建模省事
远程驱动机械效率高仿真处理困难
肌腱式手部接近生物力学直接驱动更易仿真
RSU并联踝关节经典机械设计适配 RL 需改串联
  • 硬件妥协案例:Unitree 将 RSU 并联踝关节改串联以适配 RL;部分电机控制器主动限制输出让响应更线性
  • 算力瓶颈与捷径:完整仿真计算成本极高,团队被迫走捷径(惯量靠估算、重心靠修、反射惯量靠猜)
  • 应对方向纠偏:域随机化仅为勉强修补的胶带,正确方向是改进仿真器而非改硬件适配仿真
  • 组织架构反思:团队优先让 Isaac Lab 易仿真而非改进仿真器;软硬件分离反馈极慢,全栈闭环才是核心

核心零部件供应链:全极耳高功率电池卡位

甲子光年(20260624)

  • 新能安卡位机器人电池:新能安(ATL+CATL合资)成宇树核心供应商,部分产品线已完成100%替换;无人机电池全球出货第一(每3架消费级无人机1架用其电池),高端电摩8000元以上市场占有率近70%。
  • 全极耳技术代差:2023年量产全极耳21700电芯,内阻从传统10-12mΩ降至2mΩ(降幅超80%),比三星同类产品量产提前约3年;低内阻带来三重收益:放电温升降低、瞬时功率增强、循环寿命延长。
  • 前瞻产能协同:依托ATL(小电池)+CATL(大容量)生态,新能安专攻高功率电池;产能超30GWh,非上市身份使其无短期财报压力,提前卡位机器人市场。
  • 具身导航免训练框架:Uni-LaViRA将导航拆解为语言→视觉→执行三级翻译,全程零参数训练,在六大基准取得免训练方法最优,其中四项反超训练型SOTA。
  • 成本与跨机即插即用:训练开销为0(对比训练型需0.95M–16.9M样本、320–14592 GPU小时),成本全转至推理端API调用;换机器人仅需替换底层控制器,新增一台约6-8人时。
  • MIT微型建图芯片:硬件化GMMap高斯混合模型算法,芯片面积仅4mm²,功耗低至6毫瓦(比Jetson TX2低341倍),可实时处理640×480深度图。
  • 极致建图效能:吞吐54万-132万点/秒,每秒88-331次更新,精度保持96%-99%;目标用于工业管道巡检微型机器人及轻量AR眼镜。
  • 三项硬件优化:反推可通行区降耗22%-63%;批量查询降耗74%-81%且吞吐提4-10倍;近似计算缩减芯片面积38%及地图大小44%-63%。

非人形形态演进与底盘系统量产化路径

ScienceAI(20260612) | 钛媒体AGI(20260614) | AI科技评论(20260615) | 具身智能之心(20260616) | 智能相对论(20260616) | 机器之心(20260617) | 硅星人Pro(20260617) | 硅星人Pro(20260618) | AI前线(20260619)

  • 非人形形态成为工业量产突破口:刻意回避双足平衡难题,采用轮式底盘+升降+双臂架构,精准匹配工业平整地面与高效作业需求
  • 全栈自研极致降本:Genesis AI全栈自研将数据采集手套成本降至300美元(传统遥操作的1/20)

代表产品与商业落地进展

产品硬件特性核心落地进展/规划
Genesis Eno轮式+无头三折叠躯干+双臂获1.05亿美元种子轮融资,26年Q4交付LG CNS
光象 Phi-Bot X1四舵轮底盘+升降双臂,0.05mm精度蔚来产线连续作业21.5小时零失误
思岚 Poseidon四轮独立转向,360°全方位感知标准化底盘,缩短本体开发周期至1个月

系统化兜底与数据飞轮闭环

  • Physical Harness安全绳机制:原力灵机不强求完美模型,通过三级任务分层(L1标准自动化、L2具身执行长尾、L3人工接管)保障业务连续性
  • 双轮驱动商业落地:任务分层跑通经济ROI,真实异常结构化反哺模型,已覆盖超10万SKU,日峰数万单

宏观瓶颈与范式分歧

  • 单一突破不会到来:2025年机器人风投创纪录达407亿美元,但多为高度编排演示,真正突破需依赖系统能力组合
  • 数据飞轮存在陷阱:具身数据场景强绑定跨场景无用,头部公司千万级投入采集10万条数据,模型能力提升仅约5%
  • 评估与资本双重分歧:模型架构(VLA vs 世界模型)与数据扩展路线尚未收敛,各路资本押注多路线博弈延缓技术收敛

5.2 人才迁徙、技术迁移与具身创业图谱


具身智能创业图谱与核心人才迁徙

智能涌现(20260330) | AI科技评论(20260330) | 量子位(20260331) | 字母AI(20260402) | 雷峰网(20260408) | 机器人前瞻(20260408) | AI科技评论(20260409) | 钛媒体AGI(20260410) | 智东西(20260416) | 机器人前瞻(20260416) | AI科技评论(20260421) | 机器人前瞻(20260422) | AI科技评论(20260426) | 雷峰网(20260427) | 量子位(20260518) | AI科技评论(20260518) | AI科技评论(20260521) | DeepTech深科技(20260522) | 具身智能之心(20260522) | AI科技评论(20260601) | AI科技评论(20260602) | 雷峰网(20260615) | 机器人前瞻(20260702) | 机器人前瞻(20260710) | 深度学习与NLP(20260712) | 深度学习与NLP(20260712)

核心阵营与差异化路线

  • 它石智航:丁文超(华为天才少年),Pre-A轮4.5亿美元创纪录,专注具身大模型
  • 欧拉万象:周顺波(华为天才少年),成立1月获数千万种子轮,移动底盘+双臂切入家庭
  • 叮当动力:牛建伟(前地平线),地平线领投数千万种子轮,空间智能大模型+物理Agent
  • 吉翼智能:李一同(前华为天才少年),注册资本超16亿,工业切入的渐进式大模型
  • 乐享科技:郭人杰(前追觅),累计融资10亿订单破3万台,全尺寸人形及家庭机器人
  • Zeno AI:William Zhi(CMU系),2025年成立,主攻全身协同端到端与第三人称视频学习
  • Xspark AI:熊祺(前蔚来感知与大模型),近亿元天使轮,自研世界模型SparkWorld获WorldArena冠军
  • 破晓智能:哈工大98年教授带队,主攻灵巧操作世界模型,首创触觉原生融入基础模型架构

触觉原生新风向:Xspark与破晓智能双双发力触觉写入基础模型,验证了区别于纯视觉路线的“触觉原生”正成为具身智能新风向。Xspark构建“慢脑-快脑-脊髓”三层架构,将多光谱触觉感知引入决策链路;破晓智能主张触觉原生写入模型是解决视觉盲区、实现精细操作闭环的关键。

吸金能力与资本升级:2026年Q1公开融资超300亿(远超2024全年93.55亿),国家队(北京机器人基金、上海国投)密集入场,产业资本(如吉利资本)深度协同,半数初创公司成立不到半年即完成两轮融资。

数据瓶颈与技术分化:行业普遍面临真实交互数据死锁瓶颈,部分押注物理世界数据结构化,部分探索纯Sim2Real(如Hillbot主打零真机数据,60分钟连续抓取100+未见物体Zero-shot成功率近100%)及继承LLM的Scaling Law。


5.3 创业与产业


具身智能创业生态:资本布局、商业模式与产品落地

Z Potentials(20260330) | 机器人前瞻(20260330) | AI科技评论(20260406) | 数智前线(20260407) | 机器人前瞻(20260409) | 机器人前瞻(20260409) | 具身智能之心(20260413) | 有新Newin(20260420) | 机器人前瞻(20260422) | 雷峰网(20260423) | AI科技评论(20260426) | 机器人前瞻(20260427) | 具身智能之心(20260427) | 钛媒体AGI(20260427) | 奇绩创坛(20260428) | 机器人前瞻(20260501) | "Z Potentials"(20260506) | DeepTech深科技(20260512) | 机器人前瞻(20260519) | 具身智能之心(20260601) | 具身智能之心(20260602) | 机器人前瞻(20260602) | AI科技评论(20260602) | 机器之心(20260603) | 具身智能之心(20260605) | 具身智能之心(20260608) | 钛媒体AGI(20260615) | 深度学习与NLP(20260629) | "Z Finance"(20260709) | 雷峰网(20260713) | 机器人前瞻(20260713) | 机器人前瞻(20260721)

资本规模与马太效应

  • 吸金创纪录:2026上半年融资超460亿元,70%流入前20家企业,塔尖5家占37%
  • 独角兽涌现:国内百亿级估值公司近20家,华沿机器人获超购5059倍,云深处冲刺A股
  • 高频吸金:自变量两月融四轮,千寻3月获近50亿;自然意志天使轮估值40亿,跃灵智伴首轮2000万
  • 产业资本入局:大厂与国资在10亿+融资参与率超40%成主力,顺丰领投星动,蚂蚁滴滴领投简智
  • 上游高溢价:灵巧手等零部件均融3.2亿元反超整机2.0亿,真实数据资产构筑高壁垒

技术与商业化双轮驱动

  • 技术底座收敛:VLA与世界模型成底座加速泛化,极佳视界冲刺IPO或成世界模型首股
  • 场景爆发:物流与工业制造优先落地,2026年国内人形机器人出货预计6.25-10万台

家庭具身智能创业方法论(乐享科技)

  • 渐进式代际演进:50cm移动交互→80cm地面操作→1.2m桌面泛化,严守15kg安全底线
  • B端验证切入C端:B端验证单点功能收敛真实需求,已获3万台订单后再切入C端
  • 敏捷迭代机制:团队精简至70人小步快跑,建立硅谷情报机制将落后差距控制在0.7-0.9

情感陪伴机器人标杆对比

  • 珞博智能芙崽:国内累计销近30万台,首推MEM多模态情感与仿生记忆技术栈,造养成感
  • 跃灵智伴:切入3.23亿银发市场,云计算老将带队,首款产品目标销1000台并进军美国
  • 萝博派对:获雷军系加注,依托1.5万原型机大幅降本,主打情感与陪伴交互场景

5.4 新产品形态与巨头战略生态


国内具身智能新势力:产品定位与商业化路径

具身智能之心(20260423) | 甲子光年(20260427) | 机器人前瞻(20260430) | 机器人前瞻(20260723)

国内具身智能厂商商业化路径与战略定位

越疆科技:从协作机器人第一股到具身智能全形态延伸

  • 资本里程碑:2026年7月创业板过会仅用86天,系大湾区首单H股回A;2025年营收4.93亿,2026H1预计翻倍达3.0-3.3亿元,但仍未扭亏
  • 市场与工业底座:协作机器人以13.2%全球份额居首,累计部署超10万台;覆盖15大行业200+场景,拥有10个系列30余款型号
  • 具身延伸战略:以双臂协同为锚点逐步延伸至全身移动操作,已推出Atom人形、Hexplorer六足及X-Trainer双臂等全形态产品,拒绝纯外观堆砌
  • 核心技术壁垒:全球唯一量产安全皮肤(IP68/NSF认证);焊接精度±0.3mm且合格率近100%;在比亚迪产线以0.2μm视觉精度完成装配

千诀科技:跨本体通用大脑路线(机器人安卓系统)

  • 商业定位:不造本体只做大脑,模块化按需交付,已适配7大品类30+子品牌机器人;2026年初完成Pre-A++扩展轮,累计融资数亿元
  • 解耦架构优势:感知与控制独立训练,数据需求呈加法关系,在数据匮乏的具身智能早期阶段,样本效率远胜端到端VLA(乘法关系)
  • 远期目标:采用脉冲神经网络实现神经元级因果推理,从理论上消除AI幻觉,突破Transformer仅做相关性推理的局限

聆动通用:软硬一体化新锐(科大讯飞生态)

  • 资本青睐:成立4个月连获4轮数亿元融资,创下安徽具身领域最高单笔纪录;科大讯飞与讯飞创投多次参投
  • 产品矩阵:LDT系列覆盖采训推全链路,LDB01工业级通用机器人MTBF≥1万小时,已落地高校与公共训练场
  • 模型实力:自研iFlyBot双模型均达SOTA水平;VLM在主流测评达开源最优,VLA以显隐双路径规划在抓取折叠分拣任务突破

核心技术路线对比总结

  • 端到端VLA:数据需求为乘法关系,上限高但及格线数据量极大;紧耦合适配需推倒重来,跨本体泛化困难
  • 千诀解耦类脑:数据需求为加法关系,匮乏阶段率先跑通飞轮;两段式训练保证解耦后性能损失可控

宏观趋势数据

  • 市场预测:IDC预测2030年中国具身智能用户支出将达770亿美元,CAGR高达94%,行业正进入爆发拐点

5.5 学术贡献与垂直领域商业落地


学术生态:从基础研究到产业赋能

机器人前瞻(20260331) | AI科技评论(20260413) | 量子位(20260417) | AI异类弗兰克(20260430) | 机器人前瞻(20260526) | CVer(20260415)

核心学者与产业赋能矩阵

学者学术背景创业公司核心产品与壁垒融资进程
苏昊(复旦)谷歌14.5万引,具身AI华人第一Hillbot(CTO)Alpha机器人(零售/制造),合作英伟达Cosmos未披露
黄碧薇(UCSD)CMU博士,苹果学者原识之智Causal-Copilot(集成20余种因果算法)英诺领投,顺为跟投
高飞(浙大)90后长聘副教授,80余篇论文微分智飞P300导航、非凸-α集群协同一年半6轮超5亿
黄强(北理工)师从加藤一郎,20年仿人积累理工华汇SR-01特种机器人,核心部件全自研近亿元Pre-A

苏昊学术谱系与核心判断

  • 学术轨迹:2002北航本科→2018斯坦福CS博士(导师Guibas)→UCSD教授→2026复旦浩清特聘教授、通用物理AI院长
  • 数据集奠基:主导ShapeNet(300万+3D模型)、PartNet;2008年经沈向洋推荐参与李飞飞ImageNet项目
  • 算法突破:PointNet/PointNet++为首个直接处理点云的深度学习模型,使3D视觉论文占比飙升至70%
  • 核心判断:机器人缺乏低成本数据采集方式,高保真模拟器作为关键基础设施,其价值远高于自动驾驶
  • Hillbot闭环:3D资产降本→模拟器内容丰富→泛化能力增强,底座为SAPIEN模拟器与ManiSkill
  • 师承网络:门下含弋力(清华)、卢策吾(上交穹彻)、王鹤(北大银河通用)

技术演进与商业化路径

  • 因果推理:大模型依赖相关性,在分布偏移(光照/摩擦力)时性能骤降,因果推理是走向通用的关键
  • 产业闭环:理工华汇实现电机、减速器等全自研国产化,军工特种订单破亿;微分智飞老股东含联想、百度风投
  • 知识基建:清华、北大、上交等多校联合推出具身智能行业知识库,含200+企业档案、50+数据集、20+仿真平台

5.6 硬件本体企业盈利模型与商业化


硬件本体企业盈利模型与商业化困境

第一新声(20260330) | 光锥智能(20260331) | 机器人前瞻(20260403) | 硅基观察Pro(20260401) | 机器人前瞻(20260501) | DeepTech深科技(20260609) | AI蓝媒汇(20260612) | 智东西(20260630) | 机器人前瞻(20260702) | APPSO(20260702) | 雷峰网(20260704) | 光子星球(20260708) | 硅星人Pro(20260711) | 量子位(20260717) | 具身智能之心(20260717) | 钛媒体AGI(20260722)

  • 乐聚智能:降价25.6%以价换量(销577台),连年亏损且G端与教育场景依赖度近77%
  • 微亿智造:聚焦EIIR产品线市占31%,研发占29.6%致使营收7.96亿但净利仅0.05亿
  • 普渡机器人:场景驱动部署超13万台多形态矩阵,破百亿估值并抢占具身智能商业化先机

硬件成本与量产鸿沟

  • 量产能力为界:量产能力而非单纯技术是核心护城河,全球尚无情感陪伴机器人规模交付
  • 制造成本极高:全尺寸高仿生达几十万级,面部微关节单价比工业关节贵一个数量级
  • 中国供应链优势:中国BOM约33万,非中国约93万,成本差距近3倍
  • 宇树极致控本:核心零部件全栈自研(外购比仅14%-18%),QDD路线较谐波齿轮降本80%
  • 仓储替代临界:100%遥操保守假设下时薪26.4美元,已低于美国30美元劳力成本
  • 硬件降本受阻:实验室组件转消费级BOM超标,柔性执行器无量产方案

技术演进与上游卡位

  • 产业范式跃迁:从“一机一模”向跨场景“一脑多形”演进,大幅降低边际智能成本
  • 虚实双闭环:仿真扩规模结合真实校准,仅需50条专家数据即可完成新任务适配
  • 数据飞轮壁垒:普渡13万台设备年产3650万小时导航数据,抢占真实世界交互入口
  • 小脑独立理论:空间感知非大模型包办,需独立优化(思岚科技借此卡位已实现盈利)
  • 纯视觉降本:具身时代跳过3D激光,鱼眼单目实现180°球面覆盖兼顾极致成本
  • 技术场景瓶颈:实验室情感识别超90%但复杂场景稳定性差,家务面临非标与触觉数据难题

监管约束与合规挑战

  • 监管核心悖论:拟人化情感交互是核心卖点但恰是监管最敏感区,越“像人”审查越严
  • 防沉迷严监管:办法明确禁止向未成年人提供虚拟亲密关系
  • 强制干预机制:连续使用超2小时须弹窗提醒,合规能力将比技术更快拉开企业差距
  • 新型合规风险:产品“像人”能力越强,越易触发心理操控、隐私采集等严格审查
  • 睡眠场景突破口:家庭生活七成需求在情感,睡眠是唯一可量化身心安抚的合规突破口
  • 安全范式翻转:家庭场景从“高精度控制”转向“低精度本质安全”,无需复杂精度控制

5.7 商业化落地与产品形态


具身智能垂直场景商业化验证与路径

机器人前瞻(20260401) | 机器人前瞻(20260402) | 钛媒体AGI(20260403) | 雷峰网(20260409) | 机器人前瞻(20260418) | 具身智能之心(20260423) | 新智元(20260605)

物流仓储:数据闭环驱动规模化盈利

  • Picking是原子任务:全球仓库日均上亿次真实抓取构成天然的强化学习闭环,能力可向装配、分拣等领域迁移
  • 极智嘉跑通盈利拐点:2025年营收31.71亿利润转正,海外占比超75%,AI订阅订单增速超90%验证商业重构
  • 三个月可验真实ROI:1000万装卸工存量市场,海外月薪达5000美元,渗透率不足1%
  • 避开红海切入高毛利:赛那德瞄准烟草酒水等生产端物流,作业效率达1000+件/时构建先发壁垒

工业制造:轮式构型率先跑通量产

  • 场景适配优于形态炫技:轮式覆盖80%以上物料流转刚需,双足人形在工厂难以兼顾稳定性与效率
厂商/机型核心场景关键指标
智元 A2-W/G23C与汽车产线节拍压缩至18秒,整线成功率99.9%
千寻“小墨”宁德时代电池全球首条规模化PACK产线插接
银河通用 S1宁德时代等轮式重载搬运,延伸零售
优艾智合半导体与电力80台集群日均搬运1.6万次,精度2mm

商用服务:场景驱动反推参数设计

  • 场景驱动设计:享刻按0.9m臂展与5kg负载反推油炸需求,炒温突破220℃,海外百台交付且收入占30%
  • 规模覆盖验证:橡鹿落地7000+门店,投料误差<1%;零次方单月量产百台,覆盖20+地标场所
  • 从单点切入全覆盖:享刻路径从油炸向全动线延伸,零次方以24小时不间断作业匹配客户核心诉求

6. 具身数据采集、部署基建与工程底座


6.1 数据采集与基建


具身数据采集体系演进与数据价值验证

智能涌现(20260330) | 机器之心(20260331) | 具身智能之心(20260402) | AI科技评论(20260403) | DeepTech深科技(20260408) | 机器之心(20260410) | 量子位(20260413) | 机器人前瞻(20260414) | 具身智能之心(20260415) | 新智元(20260416) | 机器之心(20260416) | AI科技评论(20260416) | 量子位(20260416) | 机器人前瞻(20260416) | Z Potentials(20260417) | 机器之心(20260417) | AI科技评论(20260417) | 甲子光年(20260417) | 具身智能之心(20260419) | 具身智能之心(20260420) | 硅星人Pro(20260427) | 数据猿(20260507) | DeepTech深科技(20260507) | 前沿在线(20260507) | AI科技评论(20260508) | 具身智能之心(20260508) | 具身智能之心(20260509) | AI科技评论(20260509) | 具身智能之心(20260510) | 数智前线(20260511) | AI科技评论(20260717)

数据供需瓶颈与多样性准则

  • 物理数据极度稀缺:优质真机数据不足大模型两万分之一,全球存量仅50万小时,缺口超99%
  • 高质量数据价值验证:400条高质量真机数据效果远超1300条低质数据,Sim-to-Real成功率从89.4%骤降至12%
  • 黄金准则:数据多样性大于规模,覆盖5万个场景远比10万小时同质化数据有价值
  • 同质化陷阱:底层供应链同源的众包模式易致二手数据反复采集,引发模型过拟合
  • 家庭场景核心:工业固定场景无需Ego数据,家庭等复杂多变场景才是通用模型训练关键
  • 多样性维度:必须覆盖真实场景、多样任务动作、不同物体工具、差异化人员环境

多源采集体系与商业化格局

  • Ego数据分层特征:通用层规模大成本低(50万小时预训练破99%);真机微调层精度高但成本超500元/时
  • 采集设备创新:无本体设备成主流,突破生理极限(如Gen DAS Dex);EgoScale首发帽子双目设备(续航10小时)
  • 高效运营闭环:EgoScale不到20人全职管理月均1500人次,有效采集率达80%(行业普遍仅10%-50%)
  • 全栈数据交付:含双目影像、IMU、标定参数及动作切分等,最大痛点为客户格式不统一
  • 中立性原则:做数据兼做模型易引发泄露担忧,绝对中立是构建全链路数据资产的核心护城河
  • 产业基建爆发:第三方数采中心受追捧(全国规划64座),“卖数据”比卖本体率先盈利

数据引擎认知与市场生态洗牌

  • 市场规模与门槛:全球年预算超10亿人民币客户约5家;国内能规模化交付Ego数据的公司不足5家
  • 行业洗牌预期:预计年底中国与海外各仅剩约5家Ego数据公司能持续运营
  • 失败数据重估:边际价值最高的是“失败→纠正→成功”负样本轨迹,驱动模型探索策略边界
  • 数据编译替代标注:技术驱动编译解决视觉(30Hz)与控制(500Hz)异步,实现毫秒级时空戳对齐
  • 闭环飞轮确立:从被动交付(Data Factory)升级为反馈驱动的数据引擎(Data Engine)持续迭代
  • 大规模开源:戴盟开源1万小时全模态触觉数据集,蚂蚁灵波开源2.71TB深度数据集突破透明材质瓶颈

6.2 具身系统框架与平台基建


具身智能操作系统架构与平台化基建

AI科技评论(20260401) | 前沿在线(20260403) | 具身智能之心(20260407) | 具身智能之心(20260413) | AI科技评论(20260422) | 雷峰网(20260427) | AI科技评论(20260429) | 硅基观察Pro(20260519) | 特工宇宙(20260628)

|---|---|---|---|
| PhyAgentOS | 中山大学HCP | Markdown协议化OS,替代黑盒 | 11岁开发者夺冠;部署周期压至数小时 |
| Agentic OS | 拉格朗日 | 系统中间层,解决跑不稳难题 | 不做模型与硬件,专注工程化系统 |
| Genie Studio | 智元机器人 | 零代码任务编排与部署平台 | 封测成功率99.999%+;无故障>168h |
| RoboGo | 地瓜机器人 | 全链路云端开发与算力底座 | POC降至100万;训练3.7元/小时 |

架构设计与协议化创新

  • 文档即接口:PhyAgentOS用六层Markdown协议(如TASK.md、ENVIRONMENT.md)取代VLA黑盒,云端LLM生成几何约束而非关节角度
  • 零代码编排:Genie Studio将VLA、强化学习、运动控制等能力模块化重组为可调用组件,拖拽节点+配置参数即可完成任务编排
  • 系统中间层:Agentic OS填补认知输出与物理执行鸿沟,将分散模型能力组织为可部署、可运维的工程系统
  • 具身原生范式:原力灵机提出数据、训练、架构三维原生,要求智能机制与物理交互深度不可分割,全栈开源DM0等三款产品

算力基建与开发降本增效

  • 边缘算力跃升:RDK S600单板覆盖仿真部署全链路,Mujoco四足仿真突破400FPS(常见上位机不足10FPS),脱离PC独立调试
  • 环境标准化:RoboGo将系统与算法预打包为镜像,基于Ubuntu底座,消除版本协作摩擦,环境搭建从数天压缩至5分钟
  • 数据云端直连:预置TB-PB级常用数据集云端直连,消除大带宽数据集(如44TB需40+天)搬运成本
  • 闭环能力进化:从单轮推理转为观察-判断-动作-再观察的持续交互,上线后通过力控与视觉反馈持续优化动作精度

行业演进关键洞察

  • 瓶颈转移:产业化卡点不在模型规模,而在系统层组织架构与可运维的闭环执行能力
  • 链路完整度:边缘算力从够用进入好用区间,评估开发平台应优先关注仿真到真机的全链路完整度
  • 仿真先行验证:三维场景重建与数字环境预演结合真机强化学习,将传统数周调试压缩至小时级

6.3 VLA开源工具与工程底座


VLA开源工具与工程底座

具身智能之心(20260413) | 新智元(20260413) | 具身智能之心(20260417) | 机器之心(20260509) | 具身智能之心(20260513) | 量子位(20260513) | AI科技评论(20260612) | 新智元(20260708)

VLA落地瓶颈已从单点算法转向全链路工程贯通,预训练解决“广泛知道”,后训练解决“具体会做”,标准化工程底座更具落地价值。三大开源底座核心信息:| 底座名称 | 核心定位 | 关键数据与特性 ||---|---|---|| StarVLA(港科大) | 乐高式架构统一VLA研发 | GitHub 2.2k star;LIBERO 30K步收敛(98.8%);256卡并行效率80% || FluxVLA(逐际动力) | 数据-训练-仿真-真机全链路 | 聚焦统一接口与隔离环境,抹平格式转换与物理执行断裂带 || LingBot-VLA 2.0(蚂蚁) | 极低门槛真机部署 | 8卡预训练,吞吐261 samples/s(1.5~2.8倍主流);4090推理延迟<130ms |StarVLA:统辖四大解码范式的框架

  • 极简与高效:Backbone换组件仅需改配置;LIBERO训练步数较前人减少6倍
  • 跨基准泛化:联合训练4大基准,RoboCasa成功率从Specialist最优48.8%提升至57.3%
  • 四大动作头:离散token自回归、轻量并行回归、流匹配去噪、双系统推理底层统一LingBot-VLA 2.0:跨本体泛化与核心升级
  • 构型与数据扩充:预训练扩至5万小时+1万Ego数据;覆盖单臂到人形20+构型,横跨17个品牌
  • 55维全身协同:升级全身控制器(臂28维+交互14维+躯干头6维+底盘3维等),实现底盘移动与双臂操作同调
  • 双查询蒸馏:单目RGB隐式重建三维几何,无需挂载深度网络;深度版在接触密集任务超越π0.5
  • 预判式控制:DINOv3+3D-RoPE,500万段视频训练时序预测,LARYBench四基准中三项最佳真机部署与生态验证
  • 双足人形闭环:乐聚KUAVO 4 Pro作为唯一双足平台跑通闭环,过程得分36.22%比π0.5高9.87个百分点
  • 工具链低门槛:开源后训练全链路,150条示教即可完成新机器人适配;ICRA 2026挑战赛中全球学生一天内跑通真机部署

6.4 数据采集硬件、模态与感知设备


感知硬件、触觉传感器与新型交互界面

新智元(20260331) | 量子位(20260404) | 机器之心(20260413) | 机器之心(20260418) | DeepTech深科技(20260419) | DeepTech深科技(20260424) | 具身智能之心(20260507) | 机器人前瞻(20260507) | DeepTech深科技(20260518) | DeepTech深科技(20260522) | DeepTech深科技(20260531)

方案/系统机构/公司核心技术关键数据与指标
SuperTac仿生皮肤清华大学多光谱融合+摩擦电传感1mm厚感知10维信息,材料成本<1美元
纤维传感器矩侨工业三明治结构解构为可编织纤维折叠半径<0.1mm,成本降至传统1/5
热缩共形电子皮肤中科院/天大Cu-EGaIn半液态金属丝网印刷57-70.6°C加热包覆,5000次弯曲稳定
毫米光场力传感器上交大单一光纤传输+AI光场解码外径1.7mm,扩散模型生成10万合成图
柔性多模态电子皮肤途见科技可拉伸纤维材料400传感器/cm²,拉伸>100%,接近觉20cm
CoinFT力觉传感斯坦福介电层电容变化+神经网络单只10美元,360Hz采样,误差0.15-0.58N
视触觉传感器戴盟机器人表面形变转为视觉图像11万感知单元/指尖,兼容现有VLA框架

柔性电子皮肤材料突破

  • 多模态集成:清华SuperTac集成10种感知(力、温度、纹理等),盲文识别100%,灵敏度超越人手
  • 共形包覆:中科院/天大利用半液态金属加热即紧密包裹任意曲面,导电性较纯液态金属提高30%
  • 可编织纤维:矩侨将传统平面结构解构为纤维,像布料般任意折叠揉搓不损伤性能
  • 产业资本加速:途见科技(斯坦福背景)累计融资超亿元,建成2000平米自动化产线投产

数据采集与力觉系统演进

  • 力触觉成核心模态:纯视觉工业泛化率仅25-30%,开普勒VTLA引入力触觉后装配成功率达99.4%
  • 穿戴式采集爆发:帕西尼82DOF+30个六维触觉(3015点),同步延迟<5ms,效率为传统遥操作3-6倍
  • 低成本数据采集:斯坦福UMI-FT用iPhone视觉+指尖CoinFT融合,开源软硬件,采集200-630组柔顺力控数据
  • 交互范式革新:上交团队水凝胶薄膜利用湍流调控湿电效应,无电池隔空8cm手势识别,仅需~20样本达99%准确率

6.5 具身感知与3D/多模态表征


具身多模态感知与3D/多模态表征学习前沿

量子位(20260404) | 具身智能之心(20260405) | PaperWeekly(20260406) | 机器之心(20260401) | 机器之心(20260408) | 机器之心(20260408) | CVer(20260409) | 机器之心(20260411) | CVer(20260412) | 新智元(20260414) | CVer(20260414) | CVer(20260428) | 机器之心(20260505) | 机器之心(20260506) | AI科技评论(20260507) | 机器之心(20260515) | 极市平台(20260529) | AI科技评论(20260602) | DeepTech深科技(20260702) | 钛媒体AGI(20260705)

触觉感知与多模态融合

  • 视觉-触觉数据与模型:哈工深EgoTouch(超200万帧),TouchAnything多视角输入Contact_IoU提升15.4%
  • 触觉频率错配解决:T-Rex诊断视觉(5Hz)与触觉(20Hz)冲突,采用MoT架构使操作成功率从6%升至65%
  • 触觉范式与综述:VTLA架构指尖达11万+感知单元;港科大系统梳理感知、跨模态生成、交互三大触觉范式

3D表征与占据预测

  • 开放词汇占据预测:LegoOcc引入语言嵌入高斯,仅用二值标签即在Occ-ScanNet达21.05 mIoU
  • 零样本占据建图:FreeOcc实现无训练跨数据集迁移,ReplicaOcc上IoU达55.65%

动态SLAM与状态估计

  • 动态SLAM抗扰:DROID-W引入动态不确定性至稠密BA,室外轨迹误差降超84%(至23cm),RTX 5090达30FPS
  • 滤波优化重构:NANO滤波器采用变分优化与自然梯度,使人形机器人位置误差降低约74%

物理驱动与4D/视频生成

  • 3D世界模型交互:Hand2World解耦相机运动,闭环生成视频FVD从908降至218(降幅76%)
  • 单图物理4D生成:PhysGM融合偏好微调与MPM引擎,1分钟内实现单图到4D,较SDS提速两个数量级

热红外与弱小目标感知

  • 热红外物理分割:TherNet融合四大物理模块建模;RTPSeg引入红外结合可见光与点云,夜间提升1.45%
  • 红外弱小时序检测:DeepPro将检测转化为一维时序异常,检测率达95.84%,推理184FPS

V2X协同与无人机定位

  • V2X无监督检测:CPD++动静分离机制,无监督3D检测AP达89.25%
  • 无人机自主定位:PiLoT无需GNSS实现10km飞行误差仅1.374m,边缘端推理25-30FPS

艺术与多模态升级

  • 2D转3D艺术建模:Art3D将视差图升级为艺术表达载体,突破纯几何生成的艺术剥夺瓶颈

6.6 评测基准、数据集与具身Agent框架


具身评测基准、数据集与生态基建

甲子光年(20260401) | 具身智能之心(20260403) | 机器人前瞻(20260403) | 智东西(20260403) | 具身智能之心(20260415) | 极市平台(20260417) | 极市平台(20260430) | CVer(20260511)

  • 真机评测取代仿真成共识:EAIDC 2026首次系统性搭建真机评测体系,上百条机械臂同时运行,将泛化能力从附加项变为核心指标
  • 混合数据范式破解采集困境:智象未来×诺亦腾首创“真实采集+生成式放大”路线,以高质量动捕数据为种子,利用生成模型进行百倍规模扩充

核心数据集与评测基准全景对比

数据集/基准规模与定位核心特性与突破
PhysInOne200万视频/15.3万场景全球最大物理AI数据集(CVPR 2026),覆盖71种物理现象,提出PMF指标量化视频物理合理性
InternScenes4万场景/196万物体规模最大可交互室内数据集,20%物体支持关节交互,适配具身导航与交互学习
Vlaser-6M600万训练样本覆盖QA、定位、规划、空间四类子集的VLA综合训练数据
RH20T11万序列/40TB聚焦接触密集型操作,融合RGB+深度+力觉及200Hz高频触觉
10KhRealOmni1万+小时采集3000+真实家庭场景,支撑无本体通用技能学习
TVL4.3万+组样本实现DIGIT触觉、视觉与语言的跨模态精细对齐
HoloAssist169小时交互第一人称视角,350对指导者-执行者配对远程协作
HM3D1000高精度扫描具身导航数字孪生,无缝适配Habitat仿真平台

通用具身模型GEN系列性能跨越

维度GEN-0GEN-1
预训练数据27万小时50万小时(可穿戴设备采集,0机器人数据)
任务平均成功率64%99%
折叠纸盒耗时~34秒12秒
单任务适配数据未公开仅1小时机器人数据
突发应变能力自主恢复+双手协同
连续作业能力需人工干预连续折叠86件T恤/分拣超1小时

6.7 具身大规模开源与多模态数据集


产业级大规模具身数据集开源实践

具身智能之心(20260401) | AI早餐汇(20260416) | AI早餐汇(20260417)

开源数据集概况

  • 智元 AGIBOT WORLD:全球首个覆盖具身全域研究的开源数据集,100%真实环境采集
  • 京东 EgoLive:首期开源1680小时,覆盖300+任务、650K样例,60 FPS高清格式
  • 场景全覆盖:数据源自零售、物流、商业、家居及安防等真实产业环境

百倍数据缺口与女娲计划

  • 核心痛点:泛化大模型需千万小时数据,现有开源仅几十万小时,面临场景单一、跨本体迁移难
  • 女娲计划:京东投入10万+内部员工与50万+外部人员,目标两年内采集千万小时级视频与百万小时本体数据

三层数据金字塔架构

层级数据类型作用局限
底层千万h级互联网视频预训练基座,量大成本低无标注、无场景指向
中层百万h级真实人类实操提升模型能力的关键核心采集成本极高
顶层机器人本体遥操数据强绑定硬件,用于落地适配跨本体迁移困难

采集方法论与自动化标注

  • 全身控制(WBC):智元实现机械臂、腰部、手部统一协同,取代传统硬件拼接方案
  • 超视距遥操作:数采员跨地域第一视角控制,结合力控采集记录真实接触反馈
  • 三步标注管线:京东自研语义分割+几何优化+手势标注,准确率达95%
  • 纠错轨迹保留:智元利用DaaS工业质检清洗,完整保留错误修正轨迹以学习自主纠错

仿真闭环与跨本体突破

  • Real2Sim2Real闭环:京东利用反向渲染撬动合成数据,智元提供数字孪生仿真环境
  • UnifyTips单模型:兼容灵巧手与夹爪等多种执行器,解决跨本体映射难题

模型验证与性能基准

  • JoyAI-RA1.0:京东世界动作模型,任务成功率高达73.5%,仿真与真机性能优于NVIDIA GROOT N1.6等头部模型

BeTTER基准揭示:顶尖VLA模型95%+成功率是

具身智能之心(20260422)

  • 顶尖VLA模型成功率是模仿幻觉:北大清华联合发布BeTTER基准,证实GR00T-N1.6等SOTA模型缺乏真正具身推理能力
  • 因果干预分离失败:10个基础任务延伸60个变体,记录特权状态实现精细化失败归因,排除执行误差
  • 指令理解依赖伪相关:GR00T-N1.6空间指令准确率100%,语义指令骤降至5%,强行绑定颜色与动作原语
  • 组合泛化全面失效:训练A→B与A→C表现优异,测试B→C新组合时所有模型成功率暴跌40%~52%
  • 细粒度辨别能力丧失:对抗性视觉相似干扰物导致脱离固定布局后,抓取错误率高达20%~30%

BeTTER基准四大因果干预维度

干预类型测试目标典型操作
空间布局偏移空间泛化能力改变物体位置与相对关系
动作原语重组零样本组合能力训练A→B、A→C,测试B→C
对抗性物体扰动语义grounding视觉相似、语义不同物体替换
时序外推因果状态追踪改变初始状态、拉长任务流程

VLM向VLA转化的系统性退化因素

退化因素具体表现
容量压缩8B压缩至2B满足端侧算力,语义与时序能力跳水
训练不对称传感器运动特征挤占表征空间,高级推理无法恢复
感知近视约束高分辨率图压缩为224×224,丢失细粒度信息
  • 改进方向明确:消融实验指明保留语义表征在分布外场景显著优于纯动作训练模型

6.8 具身多模态数据集全景与生态


具身多模态数据集全景与生态基建

量子位(20260331) | 具身智能之心(20260401) | 前沿在线(20260408) | 具身智能之心(20260410) | 极市平台(20260410) | 具身智能之心(20260723)

|---------|------|----------|-----------|
| AgiBot World | 100万+轨迹 | 217项/5大场景 | 智元G2采集,6类多模态传感 |
| EgoWorld-100W | 100万+条Ego数据 | 全场景覆盖 | 星际硅途发布,主打人员/环境最高多样性 |
| LingBot-Depth | 2.71TB/300万对 | 住宅/医院/电梯 | 专注虚实融合的深度补全,已达SOTA |
| RoboMIND | 10.7万片段 | 479项任务 | 跨4种主流机器人形态 |
| DROID | 7.6万轨迹 | 86任务/564场景 | 跨3大洲采集,具极高环境多样性 |
| RT-1 | 13万轨迹 | 多样任务 | 覆盖13种不同机器人平台 |
| OmniVTA | 2万+轨迹 | 5场景/6类触觉 | 最大视触觉对齐数据集 |
| WIYH | 1000+小时 | 10场景/40+长程 | Ego-centric视角,3D动作标注(误差5-8mm) |
| LIBERO | 1693片段 | 40任务 | 仿真环境构建,提供四维正交评测 |

采集方法与质量管控

  • 全身控制(WBC):智元统一机械臂/腰部/手部协同,升级为完整物理行为数据
  • 超视距遥操:DROID用Quest 2跨3大洲采集,智元支持跨地域第一视角遥操
  • 力控与纠错:保留真实力反馈支持柔顺操作,完整保留纠错轨迹赋予模型纠错力
  • 工业级质检:引入DaaS多轮清洗流水线,保障高质量开源数字孪生数据

多模态感知与生态趋势

  • 传感补盲:LingBot-Depth解决透明/反光表面致深度相机失效问题
  • 触觉闭环:OmniVTA构建视触觉世界模型,从被动感知迈向主动预测与闭环
  • 虚实融合:LingBot真实140万对+仿真100万对混合,解决长尾场景问题
  • 格式双雄:RLDS格式(Google系)与LeRobot格式,兼容性成社区采纳门槛
  • 飞轮闭环:采集→优化→部署→回流,突破“不成熟难部署”的困境
  • 2026质量元年:数据质量取代数量成核心,质量管控对性能贡献大于架构调优

6.9 端侧AI算力架构:感算一体与光计算


感算一体与光计算:端侧AI算力新架构

智东西(20260408) | 具身智能之心(20260408) | DeepTech深科技(20260501) | DeepTech深科技(20260504)

感算一体架构:原理与突破

  • 核心思路:在数据产生位置即完成计算,将物理信号转化为紧凑语义特征
  • 链路优化:消除传统串行架构中70%+的数据搬运开销
  • 效率破局:使毫秒级响应、极低功耗、低成本三者不再对冲
  • 产业化瓶颈:需算法、芯片、传感、系统、场景全链路工程化协同打通

前沿器件突破(中科大)

  • 技术突破:单二极管首创同时具备光感知、存储和计算(发表于Nature Electronics)
  • 识别提升:FMNIST图像经原位去噪后准确率从不足60%升至超95%
  • 工程验证:10×10阵列集成,3000秒稳定性测试电流波动<1%,8个线性电流状态
  • 商业潜力:CMOS工艺兼容,已有企业接洽用于机器人视觉应用

光计算演进路径

  • 驱动因素:Agentic AI要求AI走向感知-规划-执行的任务闭环
  • 阶段规划:中期以光电加速卡切入矩阵密集计算,长期重构整体计算链路
  • 性能优势:在能效和速度上具备3-6个数量级提升

端侧算力商业矩阵(地瓜机器人)

产品线场景定位算力(TOPS)状态
X系列泛机器人消费级5~1003/5量产,旭日7年底发布
S系列具身智能/人形560(INT8)S600头部客户合作中
RDK套件软硬协同生态10~100已发布
  • 商业爆发:2025年出货量增180%,累计超500万片,覆盖400+企业
  • 生态规模:全球超10万开发者覆盖20余国,60+生态伙伴共建
  • 资本加速:B轮累计2.7亿美元,定位为长期价值共同体
  • 产品策略:只做通用芯片不接定制,支持一脑多形多场景适配

7. 前沿技术突破与评测基准


7.1 赛事与评测


具身智能赛事与评测体系全景

量子位(20260331) | 机器之心(20260401) | 机器人前瞻(20260401) | 具身智能之心(20260403) | 智能涌现(20260403) | AI前线(20260405) | 量子位(20260410) | AI科技评论(20260410) | 机器之心(20260410) | 具身智能之心(20260410) | Z Finance(20260410) | 机器人前瞻(20260410) | 具身智能之心(20260413) | 具身智能之心(20260417) | 机器之心(20260417) | PaperWeekly(20260417) | 机器人前瞻(20260420) | 具身智能之心(20260421) | 具身智能之心(20260424) | 量子位(20260521) | 具身智能之心(20260605)

  • 真机赛事成为「具身界图灵测试」:顶级赛事均采用全链路闭环考核,彻底肃清行业预设程序的「摆拍」演示文化

主流赛事全景对比

赛事/基准规模与形式核心技术特征
EAIDC 202672-96小时极限全流程,提供100+ PFLOPS算力将6个月搭建压缩至3天,A/B榜揭示环境泛化断崖痛点
RoboChallenge Table30超7万次真机实测,18家头部企业入驻唯一真机高考,覆盖30项标准化任务,终结碎片化技术路线之争
Benjie's Olympics机器人终极挑战赛星动纪元击败美国PI包揽3项第一(剥橘子、开锁、翻袜子)
ATEC 202636万美元奖金,线上仿真+香港户外实景考核长时序连续闭环任务的真实环境抗扰动能力
ManipDojo (ICRA)基于双臂仿真与云端平台重点考察VLA与RL融合及长时序决策
LARYBench120万标注视频,151种动作,11种平台美团发布,发现通用视觉编码器物理还原能力优于专用模型
  • A/B双榜揭示泛化痛点:固定环境A榜成绩可达60%-100%,但引入光照和物体随机扰动后B榜断崖式下降,证明短周期微调无法带来真泛化
  • 多任务能力呈断崖式衰减:单任务冠军在跨任务场景下成功率大幅缩水,神秘模型Atlas以39.67%登顶多任务赛道,暴露通用操作能力瓶颈
  • 具身原生路线打破模型参数迷信:原力灵机DM0模型仅2.4B参数即登顶RoboChallenge(64.33%成功率,30项任务中17项SOTA),超越参数量更大的模型
  • 多源异构数据联合预训练:首次将机器人操作数据、智驾数据、互联网数据同模型联合训练,分别提供操作技能、空间理解与语义推理,跨本体统一输出「操作意图」
  • 物理空间思维链提升稳定性:将CoT延伸至物理世界,形成「感知→空间推理→决策→动作」闭环,大幅提升长程连续任务成功率
  • 评测驱动商业化系统级闭环:技术焦点从单点模型能力转向「数据→训练→软硬协同部署」全栈工程,成熟的评测体系已成功打通优衣库、宁德时代等头部企业商业化落地

7.2 核心零部件与机器人硬件融资


核心零部件融资与技术突破:从触觉传感到轴向磁通电机

机器人前瞻(20260330) | 机器人前瞻(20260408) | 机器人前瞻(20260421) | DeepTech深科技(20260426) | 甲子光年(20260630) | 机器人前瞻(20260710) | 新智元(20260717)

  • 灵猴机器人(执行器):7个月完成4轮融超5亿,2025年具身订单破2亿,近2000台整机交付覆盖800余家客户,红杉与智元入局
  • 泉智博(关节模组):3年8轮融超6亿,无锡基地单台90秒自动化率85%,2025出货超10万台,直供乐聚、松延动力
  • 来福谐波(减速器):港股IPO募11.5亿港元,自研δ齿形价格仅海外一半,向关节模组转型收入暴增超2200%
  • 他山科技(触觉传感):获B轮数亿元,自称占赛道80%份额;TS-F指尖传感器已被强脑、因时等头部厂商采用
  • 灵动佳芯(柔性传感):获近亿A轮(字节锦秋领投),打通PVDF材料到专用芯片全栈,2025出货超1000万只

触觉传感器:从选配转标配的关键节点

  • 技术突破:他山科技推高泛化数据采集指套直击数据痛点;灵动佳芯实现材料到芯片全栈自研
  • 资本加速:均胜、奥克斯等跨界产业资本入场,触觉算法及应用2025年Q4起陆续落地
  • 团队背书:核心团队源自清华与曼大,2019年联合成立全球首个AI触感实验室

稀土磁材:量产不可替代的物理瓶颈

  • 高量刚需:单台需3.5-4kg钕铁硼永磁体(约新能源车两倍),受晶体动力学限制不服从摩尔定律
  • 产能危机:分离精炼中国占90%份额,若年需亿台需扩产186倍,2028年后将转为产能争夺

轴向磁通电机:扁平结构的降维商业革命

  • 性能优势:扁平盘式结构使体积减1/3,扭矩密度20Nm/kg,功率密度10kW/kg,效率达97.5%
  • 高维切入:从光刻机纳米级控制、外骨骼(2026量产)切入,逐步降维至汽车轮毂电机及家电
  • 量产战略:深圳小象累计出货近7万台,建全球首条15万台产线,丰田华为比亚迪等已对接

7.3 机器人硬件与形态创新


机器人构型创新:模块化自组装与极限群控验证

DeepTech深科技(20260413) | Z Potentials(20260415)

模块化自组装机器人(西北大学·PNAS)

  • 硬件架构:62cm球形关节模块,集成电池与传感器;双模块435种连接位点,五模块达千亿级构型
  • 构型搜索:VAE压缩至8维空间,异步贝叶斯优化与深度强化学习联合筛选最优设计
  • 敏捷与损伤适应:统一控制策略覆盖正常运动与断腿场景,未受损时速度达专家策略105.3%

单模块核心运动指标

指标数值
滚动速度0.46 m/s
功耗0.38 W
原地转弯55°/s
跳跃高度37 cm(腿长1.54倍)

极限群控验证(魔法原子·苏超)

  • 协同规模:200台四足+90台人形,全球已知最大规模户外异构群控
  • 四重极限叠加:4万人通信干扰、雨天湿滑草坪、异构运动学协同、直播零容错
  • 分布式架构:去中心化调度消除单点故障,抗干扰通信支撑近300台设备稳定运行
  • 全栈自研闭环:525N·m扭矩关节模组,防滑足垫配合力反馈实时调节落脚策略
  • 部署提速:从春晚30天定制部署压缩至苏超7天可复制交付

综合洞察

  • 性能与模块化兼得:PNAS首次证明模块化重构不牺牲敏捷性,打破传统设计权衡
  • 系统鲁棒性决定落地:多不利条件叠加下的稳定表现直接决定商业部署能力
  • 能力可迁移性:群控验证能力可从演艺表演迁移至应急响应、工业协同等场景

仿生肌肉驱动:从流体致动到电流体纤维的技术演进

DeepTech深科技(20260412) | 小互AI(20260423) | DeepTech深科技(20260425) | DeepTech深科技(20260510)

  • 流体极致降本:Clone基于McKibben肌肉打造24自由度仿生手,单指抓力7kg,耐久超65万次,材料成本低于2800美元。
  • 电流体闭环突破:MIT将EHD泵内嵌McKibben执行器形成全封闭液路,22g举4kg,功率密度50W/kg,彻底消除外挂设备。
  • 预压攻克电短路:施加75kPa偏置压力有效抑制气泡,耐受电压从4kV跃升至8kV+,收缩幅度由2%提升至14-20%。
  • 模块化乐高组装:4泵并联实现180mm/s极速收缩,0.13秒单次动作,电驱动与液压可自由并联扩展。
  • 材料级运动编程:哈佛RM-3DP结合液晶弹性体(LCE),在100μm纤维内精确编程弯曲与扭转比例。
  • 同形异构免组装:外观相同的纤维因LCE分布不同可呈相反形变,将运动逻辑下沉至材料微观结构。
  • 多路线演进:Clone主攻流体极致降本,MIT突破电流体闭环,哈佛攻克材料级运动编程,共同挑战伺服电机垄断。

仿生肌肉核心技术路线对比

路线核心机制关键性能核心优势
Clone流体McKibben肌肉+液压阀阵列24自由度,单指7kg,耐久65万次高仿生度,成本极低(<$2800)
MIT电流体EHD泵+McKibben封闭液路22g举4kg,50W/kg,收缩率20%完全静音,无外挂设备
哈佛RM-3DP旋转多材料3D打印+LCE100μm纤维可编程预测形变几何可编程,一步免组装成型
首尔大学LCELCE+液态金属通道具备本体感受能力驱动与感知一体化

工程化应用前景

  • Clone全身产品含124块人工肌肉,已获超100份订单,涵盖面包店、草坪护理等行业。
  • MIT电流体纤维柔软安全,可编织进衣物,有望从底层架构终结伺服电机垄断。

新形态机器人产品化:轮足融合与算力上装

具身智能之心(20260331) | 机器人前瞻(20260423)

  • 中美机器人存在产品代差:波士顿动力前团队的RAI Roadrunner仍处技术展示阶段(15kg轮式双足),逐际动力TRON系列已领先两代并实现商业量产。
  • 逐际动力量产领先:TRON 1销往全球80余国(起步价7.98万元),TRON 2支持手脚共用与轮足臂重构(起步价<5万元)。
  • 算力背包解决端侧推理:星源智BotPack系列不足2.5kg,支持PI 0.5等VLA/VLM模型本地闭环运行,消除网络延迟影响。
  • 跨本体通用算力平台:已与智元精灵G2大批量出货,三年订单不低于五亿元,复用本体电源且支持无损快拆。

轮足与算力产品成熟度对比

产品状态核心形态价格
RAI Roadrunner技术展示轮式双足,三步态跨障切换未公开
逐际动力 TRON 1已量产,销往80余国点足/双足/轮足三形态融合7.98万元
逐际动力 TRON 2已投产交付手脚共用,轮足臂统一可重构<5万元

端侧算力背包配置对比

型号算力内存容量定位场景
BotPack B52070 TFLOPS128GB LPDDR5X家用大模型本地部署
BotPack B41200 TFLOPS64GB LPDDR5X商用基础推理

7.4 灵巧手与末端执行器


灵巧手产品矩阵与前沿结构创新

量子位(20260412) | 机器人前瞻(20260415) | DeepTech深科技(20260417) | AI科技评论(20260418) | 机器之心(20260420) | 机器人前瞻(20260420) | 钛媒体AGI(20260426) | AI早餐汇(20260429) | 智东西(20260604) | 光锥智能(20260713)

| 灵心 | Linker Hand | 7~42全覆盖 | 370g/30kg | 塑料关节399元,全价格带覆盖 |
| 强脑 | Revo 3 | 21 | 全直驱 | 可反驱弥合sim-to-real迁移gap |
| 临界点 | OmniHand 3 | 22+3 | <500g/5kg | 首创内置张紧,腱绳快拆<10分钟 |
| 曦诺 | Flex 2 | 23(19+4) | 400g/12kg | 混合驱动:后置腱绳+指尖直驱 |
| 源升 | Apex Hand | 21 | - | 误差≤0.1mm,类脑式万级触觉 |

量产梯队与产能格局

  • 产能第一梯队:灵心月产4000台居首,强脑2500台次之,因时约800台
  • 交付规模:临界点累计交付超8000台灵巧手与过万台夹爪,稳居市占前列

商业化与估值博弈

  • 极端估值倒挂:灵心目标估值60亿美元超2030全球市场预测,25年Q4营收暴涨25倍至2.5亿
  • 应用场景错位:整机厂多倾向二/三指夹持器,灵巧手实际需求覆盖率仅10%-30%
  • 降价破局:灵心核心零部件全自研降本60%,工程塑料替金属使减速器降至数十元

驱动架构演进趋势

  • 自由度甜点位:21自由度能稳定复现精细动作(如盘珠子),超此边际收益递减且控制恶化
  • 驱动后置轻量化:特斯拉V3将25个驱动全置前臂;摒弃销钉采用复合柔性部件(强度>895MPa)
  • 混合驱动架构:曦诺Flex 2以后置腱绳提供大出力缓冲,指尖微型直驱保证高精度快响应
  • 绳驱工程化:临界点首创内置张紧防松弛,自研300N微型电缸,破解绳索蠕变磨损痛点

多模态触觉感知创新

  • 帕西尼(霍尔):自研封装解磁干扰,单颗199元击穿底价,年产百亿条数据
  • 源升(类脑):万级触觉点,1000Hz刷新率,通讯延迟<1ms
  • 视觉融合:强脑与临界点引入全掌阵列+亚毫米指尖视觉,补齐视觉盲区

前沿仿生结构创新

  • 仿生爬行手:武大受章鱼启发研发可脱落手,脱离变五/六足机器人,覆盖人类33种抓取模式
  • 平台生态:灵心Linker大模型闭环自然语言至物理执行,对标英伟达开放技能商店API

7.5 评测基准与评估范式


仿生软体机器人主动形变防护骨骼系统(Science Advances 封面)

DeepTech深科技(20260601)

  • 仿生主动防护系统:北卡州立大学朱勇团队受三带犰狳启发,提出形变互锁防护模块(MIPM),在单一结构实现柔性与刚性防护的按需动态切换
  • 感知-驱动闭环响应:系统检测到威胁后自主蜷曲为刚性闭合球体,将防护从静态权衡推进到动态可切换范式,发表于 Science Advances 封面
  • 零能耗刚性维持:硬化后依靠磁吸与内骨骼互锁维持,无需持续供能;100次热驱动循环后性能稳定
  • 折纸式连接界面:将大形变分解为局部微小转动,有效解决刚柔界面脱粘难题
  • 承载能力验证:10个节段鳞片的内骨骼互锁后可承受约10N集中载荷,验证了刚性骨架的力学性能

三层功能协同架构

层级材料核心功能/性能
外骨骼3D打印光固化树脂弧形鳞片蜷曲时沿曲面连续贴合,提供全覆盖防护
内骨骼折纸+刚性聚合物节段鳞片节段互锁咬合形成刚性骨架,10节段承受约10N载荷
感知驱动层四层复合材料叠合感知威胁→驱动变形→闭环响应

感知驱动层四层复合机制

层次材料致动机制
人工肌肉层液晶弹性体(LCE)加热收缩>20%,驱动整体弯曲
传感层银纳米线(AgNW)网络形变致电阻变化触发信号,阈值可调
差异应变层聚酰亚胺(Kapton)薄膜与LCE收缩形成膨胀-收缩双层致动
加热层导电织物焦耳热激活,分布式可编程加热
  • 多模态评估验证:支持滚动、抓取等多模态变形与蓝牙无缆操控,验证了软体机器人在复杂任务中的评估范式突破

禾赛科技:从空间感知到空间智能的三层基础设施布局

机器人前瞻(20260421)

  • 战略升级:禾赛从“空间感知”升级为“空间智能”,发布6D全彩芯片“毕加索”、ETX平台、Kosmo硬件与动力模组,构建“看见-记录-改变”世界的三层能力
  • 商业基本盘:全球首家全年盈利的激光雷达公司,年出货量达160万颗,车载主雷达市场份额连续13个月第一
  • 市场预期:预计2025年机器人行业累计交付超100万台,覆盖割草、物流、无人机、人形机器人等场景

核心技术架构

  • 毕加索芯片:全球首创将RGB与TOF测距集成于同芯片,实现XYZ+RGB六维信息原生融合
  • 架构优势:在芯片源头统一结构与语义信息,彻底消除传统后融合方案的时间不同步与空间不对齐问题
  • ETX高线数平台:搭载毕加索芯片,最高支持4320线、600米测距,预计2025年下半年量产交付
  • Kosmo硬件:整合雷达感知、摄像头纹理与空间重建算法,解决真实世界3D训练数据规模化采集稀缺痛点
  • 动力模组:从感知向执行端延伸,补齐全栈具身智能拼图,明确不做整机与通用大模型

技术路线对比

维度传统激光雷达后融合方案毕加索6D全彩
输出信息XYZ空间坐标点云+图像拼接XYZ+RGB原生融合
时空对齐仅空间存在偏差芯片级同步
语义理解间接获取每点自带颜色属性

具身智能评测基准与评估范式全景

具身智能之心(20260410) | 前沿在线(20260411) | 机器之心(20260414) | 量子位(20260428) | 极市平台(20260429) | 具身智能之心(20260507) | 机器之心(20260513) | 量子位(20260522) | CVer(20260523) | 具身智能之心(20260523) | 机器之心(20260605)

  • WorldVLN:首个世界模型驱动的VLN评测基准,推动智能体从被动感知走向主动预测规划,数据集与基线全面开源
  • 仿真与生成环境:Genie Sim 3.0支持文/图分钟级生成3D环境与Sim2Real闭环(虚实差异<10%);GE-Sim 2.0统一世界动作模型与仿真器,支持RL闭环
  • 任务级评测基准:RealAppliance对齐百个高保真家电与说明书(10种交互,端到端成功率近0);EBench隔离验证集防调参并提供泛化诊断
  • 感知-行动失衡:结构围合任务主动探索与上帝视角差距达49.7%,智能体自发涌现绕后、俯视等策略
  • 被动多视角有害:GPT-5多看随机图准确率反降(距离任务从53.9%降至49.1%),证明“多看≠看对”
  • 级联失败效应:差动作引发差视角并导致更差动作的不可逆级联,行动的选择性和目的性是核心
  • 元认知与探索缺陷:主动探索下物理接触差距扩大(人类88.3% vs GPT-5 64.2%),模型过早停止或反复同向移动,缺乏寻找证伪视角的认知谨慎性
  • ESI-Bench基准:基于Spelke知识系统在OmniGibson构建3081实例,强制主动探索
  • REI-Bench语用评测:9级模糊指令基准直击指令理解软肋,主流VLN框架成功率最高暴跌36.9%
  • 过程级评估:PRM-as-a-Judge提出OPD三层指标从轨迹视频连续评估;MetaFine三维诊断发现二元成功率最高可高估操作能力达70%
  • LARYBench表征评测:通用语义编码器(V-JEPA 2、DINOv3)在动作分类与回归上均优于专用具身模型
  • 3D重建临界点:真值3D具优势(材质透明从44.0%升至60.4%),但低于阈值的重建有害(暴跌至9.9%),2D更稳健
  • 视觉感知瓶颈:仅提升视觉编码器空间保真度,即可有效解锁精细操作能力,解决视觉问题为重中之重

7.6 垂直场景机器人产品矩阵与渠道商业化


垂直场景机器人:从运动突破到材料层智能的商业化

雷峰网(20260414) | 机器人前瞻(20260414) | 量子位(20260423) | DeepTech深科技(20260423) | DeepTech深科技(20260704)

清洁机器人渠道壁垒与商业风险

  • 线下货架极度排他:欧美核心卖场进店需半年至一年,末位淘汰机制下新品牌极难突破
  • 退货率吞噬利润:电商退货率超20%,处理退货成本高于新机,线下演示可降至1%
  • 割草机渗透率低:欧洲约20%(目标40%),北美仅2%,中国品牌无一首过10万台

运动训练机器人资本与技术突破

  • 庞伯特获近2亿融资:蓝驰创投与字节系锦秋基金入场,覆盖网球(发球130km/h)及乒乓球发球机器人
  • 索尼AI登Nature封面:击败WTT世界排名第25位选手,端到端延迟20.2ms(人类约230ms)
  • 感知系统极致配置:9台高速相机(200fps/3mm精度)+事件相机(400-700Hz),10ms内完成数据处理
  • 仿真训练零样本迁移:采用SAC算法在仿真中完全训练,部署即用;8自由度机械臂Scalmalloy合金3D打印+拓扑优化,挥拍达20m/s

morph软体机器人:材料层智能化探索

维度传统软体机器人morph细胞
技术路线气动驱动/记忆合金结构+传感+驱动+控制全集成
产品形态单一功能组件模块化智能材料积木
目标场景工业/康复/手术运动表现/损伤预防/辅助
  • 核心概念:将感知、驱动、控制嵌入柔性材料,使材料本身成为AI载体
  • 创始人背景:Jean Nehme(外科医生转型),曾联合创办Digital Surgery被美敦力收购
  • 分层计算架构:材料内部传感采集→端侧低延迟控制→云端离线训练更新
  • 商业化策略:B2B嵌入合作方产品,消费先行医疗后置规避FDA审批压力
  • 监管前瞻:FDA 2024-2025年PCCP指南强调“有界适应”而非无约束学习
  • 风险提示:至今零成品展示、融资金额未披露(含8VC/Pharrell Williams),技术可行性待验证

7.7 垂直场景具身智能应用


垂直场景具身智能商业化落地与规模化部署

量子位(20260420) | 钛媒体AGI(20260421) | 具身智能之心(20260423) | 机器人前瞻(20260424) | AI科技评论(20260427) | 前沿在线(20260429) | DeepTech深科技(20260521)

  • 电力巡检成首条百亿级商用赛道:国网2026年投68亿采购8500台设备,叠加南网跟进望破100亿;单台年均省人工50-80万,回收期仅2-3年

国网68亿采购结构与核心厂商

品类数量预算均价核心厂商
四足巡检狗5000台15亿~30万云深处(市占率第一)、宇树
人形带电作业500台25亿~500万深谋(伏安)、智元、优必选
双臂巡检3000台18亿~60万傅利叶等
  • 工业重型装备智能化:塔吊场景操作员从12人降至1人,恶劣天气效率反升10%;1:15高保真仿真破数据稀缺,安全壳机制实时监控指令毛刺

轮式构型工业商业化先锋

厂商机型与场景关键数据
智元精灵G2(3C)/远征A2-W(汽车)节拍18秒,效率>20%,成功率99.9%
千寻小墨(宁德基地)全球首条规模化PACK产线
优艾智合巡霄(半导体/电力)80台集群对接<2mm,日均1.6万次
  • L4自动驾驶切入工业闭环:驭势科技定位"AI司机派遣",机场市占率超90%,为6国249客户部署,累计无人驾驶约900万公里

全球巡检机器人技术谱系

厂商机型与形态核心能力
Boston DynamicsSpot(四足)自主巡逻、热成像及仪表读取,主攻油气电站
ANYboticsANYmal X(四足防爆)ATEX防爆认证、声学气体泄漏检测
Voliro倾转旋翼(空中)空中接触式无损检测,超声波与涡流检测
Eelume蛇形(水下)长期驻留海底坞站自主巡检,颠覆传统ROV
  • 全球巡检市场2030破百亿$:从移动摄像头进化为多模态感知平台,核心驱动力为基建老化与安全法规趋严

7.8 家庭机器人与情感陪伴产品


情感陪伴与具身交互机器人的技术路线及商业化

机器人前瞻(20260401) | 十字路口Crossing(20260416) | 雷峰网(20260420) | 智能涌现(20260427) | 机器人前瞻(20260427) | DeepTech深科技(20260427) | 十字路口Crossing(20260706)

| 未来不远 | 张翼(掌门1对1创始人) | 自有资金潜行三年 | F2进300家庭测试,主打带娃 |
| 越伴动力 | 世博 | 未披露 | 「小伴」陪伴机器人,定价8499元 |
| Somnia Lab | 未披露 | 近千万美元天使轮 | 亲密关系交互,从卧室扩展全屋 |
| 首形科技 | 胡宇航(哥大博士) | 数亿元A1轮(华控/京东系) | 仿生面部硬件,多模态情绪交互 |

硬件形态与成本取舍

  • 越伴「小伴」:65cm/12kg双足,全身95%柔软材质,腿加薄膜传感器防夹伤儿童
  • 未来不远F2:选轮式保室内稳定,选二指夹爪弃五指灵巧手,自研关节降至约1000元
  • Somnia:全人形轻量化结构约20kg,仿生材料结合新运动控制算法,触感近真实
  • 首形科技:主打仿生面部硬件,嘴唇运动学习覆盖多种未训练语言

模型架构与技术路线对比

公司核心架构关键特征
破壳UAG并联世界模型放弃VLA,动作预训练保泛化,效率提升5倍
越伴三层VLA快慢脑架构1.7B快脑+7B慢脑,交互延迟<0.4秒
Somnia生成式情感交互模型连续非脚本化互动,从执行指令转向理解回应
首形CharacterMind情绪基座多模态感知,将情绪转化为语音及肢体输出

商业模式与核心壁垒

  • 未来不远:对标月租三四万的高端带娃服务(非普通阿姨),核心看续费率(50%)与转介绍率(30%)
  • Somnia Lab:从卧室情绪锚点切入建立高频信任,形成“高频使用→情感沉淀→持续付费”闭环
  • 破壳:聚焦10类通用家务(排除抱婴儿等高危场景),家庭是最复杂的数据采集场景

产品哲学与隐私安全

  • 越伴外星语:基于斯瓦希里语自创12音语言,规避恐怖谷效应,意象式表达情绪需求
  • 性格演化:越伴主张“陪伴≠讨好”,拒绝功能堆砌,性格随主人多维动态演化
  • 数据壁垒:未来不远视真实场景数据为核心护城河;越伴自建家庭模拟器标注微调端侧模型
  • 隐私安全:破壳强调柔顺控制防物理伤害,辅以工作亮灯、物理遮挡等五维度隐私保护

8. 具身操作控制与跨体迁移


8.1 机器人操作控制与导航


操作控制与精细物体位姿感知

量子位(20260402) | 机器之心(20260409) | DeepTech深科技(20260430) | DeepTech深科技(20260522) | 机器之心(20260526) | 量子位(20260527) | 机器之心(20260527)

  • 操作控制范式:英伟达CaP-X让大模型直出Python代码控制机器人,7项任务中4项追平人类,VLA降为底层API实现零样本迁移
  • 精细动作推理:RAAP框架将可供性解耦为静态接触点与动态方向预测,方向预测误差降至32.55°,仅需数十样本即跨类别零样本泛化
  • 三维知识增强:RAM框架为VLM外接三维物体知识库,14项机械臂实验平均成功率89.17%,已扩展至铰链与柔性物体
  • 视触觉感知突破:新智具身(近亿元天使轮)以内部相机拍柔性形变输出六维力,单色光方案降本,解决精细化操作90%的失败节点
  • 微型光纤传感:上海交大发布世界最小(1.7mm)六轴力传感器,采用PDMS光场编码与扩散模型合成约10万图像实现稳健解码
  • 关节物体位姿感知:CAPER++首次从关节驱动视角统一位姿估计与追踪,结合SE(3)流形切空间学习规避万向锁,达50 FPS
  • 追踪策略优化:CAPER++采用动态关键帧与相邻帧局部增量学习,多数据集取得SOTA,实现精度、鲁棒性与实时性平衡

核心技术对比

框架核心创新关键数据
CaP-X代码即策略,VLA降为API7项任务4项追平人类
RAAP静态接触点与动态方向解耦方向误差32.55°,数十样本跨类泛化
RAM外接三维物体知识库平均成功率89.17%
CAPER++关节驱动建模+SE(3)流形学习50 FPS实时推理

传感能力对比

传感器技术路线核心优势
新智具身视触觉(内置相机拍形变)输出六维力+滑移,算法可迭代
上海交大光纤+PDMS光场编码末端无电子元件,1.7mm极微创

8.2 跨具身迁移与操作表征


跨具身表征通用化与灵巧操作前沿

具身智能之心(20260330) | 机器之心(20260405) | 机器之心(20260411) | 具身智能之心(20260424)

  • 视觉锚定迁移(UniT):小鹏联合清华港大提出,将人机异构动作映射到共享离散隐空间,绕开运动学重定向
  • 数据效率突破:UniT 仅用 10% 数据即达传统全量训练水平,零样本堆叠任务成功率从 10% 跃升至 60%
  • 图结构灵巧抓取(T(R,O) Grasp):NUS 邵林团队以物体-机器手空间关系图替代距离矩阵,实现跨智能体统一表征
  • 抓取性能刷新 SOTA:多种灵巧手平均成功率 94.83%,A100 推理达 5 FPS,吞吐量 50 grasp/s,已被 ICRA 2026 接收
  • 跨平台 VLA 迁移(AirVLA):斯坦福联合 PI 首次将桌面 Pi0 模型迁移至无人机,460 次飞行验证可行性
  • 合成数据与物理引导:3D 高斯合成数据让导航过闸成功率从 45% 升至 95%,载荷物理引导使放置成功率升至 50%
  • 范式与数据演进:Diffusion Policy 凭借去噪能力成为模仿学习主流;数据从遥操作(BridgeData V2)向弱监督视频演进

技术路线对比

技术路线代表方法表征方式泛化性推理效率
视觉锚定UniT共享离散隐空间
图结构统一T(R,O) Grasp物体-关节图
距离矩阵D(R,O) Grasp距离矩阵
物体中心接触点/热力图接触点/热力图
机器人中心ACT等观测→动作映射

8.3 具身导航系统与视觉语言导航


具身导航技术前沿:从VLN算法到深空探测路径规划

机器之心(20260403) | Datawhale(20260401) | 具身智能之心(20260415) | CVer(20260430) | CVer(20260506) | 具身智能之心(20260514) | 人工智能学家(20260705)

  • 自进化推理范式:EvolveNav(TPAMI 2026)提出两阶段自反思后训练,形式化CoT使推理速度提升3倍,在R2R、CVDN等四大VLN基准登顶SOTA

评测革新:OmniNavBench统一基准

  • 统一基准Vs孤立基准:上交大联合无界动力发布OmniNavBench(RSS'26),单次串联2-4个异构任务,同步测试轮式/四足/人形三种构型
  • SOTA真实成功率仅8.74%:基于1,779条人类遥操作真实轨迹测试,多数模型配置整体成功率低于2%,远低于单任务声称水平
  • 核心瓶颈在技能衔接:单项子目标完成率高达44.54%,但整体成功率仅1.96%,常因到达无法终止或跨技能切换失败

工程落地:开源全栈导航生态

  • Marathongo全栈系统开源:朗毅开源全球首个面向人形机器人的马拉松全栈导航系统,GNSS+IMU+LiDAR多源融合定位,北京半马21公里零失误
  • 占据人形导航80%市占率:朗毅导航系统已在头部人形机器人厂商中占据约80%市场份额,国内数十家厂商采用
  • every-embodied开源框架:Datawhale发布中文导航实战框架,YOLO+VLM+Habitat规划闭环,半天跑通,支持VLM失败自动降级为规则决策

深空探测:AI规划与三代火星车演进

  • AI规划里程碑:2025年12月NASA首次将Claude VLM引入毅力号全局规划,单日行驶246m,开启机器规划自主决策的新范式
  • 规划效率跃升:Claude模型使总路径规划时间减少50%,飞控人员角色从手动规划者转型为路径审核员
  • 自主规划系深空刚需:地火通信存在3~22min单向延迟,叠加天问三号多器协作等任务激增,传统全遥控模式严重制约探测效率
  • 三代火星车对比
维度第一代第二代第三代
代表车型索杰纳号勇气/机遇号毅力号
规划方式地面全量人工人工航路点+局部避障AI全局规划+自主导航
单日行驶2-3m最远347.7m246m(验证)
人工介入全程介入每日全局规划仅审核确认

8.4 动态SLAM:从静态建图到四维环境理解


上交大王贺升团队:SLAM从静态建图走向动态世界理解的完整技术路线

AI科技评论(20260603)

  • 核心路线:感知(多模态融合)→建图(动态Gaussian)→定位(跨模态2D-3D)→规划(NeRF记忆+VLM推理),突破静态环境假设

动态场景感知:2D→3D→4D递进

层级技术方案关键特点
二维光流Memory Bank+DRU网络零样本泛化至nuScenes/Waymo
三维场景流两阶段框架+扩散模型精炼几何/流/代价体作为条件信号
四维重建4D Hybrid Representation动态场景完整重建

动态Gaussian SLAM与紧凑加速

  • 里程计:LiDAR投影BEV/图像平面,Local-to-Global网络+RANSAC迭代精炼
  • 环境解耦:背景传统高斯;前景非刚体可变形高斯+FMPTL约束;前景刚体检测+光流
  • 位姿优化:最小化光流与三维高斯投影向量的重投影误差优化相机位姿
  • 紧凑加速:体素化+滑动窗口去冗余+ICP残差压缩,速度提升约一倍接近实时

可变形环境与语义建图

  • 形变建模:定义刚体/半刚体/完全可变形体元,引入时变形变场(如手术机器人)
  • 语义SLAM:融合几何/外观/语义特征,Coarse-to-Fine层次化构建场景表示

定位、规划与工业落地

  • 跨模态定位:高精度建图+廉价摄像头,去噪匹配+位姿回归,每帧推理仅14ms
  • 经验复用:NeRF存储关键帧检索历史,VLM理解图像构建语义图谱推理
  • 场景验证:已落地矿卡(稳定运行超一年)、仓储机器人、自动泊车、割草机等

9. 跨界载具与前沿微纳硬件


9.1 自供电传感与新型交互接口


无源传感、自供电交互与非传统形态机器人

DeepTech深科技(20260524) | DeepTech深科技(20260527) | DeepTech深科技(20260531) | DeepTech深科技(20260610) | DeepTech深科技(20260630) | DeepTech深科技(20260701) | DeepTech深科技(20260713) | ScienceAI(20260716) | AI科技评论(20260716) | DeepTech深科技(20260718)

  • 纯机械流体传感:NUS的ME-SOFS传感器调3参数实现92倍灵敏度差,免疫电磁干扰
  • 无源遥操示教:内嵌磁铁生电实现3米延迟30ms遥操,蒙眼无损抓蛋生成示教数据
  • 声学触觉反推:RSS时间检验奖RBO Hand主张“形态即计算”,气动顺应性自动求解抓握姿态
  • 极简修复成本:RBO Hand损坏仅需5元硅胶胶水修复,对抗主流高昂的刚性精密手

自供电与生物混合交互

  • AI控制人手:MIT黑客松冠军用EMS+VLM实现语音控制人手,人体反向发力产生疼痛为安全线
  • 传播与消费化:原型被误读为“AI夺舍”衍生加密货币,消费品化依赖干电极突破
  • 赛博格蟑螂:NTU团队背包蟑螂已用于缅甸地震搜救,化学产氧潜水服使其水下作业3小时
  • 自动化装配:2025年发布首条赛博格昆虫装配线,单只组装缩短至68秒(原人工1小时)

非传统形态机器人

  • 软体浮空机器人:SFR靠氦气浮力失控仅缓慢飘落,Cuddle-Fish用3克舵机驱动扑翼推进
  • 善意混乱设计:保留随机风偏碰撞等不可预测性,将脆弱材质引发同情转化为社交连接
  • 量产核心瓶颈:1升氦气仅1克净升力,引发“浮力-质量循环”,微型视觉与自动充放气为关键

集群智能与动态构型

  • 动态各向同性:杜克Argus球形机20腿实现0.91全向均衡发力(主流四足低于0.6)
  • Sim-to-Real迁移:平地训练零样本适应12cm台阶,单腿标定全局复制迁移不到1天
  • 单电机集群:康奈尔模块用弱魔术贴自发分裂重组,整流对称振荡为净位移,落单率降至15%
  • 细胞级智能:Sakava立方体仅与六邻交换信息约3分钟收敛,未见损伤模式检测准确率94.8%

视觉隐身飞行

  • 视觉隐身飞行:30克单电机无人机每秒15-25圈旋转,利用视觉暂留使人眼产生透明模糊感
  • 极简飞行控制:机身反向旋转,每圈特定时刻短暂调速产生方向性偏移并累积为可控平移
  • AI搜索优化:从2万方案中优选,LPIPS隐身视觉差异0.0104,较人类设计提升近20倍
  • 核心局限:仅视觉隐身不防雷达红外且有噪音,依赖外部光学跟踪无法自主

9.2 磁控微机器人与体内介入


磁控微机器人核心技术与应用突破

AI科技评论(20260603) | DeepTech深科技(20260605)

定位与控制技术

  • 柔性磁定位:霍尔传感器阵列贴片替代大型设备,贴合ERCP内镜实现便携三维磁定位
  • 闭环学习控制:超声波反馈闭环学习取代传统PID,配合磁驱动导丝实现精确路径跟踪

介入治疗应用

  • 血液水凝胶微机器人:自体血液构建水凝胶,杨氏模量近脑组织,免疫兼容;18只比格犬实验显示肿瘤增长率明显降低
  • 磁流体左心耳封堵:柔软凝胶完美贴合任意形态,11头猪实验无渗漏无血栓,首头存活超两年
维度商用Watchman封堵器磁流体封堵方案
形态适配圆柱形,无法适配所有形态流体完美贴合任意形态
组织损伤与肌肉直接接触可能损伤柔软凝胶,无组织损伤
封堵效果可能渗漏致血栓完美封堵,无渗漏无血栓
动物验证11头猪,首头存活超两年

神经修复微机器人

  • 磁电细胞设计:CFO-BTO核壳纳米颗粒包裹细胞,磁致伸缩-压电级联产电,激活钙离子通道定向分化
  • 微流控制备:芯片实验室30分钟完成组装,细胞存活率>85%,尺寸约6微米
  • 脊髓损伤疗效:斑马鱼横断3天近恢复正常游泳;小鼠截瘫28天BMS从0.7升至3.9(健康8.8)
  • 生物安全:28天主要脏器无损伤,肝肾功能正常无免疫排斥

瓶颈与挑战

  • 硬件集成限制:微机器人无法集成执行器和传感器,必须依赖磁场远程控制
  • 转化门槛:小鼠仅为部分功能恢复非完全康复,纳米颗粒体内长期归宿未明

9.3 自动驾驶赛车:极限感知-规划-控制与逆向工程人类驾驶智能


APEX系统与经典管线在300km/h赛道的验证

AI科技评论(20260604)

  • 以赛车为机器人学极限沙盒:慕尼黑工大在真实赛道验证300km/h级感知-规划-控制全链路,两次获自动驾驶赛车联赛冠军
  • 经典管线优于端到端:极限速度下任何错误均致撞车,可解释的经典模块化架构具不可替代的结构性安全优势
  • 模块深度管理哲学:采用“一个博士生一个算法”模式,确保管线下每个核心算法环节达到极致工程深度

感知与定位层教训

  • 多传感器融合是高速基石:阿布扎比赛道遭GPS拒止(受战事影响),证明单一传感器完全无法应对极端工况
  • 三维状态估计不可或缺:极限动力学行为(如漂移、侧偏角)必须通过3D状态估计精准捕捉与建模
  • 标定纯离线完成:赛前预先标定即可满足赛道高精度需求,不做高风险在线标定

规划与控制层架构

  • 全局-局部双层规划:全局含非线性轮胎/空动全模型求解最优控制;局部采Frenet坐标系计算100米范围
  • 博弈论实现多车交互:赛车自主决策超车时机,在亚斯码头赛道实现250km/h并排超车,成功率约90%(9/10次)
  • 动态安全余量权衡:跟踪最优时间基线的同时,保留转向过度或不足的动态安全余量

APEX系统与人机对决

  • 逆向工程人类智能:三年研究发现,人类凭视触听觉感知极限并动态逼近,而非死守固定最优基线
  • APEX独立软件层:融合启发式与机器学习,核心路线为复制人类驾驶直觉以超越人类

亚斯码头赛道实测圈速对比

对手身份圈速结果
奔驰测试车手职业测试车手AI快2.6秒
本·施奈尔前DTM赛车手AI快1秒
乔治·拉塞尔F1现役车手人类快约1.5秒

9.4 EMG神经腕带与多模态数据采集基础设施


具身智能数据采集范式升级:EMG腕带补全操控信号链

新智元(20260612) | 具身智能之心(20260420) | 机器之心(20260613) | 机器人前瞻(20260715)

  • 核心瓶颈转移:具身智能落地限制从模型架构转向数据,PB级的人类物理交互经验极度匮乏,成为最稀缺战略资源
  • 五层信号补全:北大秦旭团队提出,传统采集仅记录动作结果,EMG腕带可补全“意图→姿态→发力→微控→结果”全链路信号
采集维度传统实验室遥操第一视角自然采集方案
成本投入动辄上千万,仅头部可负担设备万元级(如KAI Halo仅12999元),降百倍
场景泛化固化于实验室,脱离真实生活真实场景即采即用(居家/酒店/零售/快递)
硬件耦合数据绑定特定型号机器人解耦本体,以人体骨架为通用坐标系

硬件与数据集基建

  • 超维KAI Halo:4路鱼眼快门+多路IMU,整机380g,实现厘米级姿态捕捉与微秒级同步
  • 配套数据集:KAI Ego Dataset含超10万小时多模态数据,覆盖2000+原子技能及全身24关键点骨架

HumanEgo高效学习验证

  • 极致数据效率:仅30分钟人类视频实现零样本双臂协作,成功率92.5%,数据效率较遥操提升3.75倍
  • 泛化与去形态化:在9个分布外条件(不同机器人/相机等)维持85-95%成功率
  • 视觉与表征机制:SAM2+LaMa抠除人手渲染虚拟夹爪,绕开域适应;29维ICT编码手物几何实现形态无关适配
  • ICT消融验证:纯视觉方案天花板仅32.5%,引入几何表征ICT后跃升至85%

10. 自动驾驶前沿技术与硬件底座


10.1 智驾感知硬件:SPAD芯片与RGBD空间相机


RGBD单芯片融合:物理AI视觉感知的终局路线

雷峰网(20260527) | AI科技评论(20260605)

  • RGBD单芯片融合是物理AI视觉感知的终局方案:色彩与深度在芯片原生层融合,消除分立方案的后端对齐计算延迟与算力消耗,解决二维推测三维的深度缺失问题。
  • 纯视觉路线受制于物理与法规双重约束:白墙等极端场景下二维感知失效;国标与L3细则强制要求感知冗余,严禁依赖单一传感器源。
  • SPAD-SoC架构具有显著代差优势:对比传统SiPM(128线已属旗舰),SPAD可达数百至上千线;全栈自研直接输出数字数据,突破帧率与延迟瓶颈。
  • 传统3D相机物理缺陷与RGBD路线对比
方案核心缺陷测距范围
双目结构光受环境光限制,间接测量~1米
ToF分辨率低,无法像素级RGBD对齐~1米
传统激光雷达线数低(16-32线),仅能导航定位远距低精
RGBD单芯片像素级原生融合,无后端对齐算力消耗全场景高精
  • “万向光控”技术打破成本瓶颈:全固态光扫描技术将激光利用率从5%提升至80%以上,用10美元光源实现过去1000美元光源的效果。
  • 核心企业推进量产落地:阜时科技大面阵SPAD-SoC月出货量居全球首位,已搭载极氪9X量产交付数十万颗;速腾聚创实现深度与RGB物理层天然对齐。
  • 智驾与机器人需求分化但同源:共享底层SPAD架构,车载偏向长距低成本(百米级),机器人偏向近距高精度(毫米级)及小体积。
  • 演进路线与数据采集质变:预计2027年量产SPAD-RGBD单芯片(体积减半、功耗降40%);纯视觉数据质量难满足终端需求,多家数采公司已转向三维方案。

理想「具身智能汽车」战略

AI大模型工场(20260617) | 光锥智能(20260618) | 光子星球(20260618)

  • 具身智能汽车:理想将汽车定义为“电动车+职业司机+AI计算机+生活助手”四位一体的独立智能体
  • 全栈自研护城河:芯片+模型+OS全栈自研是超越特斯拉的唯一路径,算法优势易被人才流动迁移
  • 自研芯片门槛:年营收千亿且研发超10%;两颗M100合计800mm²晶圆面积,大几十万辆车即可有效摊薄

马赫M100芯片与架构对比

维度英伟达(冯诺依曼)理想M100(MIT数据流)
核心思路通用计算存在翻译层损耗去翻译层直抵计算本质
制程与算力-5nm车规级,1280 TOPS
性能对标Orin XOrin X的4倍,Thor-U的3倍
算力利用率-超82%

VLA模型极致时延与感知重构

  • 纯视觉3D建模:基于CVPR最佳论文3D-ViT替代BEV,近场精度达激光雷达水平
  • 整体反应0.28秒:较常规降40%,逼近F1车手0.25秒,120km/h下少用6米刹车距离
  • 全链路时延优化:视觉输入降47%、模型推理降43%、底盘响应降38%、OS调度降28%
  • 安全数据闭环:累计主动避险1727万次(重大5.6万次),Mind-Edge全本地运行防泄露
  • 舱驾分离架构:L4智驾需极高确定性与专属算力,拒绝舱驾一体,改用TOKEN Server隔离任务

具身智能延伸与索塔无界布局

  • 具身智能延伸:车已具备交互与移动能力,操作能力仍在探索;赛道正从硬件先行转向模型驱动
  • 索塔无界成立(2026.4):胡德波二次创业,聚焦通用基座模型+海外市场,主攻具身智能
  • 技术路线差异:采用统一潜空间世界动作模型,预训练即融合多模态建立物理因果理解
  • 数据引擎对比:以Ego-centric视频和UMI为引擎,区别于主流VLA被动观察式表征学习
  • 专属产品规划:自研物理智能体OS(Physica-Claw),提供场景定制本体方案
  • 商业优先策略:海外锁定欧美商业与物流集团(覆盖超百万台),最终进军家庭场景

自动驾驶团队跨界睡眠监测

深度学习与NLP(20260710)

  • 背景:一支拥有自动驾驶技术背景的团队,将感知、决策等领域的技术能力转向睡眠健康赛道
  • 技术迁移:自动驾驶中的传感器融合、环境感知、行为预测等技术,可迁移至睡眠状态监测与分析
  • 应用方向:利用AI驱动的感知技术实现非接触式睡眠质量监测、睡眠障碍识别等
  • 跨界逻辑:自动驾驶与睡眠监测在「持续感知+实时决策」技术栈上存在共性,属于AI技术的跨领域迁移应用

10.2 智驾技术范式演进与跨载具泛化


智驾跨载具泛化与重卡商业落地

雷峰网(20260508) | InfoQ(20260511) | 雷峰网(20260601)

智驾技术范式演进

维度第一代规则第二代端到端第三代原生多模态
核心逻辑人工定义场景数据驱动多模态统一预训练
泛化能力极弱需穷举约70分需打补丁目标开箱即满分
响应速度常规百毫秒级十毫秒级
  • 消除翻译层:原生多模态在预训练阶段统一视觉、语言与动作,实现知行合一
  • 跨载具统一:同一框架建模乘用车、重卡、物流车,突破跨场景限制
  • 乘商并举:卓驭50+款乘用车量产,重卡方案2025年6月起量产,客车9月交付

重卡智驾的物理极限与云端突破

约束维度关键参数对智驾系统要求
极限物理车宽3.2m/车道3.75m;总重近50吨400m+感知,7cm级横向控制
挂车盲区挂车柔性结构且无传感器仅靠车头传感器推断姿态
运营环境大雾/加塞,惯性大制动距离长容错率极低,失误被惯性放大
  • 里程指数增长:嬴彻商用运营超7亿公里,覆盖97%高速网,智驾占比超90%
  • 核心竞争壁垒:极限约束下转化长尾场景的云原生工程系统才是核心,非数据量
  • 潮汐并发调度:仿真任务发布前并发需求达日常百倍,依托阿里云万级容器调度

零一汽车“造车+智驾”商业化落地

指标2024年2025年
营收(亿元)1.245.22(同比+320.8%)
交付量(辆)2721176
毛损率-34.7%-2.5%(大幅收窄)
净亏损(亿元)2.412.81
  • 整车驱动收入:整车销售占97.2%,小满与惊蛱两车型贡献超97%;无人重卡方案首贡献810万收入
  • 毛损率快速收窄:规模效应提升议价力;正向自研降能耗15%-20%并减重1吨
  • 核心商业洞察:拒绝纯软件模式,坚持“造车+智驾”,整车销售是智驾商业化入场券

CVPR 2026自动驾驶仿真与协作智能前沿

AI科技评论(20260514) | AI科技评论(20260519)

  • 范式跃迁:CVPR 2026 自动驾驶研究从「环境感知」走向「行动决策」,重点聚焦可控场景生成、仿真增强与空间检索
  • 空间检索记忆:复旦&上交大提出基于 GPS 位姿检索街景与卫星图,融合实时感知构建空间记忆,大幅提升建图与视觉生成稳定性
  • 场景生成控制:HorizonForge 将驾驶场景重建为可编辑 Splats+Meshes,支持轨迹修改与语言指令,用户偏好提升 83.4%,FID 改进 25.19%
  • 仿真真实感:DiffusionHarmonizer 将多步扩散压缩为一步推理,修复新视角伪影并协调光照阴影,满足在线仿真实时需求
  • 动作对齐:LEAD 系统性拆解 learner-expert 不对称性,提升闭环驾驶中模仿学习的动作稳定性

Geo 图像空间记忆的任务差异化收益

任务模型指标变化核心受益点
在线建图MapTRv2mAP 61.5→73.4强补充车道线与道路边界
在线建图MapTRmAP 50.3→61.2同上
占用预测FBOccmIoU 39.11→39.74可行驶区域边界提升明显
世界模型UVGFVD 36.10→29.97约束道路漂移、减少幻觉
3D检测BEVFormermAP 41.60→41.64无法反映实时动态,增益极低

适用边界:Geo 对静态道路结构(车道线、人行道)补充显著,对动态目标感知增益有限;夜间碰撞率从 0.55% 降至 0.48%


SHIELD:混合尺度道路异常分割的小危险目标感知框架(ACM MM 2026)

CVer(20260720)

  • 核心问题:现有道路异常分割采用尺度无关评价指标,大目标主导特征聚合致小危险目标漏检——代表性方法小异常AP仅39.0%,大异常达82.5%
  • MS-Protocol评价协议:按异常面积占比划分尺度(小<0.3%、中0.3%-2.0%、大>2.0%),不依赖分辨率可跨数据集通用
  • MS-ROAD诊断集:含590幅图像覆盖白天/夜间/雪天等场景,提供实例级尺度标签,揭示现有评价掩盖小目标漏检的系统性缺陷
  • SHIELD框架:采用由粗到细的区域到像素三阶段推理(候选提取→区域级危险推理→像素级细化),将小尺度异常AP从40.50%提升至84.10%,退化指标从30.5降至5.8
  • 效率表现:仅284G FLOPs / 44.2M参数,推理速度达18.45 FPS,兼顾精度与部署可行性
  • 关键洞察:评价体系的缺陷会系统性扭曲方法设计;由粗到细分阶段处理是混合尺度问题的通用解法

10.3 英伟达全栈平台:三台计算机闭环与智能汽车底座化


英伟达DRIVE全栈体系:从芯片到生态的平台化统治

前沿在线(20260511)

  • 事实技术底座:以“三台计算机+五层蛋糕”全栈体系渗透展馆几乎所有智能汽车展位,无独立展台却成为行业核心
  • 十万亿美元级市场:全球年行驶13万亿英里,自动驾驶占比不足0.1%,每英里价值1-2美元

三台计算机闭环体系

环节核心产品关键数据
车端推理Thor芯片LLM推理性能为Orin 20倍,LLAMA-7B推理速度快9倍,FP4精度支持2倍权重传输
云端训练Cosmos模型2000万小时视频、2亿精选片段、370万推理样本
仿真计算Omniverse NuRec6小时重建照片级3D场景,日跑200万次仿真,数据多样性提升10倍

生态护城河与商业化

  • Alpayo从Cosmos蒸馏:仅8万小时数据达行业领先,先理解物理世界再学驾驶
  • 双榜表现领先:Hugging Face机器人模型下载量第二,LingoQA辅助驾驶推理排名第一
  • NVLink双芯片互连:支撑L4级热备份,延迟近零,保障高阶自动驾驶安全冗余
  • 车企集体转向:奇瑞all in DRIVE平台,小马智行等从全栈自研转向英伟达生态
  • 五层蛋糕架构:硬件→操作系统→模型→应用→基础设施,逐层开放构建生态壁垒

落地时间表

时间里程碑
2026年L2++点到点辅助驾驶落地,覆盖6座国际城市
2027年与Uber合作,美国部分城市L4 Robotaxi试点
2028年洛杉矶奥运会L4无人驾驶服务,覆盖四大洲28城

10.4 智驾技术路线


端到端智驾架构演进与数据效率前沿

AI早餐汇(20260408) | AI早餐汇(20260409) | CVer(20260410) | AI早餐汇(20260413) | AI早餐汇(20260413) | 极市平台(20260416) | 量子位(20260427) | CVer(20260529)

前沿架构创新与空间理解突破

方案核心机制关键数据
小米AutoMoT异步双专家+KV缓存复用,解耦低频理解与高频控制B2D闭环SR 74.09%,nuScenes碰撞率0.07%
奔驰SpaceDrive统一3D位置编码接口,引入可学习系数防PE打乱分布闭环SR 55.11%,开环L2误差0.32m
元戎40B基座Driver-Analyst-Critic三角色统一,视频预测预训练1PB数据利用率达100%,闭环周期缩至12h
  • VLA终局弃用Language层:小马智行提出用Intention意图层替代语言层,支持反向穷尽生成虚拟测试场景
  • 数字token存在空间缺陷:现有VLM逐位生成坐标导致轨迹塌缩,基线模型闭环成功率低于10%
  • 微调需保护通用能力:整体微调损害推理能力,应冻结理解模块,采取异步专家分工

数据闭环与小模型天花板

  • 小模型现跷跷板效应:700T算力表现与100-200T相差无几,核心瓶颈在模型能力(普遍<1B)而非算力
  • 人类数据价值归零:AI超越人类后模仿学习有害,小马PonyWorld 2.0转向强化学习与AI自我诊断进化
  • 数据质量优于架构:规则兜底(如轨迹评分)限制模型上限需彻底移除,数据分布管控贡献更大
  • MOSAIC动态采样:NYU与NVIDIA提出边际收益驱动的数据筛选,节省42%数据达同等性能

量产格局与物理AI转型

  • 智驾转型移动物理AI:卓驭指出乘用车、重卡、L4物流车、具身机器人多垂类分摊成本是生存必须
  • 舱驾同芯行业首发:卓驭推出单芯片舱驾一体方案,2025年4月推送,实现硬件效率最大化
  • 市场高投入低渗透:2025年城区NOA渗透率仅15.1%,用户黏性20%-30%,投入与使用存在巨大落差

10.5 智驾芯片与硬件


智驾芯片竞争格局与端侧架构演进

雷峰网(20260402) | 机器之心(20260402) | AI蓝媒汇(20260401) | 雷峰网(20260401) | InfoQ(20260408) | AI早餐汇(20260423) | 划重点KeyPoints(20260423) | 脑极体(20260423)

智驾芯片竞争格局与突围

  • 城区NOA“一超双强”:英伟达49.36%、华为23.07%、地平线17.88%。地平线征程系列累计出货破1000万套,2024年ADAS市占率中国第一。
  • 地平线模式转型:营收37.58亿(+57.7%)仍亏104.69亿,从IP授权(毛利94.5%)转软硬件交付(毛利34.5%),以利润换规模。
  • HSD量产突破:国内首个量产一段式端到端架构,在15万级车型落地,搭载车型中77%用户选装高配。

舱驾融合SoC:地平线星空芯片

维度星空6P旗舰规格架构优势
算力5nm / 650 TOPS集成20核CPU,支持本地运行300亿参数大模型
安全城堡物理硬隔离智驾与座舱独立运行,座舱重启不影响智驾
调度ACE自适应计算引擎硬件级算力动态调配,跨域无延迟(打破此前2秒延迟)
降本省1500-4000元/车一芯取代双芯,研发成本降70%,交付缩至8个月
  • 量产进度:已获大众、比亚迪等10余家意向,2025年Q4样片交付,2026年Q3首发量产。

蔚来自研芯片高低搭配矩阵

维度神玑NX9031第二颗5nm芯片
算力>1000 TOPS~700 TOPS(等效三颗Orin-X)
定位高端旗舰(需LPDDR5x)成本优先,瞄准中端子品牌
进度累计出货超15万套已流片,推进中

硬件与算法底层优化突破

  • 激光雷达跨场景扩张:定位“三维摄像头”,图达通1550nm量产成本降至500美金以下,联合蔚来自研核心芯片(代号“杨戬”)。
  • 潜空间推理框架:ColaVLA(被CVPR 2026接收)端到端推理延迟228ms/frame,比文本式快5-10倍,打破语言中转瓶颈。
  • 感知ODD动态分配:高速提升雷达信任权重降载,城区密集区增加语义感知和目标追踪算力,实现算力精细化管理。

10.6 激光雷达重定位与点云感知前沿


LEADER:旋转等变特征+置信度加权的激光雷达重定位(CVPR 2026 Highlight)

CVer(20260504)

  • 核心突破:厦大×布里斯托大学提出LEADER(CVPR 2026 Highlight),在SCR框架上融合旋转等变特征与置信度加权,实现精度效率双丰收
  • 偏航角不变性:柱面投影+循环稀疏卷积实现特征旋转不变;地面点校正获俯仰/横滚鲁棒性,几乎零额外开销
  • 置信度机制:TRR损失联合预测点级置信度,难预测点自动降权;RANSAC仅用高置信点拟合位姿,无需额外标注
  • 精度标杆:在NCLT数据集上达0.28m定位精度,超越检索-配准方法;5m内失败率仅0.28%,不到RING/RING++的1/25
  • 效率优势:保持十毫秒级推理速度,且推理耗时随地图规模增长极小
方法类别平均精度5m内失败率推理速度
APR(绝对位姿回归)1.19m十毫秒级
SCR(场景坐标回归)1.51m十毫秒级
检索-配准(RING/RING++)>0.28m~7%+随地图规模增长
LEADER0.28m0.28%十毫秒级

协同感知通信优化:CoLC 前景感知采样与柱状特征补全

极市平台(20260413)

CoLC(北交大&厦大,CVPR 2026)针对早期协同感知的通信压缩难题,提出前景感知采样(FAPS)与柱状特征补全(CEEF),在压缩约50%通信量下保持接近完整融合性能。

核心洞察:早期融合必须保留背景

  • 背景点不可丢:提供空间对齐和目标识别的上下文,丢弃会严重损害检测性能
  • 与中期融合经验相反:中期融合可只传前景,早期融合必须保留背景点
  • 混合采样最优:前景+背景组合在相同通信量下优于任何单一采样方案

发送端 FAPS 采样策略

  • 显著性评分:轻量级点级选择器生成分数,按阈值划分前景/背景
  • 前景保形:前景点用最远点采样(FPS),最大化保留目标几何结构
  • 背景低保:背景点用随机采样,低计算代价维持环境上下文

接收端 CEEF 补全模块

  • VQ补全流程:稀疏柱状特征→可学习码本离散化→解码器恢复稠密特征
  • 轻量高效:推理时延75.86ms,与Where2comm/CoBEVT同量级
  • 自适应互补融合:仅在原始融合信息不足位置引入补全,不破坏真实观测

三数据集 SOTA 性能(AP@0.7)

数据集CoLC (完整)CoLC* (压缩50%)
V2XSim87.89接近完整性能
OPV2V92.93接近完整性能
V2XSet89.81接近完整性能

异构鲁棒性优势

  • 模型异构不敏感:直接融合原始点云,避免中/晚期融合的语义不一致问题
  • 抗真实扰动:在定位误差、通信时延下始终优于单车检测,比早期融合更稳健
  • 早期融合新价值:配合稀疏传输+补全,展现中/晚期融合无法替代的异构兼容潜力

交叉引用