Wesum AI

🎬 多模态与AIGC

视频/图像/音频/3D生成、创意工作流
收录数:1222 篇


目录


1. 视频生成技术


1.1 国产视频模型格局


国产视频模型生态格局与产品化演进

AI大模型工场(20260331) | 船长AI视界(20260408) | 计算机司令部(20260409) | 智东西(20260410) | 赛博禅心(20260418) | AI科技评论(20260422) | 雷峰网(20260424) | 趣谈AI(20260427) | 机器之心(20260427) | 趣谈AI(20260430) | AI异类弗兰克(20260505) | 机器之心(20260508) | 船长AI视界(20260515) | 机器之心(20260524) | 量子位(20260602) | AIGC开放社区(20260605) | AIGC开放社区(20260609) | CVer(20260614) | 昆仑万维集团(20260615) | 量子位(20260619) | "Z Potentials"(20260621) | 新智元(20260623) | 人工智能学家(20260625) | 量子位(20260630) | 阿枫科技(20260702) | AI产品阿颖(20260703) | 机器之心(20260703) | 智东西(20260709) | "Z Potentials"(20260713) | AI异类弗兰克(20260714) | 机器之心(20260714) | 量子位(20260715) | 公子龙(20260715) | "Z Potentials"(20260716) | 极市平台(20260716) | CVer(20260716) | 极市平台(20260717) | AIGC开放社区(20260724) | 十字路口Crossing(20260724) | Founder Park(20260330) | 深度学习与NLP(20260430) | 深度学习与NLP(20260609) | 阿里云开发者(20260623) | AI科技评论(20260720)

前沿架构与技术突破

  • 统一生成编辑架构:字节Bernini与武大Unison(5B双向)刷新SOTA
  • MoE加速架构:巨量Mamoda 2.5融合DiT与MoE(250亿总参激活30亿),4步推理
  • 国产世界模型:斩获全球双冠,创单镜头长时连续生成纪录,Matrix-Game 3.5首创Patch Memory破长时记忆痛点,迎中国引领时刻
  • 超级智能体:Skywork基于OpenClaw多Agent协同,定位“一人公司操作系统”

核心模型与产品参数对比

  • 阿里 HappyHorse 1.1:支持9图同输入保细节,6折价0.54/0.72元每秒
  • 阿里 HappyOyster:3D交互世界模型,支持实时导演,视觉记忆约1分钟
  • 昆仑 Matrix-Game 3.0:游戏世界模型,5B达720P/40FPS,解决长时序漂移
  • 昆仑 28B世界模型:双视角生成,采独立高噪声+共享低噪声混合架构
  • 昆仑 SkyReels V4:超Sora 2登顶,双流MMDiT音画同步,1080P/32FPS/15秒
  • 昆仑 Mureka V9:音乐大模型,引入MusiCo先思考后生成,支持专业混音
  • Catnip.AI MaineCoon:流式生成首帧<1秒,47.5FPS,成本仅Seedree 1/500
  • 生数科技 Vidu S1:实时流式音视频540P/25FPS,支持语音驱动行为
  • 虎牙 VAM 1.0:全双工对话数字人,首帧1.3秒28帧输出,连续运行24h
  • Xmax X2.0:端云协同生成,端侧384p@16fps,成本仅Decart 1/10
  • 京东 JoyAI-VL:毫秒级多模态交互,8B平均延迟94ms,对豆包胜率100%
  • 国产开源框架:支持5分钟长视频生成,Pixelle(7.6K星)端到端3分钟出片;LibTV将影视流程模块化

《功夫女足》特效争议:技术升级与观感倒退

优设AIGC(20260712)

  • 票房与口碑撕裂:上映两天破4亿(首日2.6亿),豆瓣6.6分严重两极分化(17%五星 vs 8.6%一星),总票房预测上调至18.65亿
  • 高投入与低观感倒挂:总投资3.8亿近半用于特效(约1.9亿),1200+特效镜头却被批"劣质AI味",人物与背景割裂、动作失重力感
对比维度《少林足球》(2001)《功夫女足》
技术手段威亚+粗糙CG高规格数字特效
观感评价热血真实割裂漂浮、塑料感
特效投入相对有限近1.9亿
镜头数量较少1200+个
  • 特效失灵的根源:"廉价感"源于极度夸张(如重炮炸坑)却无物理逻辑与情绪支撑,视觉冲击沦为"为炫技而炫技"的杂耍
  • 情感锚点缺失:《少林足球》中"卑微困境→觉醒释放"的叙事为粗糙CG提供了情感燃料,观众有共鸣则不辨真假
  • 结构性短板:《功夫女足》群像角色单薄,缺乏生活困境铺垫,无情绪支撑的特效沦为"无源之水"
  • 评价标尺偏移:极端打分反映观众与创作者期待错位,评价核心从"电影本身"转为对"青春记忆"的缅怀

Meta MSL:Muse Image/Video 模型矩阵与竞争定位

量子位(20260708) | AI寒武纪(20260708) | 新智元(20260708)

竞争定位与核心突破

  • 综合排名:Muse Image 包揽 Arena 文生图、单图编辑、多图编辑三项第二,仅次于 GPT Image 2;Muse Video 位列文生视频榜第三,跻身第一梯队
  • 代际意义:余家辉带队,为 Meta 超智能实验室继 Muse Spark 语言模型后的第二次重大更新

Agent 式生成与自我修正涌现

  • 范式转换:不直接出图,先执行需求拆解、联网搜索、代码生成及局部修正全链路
  • 能力涌现:自我修正非显式编程,而是强化学习中因“改稿获更高奖励”自然习得
  • 量化收益:开启后文生图胜率 57.1%、单图编辑 56.3%、多图编辑 56.6% 均破 50%
  • 推理 Scaling:测试时算力越充足 Elo 评分越高,投推理比投生成收益更持久
  • 模型协同:与 Muse Spark 共享工具链,联动生成含动态 GIF 和可运行代码的网页

社交分发与隐私争议

  • 分发优势:接入 Instagram 等月活近 40 亿社交图谱,赌“谁离用户最近谁就赢”
  • 隐私隐患:@账号即可调用公开照片生图,默认开启且无通知引发重大争议
  • 退出缺陷:支持 opt-out,但关闭后此前他人违规生成的图片不可删除

本周GitHub开源热点:AI科研、语音、Agent编排与企业工具

逛逛GitHub(20260404)

AI 科研自动化

  • AI-Scientist-v2(Sakana AI):渐进式 Agent 树搜索并行探索研究路径,单次实验成本 20-25 美元,生成的论文通过 ICLR 2025 Workshop 同行评审(评分 6.33,超过 55% 人类投稿),成果发表于 2026 年 3 月 Nature
  • 内置模拟 Area Chair 自动评审器,准确率 69%,建议在 Docker 沙盒中运行防止安全风险

语音 AI 突破

  • VibeVoice(微软):0.5B 参数轻量实时 TTS,首音频延迟约 300ms,消费级 GPU 可运行;ASR 单次处理 60 分钟音频无需切片,含说话人识别与时间戳;Star 从 8K 飙至 3.5 万
  • 曾因深度伪造风险删除仓库后重新上架,Star 反弹至 3.5 万+

多 Agent 编排生态

项目定位Agent 数量特色Star
Hermes Agent (Nous)自学习闭环框架开放式任务经验自动提炼为可复用技能,支持 200+ 模型新项目
oh-my-claudecodeClaude Code 增强编排19 个智能模型路由省 30-50% Token1.1 万
oh-my-codexCodex CLI 增强编排30 个20 Worker 并行(独立 git worktree),混合 Claude/Codex1.4 万

时序预测与企业工具

  • TimesFM 2.5(Google):200M 参数,1000 亿时间点预训练,GIFT-Eval 全指标第一,上下文 16384 步(上代 8 倍),已集成 BigQuery
  • Onyx(原 Danswer,YC W24):企业 RAG 搜索,打通 GitHub/Google Drive/Confluence,获 1000 万美元种子轮,Netflix/Ramp 在用,2.3 万 Star
  • last30days-skill:一句话搜索全网 10 个信息源近 30 天讨论,平均 70 秒输出研究报告,1.8 万 Star
  • OpenScreen:Screen Studio($29/月)开源替代,支持录制美化与自动缩放平移,Beta 阶段
  • TaxHacker:拍照/PDF 收据自动提取结构化数据,支持 170+ 法定货币和 14 种加密货币,可本地 LLM 离线运行

视频生成的物理规律与原生技术路线

新智元(20260716) | 深度学习与NLP(20260723)

  • 路线分歧:行业主流涌向世界模型方向,VideoRebirth选择「视频原生」差异化路径,认为视频生成不应简单套用世界模拟器范式
  • 「视频原生」核心理念:从视频数据本身特性出发设计架构,而非将视频视为物理世界模拟的副产品,强调生成质量与可控性的直接优化
  • 核心问题:现有视频生成模型“看起来会动但不符物理规律”,PhyMAGIC 提出主动运动探测框架,从静态图像推断材料物理属性
  • 主动运动探测:让物体先动起来再观察,不同运动暴露不同物理线索(自由下落→质量/刚度,挤压→形变,旋转→惯性,坍塌→区分刚体/颗粒材料)
  • 置信度驱动迭代:物理属性经多次独立推断计算一致性;低于阈值γ=0.6时自动改写视频生成指令,生成更有针对性的运动证据;最多三轮迭代

混合物理参数(HPP)与3D仿真

模块功能
HPP参数组合材料属性(密度、杨氏模量等)+ 执行参数(速度、外力、接触模式)
TRELLIS 3D重建输入图片→3D Gaussian Splatting,每个高斯点赋物理属性
可微MPM仿真器高斯点作为材料粒子进入MPM仿真,输出多视角动态3D对象

实验结果

评估指标数据表现
CLIP相似度0.251(超OpenSora 2.0的0.233和CogVideoX的0.239)
Image-Motion-FID94.69(对比方法中最优)
参数准确率三轮迭代后约90%
人类评估(61人)物理合理性3.00分、文本一致性3.07分

关键洞察

  • 重新定义视频生成模型角色:从“最终内容生产者”扩展为“主动探测工具”,提供时间维度的物理证据
  • 模块化无训练框架:各模块可独立升级,随基础模型进步整体性能可持续提升

1.2 Wan2.7全模态视频编辑


Wan2.7全模态架构与视频编辑体系

通义大模型(20260403) | 千问APP(20260403) | 量子位(20260403) | 智东西(20260403) | 财联社AI daily(20260404) | 深度学习与NLP(20260402)

全模态架构与产品定位

  • 创作跃升:从单一素材生成升级为涵盖编辑、复刻、驱动、续写的全链路套件,以“戏核”架构融合剧情与分镜
  • 多模态支持:支持文本、图像、视频、音频四模态输入,输出720P/1080P,时长2-15秒
  • 矩阵分发:已上线通义网站、wan.video、阿里云百炼及千问App

四大核心模型矩阵

模型代号核心能力
文生视频Wan2.7-t2v文字生成视频,支持群像塑造
图生视频Wan2.7-i2v图片+音频输入生成视频
参考生视频Wan2.7-r2v最多5个主体参考,锁定外观与音色
视频编辑Wan2.7-videoedit自然语言指令修改视频

PS级视频指令驱动编辑

  • 局部增删:指令增删元素或替换物体,自动匹配原视频光影材质
  • 角色操控:将人物替换为参考图角色,保持原背景、姿态与嘴型不变
  • 台词修改:替换台词内容,自动匹配情绪口型与原音色
  • 画风转换:一键切换黏土/水彩等风格,保持人物动作不变

高阶控制与创作特性

  • 多主体一致性:业内最高支持5个主体同时锁定外观与音色,实现多人动作复刻
  • 运镜语言:支持推/拉/摇/移及希区柯克变焦等数十种技巧,指令修改机位焦距
  • 首尾帧续写:2秒素材无损延展至15秒,精准控制构图与光影,消除刹车感
  • 生图能力:同期发布Wan2.7-image,具备骨相级人物生成与8色HEX精准调色能力

LLaVA-OneVision-2.0 与低成本全帧率视频理解

InfoQ(20260520) | 阶跃星辰(20260712) | AIGC开放社区(20260713) | InfoQ(20260721) | 机器之心(20260722)

  • OneVision-Encoder架构:格灵深瞳提出基于视频编解码器的紧凑视觉token表示,推理阶段视觉token消耗降至约1/8
  • 四阶段渐进式训练:支持30秒短片至10-15分钟长视频时序理解,具备2D/3D空间定位与物体追踪能力
  • 云端落地闭环:依托视觉智能工坊(边缘哨兵+算法运营/训练中心),通过冷启动-迭代-规模化三阶段路径实现降本

VideoChat3全栈开源体系

  • 4B参数全栈开放:南大MCG等联合发布,覆盖短/长/流式视频通用理解,数据代码权重全部开源
  • I3D-ViT视觉编码器:实现约16倍时空压缩,创新将时序建模前移至编码阶段,进LLM前完成运动线索整合
  • “先融合后池化”策略:先建立片段内时空联系再池化,非简单丢帧,兼顾token密度与计算效率
  • 主动流式感知:支持在线视频流理解,自动判断响应时机,实现从被动问答到主动交互的突破

端侧1+N架构与软硬件生态

  • Step Edge端侧全家桶:1个基础模型(文本+视觉)外挂Audio/GUI/Gen三大专项,支持独立升级与按需裁剪
  • 全双工持续交互:OpenSQZ Glass采用感知-计算分离架构,眼镜仅采集,本地推理确保隐私与低延迟
  • 软硬开源生态:提供完整3D打印文件与装配教程,打造面向开发者的多模态AI眼镜参考实现

模型与引擎实测数据

模块基准实测关键指标
基础模型16项基准中8项第一GUI定位与App代理优势显著,TAU2_BENCH达58.59
Audio专项超越同级模型中英识别CER 3.1%、WER 3.6%,达专业ASR水平
Gen专项W8A16量化文生图约3秒、编辑约4.5秒
NPU引擎自研Step Inference端侧toolcall低至0.1s,加速远超GPU/CPU

市场趋势预期

  • 市场爆发预期:2026年全球AI眼镜出货量预计同增130%达2000万台(规模56亿美元),2028年或迎“iPhone时刻”

PAI 2.0:AI电影叙事模型

阿枫科技(20260709) | 优设AIGC(20260709) | 新智元(20260709)

  • 产品定位:Utopai Studios推出的AI原生电影模型,避开单镜头画质红海,专攻3分钟以上长时序叙事系统
  • 团队背景:核心成员来自Google和Meta超级智能实验室,为前MovieGen原班人马
  • 商业里程碑:上线60天实现1100万美金年度常规收入,公司估值达10亿美金

核心架构与叙事能力

能力维度具体表现
叙事链路文字剧本→大师级视觉分镜→生产级指令,全链路自动化
角色一致性持久身份锁定,数十个镜头间样貌/服装/道具不变
镜头调度自动设计镜头运动、光影布局、焦距及蒙太奇互锁
环境连贯场景风格、建筑细节、氛围元素跨镜头保持统一

差异化卡位与标杆案例

  • 标杆案例:好莱坞导演PJ Ace用它制作3-5分钟连续剧情AI短片,全网播放破百万
  • VFX输出:为韩德合拍片《半月》提供核心视觉特效支持
  • 赛道错位:主流工具卷单镜头画质(如Kling/Veo),PAI专攻长篇叙事一致性

商业化IP与开源生态

  • 双轮驱动:以“内容IP+模型授权”打破纯工具公司天花板,覆盖外部媒体客户
  • 自有IP矩阵:推出电影项目Cortez及SpaceNation(福布斯预计营收1.1亿美金)
  • PAI Pro开源:将内部Skill矩阵模块化开源,支持挂载至Claude Code、Cursor等智能体
  • 开发者赋能:在本地Agent环境中用自然语言直接调用长时序视频渲染链路

核心贡献与关键发现

极市平台(20260720)

  • Pistachio 项目:被 ECCV 2026 接收,用可控视频生成构建视频异常检测(VAD)与理解(VAU)基准,含 9 种基线全面开源
  • 数据集规模:VAD 含 4,962 视频(29.11h,31 类异常,含山体滑坡等 10 类新异常);VAU 含 1,385 视频,提供 Event/Video 级文本标注
  • 五步可控 Pipeline:场景感知分类→条件异常分配→多阶段 Storyline 拆分(正常→前兆→异常→影响→反应)→时间一致合成→先脚本后标注
  • 核心范式:通过「先构建 Storyline 再生成视频」,系统性解决长视频时间一致性漂移和标注事实幻觉难题
  • 方法远未饱和:VAD 最佳 Overall AUC 为 83.7%(PEL4VAD),VAU 最佳 F1 仅 29.39%,长视频多事件因果理解亟待突破
  • 合成数据迁移:Pistachio + 10% UCF-Crime(83.96 AUC)超过完整 UCF-Crime(82.56 AUC),定位为预训练而非替代
  • 跨生成器验证:在 Cosmos 与 Hailuo 等不同视频生成器上均验证有效,排除了模型对特定生成器过拟合的风险
  • 场景覆盖:涵盖商业娱乐、室内、自然环境、关键基础设施、工业施工、公共道路六大类,含固定与移动摄像机视角

GEODPO:VLM几何感知的结构化DPO优化范式(ICLR 2026)

量子位(20260330)

  • 核心发现:VLM几何任务失败主要源于感知错误(元素误识别、关系漏检、结构性幻觉),而非推理不足,即"看错"比"想错"更致命
  • 技术来源:光明实验室与清华大学联合提出GEOPERCEIVE评测框架与GEODPO优化方法,已入选ICLR'26
  • GEOPERCEIVE评测框架:摒弃传统端到端评测,首次将评测粒度细化至单个几何元素与结构关系的识别精度
  • 评分机制:采用"结构解析+Hungarian matching+element-level F1"流程,实现自动化、精确的结构级评分
  • GeoDSL结构化表示:几何领域专用语言,定义元素(Point/Line/Circle)与关系(Collinear/Perpendicular/Tangent),支持可控生成几何结构
  • GEODPO优化流程:采用Translator-Guided RL(模型输出自然语言→翻译器转GeoDSL→结构级评分→构造偏好对→DPO优化)
  • 三大优势:不改变输出空间、奖励信号可解释、优化目标与结构识别直接对齐
  • 实验效果:在多个backbone上显著提升几何感知能力,且分布外(OOD)泛化表现比直接SFT更稳定
  • 下游收益:感知准确度提升后,MathVista等下游几何推理benchmark同步改善
对比维度GEODPO直接SFT
几何感知提升多backbone显著提升有提升但不稳定
OOD泛化表现持续稳定提升部分模型出现波动
优化目标对齐与结构识别直接对齐端到端黑盒优化
  • 范式价值:将端到端能力拆分为可独立评测的子模块以精确定位瓶颈,该思路可扩展至工程图纸解析、CAD结构识别、医学结构建模等结构化理解任务

Spatial-TTT:参数即空间记忆的流式视频空间理解范式(ECCV 2026)

量子位(20260622) | CVer(20260622)

  • 核心范式:将模型参数作为动态空间记忆,通过 TTT 在流式视频推理时持续更新内部世界状态,取代上下文窗口无限膨胀
  • 学术背景:入选 ECCV 2026,一作清华大学博士生刘芳甫,2B 小模型超越多个闭源大模型

性能与效率优势

评估维度Spatial-TTT (2B)对比基准
VSI-Bench64.4分超越 GPT-5、Gemini-3-pro
MindCube-Tiny76.2%领先 Gemini-3-pro(63.9%) 12%
显存占用11.9GB较行业领先模型节省超 40%
视频处理120分钟支持长流式视频持续推理

混合式 TTT 架构设计

  • 层结构比例:解码器按 3:1 交错插入 TTT 层(75%)与全注意力锚定层(25%)
  • TTT 层职责:用 Large-chunk 更新提升 GPU 利用率,将长程信息写入快速权重
  • 锚定层职责:维持预训练语义与跨模态对齐,防止更新边界打断空间连续性
  • 空间预测:对 Q/K/V 加入轻量级 3D 时空卷积,编码局部几何与时间连续性
  • 消融实验:纯 TTT 结构(去掉锚定层)破坏跨模态对齐,平均分降至 53.9(-10.5)

渲染范式与跨模态图像融合前沿

极市平台(20260605) | 新智元(20260606) | CVer(20260606)

  • NeRF技术荣誉与核心机制:2025 ACM Grace Hopper奖(誉为“青年图灵奖”)授予NeRF作者,论文发表仅5年即获此殊荣
  • 作者近况:Ben Mildenhall现为World Labs(李飞飞掌舵)联创,押注空间智能;Pratul Srinivasan任职谷歌DeepMind
  • 核心机制:输入5D坐标(位置+视角),纯MLP网络输出体密度与颜色,仅凭少量2D照片学会3D场景连续表示
  • 深层价值:隐式神经场证明纯网络可替代显式几何,重塑医学成像、天文及计算物理等跨学科通用框架
维度传统图形学方法NeRF 方法
场景表示离散网格/点云/体素连续可微隐式场
几何与光影依赖手工建模与材质光照计算纯MLP网络自动隐式编码
场景分辨率受限于基元精度理论具备无限分辨率

FusionINV跨模态融合范式(TIP 2025)

  • 核心论点:将融合从信息叠加转为分布对齐,使红外融合结果贴近可见光分布,免训练即兼容下游系统
  • 双路反演:分别执行DDIM反演,以红外潜变量为主体,利用可见光注意力特征调节去噪方向
  • 分阶段注入:早期注红外保结构,中期引可见光复外观,后期模型自主去噪调细节
  • 核心洞察:预训练扩散模型具备将任意模态内容“重穿”可见光外观的能力,实现结构与外观解耦
  • 实验配置:基于SD v1.5,单卡RTX 3090,T=50步,小权重CFG保留文本交互
  • 性能表现:FMB数据集PAQ2PIQ与LIQE指标最优;MSRS语义分割(Grounding DINO+SAM无微调)平均最优

CLI:对比学习驱动的视觉语言融合新方法(ECCV 2026)

CVer(20260721)

  • CLI(Contrastive Language-Image):同济大学与蚂蚁集团联合提出,已被 ECCV 2026 接收,旨在通过对比学习框架解决跨模态融合中的语义鸿沟问题
  • 现有方法局限:CLIP等依赖大规模图文对但在细粒度语义对齐上不足;简单拼接或交叉注意力未能充分挖掘模态互补信息
  • 层次化对比学习:在全局-局部不同粒度上对齐视觉和语言特征,而非仅停留在单一全局层面
  • 自适应融合模块:动态调节视觉与语言两模态的贡献权重,突破固定比例混合的局限
  • 负样本挖掘机制:针对性提升对比学习有效性,显著增强跨模态特征判别性
评估维度对比基线CLI提升效果
图文检索CLIP系列显著超越
视觉问答主流VQA模型准确率提高
跨模态理解传统融合方法语义对齐改善
  • 消融实验结论:证实层次化对比学习与负样本挖掘是驱动性能提升的关键组件
  • 方法论启示:跨模态对齐应关注对比目标的层次化设计与负样本质量,而非仅扩大数据规模或模型参数

工业缺陷检测与多模态持续学习工具包

CVer(20260515) | PaperWeekly(20260627)

针对工业缺陷检测与多模态持续学习场景,开源工具包通过免训练机制与极限显存优化,大幅降低了前沿视觉算法的落地门槛。

核心工具包对比

工具包核心定位关键优势产出机构
MuSc-V2零样本多模态缺陷检测免训练,支持2D/3D华科大
LAMDA PRISM多模态持续指令微调单张24G显卡跑通全流程南京大学

MuSc-V2:零样本多模态缺陷检测

  • 核心机制:利用无标注样本间“互打分”实现零样本检测,无需训练即支持2D图像与3D点云
  • 特征聚合:多聚合度邻域聚合多尺度信息,exp操作放大高相似度权重,避免小缺陷被池化稀释
  • 自适应融合:2D与3D跨模态特征互相评分补全(如纹理缺陷由3D形状补全),自适应融合异常分数
  • 性能突破:在MVTec 3D-AD分割AP提升23.7%,Eyecandies提升19.3%,超越多数少样本方法
  • 工程优势:摆脱视觉语言模型推理依赖,兼容任意预训练特征提取网络,解决推理实时性瓶颈

LAMDA PRISM:多模态持续微调设施

  • 极限显存:单张24G显卡同时载入InternVL、视觉塔及路由特征,LLM主体采用bitsandbytes 8-bit加载
  • 量化设计:多模态投影层等关键连接模块跳过量化,保证多模态信息通路精度不流失
  • 插件式架构:骨干适配与方法逻辑完全解耦,核心抽象为CLIntegration接口,注册即可接入
  • 全栈精度:支持bf16/fp16/8bit/4bit四级精度,精度切换仅需修改配置项,与算法逻辑解耦
  • 高频迭代:集成12种MCIT算法与3套基准,子数据集快速验证机制可实现一天5至6版迭代

AirZoo:航拍几何3D视觉统一基准(ECCV 2026)

CVer(20260725)

  • 基准定位:国防科技大学提出的航拍场景几何3D视觉统一评测基准,被ECCV 2026接收,填补航拍3D视觉缺乏统一评测标准的空白
  • 核心动机:航拍3D视觉任务(深度估计、法线估计、光流、立体匹配)长期碎片化;现有数据集(KITTI、ScanNet)面向地面场景,航拍数据集稀缺;航拍场景具有高空尺度模糊、大覆盖范围、纹理稀疏等独特挑战
任务类型核心目标航拍特有挑战
深度估计单目/双目像素级深度预测高空尺度模糊
表面法线估计恢复场景表面几何方向平面区域主导
光流估计帧间像素对应关系大位移+视角变化
立体匹配双目/多目视差计算远距离精度下降
  • 数据构建:整合无人机航拍与卫星遥感多平台数据,覆盖城市与自然地形多场景,提供高质量几何标注(深度图、法线图、光流真值等)
  • 评测体系:统一指标体系支持跨任务横向对比;对主流方法进行系统评测,揭示航拍场景下性能瓶颈——地面场景表现优异的方法因视角与尺度差异显著退化
  • 关键洞察:统一基准是子领域走向成熟的标志(类似ImageNet时刻),与OmniData等地面多任务基准形成互补;军事侦察、灾害评估、城市规划等应用具有双重战略价值

1.3 PixVerse V6与其他视频模型


PixVerse 模型矩阵与 V6 技术代际跃升

小互AI(20260331) | Z Finance(20260331) | AI产品阿颖(20260401) | 量子位(20260401) | 十字路口Crossing(20260408) | AI大模型工场(20260409) | "Z Finance"(20260423) | 十字路口Crossing(20260617) | 甲子光年(20260714) | 智能涌现(20260713) | 智东西(20260714) | 新智元(20260715) | APPSO(20260715) | 路人甲TM(20260715) | AI科技评论(20260715) | 十字路口Crossing(20260716)

市场地位与融资

  • 登顶全球评测第二:在Artificial Analysis图生/文生视频评测中均位列全球第二,物理仿真等核心能力实现代际跃升
  • 完成C轮29.8亿元融资:阿里领投,估值达10亿美元;ARR不到12个月增长10倍超4000万美元,全球用户破1.5亿
  • 市场规模爆发:高盛预测全球AI视频市场将从2025年约30亿美元增至2030年约290亿美元

极致研发效能

  • 训练成本极致压缩:100余人团队以同行约1/10算力运营,1.5个月完成收敛(同行约3个月)

V6核心能力跃升

维度V6能力突破
基础生成最长15秒1080P,出片压缩至几十秒,支持子弹时间等电影级调度
物理模拟流体、布料、粒子系统符合物理直觉,克服高速运动穿模问题
质感微表情还原毛孔细纹突破十级美颜,精准生成眼神微动等细腻情绪
声画同步视频与音效(如雪板摩擦声)一次性协同生成,无需独立制作

三大模型产品矩阵

模型定位与核心优势
V6通用视频生成旗舰,主打物理直觉与电影级镜头
C1全球首个影视垂直大模型,首创多宫格分镜直出,专攻动漫与特效连贯性
R1实时交互式世界模型,底层Omni多模态将50+步采样压缩至1-4步

衍生游戏引擎实战

  • PixVerse Game全球首发:基于R1实时生成,10-60秒自然语言生成可交互Demo;三人团队三周完成乙女游戏PV(传统需3-6个月)
  • 底层三层解耦架构:游戏机制引擎(规则判定)+ R1实时世界模型(画面)+ AI Agent编排层(叙事一致性)

行业演进趋势

  • 集体转向实时世界模型:Runway、Sora、Decart等同向布局,2026上半年赛道吸金超30亿美元

Stellaris-VL-0.8B 端侧视觉语言模型

极市平台(20260622)

  • 产品定位:极视角 Stellaris-VL-0.8B 专为端侧与嵌入式设备设计,参数从 4B 压缩至 0.8B
  • 核心任务:聚焦 OVD(开放词汇检测)、REC(指代表达理解)、VQA(视觉问答)三大产业级能力
  • 轻量化策略:轻量 LLM + 高性能 ViT,经知识蒸馏 + SFT + RL 全链路后训练压缩参数
  • 边缘推理:针对单帧实景图像深度优化,边缘设备实现秒级画面解析
  • 稳定性:7×24 小时长时任务下内存占用不持续上涨,适配固定监控与移动巡检
  • 离线部署:支持完全本地运行,无需云端协同,满足工业与能源场景数据隐私合规
  • 落地场景:覆盖低空无人机、移动巡检机器人、车载/船载/矿载视觉等,兼容存量设备
测评维度Stellaris-VL-0.8B同参数开源模型
ODinW13 开放词表检测大幅领先基准
指代表达式定位大幅领先基准
产业综合集 mAP@0.5:0.95远超基准
工业复杂画面识别更低幻觉、更少错检漏检基准
  • 关键洞察:0.8B 是端侧部署的实用甜点;蒸馏+RL 是轻量化关键补偿;本地离线在工业场景具备差异化优势

ShotStream:实时流式多镜头长视频生成(ECCV 2026)

机器之心(20260711)

  • ShotStream:港中文与快手可灵联合提出的首个实时流式多镜头长视频生成框架,已被 ECCV 2026 接收
  • 推理效率:单张 H200 GPU 实现 16 FPS 推理,较传统双向模型效率提升 25 倍以上,支持流式提示词实时调整
  • 生成模式:突破传统双向架构的“全量等待”高延迟模式,实现流式实时输出

架构演进:两阶段蒸馏

  • 阶段一:将双向模型微调为“下一镜头”教师模型,通过动态稀疏采样避免显存爆炸
  • 阶段二:利用分布匹配蒸馏(DMD)将其转换为仅需 4 步去噪的因果学生模型

双缓存记忆与不连续 RoPE

机制全局缓存局部缓存
存储内容稀疏条件帧当前镜头刚生成帧
作用范围跨镜头一致性单镜头内一致性
  • 不连续 RoPE:在镜头切换边界施加离散相位偏移,解耦全局与局部上下文
  • 两阶段蒸馏:阶段一用真实历史帧训练,阶段二用模型自生成帧,消除训推差异
  • 实验表现:在跨镜头一致性、切换控制、文本对齐上显著优于 Mask2DiT、CineTrans 等模型

逐帧自回归实时交互视频

沃垠AI(20260716) | 通义大模型(20260717) | "Z Potentials"(20260724) | 量子位(20260724) | 十字路口Crossing(20260725) | JackCui(20260727)

  • 全双工打断:支持随时插话打断并即时响应,兼容语音/文字/图片多模态动态指令输入
  • 异步双通路:单卡Thinker感知与多卡Performer去噪,保障200ms响应底线与环境光影同步
  • 全栈加速套件:三层正交叠加(SageAttention+TurboDiffusion+TurboServe)实现系统级推理优化
  • 算力成本下探:结合NVFP4/FP4量化、融合蒸馏及KV-Cache管理,消费级显卡即可满血运行

模型演进与产品矩阵

模型版本性能参数核心特性与场景
Vivix A1约30B激活全双工实时互动,支持开放场景自由行走及全身大动作
Vivix W1交互式生成提示词仅定开局,后续叙事走向完全由用户实时交互驱动
Wan v0.1192×336基础版,验证面部特写生成效果
Wan v0.2640×368@25FPS进阶版,解锁手势等半身连贯画面
X2.0屏幕端960p/24fps换脸换装等五大实时操控能力
X2.0端侧384p/16fps首个支持手机本地运行的实时交互模型

交互能力与产品落地

  • 多维角色能力:支持环境感知与多通道情绪自然过渡(非模板切换),可执行行走转身舞蹈等动作
  • 核心产品形态:单图生成实时对话角色(人/动漫/宠物),赋能陪伴、客服、娱乐、教育及博物馆导览
  • 极致降本定价:X2.0定价6美元/小时(仅竞品1/12),2分钟试穿成本仅0.2美元
  • 开源生态策略:全面开放内测与API平台,开源加速工具以降低行业成本,核心论文公开于arXiv
  • 行业竞争趋势:模型能力趋同后,推理加速成视频赛道核心竞争维度,构建“谁更快谁赢”格局

实时交互与传统生成对比

对比维度传统视频生成实时交互模型
响应延迟秒级~分钟级百毫秒级(550ms)
视频时长固定(4-10秒)无限时长
交互方式实时双向全双工
输入形态文本/图片图片生成角色及动态多模态

1.4 国产视频模型深度评测


Vidu Q3 参考生:AI视频从单帧画质迈向多镜头一致性

APPSO(20260413) | AI产品阿颖(20260413) | 特工宇宙(20260413) | AI大模型工场(20260413) | 新智元(20260414) | 甲子光年(20260414) | 阿里云(20260414) | 量子位(20260415) | 机器之心(20260415) | 优设AIGC(20260415) | 小互AI(20260415) | 智东西(20260416) | APPSO(20260507) | 甲子光年(20260520)

核心技术突破:多图参考与视听一体化

  • 模型代际演进:Q1打通图像到视频叙事;Q2深化微表情与情绪张力;Q3实现系统性生产、16秒声画直出与4K输出
  • 全要素资产化(万物可参):支持最多7张参考图(角色/场景/服化道/音色等),通过自然语言脚本跨元素拆分融合
  • 角色IP固化:单图定妆即可在多场景/多集数保持面容、服装、音色高度一致,彻底解决跨镜头面部融化与服饰穿模痛点
  • 物理交互真实感:自动补全光影反射与空气颗粒感,过肩镜头中近远景透视遮挡关系全程恒定,人物跑动时环境互动自然

视听特效体系

视听维度覆盖类型核心表现
6大视觉特效粒子/流体/动力学/运镜/转场/光影贴合物理逻辑,深度服务于剧情推进与镜头节奏
5大沉浸音效环境/动态/氛围/拟音/情绪首次对氛围音建模,支持多轨交叠与声画精确同步

产能工业化与成本重构

应用场景优化重点成本对比
漫剧短剧跨镜一致性、速度线与打击感1集3分钟1080P仅36元,较传统降本80%
商业广告多版本快速迭代、高端质感10条15秒测试30元,较传统降本80%
  • 极致性价比:生成速度达行业5倍,1080P最低0.2元/秒;MaaS服务API价格仅为行业平均1/3
  • 计费模式颠覆:推出Video Plan包干制,每日最高40分钟额度;Vidu Claw打通微信/飞书,实现对话级一句话闭环出片

市场验证与战略合作

  • 国际双榜登顶:力压谷歌Veo等模型,登顶Artificial Analysis基准测试及SuperClue多图/单图参考双榜
  • 规模化生产验证:万兴剧厂实测抽卡精确度翻倍,分镜可用率达80%
  • 阿里云全面结盟:Vidu接入百炼平台共研多模态世界模型,依托全球一张网拓展海外市场

1.5 Wan2.7视频创作控制与扩展


Wan2.7 视频创作控制:续写、动作模仿、运镜与风格编排

千问APP(20260403) | 量子位(20260403) | 智东西(20260403) | 财联社AI daily(20260404)

阿里 Wan2.7-Video 实现从素材生成到全链路创作控制的跃升,支持文本/图像/视频/音频全模态输入,输出 720P/1080P,时长 2-15 秒。

模型代号核心能力
文生视频Wan2.7-t2v文字直出视频,支持群像千人千面
图生视频Wan2.7-i2v图像+音频输入生成视频
参考生视频Wan2.7-r2v最多5个主体参考,精准迁移复杂动作
视频编辑Wan2.7-videoedit局部修改、角色替换、场景与风格变换

视频PS级编辑操控

  • 局部增删改:自然语言指令增删替换元素,光影材质自动匹配
  • 角色与台词操控:替换角色保持背景姿态不变;改台词保持口型音色统一
  • 场景与风格转换:一键切换写实/3D/黏土等风格或季节天气,原动作不变

视频续写与运镜控制

  • 视频延展:2秒素材最长延展至15秒,首尾帧控制消除传统刹车感
  • 运镜体系:支持推拉摇移跟升降及希区柯克变焦等数十种复合运镜
  • 参数控制:机位、视角、景别、焦距等拍摄参数均可自然语言修改
  • 叙事联动:运镜与剧情联动控制叙事张力,保留原动作生成新场景

参考生视频与动作模仿

  • 多主体参考:最多支持5个主体参考(业内最多),多宫格图转动画片
  • 动作模仿:支持多人协同动作复刻,同步复现参考视频运镜与特效节奏
  • 风格库覆盖:2D/3D、水墨、赛璐璐等上千种组合,自动匹配影片类型
  • 全链路创作:支持智能剧本创作和分镜调度,实现从演到导的创作跃升

1.6 CVPR 2026 视频模型趋势:运动建模与动态世界理解


视频预测与运动建模范式演进

极市平台(20260430) | AI科技评论(20260512) | 量子位(20260516) | 机器之心(20260520) | 量子位(20260528) | AI科技大本营(20260602) | 量子位(20260605) | 机器之心(20260611) | CVer(20260614) | "Z Potentials"(20260622) | 智能涌现(20260622) | AIGC开放社区(20260716) | 机器之心(20260717) | CVer(20260718) | 机器之心(20260721) | 量子位(20260607) | 极市平台(20260722) | 量子位(20260729)

  • 隐空间视觉因果:ProLaViT构建连续隐空间三步因果链,克服纯文本CoT模态鸿沟
  • 免解码4D对齐:VGGRPO通过轻量连接层对齐VAE与LGM,隐空间4D奖励兼具低开销与动态场景支持
  • 双奖励GRPO优化:摄像机平滑度(惩罚平移/旋转加速度)+几何重投影一致性(光流过滤动态仅聚合静态点)
  • 四维空间约束:World-R1纯文本RL达PSNR+10.23dB;VGGRPO解决镜头抖动与几何畸变
  • 频域物理对齐:PhysInOne频域指标PMF使Wan2.2升至3.147;Magi-1登顶Physics-IQ榜单
  • 连续场与自回归:PDR方法实现连续高斯场视频预测超1000 FPS,突破物理对齐连续场瓶颈
  • 三层效率加速:SURF使Wan2.1-14B生成提速43倍(1080p);LightX2V三层优化显存与步数(16步收敛)
  • 跨Backbone泛化:框架不绑定特定模型,HunyuanVideo提至44.5,Wan2.2达68.2(RULER-Bench +21.8分)

核心技术路线对比

  • 物理对齐评测:PhysInone频域PMF使Wan2.2升至3.147;NEWTON准确率达37.4%
  • VLM指导优化:NEWTON/可灵采用Planner-Executor循环,过程+目标监督提升16.7分
  • 免解码4D对齐:VGGRPO防4D重投影畸变,优于损泛化的架构修改与高开销像素级RL
  • 通用视觉智能:GenCeption用123万帧媲美6亿帧专用模型,验证生成式预训练潜力

1.7 视频世界模型长期记忆评测基准


MBench:视频世界模型长期记忆能力的首次系统化评测

机器之心(20260611) | 机器之心(20260615) | CVer(20260627) | 机器之心(20260706) | 人工智能学家(20260706) | 机器之心(20260403) | 智东西(20260721) | 机器之心(20260627)

MemoBench | 动态遮挡记忆 | 10个模型ORS得分均低于0.6
KIVI-Bench | 知识密集型事实 | 最佳闭源FactP仅83.2%
Physion-Eval | 物理常识与因果 | 83.3%视频含物理错误
MME-CoF-Pro | 过程级推理一致性 | RS相关性0.61,最高推理仅56分

长期记忆与知识准确性痛点

  • 记忆与一致性短板:SOTA模型在实体/环境/因果一致性上均有缺陷,ORS普遍低于0.6
  • 事实准确性缺失:知识密集型生成频发三大系统性错误:实体误描(42.6%)、操作错误(40.7%)、组件错位(15.0%)
  • 物理常识薄弱:超83%视频含物理错误,Gemini 3.0 Pro漏检超74%,视觉真实感不等于物理真实性

推理能力与生成质量解耦

  • 推理与生成解耦:Veo-3.1与Sora-2的RS得分仅56和50,Kling生成强(65.1)但推理极弱(13.8)
  • 结果导向指标失效:RS评分与last-frame correctness呈负相关(-0.41),仅看结果会系统性高估推理能力
  • 评测范式革新:MME-CoF-Pro首创过程级评测(覆盖16类四层推理),通过Gemini-2.5逐步判定量化推理链断裂点

提示词策略与反直觉洞察

  • 文字提示双刃剑:文字提示虽能提升RS(Veo +4.5/Sora +7.6),但致7个模型一致性全线下降
  • 视觉提示认知错位:模型易将视觉标注误判为画面内容渲染,在精细任务中拉低成绩(Veo-3.1 RS -13.0)
  • 提示堆叠无法单调提升:当前模型无法稳定利用累积引导信息,多步渐进提示曲线呈现剧烈波动
  • 反直觉洞察:动态复杂性比强度更易触发失败;首帧质量提升比扩大近3倍参数量更有效(PSNR +4.2dB)

技术跃迁与范式加速

  • 评测标准更迭:传统视觉指标淘汰,FactP/HelpS双指标、V-D-R三段式探测及STEM专家评判成新标准
  • 架构创新加速:Matrix-Game 3.5首创Patch Memory直击记忆痛点,结合量化与3步采样实现单GPU 720P/20FPS实时生成

Pistachio:可控视频生成重构视频异常检测与理解基准(ECCV 2026)

极市平台(20260720)

  • 核心贡献:以可控视频生成为核心手段,系统性构建视频异常检测(VAD)与异常理解(VAU)基准,被 ECCV 2026 接收并全面开源
  • 解决数据偏置:针对现有数据集偏向高传播性事件(抢劫/打斗等)而忽视设备故障等问题,引入可控生成系统性覆盖长尾异常类别
  • 数据集规模:Pistachio-VAD 含 4,962 视频(29.11h,31类,覆盖10类传统基准未覆盖类型);Pistachio-VAU 含 1,385 视频(含时间关系与因果理解标注)
  • 方法远未饱和:VAD 最佳 AUC 仅 83.7%(PEL4VAD),VAU 最佳 F1 仅 29.39%

五步可控生成 Pipeline

步骤功能关键设计
场景感知分类VLM 识别输入图像场景确定异常分配上下文
异常分配根据场景选择合理异常确保现实合理性
Storyline构建长视频拆分7-8事件段正常→前兆→异常→影响
时间一致合成上段末帧作下段起始帧增强片段间连续性
层级语义标注先有事件脚本再生成视频减少后验标注幻觉
  • 标注范式革新:采用“构建Storyline→生成视频→转化为标注”,区别于传统“生成→猜测描述”,显著减少事实幻觉
  • 合成数据迁移价值:用 10% Pistachio 数据混合训练 UCF-Crime,AUC 从 82.56% 提升至 83.96%,AP 从 21.62 提升至 24.25%
  • 核心洞察:可控生成 > 数据增量,其价值在于异常类别均衡、正常样本复杂化和时间结构可控,可作为有效的预训练数据源

2. 图像生成与视觉AI


2.1 图像生成模型进展


图像与数字人生成前沿技术

机器之心(20260331) | 财联社AI daily(20260401) | 通义大模型(20260401) | 阿里云(20260401) | JackCui(20260401) | 智东西(20260401) | 新智元(20260401) | 路人甲TM(20260401) | 优设AIGC(20260401) | 极市平台(20260402) | 甲子光年(20260402) | AGI Hunt(20260404) | 新智元(20260405) | 机器之心(20260405) | 蓝色光标(20260408) | AIGC开放社区(20260409) | AI有道(20260412) | 卡尔的AI沃茨(20260416) | AIGC开放社区(20260417) | AI范儿(20260417) | APPSO(20260418) | 量子位(20260419) | 优设AIGC(20260420) | 阿枫科技(20260420) | APPSO(20260421) | 赛博禅心(20260421) | GeekSavvy(20260421) | 歸藏的AI工具箱(20260422) | APPSO(20260422) | 机器之心(20260422) | 量子位(20260422) | 数字生命卡兹克(20260422) | AI范儿(20260422) | JackCui(20260422) | 新智元(20260422) | 赛博禅心(20260422) | InfoQ(20260422) | 硅星人Pro(20260422) | 第一新声(20260422) | 小互AI(20260422) | 智东西(20260422) | 人工智能学家(20260422) | 新智元(20260422) | 摸鱼小李(20260422) | AI新榜(20260422) | CVer(20260422) | 量子位(20260423) | AIGC开放社区(20260423) | 十字路口Crossing(20260423) | 优设AIGC(20260423) | APPSO(20260423) | AI产品银海(20260423) | 机器之心(20260423) | 极市平台(20260423) | CVer(20260423) | 深度学习与NLP(20260422) | 硅星人Pro(20260424) | 船长AI视界(20260424) | 量子位(20260425) | 新智元(20260427) | 网罗灯下黑(20260428) | 优设AIGC(20260429) | AI寒武纪(20260429) | AI产品阿颖(20260430) | 硅星人Pro(20260430) | 量子位(20260430) | AI科技评论(20260430) | APPSO(20260501) | 量子位(20260501) | 硅星人Pro(20260501) | 机器之心(20260501) | 人工智能学家(20260502) | 硅星人Pro(20260503) | 硅星人Pro(20260505) | 机器之心(20260506) | 量子位(20260506) | AIGC开放社区(20260508) | 机器之心(20260511) | 机器之心(20260512) | CVer(20260513) | PaperWeekly(20260514) | 机器之心(20260514) | 量子位(20260516) | "Z Finance"(20260522) | AIGC开放社区(20260525) | 火山引擎(20260525) | 通义大模型(20260528) | DeepTech深科技(20260530) | AIGC开放社区(20260601) | CVer(20260601) | 机器之心(20260603) | 极市平台(20260604) | 机器之心(20260608) | AI科技评论(20260608) | 量子位(20260609) | 机器之心(20260610) | 商汤科技SenseTime(20260612) | 量子位(20260614) | 极市平台(20260616) | 机器之心(20260618) | AI科技评论(20260625) | 路人甲TM(20260628) | 量子位(20260701) | 新智元(20260701) | 夕小瑶科技说(20260701) | AI前线(20260701) | 智东西(20260701) | AIGC开放社区(20260703) | AI科技评论(20260708) | 优设AIGC(20260713) | CVer(20260713) | AI科技评论(20260715) | 智东西(20260716) | 硅星人Pro(20260719) | APPSO(20260720) | 光子星球(20260720) | 智东西(20260721) | 袋鼠帝AI客栈(20260722) | 深度学习与NLP(20260405) | 机器之心(20260728) | CVer(20260728) | AI产品银海(20260729)

  • 慎用美学RL:重度美学RL致分布坍缩,仅在不损多样性的肢体结构等问题上使用
  • 关键量化发现:汉字单字约300次曝光(日常覆盖3500字),人物身份记忆需约4500次语言匹配曝光
  • 免训练推理增强:BOG技术将DiT预测做结构化归一化,强化垂直于flow流场的信息
  • 原生2K训练修正:标准动态时间偏移在2K致过度挤压,团队给出截断修正方案
  • 弃用学术基准:学术基准失效(GPT-Image-2人类偏好最强但GenEval中游),改以人类偏好为主

AI影视与商业应用

  • 长片与商业提效:字节Seedance实现95分钟AI长片(15人制作);京东数字人直播服务7万商家,公域流量提升超60%
  • 商汤Seko 3.0实测:单人10分钟完成太空微电影,切换王家卫/黏土等Skill即变气质,中间产物留存无限画布可随时干预
  • Skill模板化机制:编码编导经验为模板,同剧本经不同Skill处理人物造型/镜头剧变,关键结果大多一次生成可用
  • 长视频理解极限:VideoChat-Flash单3090处理万帧,细节识别准确率99.1%
  • 空间智能演进:开源240亿参数JoyAI-Image-Edit将空间理解写入底层,实现轨迹控制与3D旋转
  • OPC产业基地落地:徐汇西岸40+团队入驻,联建上戏实习基地;Rang AI Studio全网播放超4亿,聚宝仙盆热度超3.5亿
  • 核心产业洞察:AI影视竞争从生成能力转向分发渠道与产业资源,工具趋同后创作与运营成真正壁垒

核心产品参数对比

  • 生成效能:华为Boogu(2.08亿图/40万美元/盲测第一) vs 字节DreamLite(0.39B端侧/3秒生成)
  • 多模态架构:商汤U1(8B无编码器/MMMU80.55) vs 字节Lance(3B MoE/GenEval0.90)
  • 视觉压缩:DeepSeek(284B MoE/图压缩81Token) vs GPT/Claude(传统大模型/迷宫任务被超越)

平台促销

  • 周年庆活动:非会员免费用Seedance 2.0 Mini,月会员首购5折,年会员首购4折,Seedance 2.0低至0.42元/秒

3D骨架行人重识别(SRID)全景综述

新智元(20260605)

  • 领域首篇系统综述:南洋理工发布3D骨架行人重识别(SRID)综述,被IJCAI 2026接收,系统梳理2014年至今技术演进(已开源:github.com/Kali-Hac/3D-SRID-Survey)
  • 核心识别逻辑:将人体简化为关节点骨架,利用物理结构(身高、臂长)与运动步态模式(步幅、步频)提取生物特征
  • 四大核心优势:天然脱敏契合GDPR隐私要求、极轻量(SimMC仅0.15M参数)、视角不变、规避换装与遮挡等外观痛点

三大建模范式横向对比

建模范式核心思路代表工作核心特点
手工特征专家定义骨骼几何与步态时空参数Munaro等(ICRA 2014)可解释性强,泛化受限
序列建模LSTM等时序模型编码姿态演变与步态语义CAGEs(TPAMI 2022)捕捉时序动态,依赖序列完整性
图建模关节构建动态拓扑图,学习部位协同联动CTR-GCN(ICCV 2021)当前主流方向,准确率高

基准测评与应用场景

  • 主流数据集:BIWI、IAS-Lab、KS20、CASIA-B、3DGait五大基准上系统横向测评,深度学习显著超越手工方法
  • 效率突破:Hi-MPC、MoCos等深度图模型在准确率与计算效率上取得较优平衡,极具边缘设备部署潜力
  • 跨域应用场景:医疗健康(帕金森预测、中风康复评估)、具身智能(虚拟化身运动重定向、手势交互)、跨模态安防认证

Vision-OPD:自蒸馏实现细粒度视觉感知SOTA

AIGC开放社区(20260729)

  • 核心发现:同一模型看裁剪放大局部图比看全图准确率高18-22个百分点,从4B到千亿参数模型均存在此鸿沟,证明细粒度瓶颈在注意力分配而非模型容量
  • 方法创新(Vision-OPD):让"看局部的自己"教"看全局的自己",仅用6.2K全自动合成数据,无需外部教师/人工标注/推理工具
  • 双角色自蒸馏架构:从同一模型派生裁剪教师(特权视角)与全图学生(标准推理),梯度只流过学生,教师用EMA正则化防漂移
  • 在线蒸馏优势:训练前缀由学生自生成,与推理时状态分布对齐,避免离线SFT的前缀错配问题;稠密token级监督克服GRPO/DAPO等RL方法的稀疏奖励问题

细粒度视觉基准排名

模型平均分
Vision-OPD-9B79.68
Gemini-3.1-Pro79.25
Gemini-3.5-Flash79.24
Qwen3.5-397B77.44
GPT-5.472.77
  • 通用能力保持:分布外任务(MMVP、CV-Bench、MMStar、POPE)分数持平或微涨,而SFT策略导致MMStar从83.07降至73.33
  • 关键洞察:精准训练信号比数据量更重要——关键不是"喂更多"而是"喂对位置";自蒸馏范式为其他模态/任务的自提升提供通用框架
  • 代码已开源:github.com/VisionOPD/Vision-OPD

大规模食品图像分割:DishSeg24k 数据集与 FEAST 方法

CVer(20260718)

  • DishSeg24k 基准:最大规模真实用餐场景菜品分割数据集,含24,096张图像、112,281个实例标注、278个菜品类别,采用[大类]-[食材]-[烹饪方式]三级分类体系
  • 核心挑战:针对菜品密集重叠、细粒度类别相似性、长尾分布三大分割难题;数据来源3,493张真实用餐图像 + ZSFood数据集的完整重标注
  • FEAST 方法创新:将查询解码重构为强化学习优化的马尔可夫决策过程(MDP),每层更新视为顺序决策步骤,随机策略采样连续语义偏移量探索多种边界假设,避免确定性方法陷入局部最优
  • MoE双评论家解耦:任务评论家指导掩码精化,结构评论家指导专家路由,有效防止高频类别垄断专家容量,解决长尾分布问题
  • 性能对比(DishSeg24k测试集):
方法mIoU(%)
DeepLabV3+32.89
FoodSAM (ViT-H)37.90
ED-AFormer44.81
Mask2Former50.22
FEAST53.43
  • 跨数据集验证:相比基线Mask2Former,mIoU +3.21%、mDice +3.68%、mAcc +4.00%;在FoodSeg103上同样有效
  • 关键洞察:MoE+强化学习双评论家解耦是解决细粒度长尾问题的有效范式,可迁移至其他细粒度分割任务;论文被ACM MM 2026(CCF-A类)录用

ViT³:亚二次复杂度的全局注意力架构

CVer(20260519)

  • 背景:标准 ViT 自注意力复杂度为 O(N²),处理高分辨率图像时计算与显存二次增长,成为密集预测任务的核心瓶颈
  • 核心创新:清华&阿里联合提出 ViT³,通过数学变换重构注意力计算,在不引入强局部性假设(如窗口注意力)的前提下实现亚二次复杂度,同时保留全局感受野
  • 关键设计:即插即用——可直接替代标准 ViT 中的多头自注意力模块
  • 架构对比
维度标准 ViTSwin TransformerViT³
复杂度O(N²)O(N·W²)低于 O(N²)
全局建模❌ 窗口内
分辨率扩展受限较好显著改善
  • 意义:挑战了"局部窗口=高效"的主流范式,证明全局建模与低复杂度可以兼得,与近期 Sub-Quadratic Transformers 研究趋势一致
  • 状态:目标投稿 CVPR 2026,目前处于预发布阶段,完整实验数据待公开

2.2 AI设计工具与UI生成


AI设计工具与可视化生成:技术演进与交互范式

莫理(20260406) | 优设AIGC(20260417) | 优设AIGC(20260422) | 路人甲TM(20260422) | AI寒武纪(20260422) | 阿枫科技(20260422) | 曼话AI(20260422) | AIZ小朱(20260422) | 沃垠AI(20260422) | AI产品阿颖(20260423) | 甲木未来派(20260423) | 卡尔的AI沃茨(20260423) | "梦飞 AI"(20260424) | AI异类弗兰克(20260426) | 路人甲TM(20260426) | AI产品银海(20260426) | 新智元(20260426) | 优设AIGC(20260427) | 沃垠AI(20260427) | 莫理(20260427) | 阿枫科技(20260429) | AIZ小朱(20260429) | 网罗灯下黑(20260429) | 饼干哥哥AGI(20260518) | "AGI Hunt"(20260519) | 莫理(20260523) | AI产品银海(20260525) | 路人甲TM(20260525) | AI寒武纪(20260526) | 阿枫科技(20260526) | AI异类弗兰克(20260526) | 沃垠AI(20260527) | 莫理(20260609) | 花叔(20260616) | 十字路口Crossing(20260618) | 沃垠AI(20260330) | 优设AIGC(20260707) | AIZ小朱(20260707) | 前沿在线(20260708) | 字节跳动Seed(20260708) | 智东西(20260709) | 火山引擎(20260708) | AI新榜(20260710) | 夕小瑶科技说(20260713) | APPSO(20260713) | 歸藏的AI工具箱(20260713) | 优设AIGC(20260715) | 路人甲TM(20260721) | 光子星球(20260721) | 阿里云开发者(20260722) | AI异类弗兰克(20260722) | 卡尔的AI沃茨(20260722) | 特工宇宙(20260722) | 老金带你玩AI(20260723) | 量子位(20260723) | 网罗灯下黑(20260423)

核心生成模型与工具对比

模型/工具核心优势价格/定位
GPT Image 2极致真实感(肉眼难辨)、多语种零乱码、精准局部编辑≈0.05元/张
Seedream 5.015+语种原生、选区自然语言局部修改2K图0.6元/张
Qwen-Image-3.04.5k超长指令、10px小字、12国语言直出免费开源
Lovart专注创意变现(品牌/电商),打通全链路工作流创意设计
Claude Design专注UI界面与产品原型,输出可交互多页面代码UI/原型

生成质量与编辑能力突破

  • 文字排版质变:文字渲染准确率逼近95%,彻底解决中文及密集排版乱码痛点
  • 极致真实感:生成人像、票据、红头文件达肉眼难辨程度,Arena排行榜领先
  • 精准局部修改:支持拆分图层、Touch Edit局部重绘(换装且手持物不变)及无痕改字
  • 可编辑活对象:直接生成SVG等矢量结构(如流程图),支持节点级编辑与联动

生产工作流与范式重构

  • 全链路闭环:串联生成-局部修改-图生视频-PSD分层-样机合成,打通生产末端
  • 交付级直出:支持导出带图层PSD/矢量字体/PPT,满足1个起订印刷与接力编辑
  • 工作流管线化:无限画布串联创意到交付,Skill封装复杂提示词实现批量自动化生产
  • Design Agent颠覆:从文本/参考图直接生成可交互原型与React代码,设计稿退化为中间产物
  • 经验流水线化:AIGX矩阵消除“抽卡”随机性,将设计专家经验深度嵌入实际工作流

商用落地与安全风险

  • 品牌一致性闭环:Brand Kit自动锁定Logo/色板/字体,AI参考AI确保跨场景高度一致
  • 结构化提示词工程:依赖“格式死锁→质感拉满→反向避坑”六步法,覆盖十余类商用场景
  • 算力成本骤降:单张图成本约5分钱,视频约1元/10秒,品牌视觉物料门槛降至极低
  • 图片信任体系崩塌:银行流水与聊天截图等可几秒无损生成,社会尚未建立替代验证机制

遥感视觉感知基础模型与多模态理解

CVer(20260401) | CVer(20260406) | CVer(20260409) | 极市平台(20260421) | CVer(20260429) | CVer(20260517) | CVer(20260518) | CVer(20260531) | CVer(20260605) | 极市平台(20260710)

视觉推理与检索增强

  • 迭代视觉证据推理:RS-EoT-7B引入苏格拉底多智能体,主动驱动多轮视觉证据寻求,破解VLM“一瞥效应”伪推理,多项遥感VQA基准达SOTA
  • 两阶段原型检索:OpenDPR分解变化定位与识别,用DiffusionSat合成视觉原型实现无训练检索,四大基准超越现有无监督方法
  • 交叉注意力重排序:CAME挖掘图库内部邻域关联修正相似度,大视角差任务AP最高提升+8.41%

多模态统一与跨域突破

  • 五模态联合生成:MetaEarth-MM以场景中心联合建模支持RGB/SAR等任意互转,自建EarthMM数据集(280万图像)
  • 光学/SAR统一分割:SkySense-VITA支持视觉/文本双提示,18个数据集平均mIoU领先超10%
  • 自适应频率分解:F2Net三分支动态分离高低频,兼顾细节与全局语义,DeepGlobe与Inria均达SOTA

零样本与弱监督范式

  • 跨域零训练分割:Earth2Ocean无需水下微调,直传陆地VLM实现开放词汇分割,平均mIoU提升超6个点
  • 部分弱监督检测:PWOOD仅需10%-30%弱标注(水平框或单点),即可比肩半监督有向目标检测方法
  • 原生SAM2免训练:Remote SAMsing采用黑遮蔽多轮迭代机制,大图覆盖率从30-68%跃升至91-98%

核心模型与数据基准

模型/基准核心数据关键成果
OlmoEarth28.5万位置观测超60%冻结特征任务达最优,超越AlphaEarth
Sky-VT-300k30万+样本/176类支撑光学/SAR统一上下文分割
EarthMM280万图像/5种模态支撑五模态任意互转
UniGeoRS14.2万图/1154地点填补卫星/无人机/地面三视角基准空白
AquaOV255255类/2万张图像支撑跨域水下零训练分割评估

CVPR 2026 模型适应性研究盘点

AI科技评论(20260609) | CVer(20260728)

  • 研究范式转向:CVPR 2026 核心趋势从「能力扩张」转向「能力管理」,聚焦持续学习与跨模态协同问题

代表性论文对比

  • QKD(北邮):参数化量子电路映射Hilbert空间,CIFAR-100/ImageNet领先,支持exemplar-free设定
  • LCA(Meta):100万单目视频预训练+多视角后训练,双分支解码器,面部/手指/身份保持优异
  • FEAT:ETF原型几何对齐+Energy推理校正,联邦设定通信开销低,兼容现有框架
  • PolyV(NUS+NTU):稀疏MoE实现图像/视频/3D双向交互,相比Qwen2.5-VL-7B平均提升约10%
  • WienerCLIP(东南大学):将维纳滤波引入CLIP表征空间,提出训练无关的频谱滤波少样本适配方法

关键洞察

  • 选择性继承优先:持续学习核心从「防遗忘」转向「任务相关性建模」与知识选择性复用
  • 方向可靠性差异:少样本适配中文本对齐方向稳定,残差方向易受噪声干扰,无差别调整会污染可靠知识
  • 信噪比自适应滤波:固定文本对齐方向作锚点,仅在残差空间依信噪比闭式滤波,额外运行开销仅约0.07%
  • 3D范式迁移:「大规模预训练+高质量后训练」成功从语言/2D视觉迁移至3D数字人领域
  • 联邦学习新解:瓶颈在「如何有效使用样本」而非「选哪些样本」,几何结构对齐提供新思路
  • 模态协同增强:统一视觉模型下一步是模态间协同增强(双向交互、语义锚点),而非简单整合多输入
  • 经典理论赋能:经典信号处理(维纳滤波)与现代深度表征存在未充分挖掘的连接,可即插即用叠加5种适配方法

MobileSAM2:手机端分割一切模型

极市平台(20260723)

  • 产品定位:MobileSAM2 为 SAM2(Segment Anything Model 2)的移动端轻量化版本,目标是在手机等移动设备上实现实时图像分割(分割一切)
  • 核心价值:将此前需高端 GPU 才能运行的分割能力下放到手机端,降低部署门槛,拓展移动端 AR、图像编辑、场景理解等应用场景

2.3 视觉特效与动态生成流水线


AI短剧工业化生产与LibTV工具平台

优设AIGC(20260615) | 卡尔的AI沃茨(20260617) | 船长AI视界(20260617) | AI异类弗兰克(20260618) | 卡尔的AI沃茨(20260622) | 有机大橘子(20260623) | 袋鼠帝AI客栈(20260623) | 公子龙(20260630) | 船长AI视界(20260701) | 路人甲TM(20260702) | 路人甲TM(20260703) | 阿枫科技(20260709) | 花叔(20260709) | 网罗灯下黑(20260713) | 苍何(20260714) | 阿枫科技(20260713) | AI信息Gap(20260714) | 哩布哩布AI(20260714) | 莫理(20260714) | "Founder Park"(20260714) | 优设AIGC(20260714) | 公子龙(20260714) | 小互AI(20260714) | 有新Newin(20260714) | 十字路口Crossing(20260714) | 袋鼠帝AI客栈(20260714) | 赛博禅心(20260714) | AI产品阿颖(20260714) | 昆仑万维集团(20260716) | 莫理(20260716) | 路人甲TM(20260717) | 沃垠AI(20260717) | 阑夕(20260723) | AI新榜(20260721) | 阿枫科技(20260727) | 船长AI视界(20260728) | 阿枫科技(20260729) | AI信息Gap(20260729) | AI产品阿颖(20260729)

  • LibTV:3分钟生成成功率超80%,千万级激励促生态变现
  • 海艺剧场:自动批量+逐镜头双模式,实测每秒成本约0.3元
  • LuxReal:Agent起稿配自由画布精修,降低单次启动成本
  • 爱奇艺纳逗:聚焦项目级统筹管理,上线近70个专属Agent
  • 小云雀:资产多维管理,单集成本约300元,支持全景与多形象
  • 豆包Seedance:极限成本0.42元/秒(一集<30元),mini模型免费
  • 豆包Seed Audio:突破泛化场景,单次最长通用声音生成2分钟

Skill系统与创作模式迭代

  • Skill产品化:封装镜头/叙事/配色逻辑,复用经验逼近90%专业效果
  • 创作生态闭环:提供数十现成Skill,支持头部创作者反向输出Skill
  • 三大创作模式:探索创作、锁定风格Skill增强、创意到成片短片工作室
  • 高质量画面:悬疑冷金属/温情蜡笔画/玄幻3D均达热播水准一次成功
  • 流程化操作:大纲到分镜流程化,上下文持久沉淀,对话确认无需提示词

关键技术突破与行业演进

  • AI视频三阶段:1.0模型层→2.0Agent层→3.0商业化层(需四位一体)
  • 3D片场与锚点:2D转3D解决空间一致性,唯一ID解决样貌漂移
  • 多集连更:大纲续集自动延续世界观,前置出错仅局部重跑降损耗
  • 行业爆款率:25Q1日均上新1300+部,爆款率仅0.16%,工具≠质量
  • Skill系统价值:AI降制作门槛未降创意门槛,Skill正弥合此创意鸿沟

核心竞争壁垒与商业化变现

  • 核心壁垒转移:工具趋同致技术红利消失,剧本/叙事等影视基本功成真壁垒
  • 跨镜头连续性:竞争转向连续性、算力、发行及可复用资产沉淀
  • IP变现最高效:工具民主化下,剧情自媒体IP成为投入产出比最高路径
  • 变现路径-短漫剧:陈柯工作室《聚宝仙盆》获漫剧榜第一
  • 变现路径-自媒体:"阿松的奋斗"6集涨粉近百万打造剧情IP
  • 变现路径-商业化:RANG AI STUDIO承制项目获央视/新华社报道
  • 变现路径-内容出海:多基地团队同步推进,验证全链路出海发行能力

AI漫剧行业兴衰:从效率红利到行业崩塌

十字路口Crossing(20260711) | 阿枫科技(20260715) | 优设AIGC(20260720) | 数智前线(20260727)

2025 AI漫剧元年市场数据

  • 市场爆发:全AI微短剧在抖音TOP5000中由1月4部增至11月217部,新增相关企业8.02万家
  • 爆款验证:《斩神台》12人团队、30天制作斩获超10亿播放、ROI超110,打响规模化变现第一枪
  • 2026预测:市场规模将破220亿(贡献50%增量),用户从1.2亿增至2.8亿,现存企业达24.5万家
  • 核心洞察:AI漫剧是首个实现规模化变现的AI视频赛道,核心壁垒为选题、IP运营与投流的复合能力

AI漫剧宏观周期与困境

  • 产能跃迁与洗牌:Seedance 2.0使单部成本降至4-5万,1人月产3-4部,行业从业者从3000锐减至约300人
  • 价值摧毁与双杀:极低门槛致行业沦为“彩票生意”,且遭官媒定调千篇一律、平台限流,出海窗口仅3-6个月

生产效率对比

  • 传统短剧:数十至百人团队,耗时数月,ROI仅为个位数
  • AI漫剧:约12人团队,耗时约30天,ROI可超110

自动化流水线基建

  • 防污染机制:Agent节点独立运作,支持画布自动浏览、角色识别与并行执行
  • 经验商品化:Skill广场已有300+全环节制作Skill,类似影像创作领域的GitHub
  • 工作流闭环:一键打通剧本至剪辑,自动配置景别、灯光等参数,支持导出达芬奇或直投平台

专业导演工作流体系

  • 极致结构化:单10秒镜头提示词可达1500字,光照发丝等细节远超新手手搓效果
  • 多机位一致:利用Skill固定背景,结合角色情绪面板精准控制表情动作
  • 合法IP壁垒:创作者可获《凡人修仙传》等独家授权,支持资产溯源与工业级导出
  • 工作流模块:以禁止项(去水印/LOGO)、风格角色设定、镜头转场逻辑实现工业级精确控图

关键行业洞察

  • 实战爆发力:叫兽易小星AI剧5天破200万播放,大圆镜科普系列播放近2亿
  • 资产升维:创作者竞争壁垒从“会用工具”升维至“能定义高质量工作流”
  • 瓶颈转移:AI制作关键不在生成质量而在流程管理,标准化传统影视工业才是核心

2.4 图像生成底层架构与范式创新


图像生成底层架构与可控生成范式创新

机器之心(20260409) | 量子位(20260411) | CVer(20260426) | AI科技评论(20260507) | 机器之心(20260509) | AI科技评论(20260512) | 极市平台(20260512) | 极市平台(20260512) | 量子位(20260513) | 机器之心(20260521) | 机器之心(20260523) | 机器之心(20260525) | 机器之心(20260525) | 极市平台(20260525) | 百度文心(20260528) | 机器之心(20260529) | 机器之心(20260530) | AI科技评论(20260602) | 极市平台(20260603) | 机器之心(20260608) | AI科技评论(20260610) | 机器之心(20260611) | 智东西(20260611) | AI异类弗兰克(20260611) | AI科技评论(20260615) | 极市平台(20260615) | 量子位(20260618) | 量子位(20260625) | CVer(20260625) | 量子位(20260627) | 机器之心(20260701) | 极市平台(20260707) | 机器之心(20260713) | 机器之心(20260717) | CVer(20260722) | 机器之心(20260724) | 极市平台(20260724)

  • 架构与Tokenizer创新:南大&腾讯HYDRA用单一ViT处理图文(1.5B理解均分63.1);上智院BARD融合自回归与扩散(吞吐升3倍);字节×HKU的RF证明离散token预测(0.76)远超连续回归
  • 表征与编码突破:谢赛宁RAEv2多层聚合降70%重建误差(成本不及FLUX一半);美图PE-Field将2D位置扩展为3D场引入Z轴深度;SSG范式揭示通道扰动对扩散引导优于空间维度且免加噪
  • SSG引导优劣:内部交换最不相似token做差修正,FID全面超越SAG/PAG等;但缺乏理论支撑,扰动层位置敏感且引入额外计算开销
  • 多任务RL与推理框架:复旦Flow-OPD单任务探索+多任务蒸馏解决奖励冲突;复旦VeRL-Omni通用框架降14%耗时(支持昇腾);小红书BigMac嵌套流水线训练提速1.9倍且显存降至常数级
  • 推理与Agent加速:感知损失替换MSE实现免蒸馏4-8步生成;联通LeMiCa全局缓存实现2倍无损加速(32s降至7s);港中文Gen-Searcher生成前搜索验证(K-Score提升16分)
  • 风格迁移突破:AnyStyle基于单LoRA+注意力调制实现一对多零样本泛化,改变纹理同时保持内容结构不变,相比DreamBooth训练存储成本最低且推理高效
  • 数据管线构建:FreeStyle挖掘社区LoRA构建超百万双参考数据,三阶段精准剔除不稳定样本;指出参考图信息注入的“干净程度”远比增加数量更重要
  • 双参生成防泄漏:浅层注意力过强引发语义泄漏(Enrichment constraint解决);RoPE引发局部复制(频率感知RoPE调制解决),成功将长尾风格转化为监督数据

DeepMind 圆桌:视频生成、世界模型与AI审美决策权

人工智能学家(20260704) | 人工智能学家(20260705) | 甲子光年(20260720)

底层架构与技术博弈

  • 语言作为中间表示:在语言上设定条件相当于对因果信息设定条件,有效缓解机器学习中的虚假相关性
  • 视频模型即世界模型:视频模型已具备物理直觉,复刻LLM演进路径(指令遵循到降幻觉),是AGI核心组件
  • 音视频联合生成:Veo 3基于统一的潜在因果生成过程,而非先生成画面再拼接音频

审美决策权与评估挑战

  • 感官语言化瓶颈:人类对气味肤色极度敏感却词汇贫乏,制约自然语言驱动的生成模型控制力
  • 隐性知识缺失:互联网仅存最终输出,复杂创意真实思考轨迹难提取,导致LLM内容千篇一律
  • 偏好对齐危险信号:AI视频在人工评估中大幅胜过真实视频,实为模型优化触发人类认知偏差错位
  • 默认审美即权力:模型团队实质掌控全球视觉默认值,审美拍板权由工程师主导,外部制衡缺失
  • 异常奖励破解:模型出现明显倾向在手部绘制婚戒的奇特现象,疑似内部奖励机制被数据破解

成本断崖与平台级渗透

维度传统制作AI生成
音乐单首成本20万-100万元不到1元
演唱特征有呼吸感、不完美过于完美,无人味
  • 爱奇艺智能制作:服务200+项目,AI辅助剪辑效率提升超50%;日均收约3000部作品,1/3为AI漫画
  • 昆仑万维SkyReels V4:聚焦人物一致性与音画同步;大场面容错率高适合AI,小众场景因数据不足效果差

创作者实战与不可替代性

  • 提示工程持久性:导演已用AI补足因天气未拍的镜头,实拍与生成难以分辨;提示词精确描述运镜仍是核心瓶颈
  • AI味技术根源:扩散模型去噪对人脸特征做平均化,导致生成面孔完美无瑕、缺乏真实缺陷
  • 表演本质差异:AI基于数据模仿过去,无法主动创造反常规经典瞬间(如《教父》即兴抱猫)
  • 版权与平权主张:呼吁强制标注AI内容、建立真人形象版权库;成本下降真正受益者是长尾创作者

2.5 多模态创意工作流与AI生图工业化


AI生图工业化工作流与提示词工程

赛博禅心(20260406) | 苍何(20260425) | AIZ小朱(20260508) | 优设AIGC(20260510) | 优设AIGC(20260511) | 百度文心(20260512) | 百度文心(20260521) | 优设AIGC(20260622) | 优设AIGC(20260702) | 优设AIGC(20260706) | 优设AIGC(20260720) | 优设AIGC(20260721) | 优设AIGC(20260723) | 优设AIGC(20260724) | 优设AIGC(20260623) | 优设AIGC(20260726) | 优设AIGC(20260728) | 优设AIGC(20260729)

AI绘图与模型配置

  • ERNIE-Image LoRA配置:24GB显存用rank=64+AdamW8bit;16GB用rank=32+layer offloading降占用。
  • 优化器与提示词:ROSE优化器的人体结构稳定性优于AdamW;trigger_word设为null可使风格自动融入。
  • 提示词资源生态:MeiGen提供万级分类提示词,PromptHero跨社区搜索,SREF聚合艺术风格代码。

物理设备与无障碍设计

  • Midjourney线下扫描:8960传感器×40环水耦合;60秒360°无辐射扫描,首家MJ Spa定址旧金山预计2027开业。
  • AI设计精细化:支持像素级修改,需结合WCAG无障碍标准让AI执行多维度自检。

视觉设计与一致性原则

  • 减法与张力:海报保留单一核心符号避免堆叠;体育海报主角穿出大标题,配合边缘失焦前景营造动作感。
  • 系列视觉一致性:多图统一使用相同色系比相同风格更能建立一致性;色彩需贯穿服装、背景与包装。
  • 纸艺质感框架:撕纸需纸瓶同色系与卷角毛边;剪纸凸显层间阴影。纸雕海报遵循主题→风格→材质→商业度四层框架。
  • 可复用提示词范式:拆解为固定框架+可替换变量(如国家/地标/配色/口味),实现同类型图无限扩展。

商业级广告出图策略

  • GPT商品图六模块:产品主体→海报风格→场景道具→棚拍光影→排版文字→色调氛围。
  • 电商批量出图:先锁定系列色调与排版模板,仅替换可变产品信息实现无限复用。
  • 质感分水岭:棚拍灯光与杂志排版指令是区分“白底图”与“品牌广告”的核心变量。
  • 强透视构图优势:近大远小让产品成为第一视觉焦点,无需复杂构图即获专业级广告效果。
  • 饮料海报六段式:①画面3:4定位→②模特设定→③透视构图(产品近大远小且不遮面部)→④口味驱动配色→⑤包装文案与水珠→⑥商业光影质感。
  • 品牌系列感构建:利用口味颜色贯穿全局保一致,通过顶部超大标题加右下角同系列多瓶产品形成品牌矩阵。

Seedance视频「真人感」9维提示词框架

饼干哥哥AGI(20260707)

  • 9维解法框架:人物5维度(脸部/皮肤/外表/情绪/运镜)+ 环境3维度(光源/景深/干扰)+ 1绕行策略,适用于Seedance 2.0等模型

人物维度:多部位过程分解替代单一极端情绪

  • 脸部公式[眼部]+[嘴部]+[鼻/颈/肩]+[情绪序列],至少覆盖四部位
  • 肢体公式[主要动作]+[同步冗余细节]+[衣物发丝物理反应],补充无意识微动作
  • 情绪时间线:0-1s触发→1-3s身体先感知未完全表达→3-5s面部失控但仍有克制;忌用「正在大哭」等顶点描述
  • 实例对比:委屈=眼眶泛红+下唇内抿+鼻翼颤动+呼吸短促;慌张=眼神横扫+喉结吞咽+手指收紧

皮肤四层瑕疵分层写入

层级提示词要点效果
肤质纹理visible pores, fine lines, uneven skin tone恢复毛孔与细纹
肤色血色natural flush, capillary redness增加微血管血色
含水含油sweat beads, oily T-zone, dry cracked lips汗珠/油光/干裂
光线互动subsurface scattering真实次表面散射
  • 负面提示词必备:airbrushed, plastic skin, wax figure

环境维度与物理规律

  • 打光公式[光源位置]+[光源类型]+[光线强度/对比描述]
  • 景深公式:前景虚化遮挡物+中景主体清晰+背景极致虚化(光圈f/1.2-f/1.8)
  • 背景动态:如「墙面电视播放球赛」让模型自动处理背景变化
  • 物理规律约束:衣物滞后于身体、物体需有支撑、头发/液体符合物理规律
  • 运镜情绪驱动:镜头运动需有情绪理由,而非随意推拉摇移

绕行策略:利用媒介特性降低门槛

  • 天然低 fidelity 媒介:行车记录仪、监控、老式DV等天然不需高保真,糊/抖/噪点是合理特征
  • 工具配合:GPT Image 2出分镜,Seedance 2.0生成视频

2.6 CVPR 2026图像编辑趋势:多图一致性与精细可控


图像编辑前沿:多图一致、组合生成与镜像错觉艺术(CVPR 2026)

AI科技评论(20260528) | CVer(20260607) | AI科技评论(20260611) | 极市平台(20260702) | 机器之心(20260704) | 量子位(20260705) | 量子位(20260711) | AI科技评论(20260717) | 新智元(20260724) | CVer(20260726) | 量子位(20260729) | 量子位(20260729)

  • OmniRef-Bench:填补复杂多参考评测空白,含395专家标注样本,DyRef得分8.38超越Seedream4.5

空间布局与连续属性控制

  • ConsistCompose:将坐标绑定写入文本序列实现原生布局控制,精度超越GLIGEN等主流方法
  • All-in-One Slider:引入稀疏自编码+Top-k实现零样本连续属性编辑,单模块有效解耦且完美保持身份

高频恢复与4K超清生成

  • HiFi-Inpaint:注入高频特征与细节感知损失解决纹理丢失,CLIP-I达95.0%、DINO达91.9%
  • VINS-120K:vivo开源首个4K编辑数据集,高频适应策略使pFID降至9.15,细节表现超越Seedream 4.0

区域拖拽与计算摄影

  • ICRDrag:基于DiT上下文学习一次性输出,结合双LoRA(图像+掩码)有效防止特征污染
  • 拖拽基建:提出IMAC/STAC约束特征防变形,开源28.7万拖拽数据集与1000组PRDBench
  • MagicBokeh:单模型一次推理同时完成超分与虚化,交替训练平衡矛盾,入围Best Paper
  • SmartPhotoCrafter:vivo实现无指令端到端自动摄影增强,完成输入照片到自动诊断推理生成的全流程
  • 双模块架构:Critic(Qwen2.5-VL-7B)输出CoT质量分析与评分;Artist(DiT+Flow Matching)负责图像生成
  • 潜在表征直连:Artist不接收文本指令,直接接收Critic的推理潜在表征,避免文本信息损失实现高带宽传递
  • 三阶段训练法:独立预训练→推理表征对齐→协同RL优化(Critic用GRPO,Artist用DiffusionNFT)
  • 属性级奖励解耦:质量评价分解为曝光、对比度、饱和度等可量化维度,将主观美学转化为细粒度优化信号
  • 双模式支持:支持全自动优化(仅输入图像)与指令驱动编辑(图像+指令)两种模式

跨界艺术生成

  • 镜像错觉:清华提出镜像错觉艺术生成器(亮点论文),支持3D打印输出,打通数字到实体全链路

2.7 统一多模态遥感图像生成:MetaEarth-MM


MetaEarth-MM:场景中心联合建模的多模态遥感生成框架

CVer(20260531)

  • 场景中心联合建模:北航提出对多模态联合分布 p(x_1,...,x_N) 建模,突破单向条件分布 p(x_b|x_a) 逐对翻译范式,单一模型同时覆盖边缘/条件/联合生成三类任务

核心解耦双模块架构

模块架构设计核心职责
场景推断模块DiT + 分区自适应LayerNorm从双模态带噪观测提取潜在场景表示
模态感知路由生成器DiT + 确定性模态路由以场景为条件独立预测各模态去噪速度场

关键技术与优化组件

  • 分区自适应层归一化:对各模态分区独立生成调制参数,适应异质噪声尺度与特征
  • 模态路由FFN:为每种模态分配专属分支,避免异质分布间的参数竞争与干扰
  • 场景一致性正则化:对称InfoNCE损失约束同场景不同模态嵌入趋于一致
  • 联合训练目标:总体损失由联合流匹配损失与场景一致性正则化共同构成

数据集与性能表现

  • EarthMM数据集:280万张图像、220万对对齐样本,覆盖RGB/SAR/NIR/PAN/OSM五模态,分辨率0.5–10m
  • 跨模态翻译领先:SAR↔RGB、OSM↔RGB等大域差异任务优势显著,联合生成质量优于现有方法
  • 基础模型潜力:所学场景表示可用于生成式数据增强、域自适应、零样本迁移等下游任务

2.8 遥感图像分析与视觉理解


遥感视觉理解与分割基准演进

CVer(20260419) | CVer(20260520) | CVer(20260521) | CVer(20260525) | CVer(20260613) | CVer(20260620) | CVer(20260703)

  • MultiMoE (TGRS 2026):冻结DINOv3内插MoE适配器,RGB与DSM具独立专家池共享Top-k路由;总参78M仅激活27M,2.5%数据下mIoU提升7.14%
  • DGKAN (AAAI 2026):首次将KAN引入图建模,GCN与KAN双路径Q/K/V自适应融合;消融中KAN分支替换MLP后Kappa指标平均下降8.1%

跨时间多模态变化推理与异常检测

  • 灾害异常定位(AnomalyCD):武大团队将灾害定位重构为无监督异常变化检测,利用多时相历史影像区分灾害与正常变化,零样本F1提升~7%
  • 任务定义(MTRS):输入双时相图像+自然语言表达,输出语言指定变化区域像素级掩码,融合跨时间变化与语言对齐双重挑战
  • MTRefSeg-21K数据集:9,521组图像对、20,924条指代表达;CRAFT-Agent自动标注四步流水线解决多时相标注瓶颈
  • MTRefSeg-R1基线:达到mIoU 65.68,较最强微调基线提升6.08,证明跨时间推理无法从单图预训练自然获得

核心方法对比汇总

模型/方法发表/期刊核心突破关键数据指标
IAPVecISPRS 2026基于SAM农田地块矢量化CAPCAD覆盖620km²,密度21-520+块/km²
PFNet+IPNetTPAMI 2026多类要素全域统一矢量化支持10000×10000像素级大图
RoadGIECVPR 2026轻量化全球道路交互提取3.7M参数,覆盖38国223城
MultiMoETGRS 2026冻结DINOv3+多模态MoE总参78M(激活27M),2.5%数据mIoU提升7.14%
DGKANAAAI 2026GCN与KAN双路径图建模KAN替换MLP后Kappa↓8.1%
AnomalyCD-无监督灾害异常定位F1提升~7% (vs基线)
MTRefSeg-R1-多时相指代表达分割基线mIoU 65.68 (基线59.60)

2.9 底层视觉与图像处理优化


LTOFusion:可学习轨迹优化的多模态图像融合范式(TIP 2026)

CVer(20260701)

  • 范式重构:受元学习启发,将图像融合从「直接映射」重构为「可学习的逐步优化」过程,通过多阶段状态转换逼近目标融合结果
  • PVF机制:设计像素变化流(PVF)作为优化动作算子,构建连续转换函数实现平滑融合轨迹
  • 可控链模型:引入潜在变量描述操作步骤,将(源图像对+中间融合结果)作为状态输入
  • 粗到细演化:合成实验中早期捕捉峰值近似位置,后期逐步锐化局部模式

范式对比

范式核心思路局限
单步直接回归端到端映射高维回归难度大,解空间被压缩
扩散式迭代去噪过程演化收敛慢,残留伪影
LTO 动态优化学习优化轨迹步数无关,初期增益偏慢

训练策略与泛化能力

  • 网络架构:采用 U-Net 在递归框架中估算每步像素流,通过回放记忆缓存复用中间结果解决梯度问题
  • 零样本泛化:在医学数据训练后无需微调即可迁移,边缘保真度与结构完整性指标显著提升
  • 学术发表:发表于 IEEE TIP 2026(重庆邮电大学等团队),代码已开源(GitHub: HeDan11/LTOFusion)

局限与未来方向

  • 收敛判定:基于单一阈值的自适应终止难以全面刻画收敛性
  • 复杂图像次优:有限步数内复杂图像的融合结果仍存在次优情况
  • 未来探索:步数相关网络架构、多指标联合终止、结合几何形变建模解决空间错位

ATD:可学习词元字典实现线性复杂度全局依赖建模(TPAMI)

CVer(20260413)

  • 核心创新:电子科大提出自适应词元字典(ATD),通过可学习字典建模全局典型结构先验,突破窗口自注意力局部性限制(发表于IEEE T-PAMI)
  • 词元字典交叉注意力:实现输入特征与全局先验的高效交互,在线性复杂度下完成全局依赖建模
  • 类别分组自注意力:利用注意力映射中的类别信息对特征分组,并在前馈网络中融入类别信息增强融合
模型变体适用任务性能表现
ATD / ATD(轻量化)图像超分辨率领先性能
ATD-U(多尺度扩展)图像去噪显著超越现有方法
ATD-UJPEG压缩伪影去除显著超越现有方法

关键洞察

  • 外部先验优于纯局部建模:可学习字典将全局典型结构编码为外部先验,比扩大窗口更高效捕获全局依赖
  • 类别信息作为结构化信号:利用注意力中的类别信息分组是一种无监督语义感知特征聚合策略
  • 全局建模新范式:证明不依赖窗口划分也能在线性复杂度下实现全局依赖建模,为高分辨率图像处理提供新路径

2.10 视觉模型工程优化与部署加速


视频审核中台性能优化:多模型推理架构重构

AI前线(20260421)

优化效果

  • 耗时降68%:多模型串行检测从280ms降至90ms,低于单模型原始耗时(CLIP 110ms)
  • 耗时拆解:Java前处理15ms + 内存传输5ms + GPU推理~70ms

三大性能瓶颈与重构策略

瓶颈问题表现重构策略
IO传输冗余Base64膨胀33%致JVM GC;4服务各自拉图致网络延迟全链路零拷贝:网关统一转byte[],内部RPC内存直传
重复前处理同一1080P图被4模型分别Decode+Resize,Python GIL阻塞GPU前处理上浮:Decode+Resize统筹至Java侧,释放Python GIL
幻灯片帧冗余黑灰产视频含大量相同帧,重复进GPU推理致算力浪费pHash图染色去重:感知哈希+贪心分组,同组仅首帧推理

差异化输入规格

  • 统一调度:ViT/CLIP 224×224,YOLO-cls/det 640×640,Java侧按需Resize

核心架构认知

  • 打破传统边界:废弃"业务层发数据、AI层管处理"模式,全局重分配CPU/GPU职责
  • 算力分工:GPU专注矩阵运算,IO/解码/缩放等CPU密集工作上浮到Java中台
  • 全局优于并行:非核心计算从关键路径剥离,比单纯模型并行更具实效

3. 音频与3D生成


3.1 AI音频与语音合成


AI语音合成与音频大模型前沿

智东西(20260331) | 莫理(20260331) | 探索AGI(20260331) | AI产品银海(20260331) | 公子龙(20260401) | 智东西(20260402) | 昆仑万维集团(20260404) | 量子位(20260408) | 花叔(20260409) | 机器之心(20260410) | MiniMax 稀宇科技(20260410) | 优设AIGC(20260411) | AI大模型工场(20260415) | 阶跃星辰(20260416) | 高飞的电子替身(20260416) | 财联社AI daily(20260420) | 智东西(20260420) | 机器之心(20260422) | 智东西(20260424) | 硅星人Pro(20260427) | 赛博禅心(20260505) | APPSO(20260508) | AI寒武纪(20260508) | 有新Newin(20260508) | AI范儿(20260508) | "财联社AI daily"(20260508) | 量子位(20260508) | "AGI Hunt"(20260508) | 小互AI(20260508) | 阶跃星辰(20260508) | 阶跃星辰(20260509) | 机器之心(20260511) | 昆仑万维集团(20260511) | 智东西(20260512) | 智东西(20260512) | AI前线(20260512) | 赛博禅心(20260512) | AI产品阿颖(20260512) | 机器之心(20260512) | 前沿在线(20260512) | 新智元(20260512) | 新智元(20260512) | 新智元(20260512) | 昆仑万维集团(20260512) | Datawhale(20260518) | 深度学习与NLP(20260518) | 通义大模型(20260520) | 夕小瑶科技说(20260522) | PaperWeekly(20260525) | 机器之心(20260527) | AI寒武纪(20260529) | "Z Potentials"(20260603) | "Z Potentials"(20260604) | 智东西(20260604) | "Z Potentials"(20260605) | AI信息Gap(20260610) | 小互AI(20260610) | 机器之心(20260611) | AI科技评论(20260617) | 火山引擎(20260618) | 量子位(20260622) | 有机大橘子(20260623) | 火山引擎(20260623) | AI产品阿颖(20260623) | 夕小瑶科技说(20260623) | 摸鱼小李(20260626) | 小互AI(20260627) | 新智元(20260702) | 量子位(20260710) | 机器之心(20260710) | 智东西(20260710) | 新智元(20260710) | 通义大模型(20260715) | 阿里云开发者(20260715) | 阿里云(20260716) | 字节跳动Seed(20260720) | 阿里云(20260720) | 通义大模型(20260720) | 智东西(20260720) | 智东西(20260720) | 阿里云开发者(20260721)

  • MusiCoT范式创新:将思维链引入音乐生成,从逐音符猜测升级为全局规划式创作,突破文本捷径依赖
  • 模态差距破解:TextPro-SLM提出纯文本Token与韵律双流,仅1000小时数据将模态差距降至0.7%

音乐生成核心玩家与性能对比

模型/产品核心性能/指标技术亮点与壁垒
Mureka V8/V92分钟生成两首歌,B端填补Suno空白MusiCoT框架,人声器乐双项超Suno/Udio
MiniMax音乐首包延迟<20秒,支持100+乐器极速跃升,拟真保留换气声等瑕疵
歌歌AI10秒生成3分钟分轨歌曲原生双流架构解决汉语四声定调难题
Suno48kHz声波建模,年run rate约3亿美元小模型规模依赖RL对齐,获华纳正版授权
LongCat-AudioDiTSIM相似度0.818超SOTA3.5B模型直接在波形潜空间建模
GPT-Realtime-2Big Bench Bench 96.6%128K上下文,原生音频推理与Agent调用

商业化进展与战略布局

产品商业化数据战略壁垒与布局
Mureka日均生成150万首,服务超8000家企业降本至1元/首,向“AI版Spotify”免费流播演进
MiniMaxC端每日500首免费,API全量开放AI Agent化创作,开源Music Skills套件
歌歌AI百万用户与十几万付费,接入抖音等七大平台采风非遗原声构建民乐独家数据护城河
ElevenLabsMusic v2发布提升多语言与快嘴说唱能力,全正版数据合法商用

技术瓶颈与演进挑战

  • 副语言能力短板:动态情绪得分仅56.51,模型“像客服”问题显著
  • 合成数据副作用:TTS合成数据超50%致自然度急剧下降,需自对齐框架干预
  • 音频推理成AGI关键:四大推理路径明确,核心挑战是锚定连续细粒度声学证据

影眸科技:3D原生生成的非典型路径与商业化进展

"Founder Park"(20260629) | 奇绩创坛(20260706) | 奇绩创坛(20260714)

  • 路线对比:2D升3D因信息丢失导致多视角不一致,原生3D虽技术门槛高但无此瓶颈,质量领先一个量级

技术架构与核心壁垒

  • 原生3D框架:基于CLAY(2024)与CAST(2025)框架全环节三维完成,彻底解决多视角不一致问题
  • Test-time Scaling:将表征长度变为可学习伸缩变量,按对象复杂度自适应分配计算预算
  • 12K原生贴图:全球首个12K原生3D贴图技术,冻结表面光场,利用稀疏体素VAE统一潜在空间

五档思考深度(Thinking Effort)

  • Extreme-Low(~4s):快速原型与UGC
  • Low(~9s):干净资产日常量产
  • Medium(~20s):综合质量最优,等同上代40s效果
  • High(~40s):3A游戏主角与影视级资产
  • Extreme-High(~80s):雕塑级细节与收藏级3D打印

关键战略与产品迭代

  • Production-ready原则:确立生产可用为商业生死线,第一代穹顶光场扫描设备因不兼容影视管线被否决
  • 主动放弃流量:2D生成App Wand达160万用户后主动放弃,转向全品类3D资产生成

商业化与全球市场

  • 客群结构:以B端企业级与Pro C端用户为主,覆盖影视、游戏、电商、具身智能等场景
  • 财务表现:上线首月订阅用户与ARR环比增速均扩大400%,当前ARR达数千万美金
  • B端收入:超同赛道所有竞争对手总和,续费率接近100%,海外营收占比70%-80%
  • 标杆应用:服务英伟达等大厂,支撑Lowe's全球1750+门店数字孪生,打造超3万SKU且单模型成本严控1美元内

学术里程碑与融资团队

  • 融资动态:一年半完成三轮融资,最新数亿元由凯辉基金与上海国投先导领投,光源资本任独家财务顾问
  • 学术成绩:2025年凭CAST获SIGGRAPH最佳论文,同期获奖商业公司仅Google、Meta与影眸三家
  • 科研团队:60人中算法团队每2人有1人获SIGGRAPH最佳论文或提名,约70%科研成果实现产品化

3.2 语音识别与转写


语音识别模型前沿:开源轻量化、多语种统一与极速推理

Z Potentials(20260330) | 智东西(20260403) | 通义大模型(20260420) | 财联社AI daily(20260420) | 阶跃星辰(20260424) | 智东西(20260424) | 阿里云(20260706) | 十字路口Crossing(20260610)

  • 统一架构与LLM降维:头部ASR模型全面采用“声学编码器+LLM解码”架构,借LLM语义辅助识别,OpenASR榜单头部平均WER已压至5.6%区间
  • LLM多Token预测:阶跃星辰首次将其引入ASR,吞吐提升400%,时延降60%,成本骤降至0.15元/小时
  • 开源轻量化标杆:Cohere Transcribe仅20亿参数,以5.42的WER登顶Open ASR榜单,消费级GPU即可部署且达524倍实时速度

前沿模型基准与特性对比

模型核心优势性能/速度
阶跃 StepAudio 2.5LLM多Token预测,32K上下文端到端处理30分钟音频吞吐提400%,500 tokens/s
阿里 Fun-ASR 1.5统一架构覆盖30种语言+7大方言,支持跨语种混合方言CER相对降56.2%
阿里 Fun-ASR-Flash离线转写极致准确率错字率1.7%(全球第一)
阿里 Fun-ASR-Realtime流式实时首字百毫秒级,融合上下文热词纠错准确率逼近离线模型
微软 MAI-Transcribe-1FLEURS基准25种语言WER最低批量转录速度提升2.5倍
Cohere Transcribe20亿参数极致轻量,Apache 2.0开源WER 5.42,524倍实时
Hojo-ASR-V1编码器-适配器-LLM三段式架构结合Qwen3-4BLibriSpeech Clean WER 1.74%

工程落地与商业化挑战

  • 极端场景鲁棒性待提升:实测发现,常规场景表现优异,但在二倍速、激烈争吵、无标点断句等极端场景下精度骤降
  • 长上下文与流式场景突破:消除传统切片断裂感,影视飓风百小时直播累计成功转写132万字
  • Voice AI成Agent核心入口:2025年Voice AI赛道融资约21亿美元,语音正从辅助交互升级为Agent核心上下文
  • 初创团队全双工突围:Hojo积淀噪声/方言/打断等车载工程经验,千万量级设备落地并规划全双工模型

3.3 AI音频大模型架构与理解


音频大模型架构演进与能力评估

PaperWeekly(20260408) | 机器之心(20260508) | 极市平台(20260509) | 机器之心(20260520) | 极市平台(20260528) | 量子位(20260615) | 逛逛GitHub(20260622)

生成架构范式突破与极速推理

  • 瓶颈验证(Omni2Sound):清华×Monash证明瓶颈在数据语义错位而非架构,仅用标准DiT即超越专家模型,获CVPR 2026 Highlight
  • Raw波形直推(WavFlow):Meta×NEU绕过VAE/Codec,借全局缩放S=50在Raw空间直接生成音频,取得最优FDPaSST
  • 极速生成(AudioX-Turbo):港科大×清华×Noiz AI用分布匹配蒸馏将50-200步压缩至4步推理,单卡RTF=0.02

数据工程精细化优于盲目扩参

  • 高质量对齐降本:Omni2Sound构建47万对齐数据集SoundAtlas,多轮智能体流水线降本5倍,对齐质量超人类专家
  • 指令微调扩充:AudioX-Turbo构建IF-caps-Pro达920万样本,比AudioCaps等主流开源数据集高出1至2个数量级

理解诊断:揭示"音频贡献缺失"

  • 静音实验揭露盲区:用静音替换音频后准确率仍达49.8%,证明主流模型过度依赖文本而非真正听取音频
  • 后训练新范式(ACF):首创音频贡献过滤法将数据强弱分离,基于此在MMAU达78.2%,获DCASE 2025冠军

音乐时序理解突破

  • 双编码器融合(GaMMA):复旦×字节联合提出,解决全局语义压缩与局部时序保留的表征冲突问题
  • 超越Gemini-3.0 Pro:在MusicBench时序任务上全面领先,和弦理解任务以75.0% vs 53.0%大幅胜出

核心洞察:语义对齐是下一代关键

  • 生成端任务竞争与理解端音频贡献缺失,均指向底层数据与语义错位,精细化对齐与智能路由远优于规模暴力美学

3DGS光栅化流水线瓶颈与优化综述

量子位(20260727)

  • 背景:3DGS已成为实时3D重建的默认方案,但单场景高斯数据可达数百MB(甚至700MB),显存/带宽/功耗约束下系统稳定性面临挑战
  • 核心观点:3DGS真正瓶颈不在表示本身,而在光栅化流水线(投影→分块→排序→α混合→梯度回传)
  • "光栅化中心"三层分类体系
    • 表示与优化:高斯参数化、致密化、正则化、剪枝、压缩
    • 光栅化流水线:α混合、特征场着色、硬件线程调度、可见性排序
    • 场景驱动扩展:4D动态、超大规模、稀疏视角、无位姿、SLAM
  • 五类核心瓶颈:投影误差(3D→2D精度损失)、可见性排序(深度排序开销随高斯数量增长)、透明度混合(逐像素α混合为主计算负载)、梯度传播(排序不可微影响训练稳定性)、存储膨胀(百万高斯参数导致显存占用过大)
  • 五个优化方向:高斯表示压缩(剪枝/量化/向量量化)、流水线并行化(CUDA线程调度/瓦片分配)、可微排序改进(解决排序不可微)、动态场景扩展(4D时序高斯/形变物体)、大场景分区策略(城市级分块/按需加载)
  • 关键洞察:不同应用场景(稀疏视角重建、抗锯齿、大场景渲染)共享相同底层瓶颈;优化应先定位瓶颈所在流水线环节,再选择对应改进方法
  • 来源:港科大(广州)3DAgentWorld Lab、南洋理工、阿里巴巴、其域创新科技联合发布

3.4 3D场景与世界模型生成


3D场景生成产品与应用落地

量子位(20260409) | CVer(20260415) | 小互AI(20260427) | 智东西(20260427) | 曼话AI(20260508) | 机器之心(20260521) | CVer(20260712)

移动端世界模型探索

  • 灵光App:接入LingBot-World-Fast,实现百毫秒级流式传输,单图秒级生成最长60秒3D世界(双摇杆交互)
  • 画质权衡:保留近中远景层次与光影,但快速移动时清晰度下降,存在约1秒操控延迟

端侧3DGS轻量化渲染(Flux-GS)

  • 极速体验:骁龙8 Gen 3实测达151 FPS(传统3DGS仅11 FPS),模型体积从478MB压缩至数MB
  • 训练提效:RTX 4090训练耗时仅10-13分钟(传统需100-150分钟),室内PSNR达30.21dB
  • 核心优化:高阶球谐蒸馏为一阶方向矩(省61%显存),结合MLP偏移预测与多视角协同稠密化
  • 核心洞察:移动端3D重建瓶颈在显存带宽而非算法精度,"先学高阶后蒸馏"是轻量化的有效范式

3D影视创作工作流(TapNow)

  • 空间稳定:首创"先建空间再做镜头",从单图生成可漫游3D场景,解决AI视频空间跳变问题
  • 资产复用:支持局部修改联动全局更新与镜位复用,全流程跑通30秒AI科幻短片《太空惊魂》

多行业3D场景生成前沿

场景方向代表框架核心突破数据指标
通用3D生成Marble 1.1/Plus双版本分离画质优化与空间扩展单图3-5分钟生成360度场景
无边界城市Yo'City(北大)语言生成可扩展3D城市,三级层次规划语义一致性及视觉质量优于Trellis等基线
医学容积重建GaussianPile切片式3DGS显式建模物理焦深Voxel Grid压缩16-26倍,约8分钟收敛
  • 产业趋势:3D生成正从单一技术突破向影视工业化、医学成像、大尺度空间构建等多维场景落地

3D场景生成前沿方法:物理仿真与Agent闭环优化

机器之心(20260502) | 机器之心(20260508) | 机器之心(20260609) | DeepTech深科技(20260621)

核心趋势:从静态生成到物理闭环优化

  • 范式跃迁:3D生成从静态模型升级为自带物理属性的交互式资产,打通“生成-优化-仿真训练”全链路
  • 四大框架并行:PAT3D、Scenethesis、PhysForge、南洋理工方案分别在静力平衡、Agent闭环、关节运动学、生成端嵌入仿真方向取得突破

四大前沿框架技术对比

维度PAT3DScenethesisPhysForge南洋理工方案
研发机构CMU等 (ICLR)英伟达&普渡 (ICLR)港大&腾讯 (ICML)南洋理工
核心机制可微刚体仿真Agent自检修复闭环KVI关节注入去噪生成内嵌物理仿真
解决痛点语义约束下的静力平衡室内外场景空间真实性几何与运动学统一输出资产无需后处理直接可用

核心机制与关键指标

  • PAT3D:构建重力方向层级场景树,18个测试中模拟位移降为0,穿插比例为0,物理评分达88.5
  • Scenethesis:Judge模块触发“生成-检查-修复”闭环,碰撞率从6.1%降至0.8%,场景通过率升至91%
  • PhysForge:VLM输出层级物理蓝图,扩散模型联合生成外观与运动学参数,打破几何与物理后处理拼接壁垒
  • 南洋理工:生成阶段直接嵌入物理仿真,输出资产可直接接入RoboTain执行训练任务

数据与标注体系(PhysForge)

  • PhysDB资产库:基于15万Objaverse资产构建,覆盖家用、工业、车辆等七大类别
  • 四层细粒度标注:涵盖场景尺度、部件材质、功能状态机及交互关节轴标记
  • 应用价值:自带完整结构与运动学属性,可直接接入Unity等引擎执行复杂操作

3.5 3D生成与空间计算


3D世界生成技术突破与产品进展

新智元(20260405) | 机器之心(20260408) | AI有道(20260410) | 腾讯混元(20260416) | 量子位(20260416) | 财联社AI daily(20260416) | AI前线(20260416) | 智东西(20260416) | 智东西(20260416) | 钛媒体AGI(20260416) | 量子位(20260417) | APPSO(20260417) | 机器之心(20260418) | 袋鼠帝AI客栈(20260418) | JackCui(20260418) | 特工宇宙(20260424) | 新智元(20260426) | 机器之心(20260501) | 沃垠AI(20260506) | CVer(20260510) | DeepTech深科技(20260513) | 机器之心(20260514) | 量子位(20260416) | 机器之心(20260521) | 极市平台(20260521) | 量子位(20260527) | 新智元(20260608) | 新智元(20260617) | 极市平台(20260624) | 新智元(20260706)

  • 近期大厂密集发布:腾讯、阿里、英伟达、魔芯、高德等同期推出3D世界模型,赛道进入爆发期

核心产品与技术指标对比

产品核心特点与优势性能/生成耗时
腾讯 HY-World 2.0首个多模态开源模型,支持单图直出多格式3D资产并对接UE场景一致性94%,耗时约1-12分钟
阿里 HappyOyster主动式实时交互,无需重置即可响应声画同步指令导演模式3分钟/漫游1分钟
英伟达 Lyra 2.0单图输入无限延展,免费开源,可直接用于机器人训练4步去噪蒸馏生成,分辨率832×480
World Labs Marble支持2D/3D双输入及全景编辑,引入分层定价生成3-10分钟,消耗1500 credits
魔芯 KOKONI-World纯隐式数据驱动(14B参数),少数已有实际收入团队支持2000帧记忆,1080P实时交互
高德 ABot-Earth 0.5单张卫星图生成原生3DGS城市,成本降至1%10分钟生成,效率提升1000倍

关键底层技术突破

  • VGGT架构与原生3D编辑:实现O(1)恒定显存无限长序列重建,原生3D编辑较传统加速120倍
  • 物理仿真引入:PAT3D首创闭环优化,物理合理性达88.5;高德DreamX-World首创视锥重叠几何检索解决转头穿帮
  • 流式生成与稳定性:HappyOyster采用持续状态复用防遗忘;MagicWorld以光流约束解决误差累积,Overall Score达0.8547
  • 密度控制可学习化:VAST与清华提出DeG范式,所需高斯数量减少50%以上

4D生成终极形态与AI涌现能力

  • 顶刊TPAMI指出4D是终极形态,受限于4D数据近乎为零,2D大模型先验是高维生成的核心语义引擎
  • Fable 5仅用1600行代码生成完整水下曼哈顿场景,展现AI空间重构与基础物理理解的涌现能力

商业化落地与交互式影游探索

  • LinearGame与Yoroll平台验证AI影游闭环:仅需一句话提示,15分钟内可自动生成包含交互逻辑的3D可玩空间或完整ARPG游戏

3.6 3D资产骨骼绑定与动画化生成


骨骼绑定与动画化技术体系

CVer(20260403) | 机器之心(20260420) | 量子位(20260422) | 新智元(20260422) | 具身智能之心(20260612) | CVer(20260506)

  • 统一生成取代串行:几何、骨架、蒙皮联合优化避免误差累积,彻底消除AIGC资产穿模与脱臼痛点,实现“生成即绑定”
  • 拓扑泛化关键:关节数量解耦特征表达,使同一套算法统一处理角色、动物与机械臂等任意拓扑结构

核心模型与技术对比

模型核心机制输入输出与工业价值
AniGen (SIGGRAPH)S³ Fields三场统一,置信度防脱臼单图生成即绑定,直导Maya/UE,覆盖多类别
TokenRig (清华&VAST)SkinTokens离散化+GRPO强化学习网格蒙皮准确率提升98%~133%,达生产级精度
MonoArt (南洋理工)四阶段渐进式推理,3D空间隔离部件单图(20.5s)直入IsaacSim机械臂仿真,提升稳定性
DancingBox (CHI提名)SAM2+CoTracker3+π3 三模型协同手机RGB视频精准估计3D包围盒运动,支持新手创作
SimArt (SIGGRAPH)聚焦3D铰链物体生成瓶颈仅需30% Token高效打破算力限制

关键技术突破

  • AniGen防脱臼:置信度衰减机制自动剔除骨骼歧义区域噪声,底层解决脱臼与穿模,覆盖柔性植物与非真实角色
  • TokenRig统一自回归:单Transformer顺序生成骨架与蒙皮,GRPO无标注迭代提升17%~22%,形变平滑
  • MonoArt特征隔离:运动推理均在3D空间,triplet loss拉开部件特征距离提升稳定性
  • DancingBox动捕生成:PointNet保证特征顺序无关,ControlNet向MDM注入包围盒控制信号

生态与开源

  • 全链路开源:AniGen提供GitHub源码与HuggingFace在线Demo体验,MonoArt支持导入IsaacSim

3.7 单图/文生3D模型资产与商业化


单图/文生3D模型:产品化能力与技术突破

AI信息Gap(20260401) | AI产品银海(20260413) | 趣谈AI(20260413) | 字节跳动Seed(20260423) | 火山引擎(20260423) | "财联社AI daily"(20260423) | 火山引擎(20260424) | 探索AGI(20260427) | 趣谈AI(20260518) | 优设AIGC(20260604) | 量子位(20260605) | 智能涌现(20260623) | "Z Potentials"(20260623) | 新智元(20260624) | APPSO(20260625) | 量子位(20260625) | 卡尔的AI沃茨(20260626) | 深度学习与NLP(20260624) | 硅星人Pro(20260629) | "Founder Park"(20260629) | AI产品银海(20260630) | 硅星人Pro(20260723)

  • Rodin Gen-2.5原生3D架构:影眸核心产品采用3D原生DiT架构,摒弃传统2D升维。全球首个千万面级3D生成模型,最快4秒出百万面,80秒出千万面,产出高精度母版向下派生轻量版本
  • 12K原生PBR贴图:材质突破传统投影限制,从模型原生“长出”,实现360度无死角物理材质覆盖,还原毛孔级微结构,几何与材质保真度超越实景扫描
  • Test-time Scaling引入:首次将类LLM“先思考再生成”范式引入3D,根据复杂度自适应分配算力,提供4秒到80秒五档思考深度
  • 智能拆件与连接:支持语义级结构理解自动拆分独立零件,并自动生成榫卯、铆钉、球关节等连接件,解决多色多材质3D打印痛点

主流生成模型对比

模型/平台核心优势技术特点与精度
影眸 Rodin Gen-2.5千万面母版,12K贴图3D原生DiT,Test-time Scaling
字节 Seed3D 2.0盲测偏好率超69%MoE+VLM先验,支持关节化建模
火山方舟 Hitem3D 2.0直出3D打印STL1536³分辨率,最高200万面
Neural4D 2.5一站式模型到视频最高100万面,AI自动生成PBR
HiCAD 2.0自然语言参数化建模生成可编辑CAD代码,浏览器端渲染

商业化与产业落地

  • 影眸商业化爆发:Rodin上线首月订阅与ARR环比增超400%,B端营收领跑全赛道,近千万全球用户,海外营收占80%,B端续费近100%
  • 资本与生态双重验证:一年完成三轮数亿元融资(凯辉、字节、美团等跟投)。作为英伟达唯一入选初创产品,深度接入Unity、Canva、Figma等专业工具链
  • 全链路工作流成型:打通“AI生图→多视角→3D模型→智能拆件→连接件生成→排盘打印”闭环,支持零素材起步
  • 跨领域应用延伸:从游戏/影视资产制作,延伸至具身智能仿真训练、电商/AR展示及工业3D打印代工(约0.35元/克)
  • 底层加速优化:Fast-SAM3D框架摒弃统一跳步,将算力精准分配至边缘高熵区域,场景级生成时间从462秒降至230秒

3.8 AI 3D 商业化生态与行业演进


AI 3D 商业化标杆与行业演进

Z Potentials(20260410) | 硅星人Pro(20260423) | 机器之心(20260427) | 量子位(20260427) | 硅星人Pro(20260610) | 量子位(20260611) | 深度学习与NLP(20260611) | 硅星人Pro(20260702) | 第一新声(20260708) | 机器之心(20260714) | 智东西(20260720) | 硅星人Pro(20260721)

赛道演变与竞争格局

  • 估值跃升:赛道最大融资额两年增超250倍(2024年Kaedim 1500万至2026年Meshy近4亿美元)
  • 头部分化:Luma AI放弃3D转做视频,全球曾仅极少数团队专注商业化
  • 范式转移:竞争焦点从单一模型质量转向全链路综合交付与入口之争

标杆企业:Meshy的商业验证

核心维度数据表现行业意义
融资与估值近4亿美元B轮,投后超百亿,IDG/经纬等领投刷新赛道最大单笔融资纪录
营收与毛利ARR破4000万美元(年增超12倍),毛利85%接近成熟SaaS,成赛道罕见盈利样本
极致生产效率单模型2分钟/1美元,切片通过率97%较传统外包两周/千美元实现千倍跃升
客户与规模注册超1200万,生成破1亿模型,全球前十科技巨头半数为客户规模化采用并渗透主流游戏工业
  • 底层根基:清华姚班与MIT博士胡渊鸣创立,主导开源图形库「太极」
  • 终极愿景:发布全球首个3D Agent,通过多轮对话自动拆解任务并适配全链路导出

多维度产业探索与竞品路线

  • VAST:获超10亿元A3轮融资,吉利与头部游戏厂入场,攻坚资产Agent化
  • 极顶:成鸿蒙首个3D大模型AI原生应用,实现移动端秒级生成直连打印
  • Viggle:摒弃纯视频路线采用JST架构,4个月Discord用户即破450万

硬件革新与生态飞轮重构

  • 资本破局:快造完成10亿元C轮,U1配置4独立工具头,效率提升5倍且耗材锐减80%
  • 四层飞轮:构建“硬件入口→耗材复购→内容社区→AI降门槛”闭环,重构商业逻辑

3.9 结构化3D生成:从内容生成到离散组合优化


LegoACE:自回归范式驱动的LEGO结构化生成引擎

AI前线(20260529)

  • 核心突破:LegoACE(SIGGRAPH Asia 2025)由VAST联合浙大、清华、KAUST、港大提出,首创隐式学习砖块组合规则,彻底摆脱人工标注连接点。
  • 技术范式:采用LEGO Native Tokenization,将砖块编码为位置、旋转、类型三个token,基于decoder-only Transformer按空间顺序自回归生成。
  • 数据支撑:构建LegoVerse数据集,包含55,000个模型、9,314种砖块类型(含车轮、门窗等不规则专用件)、48种旋转变换,规模远超以往数据集。
  • 双模态生成:支持文字(CLIP提取语义)与多视角法线图(DINOv2提取特征)双模态输入,端到端直接输出无需中间格式转换。
  • 训练策略:随机截取子序列渲染法线图做数据增强,采用DPO算法以Chamfer Distance为偏好标准进行对齐优化。
  • 范式演进:不显式编码连接关系而由模型自主学习组合规律,标志着从传统内容生成向离散结构组合优化的跨越。

传统LEGO生成方法对比:

方法核心思路核心瓶颈
体素建模转为带连接关系的三维体素需人工标注连接点,扩展性差
BrickGPT将LEGO序列化为文本微调LLM仅支持规则方块,难处理不规则件

4. 视频生成商业化与生态


4.1 AI视频商业化应用


AI视频商业化全景:营收突破与市场验证

探索AGI(20260330) | 量子位(20260403) | 机器之心(20260403) | AI信息Gap(20260406) | 量子位(20260409) | 脑极体(20260410) | 硅星人Pro(20260413) | 雷峰网(20260421) | 智能涌现(20260424) | 可灵AI(20260424) | 硅基观察Pro(20260424) | 可灵AI(20260425) | 可灵AI(20260425) | 莫理(20260426) | AI信息Gap(20260428) | 硅星人Pro(20260501) | AI寒武纪(20260504) | 小互AI(20260506) | 数智前线(20260506) | 花叔(20260506) | 智能涌现(20260507) | 量子位(20260507) | 硅星人Pro(20260508) | AI产品银海(20260511) | 莫理(20260512) | 智能涌现(20260512) | AI寒武纪(20260513) | 优设AIGC(20260513) | 船长AI视界(20260513) | AI异类弗兰克(20260514) | 路人甲TM(20260514) | 量子位(20260516) | 新智元(20260517) | 网罗灯下黑(20260517) | 小互AI(20260518) | 花叔(20260517) | 公子龙(20260518) | 沃垠AI(20260518) | 莫理(20260518) | 优设AIGC(20260518) | AI科技评论(20260519) | AI异类弗兰克(20260519) | APPSO(20260520) | 优设AIGC(20260520) | 新智元(20260520) | AI新榜(20260520) | "财联社AI daily"(20260520) | 开源AI项目落地(20260520) | 火山引擎(20260521) | 划重点KeyPoints(20260521) | "Z Potentials"(20260521) | 阿里云(20260521) | 量子位(20260522) | 商汤科技SenseTime(20260522) | 百度文心(20260522) | 钛媒体AGI(20260523) | 莫理(20260526) | 甲木未来派(20260527) | 莫理(20260527) | 花叔(20260527) | 优设AIGC(20260528) | 十字路口Crossing(20260528) | 路人甲TM(20260602) | 机器之心(20260604) | AI产品阿颖(20260609) | 莫理(20260610) | AI新榜(20260610) | 量子位(20260611) | 脑极体(20260611) | 袋鼠帝AI客栈(20260611) | 有新Newin(20260611) | 优设AIGC(20260612) | 路人甲TM(20260612) | 莫理(20260614) | 硅星人Pro(20260617) | 昆仑万维集团(20260623) | "AGI Hunt"(20260626) | "Z Potentials"(20260627) | 光锥智能(20260629) | 甲子光年(20260629) | 硅星人Pro(20260629) | 量子位(20260629) | AI寒武纪(20260629) | 逛逛GitHub(20260630) | 阿枫科技(20260701) | 沃垠AI(20260702) | "Z Potentials"(20260702) | 可灵AI(20260703) | 量子位(20260706) | AI新榜(20260706) | 智能涌现(20260707) | AI新榜(20260707) | 老金带你玩AI(20260708) | 可灵AI(20260709) | 优设AIGC(20260712) | AIGC开放社区(20260719) | 第一新声(20260720)

  • 高投入特效倒挂:总投资3.8亿近半砸向特效(1200+镜头),却因失去重力感遭批;反观《少林足球》威亚加粗糙CG因叙事热血更显真实
  • 资源错配致奇观失灵:群像缺乏生活困境铺垫致视觉沦为炫技,口碑两极本质是观众评价标尺从电影本身偏移到记忆投射

全球AI视频竞争格局与商业指标

  • 中美路线分化:硅谷转向底层推理单点收缩(Sora算力承压下载大跌66%),国内加速商业化落地与工作流整合
  • 国内头部吸金:可灵ARR超3亿美元拟分拆IPO,字节Seedance传闻年化收入达20亿,毛利率70%-90%
    | 产品 | 商业营收与进展 | 产能突破与降本成效 |
    |---|---|---|
    | Seedance | 强制千万年框,大客单充5000万 | 生成约0.38元/秒,占国内80%日消耗 |
    | 可灵AI | 70%收入来自海外 | 4K原生直出交付级,单条成本12-36元 |
    | LibTV | 上线一月单日营收破百万美金 | 获超300家B端短剧客户标配使用 |
    | DramaWave | 6亿美元ARR,超1亿MAU | AI月产能从20部真人提升至200+部AI剧 |
    | AniShort | 获近亿元赛道最大单笔融资 | 付费转化率64.8%,制作成本降低85% |

工作流重塑与商业化破局

  • 演进三阶段:2024模型秀场拼生成→2025平台接入嵌入工作流→2026业务深度整合
  • Agent+画布成标配:进化至画布内透明决策,支持角色三视图锁定、九宫格分镜推演与节点级精控
  • 极致产能释放:百万字剧本3分钟100%准确拆解,短剧成本从50万降至3-5万,效率提升超800%
  • 一站式平台爆发:火山剧创等实现剧本到成片自动化,Lumen Flow支持10万字一键生成100集
  • 同质化致低爆款率:商业化瓶颈在场景而非纯技术,AI漫剧爆款率仅约0.1%,超九成短剧公司亏损
  • 重构商业模式:从单一卖积分向技术+服务、按效果付费、分佣转移以深度绑定客户
  • Know-How成新壁垒:底层模型趋同后,导演思维与视听语言等专家知识成为差异化核心

4.2 视频创作生态与行业动态


AI视频创作生态演进与工业化全景

哩布哩布AI(20260330) | AI新榜(20260330) | AI新榜(20260331) | 可灵AI(20260401) | 机器之心(20260403) | 智能涌现(20260403) | AI新榜(20260404) | 前沿在线(20260404) | 量子位(20260404) | AI故事计划(20260407) | APPSO(20260408) | 可灵AI(20260408) | AI新榜(20260413) | 硅星人Pro(20260414) | AI新榜(20260414) | APPSO(20260422) | "MiniMax 稀宇科技"(20260423) | 钛媒体AGI(20260423) | 可灵AI(20260428) | AI新榜(20260430) | 量子位(20260501) | AI新榜(20260507) | APPSO(20260512) | AI新榜(20260513) | 硅星人Pro(20260514) | 雷峰网(20260514) | 硅星人Pro(20260515) | 可灵AI(20260518) | AI前线(20260518) | InfoQ(20260518) | AI新榜(20260519) | 沃垠AI(20260521) | 优设AIGC(20260521) | 路人甲TM(20260522) | 优设AIGC(20260524) | AI新榜(20260526) | AI新榜(20260527) | 公子龙(20260531) | 网罗灯下黑(20260531) | 优设AIGC(20260601) | AI产品阿颖(20260601) | JackCui(20260601) | 卡尔的AI沃茨(20260601) | 沃垠AI(20260601) | AI产品银海(20260602) | AI新榜(20260605) | AI产品银海(20260605) | 量子位(20260610) | AI新榜(20260612) | 网罗灯下黑(20260615) | 莫理(20260615) | AI产品银海(20260615) | 沃垠AI(20260616) | 阿枫科技(20260616) | AI异类弗兰克(20260617) | AI故事计划(20260618) | 硅星人Pro(20260619) | "财联社AI daily"(20260622) | APPSO(20260623) | 曼话AI(20260623) | 优设AIGC(20260624) | 钛媒体AGI(20260628) | 新智元(20260628) | 硅星人Pro(20260630) | AI新榜(20260701) | 可灵AI(20260702) | 苍何(20260703) | 光锥智能(20260703) | 莫理(20260704) | 优设AIGC(20260706) | 甲子光年(20260720)

爆款案例与情感共鸣

  • 叙事驱动情感共鸣:《纸手机》3天/3人制作全网曝光超2亿,AI内容完成从技术展示向大众共情的跨越
  • 低成本个人验证:《丧尸清道夫》约3000元/10天制作获超千万播放,单人单兵产出影视级内容路径已跑通
  • AI IP孵化提速:二创IP“咕咕嘎嘎”30天播放超15亿,IP孵化周期从数年压缩至数月,周边迅速变现

成本断崖与工业化拐点

  • 生产门槛降级:传统数十人/数十万的影视制作,AI赋能下降至1-3人/数天/1-3.4万元
  • 微短剧工业化:2026年Q1新上线微短剧中AI制作占比破95%,低成本促使高产测试,核心转向情绪锚点与爽点密度

技术突破与可控性

  • 原生画质破局:可灵推出原生4K直出无需超分,群像细节与物理流体达影视级标准
  • 3D导演台:以“先摆后生成”替代盲目提示词,3D画布拖拽精调机位与站位,有效解决空间穿帮并降低废片率
  • 角色一致性:提取角色三视图(正/侧/背)及场景线稿轨迹作为参考,配合节点化画布(如MVLAND),实现从分镜到剪辑闭环

商业格局与大厂之战

维度代表动态关键数据/影响
字节跳动Seedance+红果+番茄720P生成降至0.16-0.5元/秒,构建算力到变现闭环
快手可灵分拆冲刺IPO估值超180亿美元,海外收入占比近70%,每赚1元烧1.73元
长视频平台爱优腾芒全面入局漫剧成本降50%-90%,产能翻5倍
产业利润基础设施收网利润重心转向卖算力与流量,爆款内容变现仍存断层

生态演进与创作演进

  • 内容反向反哺:真人COS AI水果剧及“华强买瓜”二创破亿播放,形成“AI生成→真人模仿”模因循环
  • 系列化IP成主流:告别单条爆款,固定角色与世界观连载成竞争核心,观众焦点转向剧情讨论
  • 核心壁垒转移:技术操作经验贬值,导演思维、人生阅历与审美成创作者唯一不可替代的护城河

4.3 AI影视信任危机与行业阵痛


AI影视信任危机、合规治理与行业门槛重塑

财联社AI daily(20260402) | 阑夕(20260401) | 钛媒体AGI(20260420) | 光子星球(20260507) | 优设AIGC(20260519)

  • 监管常态化与源头追责:广电总局统筹部署,微信3月清理3800条AI魔改视频(第六期公告);红果Q1下架1718部违规漫剧,从被动响应升级为对出品方主动追责。
  • 侵权认定面临客观困境:出品方微调角色规避审核,平台对知名IP侵权查处快,但缺乏普通人肖像库,主观侵权高度依赖权利人举证。
  • “AI艺人库”引爆信任危机:爱奇艺“纳逗Pro意向库”被误读为艺人已授权,张若昀等紧急辟谣维权,折射出行业对AI替代真人表演的深层焦虑。
  • 平台倒逼供给侧精品化:红果取消中小方保底转纯分成,构建“番茄IP→AI模型→红果分发”闭环;爱奇艺转型社交媒体,AI制作成本已降至传统10%。
  • AI重构短剧生产管线:传统多工种协同被“抽卡师”概率筛选取代(以大学生为主),复杂镜头仍频发跳切穿帮,核心能力转向前置剪辑。
  • 人文创作凸显AI短板:《给阿嬷的情书》以1400万成本斩获豆瓣9.1分、预测票房破15亿,证明真实生活沉淀的情感细节是AI模式化输出的核心盲区。

红果短剧分成系数分层调整

内容类型调整前系数调整后系数
AI仿真人短剧6040
3D动画漫剧5040
2D动画漫剧4040

AI生成与人文创作的核心差异

维度AI生成现状人文创作(《给阿嬷的情书》)
情感来源数据训练的模式化输出创作者真实生活体验的沉淀
文化细节缺乏地方文化内在理解潮汕方言、侨批文化深度嵌入
情绪节奏依赖算法优化感官刺激人工克制,删减精彩片段防透支
成本与表现极低成本但细节频发失真1400万成本,豆瓣9.1分逆袭15亿

AI+医学循证的口腔护理产品矩阵与行业标准化

雷峰网(20260529)

  • 市场背景与核心理念:2024年口腔市场近2500亿(预计2030破4300亿),但成年人牙周健康率仅16.1%且存在「重治疗轻预防」倒挂格局;usmile以「医学循证+主动预防」切入,手握750余项专利
  • PrevenTech™预防科技体系:覆盖检测、功效、行为三大维度,构建含清洁、美白、护龈的全场景口腔护理矩阵
  • 核心产品与技术参数对比
产品核心定位关键技术核心参数与实证
Y50AI陪伴刷牙巨浪2.0+AI虚拟角色60°扫幅,语音导航漏刷区,早晚双效动态调节力度
P70智能动力旗舰巨浪3.0(联合哈工大)560gf·cm峰值扭矩,14800Gs永磁铁(超主流新能源车),较P10提升4.53倍
L30冷光美白组合410nm冷光+Oxy-white活氧区别院线460nm(能量更强不伤牙釉质),28天牙釉质无差异,1天媲美院线美白
C50台式级冲牙器高速涡流扩容专利一杯水实现台式机冲洗时长,获ADA及MDSAP认证
  • Y50 AI陪伴机制:内置可自定义的虚拟陪伴角色,利用「新鲜感维持习惯」解决用户刷不满两分钟的依从性痛点
  • L30院线级美白下探:采用双管分仓设计的活氧牙膏(挤出瞬间激活PMS成分),联合中山大学实证安全性,推动品类边界消融
  • 新国标T/CHEAA 0009.4-2024:首次纳入磨尖率(≥90%)、植毛块牢固度(≥50N)、震手位移(≤0.03mm)等硬指标,推动行业从参数竞争转向功效竞争

4.4 AI视频电商带货实操工作流与模型参数化


AI视频电商带货实操:工具选型、工作流闭环与功能实测

饼干哥哥AGI(20260415) | 饼干哥哥AGI(20260427) | 苍何(20260515) | APPSO(20260515) | 袋鼠帝AI客栈(20260527) | 卡尔的AI沃茨(20260615) | 特工宇宙(20260615) | 沃垠AI(20260615) | 船长AI视界(20260615) | AIZ小朱(20260615) | 硅星人Pro(20260617) | 优设AIGC(20260613)

商业化跑量与成本控制

  • 极低成本爆单:AI种草视频单条成本约3-35元,矩阵铺量+爆款复刻,单日GMV超5万美金
  • 情绪钩子为王:用户零预期刷内容,产品一致性达60分即可,核心精力投入3秒痛点可视化
  • 模型按需选型:无最强模型,Veo 3画质最高但废片率80%,Sora 2接近iPhone实拍质感

视频模型选型与API整合

场景推荐模型单条成本核心优势与局限
投流素材Grok¥0.5量大管饱
种草UGCSora 2¥3接近iPhone实拍质感
品牌宣传Veo 3¥15画质最高,但废片率达80%
故事叙事Seedance 2.0转场自然,提示词需极简
  • API打包整合:火山引擎Agent Plan将文、图、视频打包为单一API调用,适合多轮规划与自动化开发

OiiOii 2.0的Agent自动化与资产沉淀

  • 一句话生成短片:内置7个Agent(编剧/角色/场景等)自动接力,端到端生成215秒短片并支持局部精准微调
  • 自动拉片复刻:2-3分钟自动拆解视频18个维度生成报告,替换元素出新片,完成度约90%
  • 角色资产锁死:自动生成Face ID与三视图存库,1分钟6分镜角色外观全程锁定,解决换脸痛点
  • Skill库:内置电商广告、自媒体等模板,按行业分类自动读取领域资源,对话式出片

导演思维提示词与运镜控制

  • 核心认知:摒弃描述画面,采用给摄影师下指令,越像导演指令越出电影感
  • 导演六层框架:镜头类型+主体轨迹+环境反馈+材质互动+光影氛围+技术规格协同控制
  • Image2五层法:定角色、设物理场景、明画幅构图、精确文字字体、仅设单一主风格并适度留白
  • Seedance极简原则:提示词上限2000字,过长易致跟图与听文冲突;爆款交Gemini逐帧分析复用
  • 零成本轨迹运镜:生图结合手绘轨迹,经AI解析渲染四步即可免费实现精准运镜控制

4.5 视频虚拟换衣(VVT)技术前沿


KeyTailor:关键帧驱动的视频虚拟换衣新SOTA(CVPR 2026)

极市平台(20260513) | 极市平台(20260409) | 机器之心(20260707)

2026顶会VVT前沿:关键帧驱动、免训练修复与4D自由视角的范式跃迁

核心架构设计

  • KeyTailor(CVPR 2026):关键帧驱动,纯LoRA融合特征,不修改DiT架构实现视频换衣
  • PG-VTON(CVPR 2026):重构为受控修复,基于冻结FLUX.1-Fill单次推理,零训练零微调
  • TryOnCrafter(ECCV 2026):2D试衣先验蒸馏至3DGS人体,结合SMPL-X与背景点云对齐

推理控制与核心策略

  • KeyTailor:IKS模块筛选高信息锚点;GDDE注入动态褶皱;CBDO双分支融合全局与局部背景
  • PG-VTON:PIP在扩散早期贴入服装patch锚定身份;RAA增强注意力层对参考服细节感知
  • TryOnCrafter:基于Wan2.1-I2V-14B,结合4D渲染先验、CRA适配器与多模态语义补全

性能与计算开销对比

方案核心指标计算开销与数据集
KeyTailorVFID 7.53, SSIM 0.91ViT-HD(810×1080, 1.5万样本)
PG-VTONStreet场景FID 21.03零训练(基于FLUX.1-Fill)
TryOnCrafter360°环绕等自由视角代理构建38.9s,重渲染仅需14.3s

复用性与数据基准

  • 轨迹复用:TryOnCrafter更换轨迹重渲染仅需14.3s/20.3GB,无需重建代理
  • 数据基准:KeyTailor配套ViT-HD含1.5万个高清视频样本,覆盖全品类服装

4.6 交互式世界模型与实时多人生成


Agora-1:首个多人实时交互世界模型与仿真-渲染解耦架构

量子位(20260519) | 硅星人Pro(20260710)

仿真-渲染解耦架构(Agora-1)

  • 双函数设计:仿真层基于《GoldenEye 007》内部状态学习动态转移,渲染层(DiT)以共享状态生成画面,确保多人一致性。
  • 底层可控:共享状态可被直接操控,支持生成全新关卡并完整保留源游戏动态体验。
  • 早期验证:支持网页端4人实时FPS交互(致敬N64),概念验证意义重大,但当前画质模糊、延迟高。

因果生成范式与双脑协同(LingBot-World 2.0)

  • MoBA混合注意力:替代传统双向注意力,当前帧仅依赖历史上下文,从根本解决长时自回归误差累积问题。
  • 实时推理优化:通过consistency distillation与DMD将多步扩散压缩为少步生成,结合异步VAE解码大幅降低延迟。
  • Agentic双脑驱动:VLM充当大脑观察提议事件,视频模型充当小脑转化画面,实现世界主动自演化。

多人生成技术路线对比

方案核心思路关键局限
Multiverse分屏图像粗暴拼接一致性差
Solaris序列维度沿自回归展开拼接上下文爆炸,扩展性极差
Agora-1共享状态驱动,仿真与渲染解耦概念验证期,画质与操控延迟粗糙

核心产品形态与产业背景

模型/产品核心特性与参数研发主体与状态
Agora-1网页端4人实时FPS交互Odyssey(总融资2700万美元),早期验证阶段
Starchild-1视觉与听觉实时同步多模态生成Odyssey同日发布,处于早期演示阶段
LingBot-World 2.0720p/60fps小时级稳定输出,单卡运行1.3B蚂蚁灵波,非商用开源发布

4.7 AI长视频广告制作工作流:资产前置与分段生成方法论


品牌广告AI长视频全链路实操:资产前置→分镜生成→剪辑拼装

饼干哥哥AGI(20260529)

核心工作流:单次AI生成上限约15秒→资产前置→分镜生成→剪辑转场→后期配音。案例:Laura Geller口红广告(115秒,4个年龄段女性,全AI无实拍生成)

资产前置体系(跨段一致性的根基)

资产必备产出核心目的
人物全身三视图+半身+3表情+服装细节图锁住跨段人脸与穿着一致性
场景全/中/近三景空镜+360°环视视频统一光线色调与空间关系
产品正/侧/45°/使用态/logo特写五类图确保品牌露出准确无偏差
音色30秒样本+音色ID存档全片统一不可中途更换

分镜生成三策略(按镜头类型灵活选用)

方式适用场景要点提示
纯提示词开场/全新场景提示词须含主体+行为+景别+运镜+禁止项
分镜模式多镜头快切镜头间无需强连续,独立出片即可
尾帧衔接剧情连续段提取前段尾帧续写,确保动作顺接

剪辑转场规则(按场景逻辑匹配,非一刀切)

场景关系推荐转场参数控制
同场景近景别硬切无需特效
跨场景转换叠化≤0.5秒
情绪转折点闪白/闪黑0.2-0.3秒
明显拼接断档补拍过渡镜头禁靠特效硬掩盖

后期配音铁律

  • 配音顺序:拼素材→修衔接→加字幕→最后配音频,提前配音必返工
  • 混音层级:音量控制为旁白>对白>环境音>BGM,BGM须压至旁白30%以下
  • 工具推荐:出图首选Image2(质量)或豆包(试错);视频生成用Seedance 2.0或Veo 3.1

4.8 第一人称POV AI短视频:爆款逻辑与制作流水线


情绪代入机制与三步复刻法

路人甲TM(20260625) | AI新榜(20260625) | AI新榜(20260708)

情绪代入机制

  • 私人记录漏洞:低清晃动的第一人称画面被大脑归类为私人记忆,绕过理性防御实现瞬间共情
  • 决定因素转移:技术达“不出戏”阈值后,爆款核心从工具参数转向创作者的故事嗅觉与类型选择
  • 四象限击穿:题材集中于亲情、离别、重逢、冒险,越日常越能调动观众已有记忆
  • 逆向差异化:避开赛博朋克/科幻扎堆,切入美式青春校园(如《和讨厌的人灵魂互换了》全网超1500万播放)
  • 提示词表演控制:为角色加“自信”等标签实现“皮囊不变、灵魂改变”,单条提示词可达数千字
  • 评论区即矿场:提取网友真实经历喂给AI,情绪质感远优于纯虚构

五大核心赛道与爆款数据

赛道爆款案例核心数据
青春校园《和讨厌的人灵魂互换了》全网播放超1500万
未来科幻《零号档案》系列总播放超1.5亿
恐怖悬疑《禁忌家园》B站合集超2000万播放
视角反转《渔村里的画家》抖音434万赞/103万转
升维语境《当爱豆走进现实》小红书超10万赞,成本约2000元

三步复刻制作流水线

  • 剧本生成:从日常场景切入提取真实经历,配合WorkBuddy+Claude+QClaw工具组合
  • 分镜预演:打磨含景别机位与质感的光影提示词,采用手绘→智能分镜→抽卡出片工作流
  • 镜头三关键:加抖动模拟呼吸感,左右扫视模拟视线转移,配脚步风声构建空间感
  • 单人降本:单人单电脑即可完成全流程,成本约2000元,门槛大幅降至个人创作者

虚拟IP商业化闭环

  • 虚构人物IP化:TikTok账号打造AI女演员Brooke Sullivan,凭怀旧风格单条获百万点赞
  • 视觉做旧:用低分辨率模糊噪点模拟千禧年录像质感,规避版权与舆情风险
  • 反差感广告:韩国账号404product用日常痛点→荒诞产品→严肃广告公式,凭虚构样片承接真实品牌订单

5. 视频生成底层技术与工具


5.1 视频生成前沿技术


视频生成与理解前沿:音视频同步、交互生成与评测基准

量子位(20260414) | 极市平台(20260423) | AIGC开放社区(20260424) | AI有道(20260518) | 新智元(20260520) | 机器之心(20260523) | 人工智能学家(20260523) | AIGC开放社区(20260527) | 量子位(20260611) | 机器之心(20260615) | PaperWeekly(20260616) | 量子位(20260620) | 新智元(20260623) | 开源AI项目落地(20260626)

| CoInteract (清华&阿里) | DiT引入辅助HOI结构流解决穿透 | 交互合理性0.72(超SOTA 33%),零额外推理开销 |
| Wan-Streamer (阿里) | 首个原生流式全双工实时交互大模型 | 模型端延迟~200ms,25fps原生音画同步 |

  • 架构演进:从U-Net演替至DiT,双向交叉注意力实现跨模态对齐,突破25ms人类感知错位底线
  • AVI全景演进:十余子领域统一为感知/生成/交互三主线;工业界走向端到端,开源模型差距悬殊(如Qwen3-Omni仅73.6%)

实时交互与流式推理范式

框架/模型核心创新关键指标
MaineCoon (猫薄荷)三阶段训练+三智能体协同控制22B单卡47.5 FPS,推理成本$0.00025/s
JoyAI-VL (京东开源)模型自主决定交互时机,非规则硬编码8B实现94ms延迟,监控预警胜率100%
  • 动态Token与记忆:JoyAI-VL采用AdaCodec动态分配预算(关键帧256,预测帧16),结合分层记忆覆盖约12小时上下文
  • 高质量数据构建:OmniVideo-100K通过结构化剧本+证据链构建10万QA数据,线索引导时间跨度达144.75s,提升跨模态推理

数字人推理延迟逼近极限

框架/模型核心创新关键指标
Boson AI (李沐团队)全栈自研Audio+Avatar双引擎单帧延迟16ms(单H100支持8路并发)
FloodDiffusion (盛大)定制化扩散强制与下三角时间调度恒定1帧推理延迟,FID达0.057
LongCat-Video-Avatar 1.5 (美团)编码器升级Whisper结合DMD2蒸馏压缩至8步,主观胜率超OmniHuman等闭源
  • 单帧与流式突破:盛大FloodDiffusion恒定1帧推理延迟,在HumanML3D上FID达0.057,根本性解决训练-推理不一致问题

全模态奖励建模与多模态食物识别适配

CVer(20260705)

Omni-RRM:全模态结构化奖励建模(ECCV 2026)

  • 核心问题:现有奖励模型以视觉为中心、依赖人工标注、将复杂偏好压缩为单一标量,缺乏可解释性
  • 方法设计:构建Omni-Preference数据集,双教师模型基于五维Rubric(流畅性/相关性/准确性/推理/安全性)自动标注;SFT+GRPO两阶段训练,强化低margin样本判别
  • 实验结果:五维benchmark平均准确率70.4%,接近Gemini-2.5-Pro;视频任务80.2%、音频任务66.8%均领先

多模态食物识别适配(TMM 2026,CCF-A)

方法核心思路关键性能
IADR分类头替换+文本指令领域适配六大数据集平均91.22%,提升6.14%
VMR外部视觉记忆库检索增强4-shot场景提升10.26%
AGR属性引导生成式微调(颜色/纹理)可解释性强

关键洞察

  • 奖励建模正从标量评分转向Rubric-based多维可解释评估,跨模态联合训练能提升奖励边界稳定性
  • 双教师+五维Rubric的自动标注机制取代人工标注,直接降低RLHF数据成本
  • 大模型专业适配无固定最优解:少样本用检索增强(VMR),追求极限性能用判别式微调(IADR),方法选择应由数据规模和部署约束驱动

歌歌AI:十亿参数端到端华语音乐模型

量子位(20260710)

  • 十亿参数端到端模型:歌歌AI从零预训练,输入歌词+风格即可生成3分钟立体声歌曲,同步输出人声与伴奏分轨
  • 原生双流独立生成:人声与伴奏各走独立链路,通过跨流注意力机制实时对齐节奏与和声,模拟真人歌手即兴调整,告别事后硬叠
  • 音素时序软对齐:生成前构建拼音-时间轴“位置地图”作为先验知识注入,每个字的起止时间有明确上下文,大幅降低音节错位
  • 分层多维条件控制:采用AdaLN-Zero机制逐层调制,每个维度配备独立引导强度旋钮,可同时设定贴紧歌词情绪与旋律自由发挥
  • 汉语vs英语演唱差异对比
维度英语汉语
声调无固定音高走势四声决定字义
音节边界可弹性拉伸一字一音节,边界清晰
助词处理可拖长演唱轻声助词不可拖长
演唱风格发音连贯奔放含蓄细腻
  • 商业闭环:与字节跳动签订版权分成合作,AI内容可上架抖音/剪映/汽水音乐等平台,涵盖会员付费、数字专辑等渠道
  • 民乐计划:启动民乐专属AI模型研发,实地采集秦腔、评弹、葫芦丝、唢呐等非遗传承人原声作为训练数据

视觉语言模型高效推理与Token压缩

PaperAgent(20260331) | CVer(20260411) | 极市平台(20260414) | 机器之心(20260424) | CVer(20260508) | CVer(20260714)

  • 多轮VQA压缩易失效:Prompt依赖型方法仅基于首轮筛选Token,后续轮次丢弃视觉信息导致性能断崖下跌

主流视觉Token压缩与推理加速框架

框架核心机制关键性能表现适用场景
RedundancyLens动态FFN+局部注意力视觉FLOPs降约50%,图像/视频免训练图像/视频
FlashVID时空关联树解除位置限制保留10%Token维持99.1%性能,预填充加速6.3x视频,免训练
HERMES浅中深层差异化KV Cache保留减Token 68%,TTFT 10x加速流式视频,免训练
MetaCompress数据驱动元生成器学习压缩映射90%压缩率下SOTA,额外开销近零多轮VQA与视频

微调范式对比:对抗鲁棒性优化

对比维度传统分类引导微调新兴对齐引导微调(AGFT)
监督信号下游One-hot硬标签预训练概率分布软标签
对齐影响破坏连续语义与跨模态对齐保护跨模态语义结构
计算开销常规微调两次前向+单次反向
核心效果零样本泛化能力退化15个零样本基准准确率均升3.1%

华科CCIIP ACM MM 2026免训练推理优化

  • RankKV(KV缓存压缩):两阶段去冗(CountSketch粗筛+QR精去),64-token预算提升9.2pp
  • RumiA(注意力校准):利用2B小模型浅深层对比生成软校准引导7B大模型,ChartQA提升10.48%
  • AFRG(残差门控):发现FFN残差是视觉脱锚根源,自适应残差门控使Qwen3-VL-4B多模态幻觉率降至0.26

Mureka V9.5:从"更满"到"克制"的AI音乐质量跃迁

甲子光年(20260720)

  • 核心转向:放弃“更满更复杂”生成策略,转向“克制、真实”,重点解决声部争抢、人声编配脱节;指令精准度从6.92升至7.62
  • 双层架构:V9.5底座模型提升基础质量上限,O3推理扩展方案在生成中持续比较选优,将“好听”转化为可复现的系统能力
  • 底座核心能力:通过MusiCoT音乐思维链(先定结构与情绪再编排细节),实现结构编配、语义跟随、情绪匹配与复杂意图控制
  • O3检查维度:验证局部旋律是否服务全曲、编配是否遮盖人声、情绪是否提前释放、段落结构是否偏离提示词
  • Studio版本化:支持围绕同一创意快速生成多版本,满意部分保留、不合适单独替换,创作者重心从“操作”转向“审美判断”
  • 商业化场景:已开放API服务,重点切入游戏工业化、短剧量产、音乐创作平民化及影视降本增效等场景

核心技术与性能

CVer(20260509)

  • BARD-VL:首个系统化将预训练 AR-VLM 平滑转换为同架构扩散 VLM 的框架,基于 Qwen3-VL 转换,代码/权重/HuggingFace 全面开源
  • 渐进式范式迁移:按块大小序列 4→8→16→32 逐阶段扩大并行解码粒度,避免"跃迁式失败";用前一阶段扩散锚点模型(而非原 AR 模型)做教师蒸馏,监督信号匹配度显著高于传统 KL 蒸馏
  • 工程优化:混合噪声调度器(掩码噪声 + 可见 Token 均匀破坏)使模型同时习得"补全"与"修正";Packed Sequence Layout 封装上下文/clean/noisy response 于同一序列,优化长序列训练显存
  • 性能:BARD-VL 8B 在 7 项 benchmark 中 6 项超越原 Qwen3-VL 8B(MME +14、MMStar +5.1、MMMU +1.6);全面超越同规模开源扩散 VLM(LLaDA-V 8B、Dimple-VL)
  • 推理加速:解码吞吐量最高提升 3 倍,票据结构化任务仅需 6 次 diffusion refinement vs 原模型 35 步自回归解码
  • 训练数据:基于 LLaVA-OneVision-1.5 与 FineVision 清洗构建,共 4.4M 高质量样本

5.2 长视频与多镜头生成


长视频与多镜头生成前沿技术

机器之心(20260410) | 量子位(20260410) | 机器之心(20260415) | 极市平台(20260416) | 智东西(20260605) | 机器之心(20260606) | 量子位(20260607) | 机器之心(20260607) | AIGC开放社区(20260610) | CVer(20260723)

核心技术路线对比

框架核心机制关键数据
OneStory (Meta/哥本)next-shot自回归+自适应记忆筛选CVPR 2026,支持10镜头连贯
JoyAI-Echo (京东/北大/清华)7槽位配对记忆+三段后训练蒸馏身份一致性0.7793,语音0.8646,7.5倍加速
VideoClaw (哈工大/阿里)结构化场记库+VLM闭环质检支持无限续写,GitHub 1.3K Star
OmniRoam全景统一表示+两阶段轨迹解耦预览81帧约7秒,641帧一致性验证

OneStory 记忆机制

  • Next-shot生成:重构自回归范式,逐镜头推进,统一文生与图生
  • 双模块协同:Frame Selection语义选帧 + Adaptive Conditioner自适应压缩

JoyAI-Echo 核心创新

  • 远锚近联策略:7槽位(前3锚点+近4上下文)绑定视觉与音频防混淆
  • OmniNFT对齐:优势路由解决音视频奖励冲突,切断梯度防泄漏,发声区加权
  • 数据体系:100万+身份原型去重,100个故事/3000镜头评测基准,2K超分

VideoClaw 多智能体闭环

  • 场记状态库:角色与场景信息沉淀为可复用资产,支撑剧情无限续写
  • VLM双重审查:比对剧本与逻辑偏移,未达标触发回溯重生

OmniRoam 轨迹解耦

  • 全景坐标建模:去除相机自旋仅留平移,提供全局空间约束
  • 粗到精生成:首阶段轨迹控制预览,次阶段visibility mask抑制误差累积
  • 核心突破:PDR(连续高斯场)方法将视频预测速度突破 1000 FPS,重塑视频预测范式
  • 技术路线:采用连续高斯场建模,替代传统离散帧预测方式
  • 会议:入选 ECCV 2026

5.3 视频编辑与自动化创作工具


AI视频自动化编辑与精修工具

PaperWeekly(20260416) | AI信息Gap(20260424) | 智能涌现(20260424) | 卡尔的AI沃茨(20260506) | 莫理(20260506) | 饼干哥哥AGI(20260602) | 逛逛GitHub(20260610) | 量子位(20260620) | 船长AI视界(20260708) | PaperWeekly(20260714)

  • 行业痛点转移:视频核心矛盾从“做不出”转为“不知哪里烂”,生成技术成熟后审片与审美能力比技术本身更稀缺
  • Buzzy商业模式:定位视频版Photoshop,主打对话式局部精修,ARR达2000万美金,英文提示成功率约90%
  • Buzzy技术路径:基于RLHF训练专用小模型提升意图理解,将视频创作从线性流程转变为迭代式工作流
  • CutClaw盲测领先:2000份样本中49.8%认为视觉最佳,53.0%认为视听和谐度最优,得票达第二名两倍以上
  • Crayotter状态外化:将剪辑过程转为7类可检查工件链,故障精准归因到特定片段,五维度显著优于CutClaw等基线
  • aidirectorbrain审片:主打时间戳级诊断,量化留存与情绪曲线,支持点击时间点探讨张力并输出运镜/BGM提示词

AI视频编辑工具矩阵对比

工具定位核心数据/技术亮点
Buzzy对话式局部精修ARR 2000万$,英文提示成功率约90%
CutClaw全自动粗剪与卡点2000人盲测近50%认为最佳,多智能体协作
Crayotter工件驱动的长轨剪辑外化7类工件,故障定位到片段级
aidirectorbrain导演级审片诊断时间戳级定位,量化留存与情绪曲线
HyperFrames确定性渲染基建HeyGen开源2.5万Star,同一HTML同一视频
html-video模板与工作流封装21套商用模板,定位“HTML版剪映”
RemotionReact驱动的精品打磨逐帧组件描述,支持复杂动画

5.4 视频目标消除与修复


视频目标消除与抠图技术前沿

量子位(20260508) | CVer(20260707)

  • 视频抠图核心矛盾:需同时兼顾高层语义追踪(跨帧锁定)与底层细节估计(半透明/极细边界),单一模型难以兼顾
  • 微调困境:在V-HIM2K5数据集微调会破坏tracker泛化能力,从头训练则数据不足

SAM2Matting(复旦):解耦两阶段设计

  • 冻结VOS Tracker:保留泛化追踪能力,提供稳定掩码与多尺度特征,支持mask/point/box/scribble/text多模态提示
  • ROI Detector:自适应定位发丝、肢体间隙等不规则抠图区域
  • Progressive Alpha Predictor:逐级精修产生高质量alpha抠图结果
  • 零样本SOTA:仅用图像抠图数据训练,即零样本刷新视频抠图SOTA

SAM2Matting 性能参数

模型版本分辨率FPS显存
SAM2.1-Tiny1080p~40~3.61GB

SVOR(小米):真实场景视频目标消除

  • MUSE机制:时间窗口内联合遮罩替代逐帧处理,免训练解决快速运动致遮罩不完整
  • DA-Seg模块:去噪感知持续补全缺失掩码,兼容AI分割偏差与手绘遮罩
  • 课程式训练:真实背景自监督预训练转合成数据精调,解决阴影与反射残留
  • 竞赛表现:获CVPR 2026物理感知视频实例消除挑战赛冠军(18支队伍),三项指标大幅领先

5.5 3D重建与动作生成


3D重建与空间感知技术前沿

量子位(20260330) | 极市平台(20260401) | 机器之心(20260412) | 机器之心(20260416) | 量子位(20260416) | CVer(20260417) | 具身智能之心(20260419) | CVer(20260421) | 量子位(20260424) | 机器之心(20260506) | PaperWeekly(20260514) | 机器之心(20260519) | CVer(20260606) | 极市平台(20260609) | CVer(20260609) | AI科技评论(20260612) | 机器之心(20260626) | 深度学习与NLP(20260421)

技术范式跃迁

  • VLM³验证三维视觉Bitter Lesson:仅需焦距与像素空间归一化即超越专家模型SOTA
  • 生成式先验突破:VEGA-3D将视频扩散模型作世界模拟器,零3D监督多视角一致性达97.04%

稠密深度与单图重建

  • Meta SAM 3D:双模型级联单图生成3D网格,SA-3DAO基准较此前最优提升44%
  • 腾讯DepthVLM:原生输出稠密深度,δ₁=0.876远超GPT-5.5(0.407),推理约0.42秒
  • SpatialPoint框架:深度图复用RGB主干,实点预测误差降至17.2mm实现零样本泛化

大尺度与流式实时重建

  • Scal3R:全局上下文记忆对齐,单卡4090实现公里级万帧3D重建,轨迹误差降至4.45m
  • LingBot-Map:三层记忆压缩Token近80倍,实现20FPS实时推理与13.28GB恒定显存
  • 低成本单目建图:几十元级单摄跑超万帧实现整栋楼级3D地图构建,验证大尺度室内流式重建可行性

3DGS材质与暗光极限突破

  • 3DReflecNet:首发22TB非漫反射数据集,揭示材质光学特性与极线几何结构冲突为失效根因
  • AmbiSuR:球谐高阶系数模长量化光度多义性,DTU倒角距离0.46全面超越基线
  • NIRGB-GS:近红外主导几何、暗光RGB恢复色彩,攻克极暗区域纹理重建难题
  • UniSHARP:摆脱针孔假设统一四类相机几何表示,配套30万张ERP全景数据集

人体运动与多模态感知

  • M4Human:首发999段高保真毫米波人体mesh数据集,跨遮挡感知延迟仅2.74ms
  • RAM框架:端到端融合卡尔曼滤波与Transformer,实现复杂遮挡下zero-shot稳定身份跟踪
  • 灵视P1空间相机:融合多目视觉与激光雷达,打破索尼垄断并落地影视与具身智能

5.6 3D渲染引擎与底层技术


3D渲染引擎架构与神经压缩技术

CVer(20260330) | 量子位(20260415) | APPSO(20260415) | 机器之心(20260415) | 智东西(20260415) | 财联社AI daily(20260415) | 极市平台(20260415) | AIGC开放社区(20260417) | AI寒武纪(20260418) | 机器之心(20260425) | 量子位(20260427) | 机器之心(20260525) | 逛逛GitHub(20260527)

引擎开发者LOD架构场景上限核心优势
Spark 2.0World LabsSplat-based1亿高斯点首个跨设备兼容的Web端亿级渲染
Aholo Viewer群核科技Chunk-based10亿高斯点3亿点测试:内存仅Spark一半,速度快3倍

Spark 2.0 跨设备渲染架构

  • 恒定渲染预算:设定固定splat上限(移动端50万、桌面端250万),帧率与场景总量无关
  • 连续LoD树:自下而上合并消除离散跳变,结合注视点渲染集中算力至视线中心
  • GPU虚拟内存分页:LRU策略管理1600万节点池,多场景共享物理内存避免浏览器OOM
  • RAD流式格式:分块独立压缩支持网络随机访问,首块64K splat即可呈现粗略轮廓
  • 多物体统一渲染:全局坐标系统一后经Wasm后台排序,单条实例化指令完成绘制

Aholo Viewer 区块化调度路线

  • Chunk-based LOD:以Chunk数据块为单位层级切换,缓存命中更优,扩展性可达城市级
  • 按需加载与裁剪:视锥内按需加载,10亿点级别场景无需一次性装入显存
  • 工程化工具链:兼容多格式自动LOD生成,支持射线检测与物理碰撞
  • 云端混合渲染:支持3DGS与Mesh同场景串流,打通图/文生3D等业务API

NDGI 动态光照神经压缩

  • 时空解耦编码:2D三平面锁定高频细节,3D特征捕捉光照时序低频变化
  • 硬件协同压缩:训练主动模拟BC7编码损失并补偿,无缝兼容GPU纹理采样
  • 极致压缩性能:0.68 BPP下达46.69 dB(比NTC高3dB),RTX 4060解码1024×1024仅0.2ms

3D重建产业演进趋势

  • 从离线到流式在线:LongStream实现公里级18FPS流式重建,LingBot-Map前馈恢复位姿
  • 输出形态升级:从本地点云转向可在线访问与嵌入的空间内容,支撑机器人仿真
  • 生产力工具转型:其域创新LCC解耦编解码将体积压至PLY的8%,进入影视虚拟拍摄

6. 多模态模型底座与训练推理加速


6.1 闭源多模态模型发布与行业动态


多模态模型能力跃迁与架构创新

PaperAgent(20260408) | AGI Hunt(20260409) | 硅星人Pro(20260409) | 腾讯研究院(20260420) | 智东西(20260429) | CVer(20260429) | 夕小瑶科技说(20260429) | 量子位(20260429) | AIGC开放社区(20260506) | 花叔(20260506) | 火山引擎(20260506) | 刘小排r(20260506) | GLM大模型(20260508) | 机器之心(20260513) | 赛博禅心(20260513) | 网罗灯下黑(20260513) | 新智元(20260513) | PaperWeekly(20260513) | 逛逛GitHub(20260513) | 卡尔的AI沃茨(20260513) | AI产品银海(20260513) | GitHubDaily(20260513) | AI寒武纪(20260514) | APPSO(20260525) | 量子位(20260526) | 卡尔的AI沃茨(20260531) | CVer(20260607) | 量子位(20260610) | InfoQ(20260622) | 船长AI视界(20260706)

  • 豆包 Seed-2.0-lite:全模态性价比,能力达Pro版95%,价格仅1/5,总token成本降20%
  • GLM-5V-Turbo:Agent基座,感知-推理联合RL,MMSearch-Plus分数提升近8倍
  • MiniCPM-V 4.6:端侧新标杆,1.3B参数仅耗6G内存,吞吐量达2624 token/s
  • Gemma 4 12B:无编码器设计,极简视觉嵌入器替代27层ViT,单次微调更新全模态

端侧部署与极致推理优化

  • 端侧参数上限:8GB手机可用内存仅2-3GB,INT4量化下1.3B模型权重约0.65GB,1-2B为实用上限
  • Token自适应压缩:MiniCPM-V 4.6将压缩前置至ViT内部降55.8%算力,支持4倍/16倍混合压缩
  • 长上下文稀疏注意力:快手Keye-VL-2.0引入DSA,512帧准确率升至42.44%,长序列Prefill成本降50%
  • 警惕粗暴剪枝:FastV等浅层剪枝易致幻觉;COAST保留22%视觉token仍维持98.64%性能

推理范式演进与训练瓶颈

  • 视觉原生推理:DeepSeek提出“视觉原语思考”,将800×800图片压至约90个KV缓存,反超GPT/Claude
  • 物理空间反直觉现象:商汤指持续增加多模态数据反固化语言先验,须转向“Predict Next View”突破瓶颈
  • 企业级落地成本:异构数据接入融合成本占70-80%,端到端闭环交付(如小浣熊日均1500万用户)成存活核心

国产轻量模型生产实测

  • 生产可用性验证:Step 3.7 Flash等模型在流程图理解与发票提取场景达标,单次成本均低于1分钱
  • 轻量模型成本分化:Step 3.7 Flash两场景成本均最低,仅为MiniMax M3的36%(流程图场景)
  • 缓存机制影响Token:MiniMax M3 input Token消耗异常偏高(27.9K),推测与缓存写入机制直接相关
  • 核心指标关注点:多款模型响应速度差距不大,但input Token消耗差异达数十倍,直接决定规模化成本

6.2 视觉分词器与基础表征预训练


视觉分词器架构创新与基础表征预训练

机器之心(20260330) | 机器之心(20260424) | 机器之心(20260427) | 极市平台(20260625)

视觉分词器与表征预训练前沿突破对比

模型/工作核心机制性能表现
VTP联合重建+自监督+图文对齐三目标gFID 1.11刷新纪录,打破缩放退化悖论
MacTok图像与表征双空间协同注入语义64 token实现gFID 1.44,压缩64倍
InfoTok基于香农定理与ELBO路由动态分配Token推理提速11倍,无损节省20% Token
TIPSv2iBOT++全Token损失+多粒度文本防走捷径1.1B参数全面超越1.7倍大体量竞品

VTP:破解预训练缩放退化悖论

  • 直击退化诅咒:纯重建目标扩算力反致生成退化,VTP联合三目标首破此悖论
  • 刷新生成纪录:ImageNet 256×256上gFID达1.11,收敛速度显著优于VA-VAE

MacTok:根治连续分词器后验坍塌

  • 直击坍塌根源:强KL正则致编码器放弃写入语义,MacTok双空间协同直接注入语义
  • 极致压缩表现:仅用64个Token实现gFID 1.44,128 Token即匹敌1024基线

InfoTok:信息论驱动动态按需分配

  • 突破静态分配:基于香农定理证明最优Token分配以信息熵为下界,按场景复杂度伸缩
  • 极致推理提速:推理速度提升11倍,无损节省20% Token,入选ICLR 2026 Oral

TIPSv2:颠覆密集对齐监督范式

  • 突破监督范式:发现对可见Patch显式监督是对齐关键,颠覆仅计算Mask损失传统
  • 防捷径学习:交替使用多粒度文本描述训练,零样本分割mIoU飙升14.1
  • 极致效率表现:TIPSv2-g(1.1B)击败参数量大56%且数据多47倍的PE-core

6.3 AI Agent 平台架构与多智能体协作


AI Agent 平台架构与多智能体通信机制

TRAE.ai(20260401) | 人工智能学家(20260408) | 玄姐聊AGI(20260409) | 阿里云开发者(20260409) | 量子位(20260430)

Agent 平台三层解耦架构(Anthropic)

层级定位核心机制与表现
Session外置记忆Append-only事件流,崩溃可从任意位置恢复
Harness无状态编排换底层模型/算法不中断上层,崩溃自动重醒
Sandbox标准接口推理提前启动,首Token延迟p95下降超90%
  • 商业模式转型:定价从 Token 计费转向 $0.08/会话小时,定位为 Agent 基础设施提供商

多智能体通信瓶颈与语义治理

方案核心问题效果
思科 CFNMAS停留在自然语言点对点通信,语义易漂移HotPotQA/MuSiQue 提升 10%+
三态通信协议1人+6Agent+52个cron任务产生分布式ACK风暴保障 7x24 稳定运行
  • CFN 语义中间件:Cognitive Sidecar 边车部署,逻辑集中维护全局 Memory 与安全策略
  • 自治系统工程瓶颈:90% 精力花在工程基础设施而非 AI 模型本身能力

多智能体视觉幻觉抑制(ViF)

  • 幻觉滚雪球:纯文本传递致视觉信息丢失,关键视觉令牌占比从第1轮1.22%骤降至第20轮0.10%
  • ViF 即插即用:直传中层单峰视觉令牌保留原生证据,仅增 8.1%~13.4% 延迟(入选 ICLR 2026)
  • 实测效果:8大基准、4种MAS结构平均提升 2.4%~3.8%,幻觉滚雪球分数(HS)降超 30%

端云协同 Agent 架构

  • 端云算力分工:端侧(酷睿 Ultra)负责视频解码、VLM 推理等重算力,云端大模型负责叙事编排等轻决策
  • 平台能力进化:TRAE Skills 机制从程序员工具扩展为通用 AI Agent 平台,视频剪辑为首例示范

6.4 产业级视觉语言模型工程化实践


Stellaris-VL-4B:细粒度定位感知的产业视觉语言模型

极市平台(20260511) | 极市平台(20260602) | 极市平台(20260408)

产业痛点洞察:80%产业视觉需求为细粒度定位感知(OVD/REC),模型推动从1500+碎片化算法向统一架构演进

商业落地规模:覆盖100+行业、服务3000+政企客户,已在智慧城市、能源等场景规模化验证

端侧架构优势:4B参数支持单卡边缘部署断网低延迟推理,精准融合目标获取分支以兼顾理解与定位

闭环数据引擎:依托10亿+真实业务数据,经清洗、标注、验证、反哺四阶段闭环,使产业数据集性能翻倍

分阶段训练策略:SFT阶段打基础,RL阶段引入GSPO与IoU定制奖励函数,重点强化定位精度并抑制幻觉

核心能力评测表现

能力维度性能表现
通用VQA对话与指令遵循能力不退化,小幅领先同量级开源模型
开放词汇检测(OVD)覆盖1000+场景构建100k数据集,mAP@0.5:0.95显著更优
指代表达理解(REC)创新目标框Token化,复杂环境精准定位(如压线车辆)
小目标识别统一视觉编码器处理多尺度特征,抗背景干扰能力增强

工程平台赋能:极星平台支持一句话自定义提示词,快速适配多业务场景需求

权威认可:入选CCIG 2026图像图形先锋金牌榜,46项基准任务效率领先


6.5 古文字OCR评测基准与VLLM感知短板


Chronicles-OCR:中国古文字识别评测揭示多模态感知悖论

腾讯混元(20260518)

  • 首个古文字评测基准:腾讯混元联合发布 Chronicles-OCR,覆盖甲骨至草书完整演化,含 2,800 张图像(每体 400 张),已开源
  • 多模态模型识别遇瓶颈:评测 28 个 VLLM(含 GPT-5、Gemini 3.1 Pro),端到端检测 H-mean 最高仅 16.5
  • 细粒度识别天花板低:画框辅助认字最高准确率仅 27.1%,甲骨文上 Gemini 3.1 Pro 仅 14.0%
  • 阶段自适应标注:古早字体(甲骨/金文/篆)用字符级精细 bbox 与汉字映射;成熟字体(隶/楷/行/草)用行级逐字转写
  • 数据源权威:甲骨文源自安阳师范重点实验室,金文/篆书由博士团队整理,成熟字体取自故宫博物院

四大核心任务与最佳表现

核心任务适用字体最佳表现
跨时代字符检测甲骨/金文/篆H-mean 16.5
细粒度古字识别甲骨/金文/篆Exact Match 27.1%
古文转写全部七体楷书0.556,甲骨0.05
字体分类全部七体古早 96.7%,成熟 77.0%
  • 揭示感知悖论:模型靠载体纹理分类(龟甲纹理→甲骨 96.7%),楷行草皆在宣纸上失去区分力(降至 77.0%),在看纹理而非读字
  • Reasoning 放大幻觉:开启 thinking 模式后表现反降(Spotting 从 7.8 降至 2.1),感知基础不稳时推理只会放大不确定性

7. 视频生成平台工具与创作工作流


7.1 视频生成工具与 Agent 客户端


AI 视频生成与编辑产品矩阵及 Agent 编排流水线

开源AI项目落地(20260415) | 歸藏的AI工具箱(20260417) | 开源AI项目落地(20260418) | 新智元(20260420) | 优设AIGC(20260421) | 优设AIGC(20260422) | AI信息Gap(20260424) | 莫理(20260429) | 量子位(20260507) | 十字路口Crossing(20260508) | 沃垠AI(20260509) | 优设AIGC(20260512) | 优设AIGC(20260507) | 硅星人Pro(20260603) | 海外增长圈(20260607) | 袋鼠帝AI客栈(20260611) | AI有道(20260705) | 莫理(20260710) | AI异类弗兰克(20260711) | 有新Newin(20260714) | 曼话AI(20260714) | 船长AI视界(20260430)

AI视频生成正向Agent编排演进,全链路自动化与全能编辑器正将创作门槛与成本压缩至极低水平。

Agent编排与长篇叙事突破

  • 流水线重塑:OpenMontage提供400+技能,60秒动画成本仅1.33美元;MoneyPrinterTurbo获9万+Star
  • 长篇连载突破:Zopia集中资产库支撑64集长篇;LibTV内含100+Skill且提供1000万激励,累计播放超100亿
  • AI原生范式:HeyGen Hyperframes用HTML/CSS替代Diffusion渲染并反哺数字人,结合Claude实现单次对话批量产出20条脚本
  • 全能编辑降本:免费AI视频编辑器集成超长视频生成、数字人、MV、PPT转视频及海量模板与提示词,实现全链路极简创作

代表产品与核心优势对比

产品定位核心能力与数据
Buzzy视频版Photoshop对话式局部精修与非破坏性编辑,融资2000万
生数Vidu全链路生成5天广告制作压缩至1天,百元产出百万质感
OiiOii 2.0拉片复刻自动拆解参考视频18维度,10秒视频5分钟出片
MVLANDMV自动生成音乐节拍与视觉转场精准咬合,数万成本降至30分钟
Flova原生创作Agent支持资产跨项目复用、Prompt预审与任务并行

垂类场景极致降本提效

  • 电商与轻量化起稿:VidAU支持860+数字人与120+语言换脸;InVideo和DreamVid主打一键将图文创意转为多平台初稿
  • 工作流沉淀与复用:LibTV支持自定义Skill沉淀,打通多样化视频创作工作流闭环

7.2 Seedance 2.0 与 LibTV 平台生态


Seedance 2.0 技术能力、平台生态与第三方工具集成

甲木未来派(20260401) | 火山引擎(20260402) | 花叔(20260402) | 开源AI项目落地(20260402) | GitHubDaily(20260402) | 逛逛GitHub(20260402) | AI范儿(20260403) | AI异类弗兰克(20260403) | 船长AI视界(20260403) | AI产品银海(20260410) | AI信息Gap(20260411) | 莫理(20260411) | 优设AIGC(20260412) | 公子龙(20260412) | AI寒武纪(20260413) | 火山引擎(20260414) | 财联社AI daily(20260414) | AIZ小朱(20260415) | 量子位(20260417) | AI早餐汇(20260427) | "Z Finance"(20260519) | AI故事计划(20260526) | 饼干哥哥AGI(20260529) | 袋鼠帝AI客栈(20260601) | 火山引擎(20260603) | 火山引擎(20260605) | 火山引擎(20260610) | 智东西(20260616) | "财联社AI daily"(20260623) | 火山引擎(20260623) | AI寒武纪(20260623) | 曼话AI(20260623) | 优设AIGC(20260624) | 第一新声(20260707) | 火山引擎(20260715) | AI新榜(20260717) | AI新榜(20260521)

  • 版本演进:Seedance 2.0支持原生4K与10-bit直出(约100元/条,2-3分钟);2.5版单次时长将达30秒,支持50个素材输入及局部编辑

  • 产品矩阵对比
    2.0满血版:高端质感(216积分),语义遵循与质感极佳
    2.0 Fast版:轻量草稿(176积分,低约15%),易出物理错误
    Mini版:批量短视频(0.16元/秒),API价格较2.0低50%

  • 生态基建对比
    LibTV平台:第三方工作流(0.35元/秒),独立算力免排队及版权校验
    nexu客户端:开源IM集成(MIT协议),打通微信/飞书等6大渠道零门槛生成

  • 制作降本显著:抽卡出片率大增(传统约2000元,2.0均价3次出片);漫短剧降本70%-90%提效80%-90%;2分钟科幻片仅330.6元,30秒广告30-45元

  • 爆款与商业化:98分钟《人类进化史》抖音破亿;约1万元算力产出超7000万播放;AIGC素材ARPU提升80.2%;火山方舟上线版权平台引入周星驰IP

  • 市场与底层渗透:日均算力消耗份额超80%;深度嵌入剪映/CapCut;LibTV兼容Maya解决空间表达;豆包大模型日均Token超120万亿

  • 戛纳电影节里程碑:火山引擎携2.0亮相第79届戛纳,8部AI影片展映

  • 长片成本颠覆:全球首部95分钟AI长片《HELL GRIND》由15人14天完成,成本不足50万美元,约为传统同级1%

  • 国际巨头合作:吕克贝松SEEN工作室宣布用Seedance结合实拍造动画长片;Outpost VFX、WPP、Magnific等机构已披露合作


7.3 AI短剧与漫剧工业化平台及产业链


AI短剧与漫剧工业化平台生态

AIZ小朱(20260330) | 昆仑万维集团(20260331) | AI产品银海(20260402) | AI异类弗兰克(20260403) | 卡尔的AI沃茨(20260404) | 优设AIGC(20260404) | 卡尔的AI沃茨(20260407) | AI大模型工场(20260408) | Z Finance(20260408) | 特工宇宙(20260408) | 机器之心(20260408) | AI新榜(20260409) | 智东西(20260409) | 梦飞 AI(20260409) | 钛媒体AGI(20260410) | 机器之心(20260410) | APPSO(20260410) | AI前线(20260410) | 量子位(20260411) | 卡尔的AI沃茨(20260411) | 小互AI(20260413) | InfoQ(20260413) | 船长AI视界(20260413) | 莫理(20260415) | 路人甲TM(20260415) | 船长AI视界(20260415) | 摸鱼小李(20260416) | APPSO(20260419) | 网罗灯下黑(20260419) | AI异类弗兰克(20260420) | 商汤科技SenseTime(20260421) | 曼话AI(20260421) | TRAE.ai(20260422) | AI新榜(20260424) | APPSO(20260427) | 智东西(20260427) | 阿里云(20260427) | 千问APP(20260427) | 机器之心(20260427) | AI科技评论(20260427) | 十字路口Crossing(20260427) | AI异类弗兰克(20260427) | 袋鼠帝AI客栈(20260427) | 新智元(20260427) | AI信息Gap(20260428) | 硅星人Pro(20260428) | 第一新声(20260428) | AI前线(20260428) | AI新榜(20260428) | JackCui(20260428) | 商汤科技SenseTime(20260429) | 火山引擎(20260430) | 阿枫科技(20260430) | AI产品银海(20260506) | 路人甲TM(20260507) | AI信息Gap(20260513) | 莫理(20260514) | 甲木未来派(20260527) | 商汤科技SenseTime(20260609) | AI产品阿颖(20260609) | 莫理(20260610) | 阿枫科技(20260611) | 智东西(20260622) | 阿枫科技(20260705) | 深度学习与NLP(20260428)

核心架构与实测表现

  • 统一架构:15B参数40层Transformer原生音视频联合生成,取代级联拼接,文生视频Elo达1391
  • 极致效率:DMD-2蒸馏(8步去噪),单张H100生成1080p视频仅需38秒,创历史新高引发股价波动
  • 实测长板:擅长电影级中近景光影、微表情精控与长镜头连贯,支持7语种原生唇形同步
  • 实测短板:物理规律拟真弱(碰撞翻车、流体失真),画面文字乱码严重

视频生成模型格局与定价梯队

  • 阿里快乐小马:音视频同步登顶,720P低至0.44元/秒(首批上手),短板为物理逻辑差
  • 字节Seedance:综合可用率超90%,1080p成本约2-3.6元/秒,短板为成本偏高
  • OpenAI Sora:日烧1500万美元,目前已全面关停

一站式Agent平台与工业化

  • 极致降本增效:短剧周期从15-30天压缩至1-3天,单集5分钟算力成本仅240-300元
  • 平台生态涌现:Seko、OiiOii、AniShort等实现从剧本到成片全链路闭环(Seko 2月破10万用户)
  • Agent细粒度分工:内置编剧、分镜等7个专业Agent,用户一句话即可驱动整套班底
  • 多模型混合调度:常组合豆包(剧本)、Vidu(量产)、Seedance(修Bug)平衡成本

突破跨镜头一致性与资产管理

  • 数字资产库:角色多视图绑定(正/侧/背/特写)及720°全景影棚,彻底解决“变脸”痛点
  • 无限画布工作流:Seko等平台支持节点式多机位推演与资产一键复用,保障多剧集画风连贯
  • 自动审查闭环:引入独立Agent从冲突密度、水集检测等10+维度自动博弈优化,大幅降低返工率

商业化变现与市场验证

  • 跨行业渗透:从娱乐短剧转为保险、教培行业高完播率获客工具,单人单机即可实现量产
  • 市场爆款频出:大学生3个月AI短片破亿播放;巨日禄作品占年度漫剧榜近50%,单部达2.5亿播放

7.4 AI视频与漫剧创作全流程工作流实操


AI视频与漫剧创作全流程工作流实操与案例解析

船长AI视界(20260330) | APPSO(20260331) | AI大模型工场(20260331) | 卡尔的AI沃茨(20260331) | 船长AI视界(20260331) | 哩布哩布AI(20260401) | AI信息Gap(20260402) | AI产品银海(20260402) | AI寒武纪(20260402) | 公子龙(20260402) | 路人甲TM(20260402) | 哩布哩布AI(20260402) | 火山引擎(20260402) | 船长AI视界(20260401) | 优设AIGC(20260402) | 沃垠AI(20260402) | 探索AGI(20260402) | 莫理(20260402) | 小互AI(20260402) | AIZ小朱(20260402) | 阿枫科技(20260402) | 网罗灯下黑(20260402) | GitHubDaily(20260402) | 逛逛GitHub(20260402) | 船长AI视界(20260402) | 袋鼠帝AI客栈(20260403) | JackCui(20260403) | 特工宇宙(20260403) | APPSO(20260404) | APPSO(20260404) | 船长AI视界(20260404) | 曼话AI(20260405) | 卡尔的AI沃茨(20260407) | 阿枫科技(20260406) | 优设AIGC(20260407) | 优设AIGC(20260407) | 苍何(20260406) | 琢磨事(20260407) | 莫理(20260407) | AI产品银海(20260407) | AI新榜(20260415) | 莫理(20260420) | AI新榜(20260421) | AI新榜(20260515) | 曼话AI(20260517) | 船长AI视界(20260410) | "梦飞 AI"(20260605) | 莫理(20260630) | 路人甲TM(20260702) | AI异类弗兰克(20260703) | 沃垠AI(20260714)

  • 核心模型与多模态能力跃升:以Seedance 2.0、PixVerse V6为代表的模型支持文/图/音/视频四模态混合输入,原生具备物理规律理解、光影控制及多镜头连贯叙事,最高输出2K电影质感。
  • 排队痛点与极速破局:官方平台高负载下常需排队数小时甚至出现降智现象,经LibTV等第三方平台底层优化后,15秒1080p视频生成缩短至2-3分钟且支持多任务并行。
  • 全链路Agent自动化制片:OiiOii、LibTV、StepClaw等平台引入模拟工作室多Agent协作,无限画布串联剧本、三视图与分镜。支持一句话指令(如王家卫风格)全自动生成5分钟漫剧,最快30分钟出片。
  • 角色与空间一致性突破:全面告别“抽卡式盲跑”。通过角色锚点系统、九宫格分镜前置约束、3D导演台(素模空间站位)以及物理级质感重计算,精准控制人物变脸、背景穿帮与“塑料脸”痛点。
  • 工业化降本增效与数据验证:AI技术渗透率达60%-85%,漫剧制作成本下降50%-75%(如Seedance生成0.24元/秒)。创作周期极速压缩,黑客松团队36小时即可产出商用级短片。
  • 商业生态演进与创意核心化:API全面开源并接入IM端(微信/飞书),B站等巨头入局加剧生态角逐。随着技术门槛抹平,行业核心壁垒已全面转向“叙事能力与导演意识”。

主流工具生态与商业化数据对比

工具/平台核心定位与突破关键效率与成本数据
Seedance 2.0四模态输入,原生音画同步与物理推演官方日均超13万人排队,豆包大模型日均Token超120万亿
LibTV无限画布,3D导演台与多Agent自动化调度2000字剧本几十秒拆解分镜,5分钟筹备缩至40分钟
PixVerse V6物理仿真跃升,推出Mini Apps零门槛电商出片15秒1080p生成约2分钟,成本约0.04美元/秒
OiiOii / Flova内置编剧/分镜等7个专业Agent,全链路一键出片最快30分钟出片,视频成本降至0.24元/秒
LTX2.3重构VAE模型,支持超长本地部署生成缓解AI自行发挥通病,22B模型仅需32GB显存

8. 多模态推理与视觉理解


8.1 多模态推理范式与视觉语言模型前沿


多模态推理范式与能力评测系统性反思

PaperAgent(20260330) | 字母AI(20260401) | 新智元(20260410) | PaperWeekly(20260413) | AI有道(20260414) | AIGC开放社区(20260424) | ScienceAI(20260430) | 机器之心(20260430) | 花叔(20260430) | 智东西(20260430) | Datawhale(20260430) | AI寒武纪(20260430) | PaperAgent(20260501) | 机器之心(20260504) | 极市平台(20260507) | AI科技评论(20260512) | CVer(20260513) | 机器之心(20260515) | AI科技评论(20260515) | PaperWeekly(20260515) | "Z Potentials"(20260517) | CVer(20260527) | 量子位(20260614) | CVer(20260616) | CVer(20260625) | CVer(20260524) | CVer(20260717) | 新智元(20260725) | "Z Potentials"(20260729)

  • 视觉推理范式:ATLAS用单个离散Functional Token统一隐式推理与智能体操作
  • 非文生图精细推理:主流大模型纯彩铅逐笔绘画均现过度修改,完成7幅画成本差20倍

多维模型能力对比

模型/框架核心优势关键基准表现
DeepSeek (V4-Flash)空间推理与压缩迷宫导航66.9%,7项基准均分77.2%
Gemini-3-Pro视频理解上限Video-MME-v2非线性计分从66.1%暴跌至49.4%
S1-VL-32BThinking with Images推理中主动调用代码裁剪/放大图像,获5项SOTA
ATLAS视觉推理Token范式单个离散 Functional Token 统一隐式推理与智能体操作
EMO-R3轻量情绪推理新范式3B模型域内外情绪推理超越GRPO等RL基线
主流大模型非文生图精细推理纯彩铅逐笔绘画均现过度修改,完成7幅画成本差20倍

认知局限与可靠性瓶颈

  • 视频生成即推理缺陷:Sora-2媲美顶级VLM,但仅13.91%推理过程完全正确
  • 视觉深搜可靠性低:VistaHop视觉深搜任务Pass@1仅为24.31%
  • 细粒度感知断崖:在动作测试中人类少样本提升13.6%而VLM仅2.9%
  • 视觉幽默理解受限:模型严重依赖文本线索,理解卓别林默片比UGC更难
  • 自我评估与修正缺陷:GPT-5.6等模型逐笔画最终版均不如中途最佳版
  • 工程落地启示:多步Agent任务应引入“质量回退”机制,优于追求最终收敛

底层特征解耦与新模态

  • 多模态特征解耦:兰大DeSa2VA将隐藏状态拆解为独立子空间解决模态纠缠
  • 统一分割架构:X2SAM覆盖7类分割任务,计算成本大幅降低36.5%
  • 手语翻译拓展:港理工构建1311小时香港手语数据集,翻译BLEU提升至19.55
  • 嗅觉跨模态统一:NOSE框架统一分子结构、嗅觉受体与语言,达11项SOTA

8.2 视频理解模型与评测


视频理解前沿架构与垂直领域突破

量子位(20260413) | 机器之心(20260421) | 量子位(20260426) | 机器之心(20260428) | 机器之心(20260526) | 极市平台(20260529) | 机器之心(20260603) | 机器之心(20260604) | 量子位(20260608) | PaperWeekly(20260625) | 机器之心(20260703) | 新智元(20260627) | CVer(20260711) | 极市平台(20260703)

  • Video-o3:原生交错工具调用,三阶段推理,延迟较VideoChat-R1.5降40%+
  • VideoTemp-o3(快手):Agentic框架统一时序定位与深度理解,多轮自我修正验证证据
  • OV2-8B:采用Codec码流替代均匀抽帧,固定Token预算下时间定位增益+9.7分
  • LFS(华为):126K参数CNN帧选择器,助Qwen3-VL-8B准确率达75%,斩获8项SOTA
  • MOSS-VL(复旦):11B模型,交叉注意力提取视觉token并引入绝对时间戳,专攻证据级任务
  • VAM(UCL):免训练外挂,51天视频仅保留0.06%帧,Agent式检索压制幻觉

流式实时交互与时序推理

框架核心机制关键性能
AURA双滑动窗口统一流式架构端到端延迟312.2ms,超越GPT-4o
Response-G1场景图对齐解决“何时开口”OVO-Bench主动任务提升12.8%
OmniVTG2124h数据集+自我纠错链四基准全面SOTA,填补语义盲区
TaRO时序敏感奖励+渐进课程揭露CoT推理无效,TVGBench提升8.4%
  • TaRO核心警示:视频大模型带CoT推理路径与直出答案性能无差异,需强制锚定时间戳

医疗视频理解垂直突破

模型核心机制关键性能
uAI NexusMedGRPO强化学习CVS评估mIoU达89.7%(GPT仅16.4%)
SurgMotionV-JEPA潜空间运动预测过滤烟雾反光,动态理解F1+16.5%
  • uAI Nexus:4B/7B单卡部署,配套MedVidBench(53万指令对)建立首个医疗公共标尺
  • SurgMotion(中科院):全球首个十亿参数级手术模型,1500万帧预训练覆盖17项核心任务

Video-MME-v2:组级非线性评分揭示视频理解评测失真

机器之心(20260413) | AIGC开放社区(20260424)

南京大学团队发布 Video-MME-v2 评测基准,引入组级非线性评分机制,精准暴露传统逐题准确率指标的严重虚高现象,揭示多模态模型在深层逻辑连贯性上的真实短板。

三层递进评测架构

  • C1 信息聚合:提取帧、音频、字幕等分散线索,为高级认知提供事实基础
  • C2 时序理解:捕捉动作序列、状态变化及事件逻辑,超越静态画面识别
  • C3 复杂推理:结合世界知识进行多步推断,最接近人类真实理解水平

组级非线性评分机制

  • 能力一致性组:同知识点4题连环发问,采用(N/4)²计分公式,蒙对1题仅得6.25%
  • 推理连贯性组:多步推理实施首错截断机制,中间出错后续不计分,清理伪正确

核心发现与能力短板

  • 高分泡沫破裂:传统准确率指标严重虚高,模型碎片化识别和盲猜刷榜被粉碎
  • 纯视觉盲区:无字幕纯视觉设定下,部分模型开启 Thinking 反而出现性能退化
  • 层级递减规律:模型从C1到C3呈显著性能衰减,高层薄弱源于底层误差累积
测评对象传统Acc非线性得分折损幅度
人类专家94.990.7~4.5%
Gemini-3-Pro66.149.4~25%
Gemini-3-Flash61.142.5~30%

8.3 视觉理解前沿技术与评测基准


视觉理解前沿技术与评测基准

AI产品银海(20260330) | 量子位(20260330) | 极市平台(20260331) | 极市平台(20260410) | CVer(20260411) | 百度文心(20260413) | 极市平台(20260413) | 极市平台(20260421) | 机器之心(20260424) | 量子位(20260424) | 量子位(20260424) | 新智元(20260424) | CVer(20260424) | AI科技评论(20260427) | 机器之心(20260429) | 商汤科技SenseTime(20260429) | 新智元(20260429) | APPSO(20260429) | AI异类弗兰克(20260429) | 商汤科技SenseTime(20260506) | CVer(20260509) | CVer(20260514) | 机器之心(20260522) | 极市平台(20260604) | CVer(20260622) | 新智元(20260622) | AIGC开放社区(20260623) | CVer(20260623) | 机器之心(20260623) | 量子位(20260623) | 极市平台(20260623) | 极市平台(20260623) | 机器之心(20260624) | 极市平台(20260626) | PaperWeekly(20260628) | 新智元(20260703) | 机器之心(20260726)

视觉推理与多模态突破

  • 推理范式重构:CVPR 2026转向按需推理(VideoAuto-R1输出减3.3倍)与潜在空间去语言化推理(LIVR)
  • 多模态断崖:港中文CUHK-X(7模态64K样本)揭示VLM在雷达/IMU等非RGB模态存在严重能力断崖
  • 夜间极端场景:EgoNight揭示顶级VLM夜间VQA准确率暴跌至约30.9%

文档与OCR解析革新

  • 视觉前端范式革新:MonkeyOCRv2提出视觉编码器转为「证据保留器」,仅优化前端即带来13.2分跃升(57.2 vs 44.0)
  • 长程与极限解析:百度Unlimited OCR(3B)实现40+页无失忆解析(OmniDocBench 93.92%);PaddleOCR破译5000年前楔形文字
  • 轻量化登顶:PaddleOCR-VL-1.5(0.9B)以94.5分登顶全球第一

统一架构与底层演进

  • 多任务统一分割:X2SAM统一7类分割任务(视频超SoTA 14.2点,成本降36.5%);IBISAgent将医学分割转为马尔可夫决策(IoU提35.13%)
  • 感知与生成统一:SenseNova U1原生统一理解与生成(推理效率提27%);Vision Banana实现生成式统一感知(mIoU 0.699)
  • 极简与轻量化:YOLO26移除NMS(1.7ms延迟,mAP 57.5);DepthVLM单次前向推理预测深度(0.42秒,8B版本δ₁达0.876)
  • 零样本与弱监督:WISER无训练实现检索Recall@1提升56.98%;北大CPL++弱监督定位超SOTA 5.81%

前沿视觉评测与检测

  • 深度伪造检测:BCNet与AAP解决AI图像检测的语义捷径依赖与MLLM表征漂移问题
  • 长尾异常检测:动态Prompt合成刷新异常检测SOTA(I-AURO 92.5%);CARPRT零样本重加权全面优于MPE/WPE
  • 跨域融合特征:UniStitch融合几何与语义特征实现零样本跨域SOTA

8.4 多模态检索与长文档理解范式


多模态检索与长文档理解新范式

CVer(20260330) | 量子位(20260406) | 极市平台(20260415) | 机器之心(20260429) | CVer(20260510)

  • 主动探索式文档理解:Doc-V*让模型自主翻页,破解RAG输入页数增加先升后降的退化难题,多页QA平均提升49.7%
  • 视觉RAG分层决策:UniDoc-RL将检索建模为“搜索-精选-聚焦”三层动作,配合密集多奖励,3B/7B模型相比基线均提升约17.5%
  • 化解范式冲突:ReCALL提出“诊断-生成-校准”闭环,修复大模型被压缩为单向量导致的细粒度推理退化,CIRR数据集R@1达55.52%
  • 先想象后检索:DreamPRVR引入扩散模型生成全局语义背景过滤局部噪声,截断扩散仅10步,在三大长视频基准全面刷新SOTA
  • 双路径表征对齐:TARA用判别式基础模型指导大模型学习类别树,实现多粒度分层识别,粗到细各层级准确率全面提升

核心性能与效率对比

模型 / 范式核心指标性能表现
Doc-V* (多页文档QA)平均提升49.7%(80页场景领先RAG约10个点)
UniDoc-RL相比基线VRAG-RL提升17.5%以上(3B/7B模型均适用)
ReCALL (CIRR数据集)R@155.52%(相对提升+8.38%,细粒度子集SOTA)
DreamPRVR (ActivityNet)SumR156.1(SOTA,截断扩散仅10步保持低延迟)
TARA (iNaturalist)各层级准确率粗到细全面提升,新类泛化性显著改善

9. 图像与视觉生成训练优化及加速


9.1 图像生成底层技术与推理加速


扩散模型推理加速与长视频生成校正

机器之心(20260401) | 机器之心(20260410) | 极市平台(20260410) | AI科技评论(20260414) | AI科技评论(20260417) | AI科技评论(20260425) | 量子位(20260612) | 极市平台(20260707) | 量子位(20260708) | 新智元(20260722)

核心范式:2025年扩散模型加速呈现“免训练、即插即用”趋势,从损失函数、特征缓存、多分辨率到引导控制全面突破。

代表方法与性能对比

方法机构技术路线核心成果
PFM-感知损失替代MSE免蒸馏实现4-8步生成,决定少步能力的是监督空间几何
MeanCache中联通/南大平均速度修正轨迹漂移FLUX.1提速4x,HunyuanVideo提速3.6x
TC-Padé阿里/浙大Padé有理函数预测层间残差FLUX.1提速2.88x,Wan2.1提速1.72x,低步数极稳
MrFlow-低清生成+像素超分+高清修缮Qwen-Image端到端提速超10x(叠加蒸馏达25x)
C²FGvivo/上交大指数控制适配score衰减SiT-XL FID降16%,破解固定CFG理论缺陷
CFG-Ctrl清华引入滑模控制做非线性反馈消除高guidance振荡,模型越大优势越显著

视频生成专属加速

  • 帧间异步去噪(RhymeFlow):关键帧完整计算,非关键帧少算,DiT提速1.5-1.8x,叠加SAP达1.93x
  • 盲测高保真:82人双盲测试中62.5%用户无法区分RhymeFlow与原始模型差异
  • 交互式加速(Light Interaction):浙大/NVIDIA提出相机轨迹语义化为调度信号,最高提速2.59x
  • 动态计算分配:探索新区域时减历史依赖,回访旧区域直接复用去噪输出

长视频退化校正(FreeLOC)

  • 退化根因:长视频质量下降本质为位置与上下文双重分布外(O.O.D)问题
  • 分层适配:按Transformer层敏感度分配模块(TSA控上下文,VRPR重编码位置)
  • 效果显著:Wan2.1和HunyuanVideo在4倍长度时,图像质量领先Direct方法8.2分

9.2 图像生成策略优化与强化学习对齐


图像生成策略优化:从强化学习对齐到可微损失函数

机器之心(20260409) | 机器之心(20260410) | CVer(20260412) | 机器之心(20260416) | 量子位(20260423) | AIGC开放社区(20260424) | CVer(20260427) | CVer(20260503) | 机器之心(20260506) | AI科技评论(20260507) | 机器之心(20260515) | 极市平台(20260515) | 机器之心(20260529) | CVer(20260530) | 量子位(20260729)

  • 多参考动态奖励优化:DyRef采用难度自适应与差异化奖励分离,仅14K数据将Qwen-Image-Edit在OmniRef-Bench从4.97提升至8.38,超越Seedream4.5
  • 多参考约束协同:DyRef有效解决多类参考图同时满足时的冲突问题,参考图越多缓解效果越显著,且未损害单图编辑能力,反提升整体理解
  • OmniRef-Bench评测基准:提供395个专家标注样本,覆盖5类参考类型10种组合,最多4类参考同时约束,填补复杂多参考场景评测空白
  • 双精度训练加速:Sol-RL采用FP4快速探索与BF16精训解耦,将扩散RL后训练收敛速度最高提升至4.64倍
  • 统一自适应生成:AdaGen将四大生成范式统一建模为MDP,极轻量策略网络实现17%-54%性能提升,计算开销<0.4%
  • 熵信号双重加速:Drift-AR利用连续空间预测熵同时加速AR与视觉解码,单一生成信号实现3.8-5.5倍加速
  • 方向低秩蒸馏:WaDi借鉴RoPE仅调整方向,以10%参数达单步SOTA,下游加速86%
  • 多任务蒸馏解耦:DiffusionOPD证明闭式KL蒸馏与PPO梯度期望等价但无方差,兼容ODE并全面超越联合RL
  • 在线自蒸馏防遗忘:D-OPSD采用双分支协同优化策略,解决少步扩散模型微调时的灾难性遗忘
  • 评测指标可微化:FD-Loss将FID解耦为统计估算与梯度回传并转化为可微损失,FID从2.29降至0.77,推理零开销
  • 少步生成RL突破:TDM-R1拆分代理奖励与生成器双轨学习,4步GenEval达0.92,全面超越GPT-4o

核心方法与性能对比

  • MILR:隐空间测试时推理,零参数更新获GenEval 0.95
  • SOAR:数据驱动轨迹纠偏,完全免奖励模型,Aesthetic达5.94
  • PromptEcho:冻结VLM直接做Reward,免训练提升+7pp文字准确率

9.3 阶跃 Step Image Edit 2:轻量级图像编辑模型训练范式


多专家自演化学习与分布匹配强化学习(DARL)

阶跃星辰(20260429)

性能表现

  • 轻量碾压:3.5B参数在KRIS-Bench综合排名第一,超越12B-20B级开源模型
  • 极速响应:单次生图仅需0.5-2s,以极低资源成本逼近大模型表现
  • 能力全覆盖:支持中英文渲染、局部编辑、视觉推理、主体一致性、风格迁移

三大技术创新机制

机制核心思路解决痛点/效果
多专家自演化(MESE)衍生细分专家差异化训练,迭代自蒸馏聚合回基座不增参数实现能力非线性跨越
分布匹配强化学习(DARL)输出分布与参考分布全面对齐解决传统RL奖励稀疏、方差大问题
三级数据质控智能体自动清洗→大模型评估→人工筛选保障训练数据质量与分布达标

数据工程构建

  • 图像编辑数据:超5000万条(真实挖掘+定向合成+高质量开源)
  • 文字渲染数据:2000万条(自研排版系统生成),攻克行业文字渲染难点

9.4 扩散模型预测目标反思:JiT 直接预测原图(CVPR 2026)


JiT:从噪声预测到图像预测的范式重构

CVer(20260502)

  • 核心反思:何恺明团队CVPR 2026提出JiT(Just image Transformers),指出扩散模型主流的“预测噪声”范式偏离本质,应直接预测原图
  • 极简架构:纯像素输入+标准ViT直接预测原图,无VAE、Tokenizer、CLIP对齐及额外损失
  • 高维崩溃现象:低维下各目标表现相当,但高维空间(Patch 16×16及以上)预测噪声彻底崩溃
  • 反直觉发现:输入端加瓶颈层降维反而提升生成质量,契合流形学习过滤噪声的本质
  • SOTA性能:ImageNet 256×256和512×512上分别达FID 1.82和1.78,完全不依赖复杂组件

预测目标范式对比

预测目标目标分布容量需求高维Patch表现
预测噪声均匀弥散高维空间极高,易崩溃FID指数级飙升
预测速度场一半流形一半外较高逐渐恶化
预测原图(JiT)集中低维流形低,天然擅长扩展至64×64仍稳健

研究脉络与启示

  • 脉络传承:从ResNet→MAE→JiT一脉相承,坚持极简架构与“预测目标”的本质探索
  • 范式启示:暗示当前扩散模型复杂的工程技巧,可能只是在补偿错误的预测目标

10. 视觉认知推理与渲染引擎


10.1 ReasonBrain:假设性指令图像编辑推理框架(ICML 2026)


ICML 2026 图像编辑推理前沿:ReasonBrain 与 HOI-Edit

极市平台(20260514) | 机器之心(20260710)

  • 框架定位:ReasonBrain与HOI-Edit标志着图像编辑从"改像素"向"改交互、改推理"升级,均已被ICML 2026接收
  • ReasonBrain框架:首个专攻假设性指令的编辑框架,能理解"冰块融化"等需结合物理与因果规律的隐含意图
  • HOI-Edit基准:首个层级化人-物交互评测体系,推动编辑模型同时满足身份保持、空间指代、动作推理多重约束
  • 轻量融合策略:ReasonBrain仅通过LoRA微调即可高效适配,无需修改MLLM与扩散模型底层架构

核心数据与性能表现

评测维度关键指标具体表现
因果推理(ReasonBrain)Ins-Align从0.501跃升至0.858
推理编辑(ReasonBrain)IP(身份保留)9.72(排名第一)
基础交互(HOI-Edit L1)交互分数提升约22%超越闭源基线
上下文理解(HOI-Edit L2)约束成功率提升约26%超越闭源基线
因果推理(HOI-Edit L3)约束成功率提升约22%超越闭源基线

数据集与评测创新

  • Reason50K数据集:含51,039个样本,填补物理/时间/因果/故事四大深度推理场景的数据空白
  • HOI-Eval协议:基于成对区域定位目标,Pearson相关性显著优于CLIPScore等全局相似度指标
  • 细粒度推理提取:含视觉与文本双分支,通过ID控制器锚定目标物体,解决多相似物体的语义歧义

SCPE自纠错框架核心

  • 闭环机制:四智能体(Generator-Analyzer-Reflector-Curator),利用I2V模型视频轨迹暴露交互失败原因
  • 工具书机制:将个例失败经验沉淀为跨样本策略,下轮编辑显式强调目标与物理后果
  • 消融关键发现:官方Prompt Enhancer导致身份漂移,完整SCPE(交互0.8199/身份0.8954)优于去工具书版,证明经验沉淀是提升核心
  • 泛化验证:接入TurboDiffusion及独立评测器性能趋势一致,优势源于白盒诊断与经验积累

10.2 视觉生成的推理-执行解耦架构


Unified Thinker:思考与执行解耦的视觉生成推理架构(ACL 2026)

量子位(20260526)

  • 核心瓶颈:开源视觉生成模型的短板不在生成器,而在缺乏独立推理模块;紧耦合训练不稳定,外挂 LLM 易致语义-视觉错位
  • 解耦架构:浙大&阿里提出 Unified Thinker(ACL 2026 Oral),Thinker 拆解意图输出可执行计划,Generator 专注高精度像素合成
模块角色核心职责
Thinker大脑分层拆解意图,输出结构化的可执行计划
Generator双手接收指令,专注像素合成与视觉保真
  • 数据工程:构建 4 万样本的 HieraReason-40K 数据集,推理链路固定为意图拆解→逻辑具体化→视觉转译
  • 编辑法则:Prompt 严禁描述未改变区域,从源头切断多余视觉信号干扰,有效减少语义漂移
  • 训练策略:推理导向阶段使用 GRPO 强化学习(结合多路径探索与视觉质量反馈);生成导向阶段使用随机采样策略提升复杂指令执行保真度
  • 实验表现:在 RISEBench(推理图像编辑)与 WiseBench(知识密集型文生图)上显著优于开源基线,时间演化与空间定位任务接近闭源模型水平
  • 跨模型迁移:Thinker 挂载于未参与训练的底座(如 Qwen-Image、BAGEL)仍能显著提升逻辑执行准确度
  • 开源信息:代码已开源(GitHub: LivingFutureLab/UnifiedThinker)

10.3 AesFormer:美学照片重构任务与美学理解-执行解耦架构(ICML 2026)


美学照片重构:从表层修饰到结构级重构的范式跃迁

新智元(20260608)

  • 任务定义:北大首提「美学照片重构」,将美化从调色/美颜表层升级为构图/视角/姿态的结构级重构(ICML 2026)
  • 数据集构建:AesRecon含9071对严格语义对齐的「普通原片→出彩成片」人像样本,由拍照教学视频挖掘获得

VCMP四阶段语料挖掘流水线

阶段核心任务
出彩成片定位在视频中定位最终展示的高质量成片
普通原片匹配为成片匹配语义一致但效果欠佳的原片
照片去干扰去除字幕、图标、辅助线等遮挡元素
拍摄事件对齐过滤非同一拍摄事件的照片对
  • 解耦架构:分离美学规划器(AesThinker生成方案)与美学编辑器(AesEditor像素执行)
  • 美学规划:AesThinker基于Qwen3-VL-8B,采用冷启动SFT+美学引导GRPO,沿七个递进摄影维度生成优化方案
  • GRPO三类奖励:格式奖励、语义对齐奖励、美学创意奖励,鼓励模型探索多样优化路径
  • 美学执行:AesEditor基于Qwen-Image-Edit-2511,按规划方案执行像素级重构
  • 专门训练不可替代:GPT-4o+通用编辑器未能稳定提升,证明美学理解与执行均需专门训练
  • 性能表现:全面优于开源模型,多数指标超越Google闭源商业模型Nano Banana Pro

10.4 移动端神经渲染:Arm GPU 架构转型与 MegaLights 落地


移动端神经渲染管线与 Mali GPU 架构演进

AI前线(20260613) | InfoQ(20260613)

  • 神经渲染嵌入移动图形管线:Arm与Sumo Digital联合发布《光影新生》技术演示,首次将神经图形技术完整嵌入真实移动端开发流程,验证移动设备可承担此前仅限高端PC/主机的实时光照计算

  • 核心技术与渲染收益

技术模块功能定位效果收益
NSSD(神经超采样与降噪)低分辨率渲染后AI恢复细节降低GPU负载,保图像质量
NFRU(神经帧率提升)神经网络生成中间帧提升动态流畅度,降渲染开销
MegaLights(UE5.5光照)支持大量实时动态光源+光追阴影移动端实现主机级动态光照
  • 功耗预算重分配:传统移动端受功耗墙限制,Arm转变思路,先低成本基础渲染,由神经网络恢复细节,省出的功耗空间转投给更复杂光照与场景效果
  • AI下沉为渲染模块:思路与PC端DLSS/FSR同源,AI不参与游戏逻辑,而是作为渲染管线组成部分嵌入图形管线
  • 光照升级为玩法核心:MegaLights动态光照系统在移动端落地,使光线突破传统限制,在游戏中承担氛围营造、导航和交互提示功能
  • Mali GPU架构转型:下一代Mali GPU将首次集成专用神经加速器,GPU负责图形计算,加速器负责AI推理,标志移动GPU向图形+神经协同架构转变
  • 已纳入Arm CSS平台:专用神经加速器已纳入今年推出的移动端Arm CSS平台,现有UE项目可通过插件逐步引入神经渲染管线

交叉引用