🎬 多模态与AIGC
视频/图像/音频/3D生成、创意工作流
收录数:1222 篇
目录
- 1. 视频生成技术
- 2. 图像生成与视觉AI
- 3. 音频与3D生成
- 4. 视频生成商业化与生态
- 5. 视频生成底层技术与工具
- 6. 多模态模型底座与训练推理加速
- 7. 视频生成平台工具与创作工作流
- 8. 多模态推理与视觉理解
- 9. 图像与视觉生成训练优化及加速
- 10. 视觉认知推理与渲染引擎
1. 视频生成技术
1.1 国产视频模型格局
国产视频模型生态格局与产品化演进
AI大模型工场(20260331) | 船长AI视界(20260408) | 计算机司令部(20260409) | 智东西(20260410) | 赛博禅心(20260418) | AI科技评论(20260422) | 雷峰网(20260424) | 趣谈AI(20260427) | 机器之心(20260427) | 趣谈AI(20260430) | AI异类弗兰克(20260505) | 机器之心(20260508) | 船长AI视界(20260515) | 机器之心(20260524) | 量子位(20260602) | AIGC开放社区(20260605) | AIGC开放社区(20260609) | CVer(20260614) | 昆仑万维集团(20260615) | 量子位(20260619) | "Z Potentials"(20260621) | 新智元(20260623) | 人工智能学家(20260625) | 量子位(20260630) | 阿枫科技(20260702) | AI产品阿颖(20260703) | 机器之心(20260703) | 智东西(20260709) | "Z Potentials"(20260713) | AI异类弗兰克(20260714) | 机器之心(20260714) | 量子位(20260715) | 公子龙(20260715) | "Z Potentials"(20260716) | 极市平台(20260716) | CVer(20260716) | 极市平台(20260717) | AIGC开放社区(20260724) | 十字路口Crossing(20260724) | Founder Park(20260330) | 深度学习与NLP(20260430) | 深度学习与NLP(20260609) | 阿里云开发者(20260623) | AI科技评论(20260720)
前沿架构与技术突破
- 统一生成编辑架构:字节Bernini与武大Unison(5B双向)刷新SOTA
- MoE加速架构:巨量Mamoda 2.5融合DiT与MoE(250亿总参激活30亿),4步推理
- 国产世界模型:斩获全球双冠,创单镜头长时连续生成纪录,Matrix-Game 3.5首创Patch Memory破长时记忆痛点,迎中国引领时刻
- 超级智能体:Skywork基于OpenClaw多Agent协同,定位“一人公司操作系统”
核心模型与产品参数对比
- 阿里 HappyHorse 1.1:支持9图同输入保细节,6折价0.54/0.72元每秒
- 阿里 HappyOyster:3D交互世界模型,支持实时导演,视觉记忆约1分钟
- 昆仑 Matrix-Game 3.0:游戏世界模型,5B达720P/40FPS,解决长时序漂移
- 昆仑 28B世界模型:双视角生成,采独立高噪声+共享低噪声混合架构
- 昆仑 SkyReels V4:超Sora 2登顶,双流MMDiT音画同步,1080P/32FPS/15秒
- 昆仑 Mureka V9:音乐大模型,引入MusiCo先思考后生成,支持专业混音
- Catnip.AI MaineCoon:流式生成首帧<1秒,47.5FPS,成本仅Seedree 1/500
- 生数科技 Vidu S1:实时流式音视频540P/25FPS,支持语音驱动行为
- 虎牙 VAM 1.0:全双工对话数字人,首帧1.3秒28帧输出,连续运行24h
- Xmax X2.0:端云协同生成,端侧384p@16fps,成本仅Decart 1/10
- 京东 JoyAI-VL:毫秒级多模态交互,8B平均延迟94ms,对豆包胜率100%
- 国产开源框架:支持5分钟长视频生成,Pixelle(7.6K星)端到端3分钟出片;LibTV将影视流程模块化
《功夫女足》特效争议:技术升级与观感倒退
- 票房与口碑撕裂:上映两天破4亿(首日2.6亿),豆瓣6.6分严重两极分化(17%五星 vs 8.6%一星),总票房预测上调至18.65亿
- 高投入与低观感倒挂:总投资3.8亿近半用于特效(约1.9亿),1200+特效镜头却被批"劣质AI味",人物与背景割裂、动作失重力感
| 对比维度 | 《少林足球》(2001) | 《功夫女足》 |
|---|---|---|
| 技术手段 | 威亚+粗糙CG | 高规格数字特效 |
| 观感评价 | 热血真实 | 割裂漂浮、塑料感 |
| 特效投入 | 相对有限 | 近1.9亿 |
| 镜头数量 | 较少 | 1200+个 |
- 特效失灵的根源:"廉价感"源于极度夸张(如重炮炸坑)却无物理逻辑与情绪支撑,视觉冲击沦为"为炫技而炫技"的杂耍
- 情感锚点缺失:《少林足球》中"卑微困境→觉醒释放"的叙事为粗糙CG提供了情感燃料,观众有共鸣则不辨真假
- 结构性短板:《功夫女足》群像角色单薄,缺乏生活困境铺垫,无情绪支撑的特效沦为"无源之水"
- 评价标尺偏移:极端打分反映观众与创作者期待错位,评价核心从"电影本身"转为对"青春记忆"的缅怀
Meta MSL:Muse Image/Video 模型矩阵与竞争定位
竞争定位与核心突破
- 综合排名:Muse Image 包揽 Arena 文生图、单图编辑、多图编辑三项第二,仅次于 GPT Image 2;Muse Video 位列文生视频榜第三,跻身第一梯队
- 代际意义:余家辉带队,为 Meta 超智能实验室继 Muse Spark 语言模型后的第二次重大更新
Agent 式生成与自我修正涌现
- 范式转换:不直接出图,先执行需求拆解、联网搜索、代码生成及局部修正全链路
- 能力涌现:自我修正非显式编程,而是强化学习中因“改稿获更高奖励”自然习得
- 量化收益:开启后文生图胜率 57.1%、单图编辑 56.3%、多图编辑 56.6% 均破 50%
- 推理 Scaling:测试时算力越充足 Elo 评分越高,投推理比投生成收益更持久
- 模型协同:与 Muse Spark 共享工具链,联动生成含动态 GIF 和可运行代码的网页
社交分发与隐私争议
- 分发优势:接入 Instagram 等月活近 40 亿社交图谱,赌“谁离用户最近谁就赢”
- 隐私隐患:@账号即可调用公开照片生图,默认开启且无通知引发重大争议
- 退出缺陷:支持 opt-out,但关闭后此前他人违规生成的图片不可删除
本周GitHub开源热点:AI科研、语音、Agent编排与企业工具
AI 科研自动化
- AI-Scientist-v2(Sakana AI):渐进式 Agent 树搜索并行探索研究路径,单次实验成本 20-25 美元,生成的论文通过 ICLR 2025 Workshop 同行评审(评分 6.33,超过 55% 人类投稿),成果发表于 2026 年 3 月 Nature
- 内置模拟 Area Chair 自动评审器,准确率 69%,建议在 Docker 沙盒中运行防止安全风险
语音 AI 突破
- VibeVoice(微软):0.5B 参数轻量实时 TTS,首音频延迟约 300ms,消费级 GPU 可运行;ASR 单次处理 60 分钟音频无需切片,含说话人识别与时间戳;Star 从 8K 飙至 3.5 万
- 曾因深度伪造风险删除仓库后重新上架,Star 反弹至 3.5 万+
多 Agent 编排生态
| 项目 | 定位 | Agent 数量 | 特色 | Star |
|---|---|---|---|---|
| Hermes Agent (Nous) | 自学习闭环框架 | 开放式 | 任务经验自动提炼为可复用技能,支持 200+ 模型 | 新项目 |
| oh-my-claudecode | Claude Code 增强编排 | 19 个 | 智能模型路由省 30-50% Token | 1.1 万 |
| oh-my-codex | Codex CLI 增强编排 | 30 个 | 20 Worker 并行(独立 git worktree),混合 Claude/Codex | 1.4 万 |
时序预测与企业工具
- TimesFM 2.5(Google):200M 参数,1000 亿时间点预训练,GIFT-Eval 全指标第一,上下文 16384 步(上代 8 倍),已集成 BigQuery
- Onyx(原 Danswer,YC W24):企业 RAG 搜索,打通 GitHub/Google Drive/Confluence,获 1000 万美元种子轮,Netflix/Ramp 在用,2.3 万 Star
- last30days-skill:一句话搜索全网 10 个信息源近 30 天讨论,平均 70 秒输出研究报告,1.8 万 Star
- OpenScreen:Screen Studio($29/月)开源替代,支持录制美化与自动缩放平移,Beta 阶段
- TaxHacker:拍照/PDF 收据自动提取结构化数据,支持 170+ 法定货币和 14 种加密货币,可本地 LLM 离线运行
视频生成的物理规律与原生技术路线
- 路线分歧:行业主流涌向世界模型方向,VideoRebirth选择「视频原生」差异化路径,认为视频生成不应简单套用世界模拟器范式
- 「视频原生」核心理念:从视频数据本身特性出发设计架构,而非将视频视为物理世界模拟的副产品,强调生成质量与可控性的直接优化
- 核心问题:现有视频生成模型“看起来会动但不符物理规律”,PhyMAGIC 提出主动运动探测框架,从静态图像推断材料物理属性
- 主动运动探测:让物体先动起来再观察,不同运动暴露不同物理线索(自由下落→质量/刚度,挤压→形变,旋转→惯性,坍塌→区分刚体/颗粒材料)
- 置信度驱动迭代:物理属性经多次独立推断计算一致性;低于阈值γ=0.6时自动改写视频生成指令,生成更有针对性的运动证据;最多三轮迭代
混合物理参数(HPP)与3D仿真
| 模块 | 功能 |
|---|---|
| HPP参数组合 | 材料属性(密度、杨氏模量等)+ 执行参数(速度、外力、接触模式) |
| TRELLIS 3D重建 | 输入图片→3D Gaussian Splatting,每个高斯点赋物理属性 |
| 可微MPM仿真器 | 高斯点作为材料粒子进入MPM仿真,输出多视角动态3D对象 |
实验结果
| 评估指标 | 数据表现 |
|---|---|
| CLIP相似度 | 0.251(超OpenSora 2.0的0.233和CogVideoX的0.239) |
| Image-Motion-FID | 94.69(对比方法中最优) |
| 参数准确率 | 三轮迭代后约90% |
| 人类评估(61人) | 物理合理性3.00分、文本一致性3.07分 |
关键洞察
- 重新定义视频生成模型角色:从“最终内容生产者”扩展为“主动探测工具”,提供时间维度的物理证据
- 模块化无训练框架:各模块可独立升级,随基础模型进步整体性能可持续提升
1.2 Wan2.7全模态视频编辑
Wan2.7全模态架构与视频编辑体系
通义大模型(20260403) | 千问APP(20260403) | 量子位(20260403) | 智东西(20260403) | 财联社AI daily(20260404) | 深度学习与NLP(20260402)
全模态架构与产品定位
- 创作跃升:从单一素材生成升级为涵盖编辑、复刻、驱动、续写的全链路套件,以“戏核”架构融合剧情与分镜
- 多模态支持:支持文本、图像、视频、音频四模态输入,输出720P/1080P,时长2-15秒
- 矩阵分发:已上线通义网站、wan.video、阿里云百炼及千问App
四大核心模型矩阵
| 模型 | 代号 | 核心能力 |
|---|---|---|
| 文生视频 | Wan2.7-t2v | 文字生成视频,支持群像塑造 |
| 图生视频 | Wan2.7-i2v | 图片+音频输入生成视频 |
| 参考生视频 | Wan2.7-r2v | 最多5个主体参考,锁定外观与音色 |
| 视频编辑 | Wan2.7-videoedit | 自然语言指令修改视频 |
PS级视频指令驱动编辑
- 局部增删:指令增删元素或替换物体,自动匹配原视频光影材质
- 角色操控:将人物替换为参考图角色,保持原背景、姿态与嘴型不变
- 台词修改:替换台词内容,自动匹配情绪口型与原音色
- 画风转换:一键切换黏土/水彩等风格,保持人物动作不变
高阶控制与创作特性
- 多主体一致性:业内最高支持5个主体同时锁定外观与音色,实现多人动作复刻
- 运镜语言:支持推/拉/摇/移及希区柯克变焦等数十种技巧,指令修改机位焦距
- 首尾帧续写:2秒素材无损延展至15秒,精准控制构图与光影,消除刹车感
- 生图能力:同期发布Wan2.7-image,具备骨相级人物生成与8色HEX精准调色能力
LLaVA-OneVision-2.0 与低成本全帧率视频理解
InfoQ(20260520) | 阶跃星辰(20260712) | AIGC开放社区(20260713) | InfoQ(20260721) | 机器之心(20260722)
- OneVision-Encoder架构:格灵深瞳提出基于视频编解码器的紧凑视觉token表示,推理阶段视觉token消耗降至约1/8
- 四阶段渐进式训练:支持30秒短片至10-15分钟长视频时序理解,具备2D/3D空间定位与物体追踪能力
- 云端落地闭环:依托视觉智能工坊(边缘哨兵+算法运营/训练中心),通过冷启动-迭代-规模化三阶段路径实现降本
VideoChat3全栈开源体系
- 4B参数全栈开放:南大MCG等联合发布,覆盖短/长/流式视频通用理解,数据代码权重全部开源
- I3D-ViT视觉编码器:实现约16倍时空压缩,创新将时序建模前移至编码阶段,进LLM前完成运动线索整合
- “先融合后池化”策略:先建立片段内时空联系再池化,非简单丢帧,兼顾token密度与计算效率
- 主动流式感知:支持在线视频流理解,自动判断响应时机,实现从被动问答到主动交互的突破
端侧1+N架构与软硬件生态
- Step Edge端侧全家桶:1个基础模型(文本+视觉)外挂Audio/GUI/Gen三大专项,支持独立升级与按需裁剪
- 全双工持续交互:OpenSQZ Glass采用感知-计算分离架构,眼镜仅采集,本地推理确保隐私与低延迟
- 软硬开源生态:提供完整3D打印文件与装配教程,打造面向开发者的多模态AI眼镜参考实现
模型与引擎实测数据
| 模块 | 基准实测 | 关键指标 |
|---|---|---|
| 基础模型 | 16项基准中8项第一 | GUI定位与App代理优势显著,TAU2_BENCH达58.59 |
| Audio专项 | 超越同级模型 | 中英识别CER 3.1%、WER 3.6%,达专业ASR水平 |
| Gen专项 | W8A16量化 | 文生图约3秒、编辑约4.5秒 |
| NPU引擎 | 自研Step Inference | 端侧toolcall低至0.1s,加速远超GPU/CPU |
市场趋势预期
- 市场爆发预期:2026年全球AI眼镜出货量预计同增130%达2000万台(规模56亿美元),2028年或迎“iPhone时刻”
PAI 2.0:AI电影叙事模型
- 产品定位:Utopai Studios推出的AI原生电影模型,避开单镜头画质红海,专攻3分钟以上长时序叙事系统
- 团队背景:核心成员来自Google和Meta超级智能实验室,为前MovieGen原班人马
- 商业里程碑:上线60天实现1100万美金年度常规收入,公司估值达10亿美金
核心架构与叙事能力
| 能力维度 | 具体表现 |
|---|---|
| 叙事链路 | 文字剧本→大师级视觉分镜→生产级指令,全链路自动化 |
| 角色一致性 | 持久身份锁定,数十个镜头间样貌/服装/道具不变 |
| 镜头调度 | 自动设计镜头运动、光影布局、焦距及蒙太奇互锁 |
| 环境连贯 | 场景风格、建筑细节、氛围元素跨镜头保持统一 |
差异化卡位与标杆案例
- 标杆案例:好莱坞导演PJ Ace用它制作3-5分钟连续剧情AI短片,全网播放破百万
- VFX输出:为韩德合拍片《半月》提供核心视觉特效支持
- 赛道错位:主流工具卷单镜头画质(如Kling/Veo),PAI专攻长篇叙事一致性
商业化IP与开源生态
- 双轮驱动:以“内容IP+模型授权”打破纯工具公司天花板,覆盖外部媒体客户
- 自有IP矩阵:推出电影项目Cortez及SpaceNation(福布斯预计营收1.1亿美金)
- PAI Pro开源:将内部Skill矩阵模块化开源,支持挂载至Claude Code、Cursor等智能体
- 开发者赋能:在本地Agent环境中用自然语言直接调用长时序视频渲染链路
核心贡献与关键发现
- Pistachio 项目:被 ECCV 2026 接收,用可控视频生成构建视频异常检测(VAD)与理解(VAU)基准,含 9 种基线全面开源
- 数据集规模:VAD 含 4,962 视频(29.11h,31 类异常,含山体滑坡等 10 类新异常);VAU 含 1,385 视频,提供 Event/Video 级文本标注
- 五步可控 Pipeline:场景感知分类→条件异常分配→多阶段 Storyline 拆分(正常→前兆→异常→影响→反应)→时间一致合成→先脚本后标注
- 核心范式:通过「先构建 Storyline 再生成视频」,系统性解决长视频时间一致性漂移和标注事实幻觉难题
- 方法远未饱和:VAD 最佳 Overall AUC 为 83.7%(PEL4VAD),VAU 最佳 F1 仅 29.39%,长视频多事件因果理解亟待突破
- 合成数据迁移:Pistachio + 10% UCF-Crime(83.96 AUC)超过完整 UCF-Crime(82.56 AUC),定位为预训练而非替代
- 跨生成器验证:在 Cosmos 与 Hailuo 等不同视频生成器上均验证有效,排除了模型对特定生成器过拟合的风险
- 场景覆盖:涵盖商业娱乐、室内、自然环境、关键基础设施、工业施工、公共道路六大类,含固定与移动摄像机视角
GEODPO:VLM几何感知的结构化DPO优化范式(ICLR 2026)
- 核心发现:VLM几何任务失败主要源于感知错误(元素误识别、关系漏检、结构性幻觉),而非推理不足,即"看错"比"想错"更致命
- 技术来源:光明实验室与清华大学联合提出GEOPERCEIVE评测框架与GEODPO优化方法,已入选ICLR'26
- GEOPERCEIVE评测框架:摒弃传统端到端评测,首次将评测粒度细化至单个几何元素与结构关系的识别精度
- 评分机制:采用"结构解析+Hungarian matching+element-level F1"流程,实现自动化、精确的结构级评分
- GeoDSL结构化表示:几何领域专用语言,定义元素(Point/Line/Circle)与关系(Collinear/Perpendicular/Tangent),支持可控生成几何结构
- GEODPO优化流程:采用Translator-Guided RL(模型输出自然语言→翻译器转GeoDSL→结构级评分→构造偏好对→DPO优化)
- 三大优势:不改变输出空间、奖励信号可解释、优化目标与结构识别直接对齐
- 实验效果:在多个backbone上显著提升几何感知能力,且分布外(OOD)泛化表现比直接SFT更稳定
- 下游收益:感知准确度提升后,MathVista等下游几何推理benchmark同步改善
| 对比维度 | GEODPO | 直接SFT |
|---|---|---|
| 几何感知提升 | 多backbone显著提升 | 有提升但不稳定 |
| OOD泛化表现 | 持续稳定提升 | 部分模型出现波动 |
| 优化目标对齐 | 与结构识别直接对齐 | 端到端黑盒优化 |
- 范式价值:将端到端能力拆分为可独立评测的子模块以精确定位瓶颈,该思路可扩展至工程图纸解析、CAD结构识别、医学结构建模等结构化理解任务
Spatial-TTT:参数即空间记忆的流式视频空间理解范式(ECCV 2026)
- 核心范式:将模型参数作为动态空间记忆,通过 TTT 在流式视频推理时持续更新内部世界状态,取代上下文窗口无限膨胀
- 学术背景:入选 ECCV 2026,一作清华大学博士生刘芳甫,2B 小模型超越多个闭源大模型
性能与效率优势
| 评估维度 | Spatial-TTT (2B) | 对比基准 |
|---|---|---|
| VSI-Bench | 64.4分 | 超越 GPT-5、Gemini-3-pro |
| MindCube-Tiny | 76.2% | 领先 Gemini-3-pro(63.9%) 12% |
| 显存占用 | 11.9GB | 较行业领先模型节省超 40% |
| 视频处理 | 120分钟 | 支持长流式视频持续推理 |
混合式 TTT 架构设计
- 层结构比例:解码器按 3:1 交错插入 TTT 层(75%)与全注意力锚定层(25%)
- TTT 层职责:用 Large-chunk 更新提升 GPU 利用率,将长程信息写入快速权重
- 锚定层职责:维持预训练语义与跨模态对齐,防止更新边界打断空间连续性
- 空间预测:对 Q/K/V 加入轻量级 3D 时空卷积,编码局部几何与时间连续性
- 消融实验:纯 TTT 结构(去掉锚定层)破坏跨模态对齐,平均分降至 53.9(-10.5)
渲染范式与跨模态图像融合前沿
- NeRF技术荣誉与核心机制:2025 ACM Grace Hopper奖(誉为“青年图灵奖”)授予NeRF作者,论文发表仅5年即获此殊荣
- 作者近况:Ben Mildenhall现为World Labs(李飞飞掌舵)联创,押注空间智能;Pratul Srinivasan任职谷歌DeepMind
- 核心机制:输入5D坐标(位置+视角),纯MLP网络输出体密度与颜色,仅凭少量2D照片学会3D场景连续表示
- 深层价值:隐式神经场证明纯网络可替代显式几何,重塑医学成像、天文及计算物理等跨学科通用框架
| 维度 | 传统图形学方法 | NeRF 方法 |
|---|---|---|
| 场景表示 | 离散网格/点云/体素 | 连续可微隐式场 |
| 几何与光影 | 依赖手工建模与材质光照计算 | 纯MLP网络自动隐式编码 |
| 场景分辨率 | 受限于基元精度 | 理论具备无限分辨率 |
FusionINV跨模态融合范式(TIP 2025)
- 核心论点:将融合从信息叠加转为分布对齐,使红外融合结果贴近可见光分布,免训练即兼容下游系统
- 双路反演:分别执行DDIM反演,以红外潜变量为主体,利用可见光注意力特征调节去噪方向
- 分阶段注入:早期注红外保结构,中期引可见光复外观,后期模型自主去噪调细节
- 核心洞察:预训练扩散模型具备将任意模态内容“重穿”可见光外观的能力,实现结构与外观解耦
- 实验配置:基于SD v1.5,单卡RTX 3090,T=50步,小权重CFG保留文本交互
- 性能表现:FMB数据集PAQ2PIQ与LIQE指标最优;MSRS语义分割(Grounding DINO+SAM无微调)平均最优
CLI:对比学习驱动的视觉语言融合新方法(ECCV 2026)
- CLI(Contrastive Language-Image):同济大学与蚂蚁集团联合提出,已被 ECCV 2026 接收,旨在通过对比学习框架解决跨模态融合中的语义鸿沟问题
- 现有方法局限:CLIP等依赖大规模图文对但在细粒度语义对齐上不足;简单拼接或交叉注意力未能充分挖掘模态互补信息
- 层次化对比学习:在全局-局部不同粒度上对齐视觉和语言特征,而非仅停留在单一全局层面
- 自适应融合模块:动态调节视觉与语言两模态的贡献权重,突破固定比例混合的局限
- 负样本挖掘机制:针对性提升对比学习有效性,显著增强跨模态特征判别性
| 评估维度 | 对比基线 | CLI提升效果 |
|---|---|---|
| 图文检索 | CLIP系列 | 显著超越 |
| 视觉问答 | 主流VQA模型 | 准确率提高 |
| 跨模态理解 | 传统融合方法 | 语义对齐改善 |
- 消融实验结论:证实层次化对比学习与负样本挖掘是驱动性能提升的关键组件
- 方法论启示:跨模态对齐应关注对比目标的层次化设计与负样本质量,而非仅扩大数据规模或模型参数
工业缺陷检测与多模态持续学习工具包
针对工业缺陷检测与多模态持续学习场景,开源工具包通过免训练机制与极限显存优化,大幅降低了前沿视觉算法的落地门槛。
核心工具包对比
| 工具包 | 核心定位 | 关键优势 | 产出机构 |
|---|---|---|---|
| MuSc-V2 | 零样本多模态缺陷检测 | 免训练,支持2D/3D | 华科大 |
| LAMDA PRISM | 多模态持续指令微调 | 单张24G显卡跑通全流程 | 南京大学 |
MuSc-V2:零样本多模态缺陷检测
- 核心机制:利用无标注样本间“互打分”实现零样本检测,无需训练即支持2D图像与3D点云
- 特征聚合:多聚合度邻域聚合多尺度信息,exp操作放大高相似度权重,避免小缺陷被池化稀释
- 自适应融合:2D与3D跨模态特征互相评分补全(如纹理缺陷由3D形状补全),自适应融合异常分数
- 性能突破:在MVTec 3D-AD分割AP提升23.7%,Eyecandies提升19.3%,超越多数少样本方法
- 工程优势:摆脱视觉语言模型推理依赖,兼容任意预训练特征提取网络,解决推理实时性瓶颈
LAMDA PRISM:多模态持续微调设施
- 极限显存:单张24G显卡同时载入InternVL、视觉塔及路由特征,LLM主体采用bitsandbytes 8-bit加载
- 量化设计:多模态投影层等关键连接模块跳过量化,保证多模态信息通路精度不流失
- 插件式架构:骨干适配与方法逻辑完全解耦,核心抽象为CLIntegration接口,注册即可接入
- 全栈精度:支持bf16/fp16/8bit/4bit四级精度,精度切换仅需修改配置项,与算法逻辑解耦
- 高频迭代:集成12种MCIT算法与3套基准,子数据集快速验证机制可实现一天5至6版迭代
AirZoo:航拍几何3D视觉统一基准(ECCV 2026)
- 基准定位:国防科技大学提出的航拍场景几何3D视觉统一评测基准,被ECCV 2026接收,填补航拍3D视觉缺乏统一评测标准的空白
- 核心动机:航拍3D视觉任务(深度估计、法线估计、光流、立体匹配)长期碎片化;现有数据集(KITTI、ScanNet)面向地面场景,航拍数据集稀缺;航拍场景具有高空尺度模糊、大覆盖范围、纹理稀疏等独特挑战
| 任务类型 | 核心目标 | 航拍特有挑战 |
|---|---|---|
| 深度估计 | 单目/双目像素级深度预测 | 高空尺度模糊 |
| 表面法线估计 | 恢复场景表面几何方向 | 平面区域主导 |
| 光流估计 | 帧间像素对应关系 | 大位移+视角变化 |
| 立体匹配 | 双目/多目视差计算 | 远距离精度下降 |
- 数据构建:整合无人机航拍与卫星遥感多平台数据,覆盖城市与自然地形多场景,提供高质量几何标注(深度图、法线图、光流真值等)
- 评测体系:统一指标体系支持跨任务横向对比;对主流方法进行系统评测,揭示航拍场景下性能瓶颈——地面场景表现优异的方法因视角与尺度差异显著退化
- 关键洞察:统一基准是子领域走向成熟的标志(类似ImageNet时刻),与OmniData等地面多任务基准形成互补;军事侦察、灾害评估、城市规划等应用具有双重战略价值
1.3 PixVerse V6与其他视频模型
PixVerse 模型矩阵与 V6 技术代际跃升
小互AI(20260331) | Z Finance(20260331) | AI产品阿颖(20260401) | 量子位(20260401) | 十字路口Crossing(20260408) | AI大模型工场(20260409) | "Z Finance"(20260423) | 十字路口Crossing(20260617) | 甲子光年(20260714) | 智能涌现(20260713) | 智东西(20260714) | 新智元(20260715) | APPSO(20260715) | 路人甲TM(20260715) | AI科技评论(20260715) | 十字路口Crossing(20260716)
市场地位与融资
- 登顶全球评测第二:在Artificial Analysis图生/文生视频评测中均位列全球第二,物理仿真等核心能力实现代际跃升
- 完成C轮29.8亿元融资:阿里领投,估值达10亿美元;ARR不到12个月增长10倍超4000万美元,全球用户破1.5亿
- 市场规模爆发:高盛预测全球AI视频市场将从2025年约30亿美元增至2030年约290亿美元
极致研发效能
- 训练成本极致压缩:100余人团队以同行约1/10算力运营,1.5个月完成收敛(同行约3个月)
V6核心能力跃升
| 维度 | V6能力突破 |
|---|---|
| 基础生成 | 最长15秒1080P,出片压缩至几十秒,支持子弹时间等电影级调度 |
| 物理模拟 | 流体、布料、粒子系统符合物理直觉,克服高速运动穿模问题 |
| 质感微表情 | 还原毛孔细纹突破十级美颜,精准生成眼神微动等细腻情绪 |
| 声画同步 | 视频与音效(如雪板摩擦声)一次性协同生成,无需独立制作 |
三大模型产品矩阵
| 模型 | 定位与核心优势 |
|---|---|
| V6 | 通用视频生成旗舰,主打物理直觉与电影级镜头 |
| C1 | 全球首个影视垂直大模型,首创多宫格分镜直出,专攻动漫与特效连贯性 |
| R1 | 实时交互式世界模型,底层Omni多模态将50+步采样压缩至1-4步 |
衍生游戏引擎实战
- PixVerse Game全球首发:基于R1实时生成,10-60秒自然语言生成可交互Demo;三人团队三周完成乙女游戏PV(传统需3-6个月)
- 底层三层解耦架构:游戏机制引擎(规则判定)+ R1实时世界模型(画面)+ AI Agent编排层(叙事一致性)
行业演进趋势
- 集体转向实时世界模型:Runway、Sora、Decart等同向布局,2026上半年赛道吸金超30亿美元
Stellaris-VL-0.8B 端侧视觉语言模型
- 产品定位:极视角 Stellaris-VL-0.8B 专为端侧与嵌入式设备设计,参数从 4B 压缩至 0.8B
- 核心任务:聚焦 OVD(开放词汇检测)、REC(指代表达理解)、VQA(视觉问答)三大产业级能力
- 轻量化策略:轻量 LLM + 高性能 ViT,经知识蒸馏 + SFT + RL 全链路后训练压缩参数
- 边缘推理:针对单帧实景图像深度优化,边缘设备实现秒级画面解析
- 稳定性:7×24 小时长时任务下内存占用不持续上涨,适配固定监控与移动巡检
- 离线部署:支持完全本地运行,无需云端协同,满足工业与能源场景数据隐私合规
- 落地场景:覆盖低空无人机、移动巡检机器人、车载/船载/矿载视觉等,兼容存量设备
| 测评维度 | Stellaris-VL-0.8B | 同参数开源模型 |
|---|---|---|
| ODinW13 开放词表检测 | 大幅领先 | 基准 |
| 指代表达式定位 | 大幅领先 | 基准 |
| 产业综合集 mAP@0.5:0.95 | 远超 | 基准 |
| 工业复杂画面识别 | 更低幻觉、更少错检漏检 | 基准 |
- 关键洞察:0.8B 是端侧部署的实用甜点;蒸馏+RL 是轻量化关键补偿;本地离线在工业场景具备差异化优势
ShotStream:实时流式多镜头长视频生成(ECCV 2026)
- ShotStream:港中文与快手可灵联合提出的首个实时流式多镜头长视频生成框架,已被 ECCV 2026 接收
- 推理效率:单张 H200 GPU 实现 16 FPS 推理,较传统双向模型效率提升 25 倍以上,支持流式提示词实时调整
- 生成模式:突破传统双向架构的“全量等待”高延迟模式,实现流式实时输出
架构演进:两阶段蒸馏
- 阶段一:将双向模型微调为“下一镜头”教师模型,通过动态稀疏采样避免显存爆炸
- 阶段二:利用分布匹配蒸馏(DMD)将其转换为仅需 4 步去噪的因果学生模型
双缓存记忆与不连续 RoPE
| 机制 | 全局缓存 | 局部缓存 |
|---|---|---|
| 存储内容 | 稀疏条件帧 | 当前镜头刚生成帧 |
| 作用范围 | 跨镜头一致性 | 单镜头内一致性 |
- 不连续 RoPE:在镜头切换边界施加离散相位偏移,解耦全局与局部上下文
- 两阶段蒸馏:阶段一用真实历史帧训练,阶段二用模型自生成帧,消除训推差异
- 实验表现:在跨镜头一致性、切换控制、文本对齐上显著优于 Mask2DiT、CineTrans 等模型
逐帧自回归实时交互视频
沃垠AI(20260716) | 通义大模型(20260717) | "Z Potentials"(20260724) | 量子位(20260724) | 十字路口Crossing(20260725) | JackCui(20260727)
- 全双工打断:支持随时插话打断并即时响应,兼容语音/文字/图片多模态动态指令输入
- 异步双通路:单卡Thinker感知与多卡Performer去噪,保障200ms响应底线与环境光影同步
- 全栈加速套件:三层正交叠加(SageAttention+TurboDiffusion+TurboServe)实现系统级推理优化
- 算力成本下探:结合NVFP4/FP4量化、融合蒸馏及KV-Cache管理,消费级显卡即可满血运行
模型演进与产品矩阵
| 模型版本 | 性能参数 | 核心特性与场景 |
|---|---|---|
| Vivix A1 | 约30B激活 | 全双工实时互动,支持开放场景自由行走及全身大动作 |
| Vivix W1 | 交互式生成 | 提示词仅定开局,后续叙事走向完全由用户实时交互驱动 |
| Wan v0.1 | 192×336 | 基础版,验证面部特写生成效果 |
| Wan v0.2 | 640×368@25FPS | 进阶版,解锁手势等半身连贯画面 |
| X2.0屏幕端 | 960p/24fps | 换脸换装等五大实时操控能力 |
| X2.0端侧 | 384p/16fps | 首个支持手机本地运行的实时交互模型 |
交互能力与产品落地
- 多维角色能力:支持环境感知与多通道情绪自然过渡(非模板切换),可执行行走转身舞蹈等动作
- 核心产品形态:单图生成实时对话角色(人/动漫/宠物),赋能陪伴、客服、娱乐、教育及博物馆导览
- 极致降本定价:X2.0定价6美元/小时(仅竞品1/12),2分钟试穿成本仅0.2美元
- 开源生态策略:全面开放内测与API平台,开源加速工具以降低行业成本,核心论文公开于arXiv
- 行业竞争趋势:模型能力趋同后,推理加速成视频赛道核心竞争维度,构建“谁更快谁赢”格局
实时交互与传统生成对比
| 对比维度 | 传统视频生成 | 实时交互模型 |
|---|---|---|
| 响应延迟 | 秒级~分钟级 | 百毫秒级(550ms) |
| 视频时长 | 固定(4-10秒) | 无限时长 |
| 交互方式 | 无 | 实时双向全双工 |
| 输入形态 | 文本/图片 | 图片生成角色及动态多模态 |
1.4 国产视频模型深度评测
Vidu Q3 参考生:AI视频从单帧画质迈向多镜头一致性
APPSO(20260413) | AI产品阿颖(20260413) | 特工宇宙(20260413) | AI大模型工场(20260413) | 新智元(20260414) | 甲子光年(20260414) | 阿里云(20260414) | 量子位(20260415) | 机器之心(20260415) | 优设AIGC(20260415) | 小互AI(20260415) | 智东西(20260416) | APPSO(20260507) | 甲子光年(20260520)
核心技术突破:多图参考与视听一体化
- 模型代际演进:Q1打通图像到视频叙事;Q2深化微表情与情绪张力;Q3实现系统性生产、16秒声画直出与4K输出
- 全要素资产化(万物可参):支持最多7张参考图(角色/场景/服化道/音色等),通过自然语言脚本跨元素拆分融合
- 角色IP固化:单图定妆即可在多场景/多集数保持面容、服装、音色高度一致,彻底解决跨镜头面部融化与服饰穿模痛点
- 物理交互真实感:自动补全光影反射与空气颗粒感,过肩镜头中近远景透视遮挡关系全程恒定,人物跑动时环境互动自然
视听特效体系
| 视听维度 | 覆盖类型 | 核心表现 |
|---|---|---|
| 6大视觉特效 | 粒子/流体/动力学/运镜/转场/光影 | 贴合物理逻辑,深度服务于剧情推进与镜头节奏 |
| 5大沉浸音效 | 环境/动态/氛围/拟音/情绪 | 首次对氛围音建模,支持多轨交叠与声画精确同步 |
产能工业化与成本重构
| 应用场景 | 优化重点 | 成本对比 |
|---|---|---|
| 漫剧短剧 | 跨镜一致性、速度线与打击感 | 1集3分钟1080P仅36元,较传统降本80% |
| 商业广告 | 多版本快速迭代、高端质感 | 10条15秒测试30元,较传统降本80% |
- 极致性价比:生成速度达行业5倍,1080P最低0.2元/秒;MaaS服务API价格仅为行业平均1/3
- 计费模式颠覆:推出Video Plan包干制,每日最高40分钟额度;Vidu Claw打通微信/飞书,实现对话级一句话闭环出片
市场验证与战略合作
- 国际双榜登顶:力压谷歌Veo等模型,登顶Artificial Analysis基准测试及SuperClue多图/单图参考双榜
- 规模化生产验证:万兴剧厂实测抽卡精确度翻倍,分镜可用率达80%
- 阿里云全面结盟:Vidu接入百炼平台共研多模态世界模型,依托全球一张网拓展海外市场
1.5 Wan2.7视频创作控制与扩展
Wan2.7 视频创作控制:续写、动作模仿、运镜与风格编排
千问APP(20260403) | 量子位(20260403) | 智东西(20260403) | 财联社AI daily(20260404)
阿里 Wan2.7-Video 实现从素材生成到全链路创作控制的跃升,支持文本/图像/视频/音频全模态输入,输出 720P/1080P,时长 2-15 秒。
| 模型 | 代号 | 核心能力 |
|---|---|---|
| 文生视频 | Wan2.7-t2v | 文字直出视频,支持群像千人千面 |
| 图生视频 | Wan2.7-i2v | 图像+音频输入生成视频 |
| 参考生视频 | Wan2.7-r2v | 最多5个主体参考,精准迁移复杂动作 |
| 视频编辑 | Wan2.7-videoedit | 局部修改、角色替换、场景与风格变换 |
视频PS级编辑操控
- 局部增删改:自然语言指令增删替换元素,光影材质自动匹配
- 角色与台词操控:替换角色保持背景姿态不变;改台词保持口型音色统一
- 场景与风格转换:一键切换写实/3D/黏土等风格或季节天气,原动作不变
视频续写与运镜控制
- 视频延展:2秒素材最长延展至15秒,首尾帧控制消除传统刹车感
- 运镜体系:支持推拉摇移跟升降及希区柯克变焦等数十种复合运镜
- 参数控制:机位、视角、景别、焦距等拍摄参数均可自然语言修改
- 叙事联动:运镜与剧情联动控制叙事张力,保留原动作生成新场景
参考生视频与动作模仿
- 多主体参考:最多支持5个主体参考(业内最多),多宫格图转动画片
- 动作模仿:支持多人协同动作复刻,同步复现参考视频运镜与特效节奏
- 风格库覆盖:2D/3D、水墨、赛璐璐等上千种组合,自动匹配影片类型
- 全链路创作:支持智能剧本创作和分镜调度,实现从演到导的创作跃升
1.6 CVPR 2026 视频模型趋势:运动建模与动态世界理解
视频预测与运动建模范式演进
极市平台(20260430) | AI科技评论(20260512) | 量子位(20260516) | 机器之心(20260520) | 量子位(20260528) | AI科技大本营(20260602) | 量子位(20260605) | 机器之心(20260611) | CVer(20260614) | "Z Potentials"(20260622) | 智能涌现(20260622) | AIGC开放社区(20260716) | 机器之心(20260717) | CVer(20260718) | 机器之心(20260721) | 量子位(20260607) | 极市平台(20260722) | 量子位(20260729)
- 隐空间视觉因果:ProLaViT构建连续隐空间三步因果链,克服纯文本CoT模态鸿沟
- 免解码4D对齐:VGGRPO通过轻量连接层对齐VAE与LGM,隐空间4D奖励兼具低开销与动态场景支持
- 双奖励GRPO优化:摄像机平滑度(惩罚平移/旋转加速度)+几何重投影一致性(光流过滤动态仅聚合静态点)
- 四维空间约束:World-R1纯文本RL达PSNR+10.23dB;VGGRPO解决镜头抖动与几何畸变
- 频域物理对齐:PhysInOne频域指标PMF使Wan2.2升至3.147;Magi-1登顶Physics-IQ榜单
- 连续场与自回归:PDR方法实现连续高斯场视频预测超1000 FPS,突破物理对齐连续场瓶颈
- 三层效率加速:SURF使Wan2.1-14B生成提速43倍(1080p);LightX2V三层优化显存与步数(16步收敛)
- 跨Backbone泛化:框架不绑定特定模型,HunyuanVideo提至44.5,Wan2.2达68.2(RULER-Bench +21.8分)
核心技术路线对比
- 物理对齐评测:PhysInone频域PMF使Wan2.2升至3.147;NEWTON准确率达37.4%
- VLM指导优化:NEWTON/可灵采用Planner-Executor循环,过程+目标监督提升16.7分
- 免解码4D对齐:VGGRPO防4D重投影畸变,优于损泛化的架构修改与高开销像素级RL
- 通用视觉智能:GenCeption用123万帧媲美6亿帧专用模型,验证生成式预训练潜力
1.7 视频世界模型长期记忆评测基准
MBench:视频世界模型长期记忆能力的首次系统化评测
机器之心(20260611) | 机器之心(20260615) | CVer(20260627) | 机器之心(20260706) | 人工智能学家(20260706) | 机器之心(20260403) | 智东西(20260721) | 机器之心(20260627)
MemoBench | 动态遮挡记忆 | 10个模型ORS得分均低于0.6
KIVI-Bench | 知识密集型事实 | 最佳闭源FactP仅83.2%
Physion-Eval | 物理常识与因果 | 83.3%视频含物理错误
MME-CoF-Pro | 过程级推理一致性 | RS相关性0.61,最高推理仅56分
长期记忆与知识准确性痛点
- 记忆与一致性短板:SOTA模型在实体/环境/因果一致性上均有缺陷,ORS普遍低于0.6
- 事实准确性缺失:知识密集型生成频发三大系统性错误:实体误描(42.6%)、操作错误(40.7%)、组件错位(15.0%)
- 物理常识薄弱:超83%视频含物理错误,Gemini 3.0 Pro漏检超74%,视觉真实感不等于物理真实性
推理能力与生成质量解耦
- 推理与生成解耦:Veo-3.1与Sora-2的RS得分仅56和50,Kling生成强(65.1)但推理极弱(13.8)
- 结果导向指标失效:RS评分与last-frame correctness呈负相关(-0.41),仅看结果会系统性高估推理能力
- 评测范式革新:MME-CoF-Pro首创过程级评测(覆盖16类四层推理),通过Gemini-2.5逐步判定量化推理链断裂点
提示词策略与反直觉洞察
- 文字提示双刃剑:文字提示虽能提升RS(Veo +4.5/Sora +7.6),但致7个模型一致性全线下降
- 视觉提示认知错位:模型易将视觉标注误判为画面内容渲染,在精细任务中拉低成绩(Veo-3.1 RS -13.0)
- 提示堆叠无法单调提升:当前模型无法稳定利用累积引导信息,多步渐进提示曲线呈现剧烈波动
- 反直觉洞察:动态复杂性比强度更易触发失败;首帧质量提升比扩大近3倍参数量更有效(PSNR +4.2dB)
技术跃迁与范式加速
- 评测标准更迭:传统视觉指标淘汰,FactP/HelpS双指标、V-D-R三段式探测及STEM专家评判成新标准
- 架构创新加速:Matrix-Game 3.5首创Patch Memory直击记忆痛点,结合量化与3步采样实现单GPU 720P/20FPS实时生成
Pistachio:可控视频生成重构视频异常检测与理解基准(ECCV 2026)
- 核心贡献:以可控视频生成为核心手段,系统性构建视频异常检测(VAD)与异常理解(VAU)基准,被 ECCV 2026 接收并全面开源
- 解决数据偏置:针对现有数据集偏向高传播性事件(抢劫/打斗等)而忽视设备故障等问题,引入可控生成系统性覆盖长尾异常类别
- 数据集规模:Pistachio-VAD 含 4,962 视频(29.11h,31类,覆盖10类传统基准未覆盖类型);Pistachio-VAU 含 1,385 视频(含时间关系与因果理解标注)
- 方法远未饱和:VAD 最佳 AUC 仅 83.7%(PEL4VAD),VAU 最佳 F1 仅 29.39%
五步可控生成 Pipeline
| 步骤 | 功能 | 关键设计 |
|---|---|---|
| 场景感知分类 | VLM 识别输入图像场景 | 确定异常分配上下文 |
| 异常分配 | 根据场景选择合理异常 | 确保现实合理性 |
| Storyline构建 | 长视频拆分7-8事件段 | 正常→前兆→异常→影响 |
| 时间一致合成 | 上段末帧作下段起始帧 | 增强片段间连续性 |
| 层级语义标注 | 先有事件脚本再生成视频 | 减少后验标注幻觉 |
- 标注范式革新:采用“构建Storyline→生成视频→转化为标注”,区别于传统“生成→猜测描述”,显著减少事实幻觉
- 合成数据迁移价值:用 10% Pistachio 数据混合训练 UCF-Crime,AUC 从 82.56% 提升至 83.96%,AP 从 21.62 提升至 24.25%
- 核心洞察:可控生成 > 数据增量,其价值在于异常类别均衡、正常样本复杂化和时间结构可控,可作为有效的预训练数据源
2. 图像生成与视觉AI
2.1 图像生成模型进展
图像与数字人生成前沿技术
机器之心(20260331) | 财联社AI daily(20260401) | 通义大模型(20260401) | 阿里云(20260401) | JackCui(20260401) | 智东西(20260401) | 新智元(20260401) | 路人甲TM(20260401) | 优设AIGC(20260401) | 极市平台(20260402) | 甲子光年(20260402) | AGI Hunt(20260404) | 新智元(20260405) | 机器之心(20260405) | 蓝色光标(20260408) | AIGC开放社区(20260409) | AI有道(20260412) | 卡尔的AI沃茨(20260416) | AIGC开放社区(20260417) | AI范儿(20260417) | APPSO(20260418) | 量子位(20260419) | 优设AIGC(20260420) | 阿枫科技(20260420) | APPSO(20260421) | 赛博禅心(20260421) | GeekSavvy(20260421) | 歸藏的AI工具箱(20260422) | APPSO(20260422) | 机器之心(20260422) | 量子位(20260422) | 数字生命卡兹克(20260422) | AI范儿(20260422) | JackCui(20260422) | 新智元(20260422) | 赛博禅心(20260422) | InfoQ(20260422) | 硅星人Pro(20260422) | 第一新声(20260422) | 小互AI(20260422) | 智东西(20260422) | 人工智能学家(20260422) | 新智元(20260422) | 摸鱼小李(20260422) | AI新榜(20260422) | CVer(20260422) | 量子位(20260423) | AIGC开放社区(20260423) | 十字路口Crossing(20260423) | 优设AIGC(20260423) | APPSO(20260423) | AI产品银海(20260423) | 机器之心(20260423) | 极市平台(20260423) | CVer(20260423) | 深度学习与NLP(20260422) | 硅星人Pro(20260424) | 船长AI视界(20260424) | 量子位(20260425) | 新智元(20260427) | 网罗灯下黑(20260428) | 优设AIGC(20260429) | AI寒武纪(20260429) | AI产品阿颖(20260430) | 硅星人Pro(20260430) | 量子位(20260430) | AI科技评论(20260430) | APPSO(20260501) | 量子位(20260501) | 硅星人Pro(20260501) | 机器之心(20260501) | 人工智能学家(20260502) | 硅星人Pro(20260503) | 硅星人Pro(20260505) | 机器之心(20260506) | 量子位(20260506) | AIGC开放社区(20260508) | 机器之心(20260511) | 机器之心(20260512) | CVer(20260513) | PaperWeekly(20260514) | 机器之心(20260514) | 量子位(20260516) | "Z Finance"(20260522) | AIGC开放社区(20260525) | 火山引擎(20260525) | 通义大模型(20260528) | DeepTech深科技(20260530) | AIGC开放社区(20260601) | CVer(20260601) | 机器之心(20260603) | 极市平台(20260604) | 机器之心(20260608) | AI科技评论(20260608) | 量子位(20260609) | 机器之心(20260610) | 商汤科技SenseTime(20260612) | 量子位(20260614) | 极市平台(20260616) | 机器之心(20260618) | AI科技评论(20260625) | 路人甲TM(20260628) | 量子位(20260701) | 新智元(20260701) | 夕小瑶科技说(20260701) | AI前线(20260701) | 智东西(20260701) | AIGC开放社区(20260703) | AI科技评论(20260708) | 优设AIGC(20260713) | CVer(20260713) | AI科技评论(20260715) | 智东西(20260716) | 硅星人Pro(20260719) | APPSO(20260720) | 光子星球(20260720) | 智东西(20260721) | 袋鼠帝AI客栈(20260722) | 深度学习与NLP(20260405) | 机器之心(20260728) | CVer(20260728) | AI产品银海(20260729)
- 慎用美学RL:重度美学RL致分布坍缩,仅在不损多样性的肢体结构等问题上使用
- 关键量化发现:汉字单字约300次曝光(日常覆盖3500字),人物身份记忆需约4500次语言匹配曝光
- 免训练推理增强:BOG技术将DiT预测做结构化归一化,强化垂直于flow流场的信息
- 原生2K训练修正:标准动态时间偏移在2K致过度挤压,团队给出截断修正方案
- 弃用学术基准:学术基准失效(GPT-Image-2人类偏好最强但GenEval中游),改以人类偏好为主
AI影视与商业应用
- 长片与商业提效:字节Seedance实现95分钟AI长片(15人制作);京东数字人直播服务7万商家,公域流量提升超60%
- 商汤Seko 3.0实测:单人10分钟完成太空微电影,切换王家卫/黏土等Skill即变气质,中间产物留存无限画布可随时干预
- Skill模板化机制:编码编导经验为模板,同剧本经不同Skill处理人物造型/镜头剧变,关键结果大多一次生成可用
- 长视频理解极限:VideoChat-Flash单3090处理万帧,细节识别准确率99.1%
- 空间智能演进:开源240亿参数JoyAI-Image-Edit将空间理解写入底层,实现轨迹控制与3D旋转
- OPC产业基地落地:徐汇西岸40+团队入驻,联建上戏实习基地;Rang AI Studio全网播放超4亿,聚宝仙盆热度超3.5亿
- 核心产业洞察:AI影视竞争从生成能力转向分发渠道与产业资源,工具趋同后创作与运营成真正壁垒
核心产品参数对比
- 生成效能:华为Boogu(2.08亿图/40万美元/盲测第一) vs 字节DreamLite(0.39B端侧/3秒生成)
- 多模态架构:商汤U1(8B无编码器/MMMU80.55) vs 字节Lance(3B MoE/GenEval0.90)
- 视觉压缩:DeepSeek(284B MoE/图压缩81Token) vs GPT/Claude(传统大模型/迷宫任务被超越)
平台促销
- 周年庆活动:非会员免费用Seedance 2.0 Mini,月会员首购5折,年会员首购4折,Seedance 2.0低至0.42元/秒
3D骨架行人重识别(SRID)全景综述
- 领域首篇系统综述:南洋理工发布3D骨架行人重识别(SRID)综述,被IJCAI 2026接收,系统梳理2014年至今技术演进(已开源:github.com/Kali-Hac/3D-SRID-Survey)
- 核心识别逻辑:将人体简化为关节点骨架,利用物理结构(身高、臂长)与运动步态模式(步幅、步频)提取生物特征
- 四大核心优势:天然脱敏契合GDPR隐私要求、极轻量(SimMC仅0.15M参数)、视角不变、规避换装与遮挡等外观痛点
三大建模范式横向对比
| 建模范式 | 核心思路 | 代表工作 | 核心特点 |
|---|---|---|---|
| 手工特征 | 专家定义骨骼几何与步态时空参数 | Munaro等(ICRA 2014) | 可解释性强,泛化受限 |
| 序列建模 | LSTM等时序模型编码姿态演变与步态语义 | CAGEs(TPAMI 2022) | 捕捉时序动态,依赖序列完整性 |
| 图建模 | 关节构建动态拓扑图,学习部位协同联动 | CTR-GCN(ICCV 2021) | 当前主流方向,准确率高 |
基准测评与应用场景
- 主流数据集:BIWI、IAS-Lab、KS20、CASIA-B、3DGait五大基准上系统横向测评,深度学习显著超越手工方法
- 效率突破:Hi-MPC、MoCos等深度图模型在准确率与计算效率上取得较优平衡,极具边缘设备部署潜力
- 跨域应用场景:医疗健康(帕金森预测、中风康复评估)、具身智能(虚拟化身运动重定向、手势交互)、跨模态安防认证
Vision-OPD:自蒸馏实现细粒度视觉感知SOTA
- 核心发现:同一模型看裁剪放大局部图比看全图准确率高18-22个百分点,从4B到千亿参数模型均存在此鸿沟,证明细粒度瓶颈在注意力分配而非模型容量
- 方法创新(Vision-OPD):让"看局部的自己"教"看全局的自己",仅用6.2K全自动合成数据,无需外部教师/人工标注/推理工具
- 双角色自蒸馏架构:从同一模型派生裁剪教师(特权视角)与全图学生(标准推理),梯度只流过学生,教师用EMA正则化防漂移
- 在线蒸馏优势:训练前缀由学生自生成,与推理时状态分布对齐,避免离线SFT的前缀错配问题;稠密token级监督克服GRPO/DAPO等RL方法的稀疏奖励问题
细粒度视觉基准排名
| 模型 | 平均分 |
|---|---|
| Vision-OPD-9B | 79.68 |
| Gemini-3.1-Pro | 79.25 |
| Gemini-3.5-Flash | 79.24 |
| Qwen3.5-397B | 77.44 |
| GPT-5.4 | 72.77 |
- 通用能力保持:分布外任务(MMVP、CV-Bench、MMStar、POPE)分数持平或微涨,而SFT策略导致MMStar从83.07降至73.33
- 关键洞察:精准训练信号比数据量更重要——关键不是"喂更多"而是"喂对位置";自蒸馏范式为其他模态/任务的自提升提供通用框架
- 代码已开源:github.com/VisionOPD/Vision-OPD
大规模食品图像分割:DishSeg24k 数据集与 FEAST 方法
- DishSeg24k 基准:最大规模真实用餐场景菜品分割数据集,含24,096张图像、112,281个实例标注、278个菜品类别,采用[大类]-[食材]-[烹饪方式]三级分类体系
- 核心挑战:针对菜品密集重叠、细粒度类别相似性、长尾分布三大分割难题;数据来源3,493张真实用餐图像 + ZSFood数据集的完整重标注
- FEAST 方法创新:将查询解码重构为强化学习优化的马尔可夫决策过程(MDP),每层更新视为顺序决策步骤,随机策略采样连续语义偏移量探索多种边界假设,避免确定性方法陷入局部最优
- MoE双评论家解耦:任务评论家指导掩码精化,结构评论家指导专家路由,有效防止高频类别垄断专家容量,解决长尾分布问题
- 性能对比(DishSeg24k测试集):
| 方法 | mIoU(%) |
|---|---|
| DeepLabV3+ | 32.89 |
| FoodSAM (ViT-H) | 37.90 |
| ED-AFormer | 44.81 |
| Mask2Former | 50.22 |
| FEAST | 53.43 |
- 跨数据集验证:相比基线Mask2Former,mIoU +3.21%、mDice +3.68%、mAcc +4.00%;在FoodSeg103上同样有效
- 关键洞察:MoE+强化学习双评论家解耦是解决细粒度长尾问题的有效范式,可迁移至其他细粒度分割任务;论文被ACM MM 2026(CCF-A类)录用
ViT³:亚二次复杂度的全局注意力架构
- 背景:标准 ViT 自注意力复杂度为 O(N²),处理高分辨率图像时计算与显存二次增长,成为密集预测任务的核心瓶颈
- 核心创新:清华&阿里联合提出 ViT³,通过数学变换重构注意力计算,在不引入强局部性假设(如窗口注意力)的前提下实现亚二次复杂度,同时保留全局感受野
- 关键设计:即插即用——可直接替代标准 ViT 中的多头自注意力模块
- 架构对比:
| 维度 | 标准 ViT | Swin Transformer | ViT³ |
|---|---|---|---|
| 复杂度 | O(N²) | O(N·W²) | 低于 O(N²) |
| 全局建模 | ✅ | ❌ 窗口内 | ✅ |
| 分辨率扩展 | 受限 | 较好 | 显著改善 |
- 意义:挑战了"局部窗口=高效"的主流范式,证明全局建模与低复杂度可以兼得,与近期 Sub-Quadratic Transformers 研究趋势一致
- 状态:目标投稿 CVPR 2026,目前处于预发布阶段,完整实验数据待公开
2.2 AI设计工具与UI生成
AI设计工具与可视化生成:技术演进与交互范式
莫理(20260406) | 优设AIGC(20260417) | 优设AIGC(20260422) | 路人甲TM(20260422) | AI寒武纪(20260422) | 阿枫科技(20260422) | 曼话AI(20260422) | AIZ小朱(20260422) | 沃垠AI(20260422) | AI产品阿颖(20260423) | 甲木未来派(20260423) | 卡尔的AI沃茨(20260423) | "梦飞 AI"(20260424) | AI异类弗兰克(20260426) | 路人甲TM(20260426) | AI产品银海(20260426) | 新智元(20260426) | 优设AIGC(20260427) | 沃垠AI(20260427) | 莫理(20260427) | 阿枫科技(20260429) | AIZ小朱(20260429) | 网罗灯下黑(20260429) | 饼干哥哥AGI(20260518) | "AGI Hunt"(20260519) | 莫理(20260523) | AI产品银海(20260525) | 路人甲TM(20260525) | AI寒武纪(20260526) | 阿枫科技(20260526) | AI异类弗兰克(20260526) | 沃垠AI(20260527) | 莫理(20260609) | 花叔(20260616) | 十字路口Crossing(20260618) | 沃垠AI(20260330) | 优设AIGC(20260707) | AIZ小朱(20260707) | 前沿在线(20260708) | 字节跳动Seed(20260708) | 智东西(20260709) | 火山引擎(20260708) | AI新榜(20260710) | 夕小瑶科技说(20260713) | APPSO(20260713) | 歸藏的AI工具箱(20260713) | 优设AIGC(20260715) | 路人甲TM(20260721) | 光子星球(20260721) | 阿里云开发者(20260722) | AI异类弗兰克(20260722) | 卡尔的AI沃茨(20260722) | 特工宇宙(20260722) | 老金带你玩AI(20260723) | 量子位(20260723) | 网罗灯下黑(20260423)
核心生成模型与工具对比
| 模型/工具 | 核心优势 | 价格/定位 |
|---|---|---|
| GPT Image 2 | 极致真实感(肉眼难辨)、多语种零乱码、精准局部编辑 | ≈0.05元/张 |
| Seedream 5.0 | 15+语种原生、选区自然语言局部修改 | 2K图0.6元/张 |
| Qwen-Image-3.0 | 4.5k超长指令、10px小字、12国语言直出 | 免费开源 |
| Lovart | 专注创意变现(品牌/电商),打通全链路工作流 | 创意设计 |
| Claude Design | 专注UI界面与产品原型,输出可交互多页面代码 | UI/原型 |
生成质量与编辑能力突破
- 文字排版质变:文字渲染准确率逼近95%,彻底解决中文及密集排版乱码痛点
- 极致真实感:生成人像、票据、红头文件达肉眼难辨程度,Arena排行榜领先
- 精准局部修改:支持拆分图层、Touch Edit局部重绘(换装且手持物不变)及无痕改字
- 可编辑活对象:直接生成SVG等矢量结构(如流程图),支持节点级编辑与联动
生产工作流与范式重构
- 全链路闭环:串联生成-局部修改-图生视频-PSD分层-样机合成,打通生产末端
- 交付级直出:支持导出带图层PSD/矢量字体/PPT,满足1个起订印刷与接力编辑
- 工作流管线化:无限画布串联创意到交付,Skill封装复杂提示词实现批量自动化生产
- Design Agent颠覆:从文本/参考图直接生成可交互原型与React代码,设计稿退化为中间产物
- 经验流水线化:AIGX矩阵消除“抽卡”随机性,将设计专家经验深度嵌入实际工作流
商用落地与安全风险
- 品牌一致性闭环:Brand Kit自动锁定Logo/色板/字体,AI参考AI确保跨场景高度一致
- 结构化提示词工程:依赖“格式死锁→质感拉满→反向避坑”六步法,覆盖十余类商用场景
- 算力成本骤降:单张图成本约5分钱,视频约1元/10秒,品牌视觉物料门槛降至极低
- 图片信任体系崩塌:银行流水与聊天截图等可几秒无损生成,社会尚未建立替代验证机制
遥感视觉感知基础模型与多模态理解
CVer(20260401) | CVer(20260406) | CVer(20260409) | 极市平台(20260421) | CVer(20260429) | CVer(20260517) | CVer(20260518) | CVer(20260531) | CVer(20260605) | 极市平台(20260710)
视觉推理与检索增强
- 迭代视觉证据推理:RS-EoT-7B引入苏格拉底多智能体,主动驱动多轮视觉证据寻求,破解VLM“一瞥效应”伪推理,多项遥感VQA基准达SOTA
- 两阶段原型检索:OpenDPR分解变化定位与识别,用DiffusionSat合成视觉原型实现无训练检索,四大基准超越现有无监督方法
- 交叉注意力重排序:CAME挖掘图库内部邻域关联修正相似度,大视角差任务AP最高提升+8.41%
多模态统一与跨域突破
- 五模态联合生成:MetaEarth-MM以场景中心联合建模支持RGB/SAR等任意互转,自建EarthMM数据集(280万图像)
- 光学/SAR统一分割:SkySense-VITA支持视觉/文本双提示,18个数据集平均mIoU领先超10%
- 自适应频率分解:F2Net三分支动态分离高低频,兼顾细节与全局语义,DeepGlobe与Inria均达SOTA
零样本与弱监督范式
- 跨域零训练分割:Earth2Ocean无需水下微调,直传陆地VLM实现开放词汇分割,平均mIoU提升超6个点
- 部分弱监督检测:PWOOD仅需10%-30%弱标注(水平框或单点),即可比肩半监督有向目标检测方法
- 原生SAM2免训练:Remote SAMsing采用黑遮蔽多轮迭代机制,大图覆盖率从30-68%跃升至91-98%
核心模型与数据基准
| 模型/基准 | 核心数据 | 关键成果 |
|---|---|---|
| OlmoEarth | 28.5万位置观测 | 超60%冻结特征任务达最优,超越AlphaEarth |
| Sky-VT-300k | 30万+样本/176类 | 支撑光学/SAR统一上下文分割 |
| EarthMM | 280万图像/5种模态 | 支撑五模态任意互转 |
| UniGeoRS | 14.2万图/1154地点 | 填补卫星/无人机/地面三视角基准空白 |
| AquaOV255 | 255类/2万张图像 | 支撑跨域水下零训练分割评估 |
CVPR 2026 模型适应性研究盘点
- 研究范式转向:CVPR 2026 核心趋势从「能力扩张」转向「能力管理」,聚焦持续学习与跨模态协同问题
代表性论文对比
- QKD(北邮):参数化量子电路映射Hilbert空间,CIFAR-100/ImageNet领先,支持exemplar-free设定
- LCA(Meta):100万单目视频预训练+多视角后训练,双分支解码器,面部/手指/身份保持优异
- FEAT:ETF原型几何对齐+Energy推理校正,联邦设定通信开销低,兼容现有框架
- PolyV(NUS+NTU):稀疏MoE实现图像/视频/3D双向交互,相比Qwen2.5-VL-7B平均提升约10%
- WienerCLIP(东南大学):将维纳滤波引入CLIP表征空间,提出训练无关的频谱滤波少样本适配方法
关键洞察
- 选择性继承优先:持续学习核心从「防遗忘」转向「任务相关性建模」与知识选择性复用
- 方向可靠性差异:少样本适配中文本对齐方向稳定,残差方向易受噪声干扰,无差别调整会污染可靠知识
- 信噪比自适应滤波:固定文本对齐方向作锚点,仅在残差空间依信噪比闭式滤波,额外运行开销仅约0.07%
- 3D范式迁移:「大规模预训练+高质量后训练」成功从语言/2D视觉迁移至3D数字人领域
- 联邦学习新解:瓶颈在「如何有效使用样本」而非「选哪些样本」,几何结构对齐提供新思路
- 模态协同增强:统一视觉模型下一步是模态间协同增强(双向交互、语义锚点),而非简单整合多输入
- 经典理论赋能:经典信号处理(维纳滤波)与现代深度表征存在未充分挖掘的连接,可即插即用叠加5种适配方法
MobileSAM2:手机端分割一切模型
- 产品定位:MobileSAM2 为 SAM2(Segment Anything Model 2)的移动端轻量化版本,目标是在手机等移动设备上实现实时图像分割(分割一切)
- 核心价值:将此前需高端 GPU 才能运行的分割能力下放到手机端,降低部署门槛,拓展移动端 AR、图像编辑、场景理解等应用场景
2.3 视觉特效与动态生成流水线
AI短剧工业化生产与LibTV工具平台
优设AIGC(20260615) | 卡尔的AI沃茨(20260617) | 船长AI视界(20260617) | AI异类弗兰克(20260618) | 卡尔的AI沃茨(20260622) | 有机大橘子(20260623) | 袋鼠帝AI客栈(20260623) | 公子龙(20260630) | 船长AI视界(20260701) | 路人甲TM(20260702) | 路人甲TM(20260703) | 阿枫科技(20260709) | 花叔(20260709) | 网罗灯下黑(20260713) | 苍何(20260714) | 阿枫科技(20260713) | AI信息Gap(20260714) | 哩布哩布AI(20260714) | 莫理(20260714) | "Founder Park"(20260714) | 优设AIGC(20260714) | 公子龙(20260714) | 小互AI(20260714) | 有新Newin(20260714) | 十字路口Crossing(20260714) | 袋鼠帝AI客栈(20260714) | 赛博禅心(20260714) | AI产品阿颖(20260714) | 昆仑万维集团(20260716) | 莫理(20260716) | 路人甲TM(20260717) | 沃垠AI(20260717) | 阑夕(20260723) | AI新榜(20260721) | 阿枫科技(20260727) | 船长AI视界(20260728) | 阿枫科技(20260729) | AI信息Gap(20260729) | AI产品阿颖(20260729)
- LibTV:3分钟生成成功率超80%,千万级激励促生态变现
- 海艺剧场:自动批量+逐镜头双模式,实测每秒成本约0.3元
- LuxReal:Agent起稿配自由画布精修,降低单次启动成本
- 爱奇艺纳逗:聚焦项目级统筹管理,上线近70个专属Agent
- 小云雀:资产多维管理,单集成本约300元,支持全景与多形象
- 豆包Seedance:极限成本0.42元/秒(一集<30元),mini模型免费
- 豆包Seed Audio:突破泛化场景,单次最长通用声音生成2分钟
Skill系统与创作模式迭代
- Skill产品化:封装镜头/叙事/配色逻辑,复用经验逼近90%专业效果
- 创作生态闭环:提供数十现成Skill,支持头部创作者反向输出Skill
- 三大创作模式:探索创作、锁定风格Skill增强、创意到成片短片工作室
- 高质量画面:悬疑冷金属/温情蜡笔画/玄幻3D均达热播水准一次成功
- 流程化操作:大纲到分镜流程化,上下文持久沉淀,对话确认无需提示词
关键技术突破与行业演进
- AI视频三阶段:1.0模型层→2.0Agent层→3.0商业化层(需四位一体)
- 3D片场与锚点:2D转3D解决空间一致性,唯一ID解决样貌漂移
- 多集连更:大纲续集自动延续世界观,前置出错仅局部重跑降损耗
- 行业爆款率:25Q1日均上新1300+部,爆款率仅0.16%,工具≠质量
- Skill系统价值:AI降制作门槛未降创意门槛,Skill正弥合此创意鸿沟
核心竞争壁垒与商业化变现
- 核心壁垒转移:工具趋同致技术红利消失,剧本/叙事等影视基本功成真壁垒
- 跨镜头连续性:竞争转向连续性、算力、发行及可复用资产沉淀
- IP变现最高效:工具民主化下,剧情自媒体IP成为投入产出比最高路径
- 变现路径-短漫剧:陈柯工作室《聚宝仙盆》获漫剧榜第一
- 变现路径-自媒体:"阿松的奋斗"6集涨粉近百万打造剧情IP
- 变现路径-商业化:RANG AI STUDIO承制项目获央视/新华社报道
- 变现路径-内容出海:多基地团队同步推进,验证全链路出海发行能力
AI漫剧行业兴衰:从效率红利到行业崩塌
十字路口Crossing(20260711) | 阿枫科技(20260715) | 优设AIGC(20260720) | 数智前线(20260727)
2025 AI漫剧元年市场数据
- 市场爆发:全AI微短剧在抖音TOP5000中由1月4部增至11月217部,新增相关企业8.02万家
- 爆款验证:《斩神台》12人团队、30天制作斩获超10亿播放、ROI超110,打响规模化变现第一枪
- 2026预测:市场规模将破220亿(贡献50%增量),用户从1.2亿增至2.8亿,现存企业达24.5万家
- 核心洞察:AI漫剧是首个实现规模化变现的AI视频赛道,核心壁垒为选题、IP运营与投流的复合能力
AI漫剧宏观周期与困境
- 产能跃迁与洗牌:Seedance 2.0使单部成本降至4-5万,1人月产3-4部,行业从业者从3000锐减至约300人
- 价值摧毁与双杀:极低门槛致行业沦为“彩票生意”,且遭官媒定调千篇一律、平台限流,出海窗口仅3-6个月
生产效率对比
- 传统短剧:数十至百人团队,耗时数月,ROI仅为个位数
- AI漫剧:约12人团队,耗时约30天,ROI可超110
自动化流水线基建
- 防污染机制:Agent节点独立运作,支持画布自动浏览、角色识别与并行执行
- 经验商品化:Skill广场已有300+全环节制作Skill,类似影像创作领域的GitHub
- 工作流闭环:一键打通剧本至剪辑,自动配置景别、灯光等参数,支持导出达芬奇或直投平台
专业导演工作流体系
- 极致结构化:单10秒镜头提示词可达1500字,光照发丝等细节远超新手手搓效果
- 多机位一致:利用Skill固定背景,结合角色情绪面板精准控制表情动作
- 合法IP壁垒:创作者可获《凡人修仙传》等独家授权,支持资产溯源与工业级导出
- 工作流模块:以禁止项(去水印/LOGO)、风格角色设定、镜头转场逻辑实现工业级精确控图
关键行业洞察
- 实战爆发力:叫兽易小星AI剧5天破200万播放,大圆镜科普系列播放近2亿
- 资产升维:创作者竞争壁垒从“会用工具”升维至“能定义高质量工作流”
- 瓶颈转移:AI制作关键不在生成质量而在流程管理,标准化传统影视工业才是核心
2.4 图像生成底层架构与范式创新
图像生成底层架构与可控生成范式创新
机器之心(20260409) | 量子位(20260411) | CVer(20260426) | AI科技评论(20260507) | 机器之心(20260509) | AI科技评论(20260512) | 极市平台(20260512) | 极市平台(20260512) | 量子位(20260513) | 机器之心(20260521) | 机器之心(20260523) | 机器之心(20260525) | 机器之心(20260525) | 极市平台(20260525) | 百度文心(20260528) | 机器之心(20260529) | 机器之心(20260530) | AI科技评论(20260602) | 极市平台(20260603) | 机器之心(20260608) | AI科技评论(20260610) | 机器之心(20260611) | 智东西(20260611) | AI异类弗兰克(20260611) | AI科技评论(20260615) | 极市平台(20260615) | 量子位(20260618) | 量子位(20260625) | CVer(20260625) | 量子位(20260627) | 机器之心(20260701) | 极市平台(20260707) | 机器之心(20260713) | 机器之心(20260717) | CVer(20260722) | 机器之心(20260724) | 极市平台(20260724)
- 架构与Tokenizer创新:南大&腾讯HYDRA用单一ViT处理图文(1.5B理解均分63.1);上智院BARD融合自回归与扩散(吞吐升3倍);字节×HKU的RF证明离散token预测(0.76)远超连续回归
- 表征与编码突破:谢赛宁RAEv2多层聚合降70%重建误差(成本不及FLUX一半);美图PE-Field将2D位置扩展为3D场引入Z轴深度;SSG范式揭示通道扰动对扩散引导优于空间维度且免加噪
- SSG引导优劣:内部交换最不相似token做差修正,FID全面超越SAG/PAG等;但缺乏理论支撑,扰动层位置敏感且引入额外计算开销
- 多任务RL与推理框架:复旦Flow-OPD单任务探索+多任务蒸馏解决奖励冲突;复旦VeRL-Omni通用框架降14%耗时(支持昇腾);小红书BigMac嵌套流水线训练提速1.9倍且显存降至常数级
- 推理与Agent加速:感知损失替换MSE实现免蒸馏4-8步生成;联通LeMiCa全局缓存实现2倍无损加速(32s降至7s);港中文Gen-Searcher生成前搜索验证(K-Score提升16分)
- 风格迁移突破:AnyStyle基于单LoRA+注意力调制实现一对多零样本泛化,改变纹理同时保持内容结构不变,相比DreamBooth训练存储成本最低且推理高效
- 数据管线构建:FreeStyle挖掘社区LoRA构建超百万双参考数据,三阶段精准剔除不稳定样本;指出参考图信息注入的“干净程度”远比增加数量更重要
- 双参生成防泄漏:浅层注意力过强引发语义泄漏(Enrichment constraint解决);RoPE引发局部复制(频率感知RoPE调制解决),成功将长尾风格转化为监督数据
DeepMind 圆桌:视频生成、世界模型与AI审美决策权
底层架构与技术博弈
- 语言作为中间表示:在语言上设定条件相当于对因果信息设定条件,有效缓解机器学习中的虚假相关性
- 视频模型即世界模型:视频模型已具备物理直觉,复刻LLM演进路径(指令遵循到降幻觉),是AGI核心组件
- 音视频联合生成:Veo 3基于统一的潜在因果生成过程,而非先生成画面再拼接音频
审美决策权与评估挑战
- 感官语言化瓶颈:人类对气味肤色极度敏感却词汇贫乏,制约自然语言驱动的生成模型控制力
- 隐性知识缺失:互联网仅存最终输出,复杂创意真实思考轨迹难提取,导致LLM内容千篇一律
- 偏好对齐危险信号:AI视频在人工评估中大幅胜过真实视频,实为模型优化触发人类认知偏差错位
- 默认审美即权力:模型团队实质掌控全球视觉默认值,审美拍板权由工程师主导,外部制衡缺失
- 异常奖励破解:模型出现明显倾向在手部绘制婚戒的奇特现象,疑似内部奖励机制被数据破解
成本断崖与平台级渗透
| 维度 | 传统制作 | AI生成 |
|---|---|---|
| 音乐单首成本 | 20万-100万元 | 不到1元 |
| 演唱特征 | 有呼吸感、不完美 | 过于完美,无人味 |
- 爱奇艺智能制作:服务200+项目,AI辅助剪辑效率提升超50%;日均收约3000部作品,1/3为AI漫画
- 昆仑万维SkyReels V4:聚焦人物一致性与音画同步;大场面容错率高适合AI,小众场景因数据不足效果差
创作者实战与不可替代性
- 提示工程持久性:导演已用AI补足因天气未拍的镜头,实拍与生成难以分辨;提示词精确描述运镜仍是核心瓶颈
- AI味技术根源:扩散模型去噪对人脸特征做平均化,导致生成面孔完美无瑕、缺乏真实缺陷
- 表演本质差异:AI基于数据模仿过去,无法主动创造反常规经典瞬间(如《教父》即兴抱猫)
- 版权与平权主张:呼吁强制标注AI内容、建立真人形象版权库;成本下降真正受益者是长尾创作者
2.5 多模态创意工作流与AI生图工业化
AI生图工业化工作流与提示词工程
赛博禅心(20260406) | 苍何(20260425) | AIZ小朱(20260508) | 优设AIGC(20260510) | 优设AIGC(20260511) | 百度文心(20260512) | 百度文心(20260521) | 优设AIGC(20260622) | 优设AIGC(20260702) | 优设AIGC(20260706) | 优设AIGC(20260720) | 优设AIGC(20260721) | 优设AIGC(20260723) | 优设AIGC(20260724) | 优设AIGC(20260623) | 优设AIGC(20260726) | 优设AIGC(20260728) | 优设AIGC(20260729)
AI绘图与模型配置
- ERNIE-Image LoRA配置:24GB显存用rank=64+AdamW8bit;16GB用rank=32+layer offloading降占用。
- 优化器与提示词:ROSE优化器的人体结构稳定性优于AdamW;trigger_word设为null可使风格自动融入。
- 提示词资源生态:MeiGen提供万级分类提示词,PromptHero跨社区搜索,SREF聚合艺术风格代码。
物理设备与无障碍设计
- Midjourney线下扫描:8960传感器×40环水耦合;60秒360°无辐射扫描,首家MJ Spa定址旧金山预计2027开业。
- AI设计精细化:支持像素级修改,需结合WCAG无障碍标准让AI执行多维度自检。
视觉设计与一致性原则
- 减法与张力:海报保留单一核心符号避免堆叠;体育海报主角穿出大标题,配合边缘失焦前景营造动作感。
- 系列视觉一致性:多图统一使用相同色系比相同风格更能建立一致性;色彩需贯穿服装、背景与包装。
- 纸艺质感框架:撕纸需纸瓶同色系与卷角毛边;剪纸凸显层间阴影。纸雕海报遵循主题→风格→材质→商业度四层框架。
- 可复用提示词范式:拆解为固定框架+可替换变量(如国家/地标/配色/口味),实现同类型图无限扩展。
商业级广告出图策略
- GPT商品图六模块:产品主体→海报风格→场景道具→棚拍光影→排版文字→色调氛围。
- 电商批量出图:先锁定系列色调与排版模板,仅替换可变产品信息实现无限复用。
- 质感分水岭:棚拍灯光与杂志排版指令是区分“白底图”与“品牌广告”的核心变量。
- 强透视构图优势:近大远小让产品成为第一视觉焦点,无需复杂构图即获专业级广告效果。
- 饮料海报六段式:①画面3:4定位→②模特设定→③透视构图(产品近大远小且不遮面部)→④口味驱动配色→⑤包装文案与水珠→⑥商业光影质感。
- 品牌系列感构建:利用口味颜色贯穿全局保一致,通过顶部超大标题加右下角同系列多瓶产品形成品牌矩阵。
Seedance视频「真人感」9维提示词框架
- 9维解法框架:人物5维度(脸部/皮肤/外表/情绪/运镜)+ 环境3维度(光源/景深/干扰)+ 1绕行策略,适用于Seedance 2.0等模型
人物维度:多部位过程分解替代单一极端情绪
- 脸部公式:
[眼部]+[嘴部]+[鼻/颈/肩]+[情绪序列],至少覆盖四部位 - 肢体公式:
[主要动作]+[同步冗余细节]+[衣物发丝物理反应],补充无意识微动作 - 情绪时间线:0-1s触发→1-3s身体先感知未完全表达→3-5s面部失控但仍有克制;忌用「正在大哭」等顶点描述
- 实例对比:委屈=眼眶泛红+下唇内抿+鼻翼颤动+呼吸短促;慌张=眼神横扫+喉结吞咽+手指收紧
皮肤四层瑕疵分层写入
| 层级 | 提示词要点 | 效果 |
|---|---|---|
| 肤质纹理 | visible pores, fine lines, uneven skin tone | 恢复毛孔与细纹 |
| 肤色血色 | natural flush, capillary redness | 增加微血管血色 |
| 含水含油 | sweat beads, oily T-zone, dry cracked lips | 汗珠/油光/干裂 |
| 光线互动 | subsurface scattering | 真实次表面散射 |
- 负面提示词必备:airbrushed, plastic skin, wax figure
环境维度与物理规律
- 打光公式:
[光源位置]+[光源类型]+[光线强度/对比描述] - 景深公式:前景虚化遮挡物+中景主体清晰+背景极致虚化(光圈f/1.2-f/1.8)
- 背景动态:如「墙面电视播放球赛」让模型自动处理背景变化
- 物理规律约束:衣物滞后于身体、物体需有支撑、头发/液体符合物理规律
- 运镜情绪驱动:镜头运动需有情绪理由,而非随意推拉摇移
绕行策略:利用媒介特性降低门槛
- 天然低 fidelity 媒介:行车记录仪、监控、老式DV等天然不需高保真,糊/抖/噪点是合理特征
- 工具配合:GPT Image 2出分镜,Seedance 2.0生成视频
2.6 CVPR 2026图像编辑趋势:多图一致性与精细可控
图像编辑前沿:多图一致、组合生成与镜像错觉艺术(CVPR 2026)
AI科技评论(20260528) | CVer(20260607) | AI科技评论(20260611) | 极市平台(20260702) | 机器之心(20260704) | 量子位(20260705) | 量子位(20260711) | AI科技评论(20260717) | 新智元(20260724) | CVer(20260726) | 量子位(20260729) | 量子位(20260729)
- OmniRef-Bench:填补复杂多参考评测空白,含395专家标注样本,DyRef得分8.38超越Seedream4.5
空间布局与连续属性控制
- ConsistCompose:将坐标绑定写入文本序列实现原生布局控制,精度超越GLIGEN等主流方法
- All-in-One Slider:引入稀疏自编码+Top-k实现零样本连续属性编辑,单模块有效解耦且完美保持身份
高频恢复与4K超清生成
- HiFi-Inpaint:注入高频特征与细节感知损失解决纹理丢失,CLIP-I达95.0%、DINO达91.9%
- VINS-120K:vivo开源首个4K编辑数据集,高频适应策略使pFID降至9.15,细节表现超越Seedream 4.0
区域拖拽与计算摄影
- ICRDrag:基于DiT上下文学习一次性输出,结合双LoRA(图像+掩码)有效防止特征污染
- 拖拽基建:提出IMAC/STAC约束特征防变形,开源28.7万拖拽数据集与1000组PRDBench
- MagicBokeh:单模型一次推理同时完成超分与虚化,交替训练平衡矛盾,入围Best Paper
- SmartPhotoCrafter:vivo实现无指令端到端自动摄影增强,完成输入照片到自动诊断推理生成的全流程
- 双模块架构:Critic(Qwen2.5-VL-7B)输出CoT质量分析与评分;Artist(DiT+Flow Matching)负责图像生成
- 潜在表征直连:Artist不接收文本指令,直接接收Critic的推理潜在表征,避免文本信息损失实现高带宽传递
- 三阶段训练法:独立预训练→推理表征对齐→协同RL优化(Critic用GRPO,Artist用DiffusionNFT)
- 属性级奖励解耦:质量评价分解为曝光、对比度、饱和度等可量化维度,将主观美学转化为细粒度优化信号
- 双模式支持:支持全自动优化(仅输入图像)与指令驱动编辑(图像+指令)两种模式
跨界艺术生成
- 镜像错觉:清华提出镜像错觉艺术生成器(亮点论文),支持3D打印输出,打通数字到实体全链路
2.7 统一多模态遥感图像生成:MetaEarth-MM
MetaEarth-MM:场景中心联合建模的多模态遥感生成框架
- 场景中心联合建模:北航提出对多模态联合分布 p(x_1,...,x_N) 建模,突破单向条件分布 p(x_b|x_a) 逐对翻译范式,单一模型同时覆盖边缘/条件/联合生成三类任务
核心解耦双模块架构
| 模块 | 架构设计 | 核心职责 |
|---|---|---|
| 场景推断模块 | DiT + 分区自适应LayerNorm | 从双模态带噪观测提取潜在场景表示 |
| 模态感知路由生成器 | DiT + 确定性模态路由 | 以场景为条件独立预测各模态去噪速度场 |
关键技术与优化组件
- 分区自适应层归一化:对各模态分区独立生成调制参数,适应异质噪声尺度与特征
- 模态路由FFN:为每种模态分配专属分支,避免异质分布间的参数竞争与干扰
- 场景一致性正则化:对称InfoNCE损失约束同场景不同模态嵌入趋于一致
- 联合训练目标:总体损失由联合流匹配损失与场景一致性正则化共同构成
数据集与性能表现
- EarthMM数据集:280万张图像、220万对对齐样本,覆盖RGB/SAR/NIR/PAN/OSM五模态,分辨率0.5–10m
- 跨模态翻译领先:SAR↔RGB、OSM↔RGB等大域差异任务优势显著,联合生成质量优于现有方法
- 基础模型潜力:所学场景表示可用于生成式数据增强、域自适应、零样本迁移等下游任务
2.8 遥感图像分析与视觉理解
遥感视觉理解与分割基准演进
CVer(20260419) | CVer(20260520) | CVer(20260521) | CVer(20260525) | CVer(20260613) | CVer(20260620) | CVer(20260703)
- MultiMoE (TGRS 2026):冻结DINOv3内插MoE适配器,RGB与DSM具独立专家池共享Top-k路由;总参78M仅激活27M,2.5%数据下mIoU提升7.14%
- DGKAN (AAAI 2026):首次将KAN引入图建模,GCN与KAN双路径Q/K/V自适应融合;消融中KAN分支替换MLP后Kappa指标平均下降8.1%
跨时间多模态变化推理与异常检测
- 灾害异常定位(AnomalyCD):武大团队将灾害定位重构为无监督异常变化检测,利用多时相历史影像区分灾害与正常变化,零样本F1提升~7%
- 任务定义(MTRS):输入双时相图像+自然语言表达,输出语言指定变化区域像素级掩码,融合跨时间变化与语言对齐双重挑战
- MTRefSeg-21K数据集:9,521组图像对、20,924条指代表达;CRAFT-Agent自动标注四步流水线解决多时相标注瓶颈
- MTRefSeg-R1基线:达到mIoU 65.68,较最强微调基线提升6.08,证明跨时间推理无法从单图预训练自然获得
核心方法对比汇总
| 模型/方法 | 发表/期刊 | 核心突破 | 关键数据指标 |
|---|---|---|---|
| IAPVec | ISPRS 2026 | 基于SAM农田地块矢量化 | CAPCAD覆盖620km²,密度21-520+块/km² |
| PFNet+IPNet | TPAMI 2026 | 多类要素全域统一矢量化 | 支持10000×10000像素级大图 |
| RoadGIE | CVPR 2026 | 轻量化全球道路交互提取 | 3.7M参数,覆盖38国223城 |
| MultiMoE | TGRS 2026 | 冻结DINOv3+多模态MoE | 总参78M(激活27M),2.5%数据mIoU提升7.14% |
| DGKAN | AAAI 2026 | GCN与KAN双路径图建模 | KAN替换MLP后Kappa↓8.1% |
| AnomalyCD | - | 无监督灾害异常定位 | F1提升~7% (vs基线) |
| MTRefSeg-R1 | - | 多时相指代表达分割基线 | mIoU 65.68 (基线59.60) |
2.9 底层视觉与图像处理优化
LTOFusion:可学习轨迹优化的多模态图像融合范式(TIP 2026)
- 范式重构:受元学习启发,将图像融合从「直接映射」重构为「可学习的逐步优化」过程,通过多阶段状态转换逼近目标融合结果
- PVF机制:设计像素变化流(PVF)作为优化动作算子,构建连续转换函数实现平滑融合轨迹
- 可控链模型:引入潜在变量描述操作步骤,将(源图像对+中间融合结果)作为状态输入
- 粗到细演化:合成实验中早期捕捉峰值近似位置,后期逐步锐化局部模式
范式对比
| 范式 | 核心思路 | 局限 |
|---|---|---|
| 单步直接回归 | 端到端映射 | 高维回归难度大,解空间被压缩 |
| 扩散式迭代 | 去噪过程演化 | 收敛慢,残留伪影 |
| LTO 动态优化 | 学习优化轨迹 | 步数无关,初期增益偏慢 |
训练策略与泛化能力
- 网络架构:采用 U-Net 在递归框架中估算每步像素流,通过回放记忆缓存复用中间结果解决梯度问题
- 零样本泛化:在医学数据训练后无需微调即可迁移,边缘保真度与结构完整性指标显著提升
- 学术发表:发表于 IEEE TIP 2026(重庆邮电大学等团队),代码已开源(GitHub: HeDan11/LTOFusion)
局限与未来方向
- 收敛判定:基于单一阈值的自适应终止难以全面刻画收敛性
- 复杂图像次优:有限步数内复杂图像的融合结果仍存在次优情况
- 未来探索:步数相关网络架构、多指标联合终止、结合几何形变建模解决空间错位
ATD:可学习词元字典实现线性复杂度全局依赖建模(TPAMI)
- 核心创新:电子科大提出自适应词元字典(ATD),通过可学习字典建模全局典型结构先验,突破窗口自注意力局部性限制(发表于IEEE T-PAMI)
- 词元字典交叉注意力:实现输入特征与全局先验的高效交互,在线性复杂度下完成全局依赖建模
- 类别分组自注意力:利用注意力映射中的类别信息对特征分组,并在前馈网络中融入类别信息增强融合
| 模型变体 | 适用任务 | 性能表现 |
|---|---|---|
| ATD / ATD(轻量化) | 图像超分辨率 | 领先性能 |
| ATD-U(多尺度扩展) | 图像去噪 | 显著超越现有方法 |
| ATD-U | JPEG压缩伪影去除 | 显著超越现有方法 |
关键洞察
- 外部先验优于纯局部建模:可学习字典将全局典型结构编码为外部先验,比扩大窗口更高效捕获全局依赖
- 类别信息作为结构化信号:利用注意力中的类别信息分组是一种无监督语义感知特征聚合策略
- 全局建模新范式:证明不依赖窗口划分也能在线性复杂度下实现全局依赖建模,为高分辨率图像处理提供新路径
2.10 视觉模型工程优化与部署加速
视频审核中台性能优化:多模型推理架构重构
优化效果
- 耗时降68%:多模型串行检测从280ms降至90ms,低于单模型原始耗时(CLIP 110ms)
- 耗时拆解:Java前处理
15ms + 内存传输5ms + GPU推理~70ms
三大性能瓶颈与重构策略
| 瓶颈 | 问题表现 | 重构策略 |
|---|---|---|
| IO传输冗余 | Base64膨胀33%致JVM GC;4服务各自拉图致网络延迟 | 全链路零拷贝:网关统一转byte[],内部RPC内存直传 |
| 重复前处理 | 同一1080P图被4模型分别Decode+Resize,Python GIL阻塞GPU | 前处理上浮:Decode+Resize统筹至Java侧,释放Python GIL |
| 幻灯片帧冗余 | 黑灰产视频含大量相同帧,重复进GPU推理致算力浪费 | pHash图染色去重:感知哈希+贪心分组,同组仅首帧推理 |
差异化输入规格
- 统一调度:ViT/CLIP 224×224,YOLO-cls/det 640×640,Java侧按需Resize
核心架构认知
- 打破传统边界:废弃"业务层发数据、AI层管处理"模式,全局重分配CPU/GPU职责
- 算力分工:GPU专注矩阵运算,IO/解码/缩放等CPU密集工作上浮到Java中台
- 全局优于并行:非核心计算从关键路径剥离,比单纯模型并行更具实效
3. 音频与3D生成
3.1 AI音频与语音合成
AI语音合成与音频大模型前沿
智东西(20260331) | 莫理(20260331) | 探索AGI(20260331) | AI产品银海(20260331) | 公子龙(20260401) | 智东西(20260402) | 昆仑万维集团(20260404) | 量子位(20260408) | 花叔(20260409) | 机器之心(20260410) | MiniMax 稀宇科技(20260410) | 优设AIGC(20260411) | AI大模型工场(20260415) | 阶跃星辰(20260416) | 高飞的电子替身(20260416) | 财联社AI daily(20260420) | 智东西(20260420) | 机器之心(20260422) | 智东西(20260424) | 硅星人Pro(20260427) | 赛博禅心(20260505) | APPSO(20260508) | AI寒武纪(20260508) | 有新Newin(20260508) | AI范儿(20260508) | "财联社AI daily"(20260508) | 量子位(20260508) | "AGI Hunt"(20260508) | 小互AI(20260508) | 阶跃星辰(20260508) | 阶跃星辰(20260509) | 机器之心(20260511) | 昆仑万维集团(20260511) | 智东西(20260512) | 智东西(20260512) | AI前线(20260512) | 赛博禅心(20260512) | AI产品阿颖(20260512) | 机器之心(20260512) | 前沿在线(20260512) | 新智元(20260512) | 新智元(20260512) | 新智元(20260512) | 昆仑万维集团(20260512) | Datawhale(20260518) | 深度学习与NLP(20260518) | 通义大模型(20260520) | 夕小瑶科技说(20260522) | PaperWeekly(20260525) | 机器之心(20260527) | AI寒武纪(20260529) | "Z Potentials"(20260603) | "Z Potentials"(20260604) | 智东西(20260604) | "Z Potentials"(20260605) | AI信息Gap(20260610) | 小互AI(20260610) | 机器之心(20260611) | AI科技评论(20260617) | 火山引擎(20260618) | 量子位(20260622) | 有机大橘子(20260623) | 火山引擎(20260623) | AI产品阿颖(20260623) | 夕小瑶科技说(20260623) | 摸鱼小李(20260626) | 小互AI(20260627) | 新智元(20260702) | 量子位(20260710) | 机器之心(20260710) | 智东西(20260710) | 新智元(20260710) | 通义大模型(20260715) | 阿里云开发者(20260715) | 阿里云(20260716) | 字节跳动Seed(20260720) | 阿里云(20260720) | 通义大模型(20260720) | 智东西(20260720) | 智东西(20260720) | 阿里云开发者(20260721)
- MusiCoT范式创新:将思维链引入音乐生成,从逐音符猜测升级为全局规划式创作,突破文本捷径依赖
- 模态差距破解:TextPro-SLM提出纯文本Token与韵律双流,仅1000小时数据将模态差距降至0.7%
音乐生成核心玩家与性能对比
| 模型/产品 | 核心性能/指标 | 技术亮点与壁垒 |
|---|---|---|
| Mureka V8/V9 | 2分钟生成两首歌,B端填补Suno空白 | MusiCoT框架,人声器乐双项超Suno/Udio |
| MiniMax音乐 | 首包延迟<20秒,支持100+乐器 | 极速跃升,拟真保留换气声等瑕疵 |
| 歌歌AI | 10秒生成3分钟分轨歌曲 | 原生双流架构解决汉语四声定调难题 |
| Suno | 48kHz声波建模,年run rate约3亿美元 | 小模型规模依赖RL对齐,获华纳正版授权 |
| LongCat-AudioDiT | SIM相似度0.818超SOTA | 3.5B模型直接在波形潜空间建模 |
| GPT-Realtime-2 | Big Bench Bench 96.6% | 128K上下文,原生音频推理与Agent调用 |
商业化进展与战略布局
| 产品 | 商业化数据 | 战略壁垒与布局 |
|---|---|---|
| Mureka | 日均生成150万首,服务超8000家企业 | 降本至1元/首,向“AI版Spotify”免费流播演进 |
| MiniMax | C端每日500首免费,API全量开放 | AI Agent化创作,开源Music Skills套件 |
| 歌歌AI | 百万用户与十几万付费,接入抖音等七大平台 | 采风非遗原声构建民乐独家数据护城河 |
| ElevenLabs | Music v2发布 | 提升多语言与快嘴说唱能力,全正版数据合法商用 |
技术瓶颈与演进挑战
- 副语言能力短板:动态情绪得分仅56.51,模型“像客服”问题显著
- 合成数据副作用:TTS合成数据超50%致自然度急剧下降,需自对齐框架干预
- 音频推理成AGI关键:四大推理路径明确,核心挑战是锚定连续细粒度声学证据
影眸科技:3D原生生成的非典型路径与商业化进展
- 路线对比:2D升3D因信息丢失导致多视角不一致,原生3D虽技术门槛高但无此瓶颈,质量领先一个量级
技术架构与核心壁垒
- 原生3D框架:基于CLAY(2024)与CAST(2025)框架全环节三维完成,彻底解决多视角不一致问题
- Test-time Scaling:将表征长度变为可学习伸缩变量,按对象复杂度自适应分配计算预算
- 12K原生贴图:全球首个12K原生3D贴图技术,冻结表面光场,利用稀疏体素VAE统一潜在空间
五档思考深度(Thinking Effort)
- Extreme-Low(~4s):快速原型与UGC
- Low(~9s):干净资产日常量产
- Medium(~20s):综合质量最优,等同上代40s效果
- High(~40s):3A游戏主角与影视级资产
- Extreme-High(~80s):雕塑级细节与收藏级3D打印
关键战略与产品迭代
- Production-ready原则:确立生产可用为商业生死线,第一代穹顶光场扫描设备因不兼容影视管线被否决
- 主动放弃流量:2D生成App Wand达160万用户后主动放弃,转向全品类3D资产生成
商业化与全球市场
- 客群结构:以B端企业级与Pro C端用户为主,覆盖影视、游戏、电商、具身智能等场景
- 财务表现:上线首月订阅用户与ARR环比增速均扩大400%,当前ARR达数千万美金
- B端收入:超同赛道所有竞争对手总和,续费率接近100%,海外营收占比70%-80%
- 标杆应用:服务英伟达等大厂,支撑Lowe's全球1750+门店数字孪生,打造超3万SKU且单模型成本严控1美元内
学术里程碑与融资团队
- 融资动态:一年半完成三轮融资,最新数亿元由凯辉基金与上海国投先导领投,光源资本任独家财务顾问
- 学术成绩:2025年凭CAST获SIGGRAPH最佳论文,同期获奖商业公司仅Google、Meta与影眸三家
- 科研团队:60人中算法团队每2人有1人获SIGGRAPH最佳论文或提名,约70%科研成果实现产品化
3.2 语音识别与转写
语音识别模型前沿:开源轻量化、多语种统一与极速推理
Z Potentials(20260330) | 智东西(20260403) | 通义大模型(20260420) | 财联社AI daily(20260420) | 阶跃星辰(20260424) | 智东西(20260424) | 阿里云(20260706) | 十字路口Crossing(20260610)
- 统一架构与LLM降维:头部ASR模型全面采用“声学编码器+LLM解码”架构,借LLM语义辅助识别,OpenASR榜单头部平均WER已压至5.6%区间
- LLM多Token预测:阶跃星辰首次将其引入ASR,吞吐提升400%,时延降60%,成本骤降至0.15元/小时
- 开源轻量化标杆:Cohere Transcribe仅20亿参数,以5.42的WER登顶Open ASR榜单,消费级GPU即可部署且达524倍实时速度
前沿模型基准与特性对比
| 模型 | 核心优势 | 性能/速度 |
|---|---|---|
| 阶跃 StepAudio 2.5 | LLM多Token预测,32K上下文端到端处理30分钟音频 | 吞吐提400%,500 tokens/s |
| 阿里 Fun-ASR 1.5 | 统一架构覆盖30种语言+7大方言,支持跨语种混合 | 方言CER相对降56.2% |
| 阿里 Fun-ASR-Flash | 离线转写极致准确率 | 错字率1.7%(全球第一) |
| 阿里 Fun-ASR-Realtime | 流式实时首字百毫秒级,融合上下文热词纠错 | 准确率逼近离线模型 |
| 微软 MAI-Transcribe-1 | FLEURS基准25种语言WER最低 | 批量转录速度提升2.5倍 |
| Cohere Transcribe | 20亿参数极致轻量,Apache 2.0开源 | WER 5.42,524倍实时 |
| Hojo-ASR-V1 | 编码器-适配器-LLM三段式架构结合Qwen3-4B | LibriSpeech Clean WER 1.74% |
工程落地与商业化挑战
- 极端场景鲁棒性待提升:实测发现,常规场景表现优异,但在二倍速、激烈争吵、无标点断句等极端场景下精度骤降
- 长上下文与流式场景突破:消除传统切片断裂感,影视飓风百小时直播累计成功转写132万字
- Voice AI成Agent核心入口:2025年Voice AI赛道融资约21亿美元,语音正从辅助交互升级为Agent核心上下文
- 初创团队全双工突围:Hojo积淀噪声/方言/打断等车载工程经验,千万量级设备落地并规划全双工模型
3.3 AI音频大模型架构与理解
音频大模型架构演进与能力评估
PaperWeekly(20260408) | 机器之心(20260508) | 极市平台(20260509) | 机器之心(20260520) | 极市平台(20260528) | 量子位(20260615) | 逛逛GitHub(20260622)
生成架构范式突破与极速推理
- 瓶颈验证(Omni2Sound):清华×Monash证明瓶颈在数据语义错位而非架构,仅用标准DiT即超越专家模型,获CVPR 2026 Highlight
- Raw波形直推(WavFlow):Meta×NEU绕过VAE/Codec,借全局缩放S=50在Raw空间直接生成音频,取得最优FDPaSST
- 极速生成(AudioX-Turbo):港科大×清华×Noiz AI用分布匹配蒸馏将50-200步压缩至4步推理,单卡RTF=0.02
数据工程精细化优于盲目扩参
- 高质量对齐降本:Omni2Sound构建47万对齐数据集SoundAtlas,多轮智能体流水线降本5倍,对齐质量超人类专家
- 指令微调扩充:AudioX-Turbo构建IF-caps-Pro达920万样本,比AudioCaps等主流开源数据集高出1至2个数量级
理解诊断:揭示"音频贡献缺失"
- 静音实验揭露盲区:用静音替换音频后准确率仍达49.8%,证明主流模型过度依赖文本而非真正听取音频
- 后训练新范式(ACF):首创音频贡献过滤法将数据强弱分离,基于此在MMAU达78.2%,获DCASE 2025冠军
音乐时序理解突破
- 双编码器融合(GaMMA):复旦×字节联合提出,解决全局语义压缩与局部时序保留的表征冲突问题
- 超越Gemini-3.0 Pro:在MusicBench时序任务上全面领先,和弦理解任务以75.0% vs 53.0%大幅胜出
核心洞察:语义对齐是下一代关键
- 生成端任务竞争与理解端音频贡献缺失,均指向底层数据与语义错位,精细化对齐与智能路由远优于规模暴力美学
3DGS光栅化流水线瓶颈与优化综述
- 背景:3DGS已成为实时3D重建的默认方案,但单场景高斯数据可达数百MB(甚至700MB),显存/带宽/功耗约束下系统稳定性面临挑战
- 核心观点:3DGS真正瓶颈不在表示本身,而在光栅化流水线(投影→分块→排序→α混合→梯度回传)
- "光栅化中心"三层分类体系:
- 表示与优化:高斯参数化、致密化、正则化、剪枝、压缩
- 光栅化流水线:α混合、特征场着色、硬件线程调度、可见性排序
- 场景驱动扩展:4D动态、超大规模、稀疏视角、无位姿、SLAM
- 五类核心瓶颈:投影误差(3D→2D精度损失)、可见性排序(深度排序开销随高斯数量增长)、透明度混合(逐像素α混合为主计算负载)、梯度传播(排序不可微影响训练稳定性)、存储膨胀(百万高斯参数导致显存占用过大)
- 五个优化方向:高斯表示压缩(剪枝/量化/向量量化)、流水线并行化(CUDA线程调度/瓦片分配)、可微排序改进(解决排序不可微)、动态场景扩展(4D时序高斯/形变物体)、大场景分区策略(城市级分块/按需加载)
- 关键洞察:不同应用场景(稀疏视角重建、抗锯齿、大场景渲染)共享相同底层瓶颈;优化应先定位瓶颈所在流水线环节,再选择对应改进方法
- 来源:港科大(广州)3DAgentWorld Lab、南洋理工、阿里巴巴、其域创新科技联合发布
3.4 3D场景与世界模型生成
3D场景生成产品与应用落地
量子位(20260409) | CVer(20260415) | 小互AI(20260427) | 智东西(20260427) | 曼话AI(20260508) | 机器之心(20260521) | CVer(20260712)
移动端世界模型探索
- 灵光App:接入LingBot-World-Fast,实现百毫秒级流式传输,单图秒级生成最长60秒3D世界(双摇杆交互)
- 画质权衡:保留近中远景层次与光影,但快速移动时清晰度下降,存在约1秒操控延迟
端侧3DGS轻量化渲染(Flux-GS)
- 极速体验:骁龙8 Gen 3实测达151 FPS(传统3DGS仅11 FPS),模型体积从478MB压缩至数MB
- 训练提效:RTX 4090训练耗时仅10-13分钟(传统需100-150分钟),室内PSNR达30.21dB
- 核心优化:高阶球谐蒸馏为一阶方向矩(省61%显存),结合MLP偏移预测与多视角协同稠密化
- 核心洞察:移动端3D重建瓶颈在显存带宽而非算法精度,"先学高阶后蒸馏"是轻量化的有效范式
3D影视创作工作流(TapNow)
- 空间稳定:首创"先建空间再做镜头",从单图生成可漫游3D场景,解决AI视频空间跳变问题
- 资产复用:支持局部修改联动全局更新与镜位复用,全流程跑通30秒AI科幻短片《太空惊魂》
多行业3D场景生成前沿
| 场景方向 | 代表框架 | 核心突破 | 数据指标 |
|---|---|---|---|
| 通用3D生成 | Marble 1.1/Plus | 双版本分离画质优化与空间扩展 | 单图3-5分钟生成360度场景 |
| 无边界城市 | Yo'City(北大) | 语言生成可扩展3D城市,三级层次规划 | 语义一致性及视觉质量优于Trellis等基线 |
| 医学容积重建 | GaussianPile | 切片式3DGS显式建模物理焦深 | Voxel Grid压缩16-26倍,约8分钟收敛 |
- 产业趋势:3D生成正从单一技术突破向影视工业化、医学成像、大尺度空间构建等多维场景落地
3D场景生成前沿方法:物理仿真与Agent闭环优化
机器之心(20260502) | 机器之心(20260508) | 机器之心(20260609) | DeepTech深科技(20260621)
核心趋势:从静态生成到物理闭环优化
- 范式跃迁:3D生成从静态模型升级为自带物理属性的交互式资产,打通“生成-优化-仿真训练”全链路
- 四大框架并行:PAT3D、Scenethesis、PhysForge、南洋理工方案分别在静力平衡、Agent闭环、关节运动学、生成端嵌入仿真方向取得突破
四大前沿框架技术对比
| 维度 | PAT3D | Scenethesis | PhysForge | 南洋理工方案 |
|---|---|---|---|---|
| 研发机构 | CMU等 (ICLR) | 英伟达&普渡 (ICLR) | 港大&腾讯 (ICML) | 南洋理工 |
| 核心机制 | 可微刚体仿真 | Agent自检修复闭环 | KVI关节注入去噪 | 生成内嵌物理仿真 |
| 解决痛点 | 语义约束下的静力平衡 | 室内外场景空间真实性 | 几何与运动学统一输出 | 资产无需后处理直接可用 |
核心机制与关键指标
- PAT3D:构建重力方向层级场景树,18个测试中模拟位移降为0,穿插比例为0,物理评分达88.5
- Scenethesis:Judge模块触发“生成-检查-修复”闭环,碰撞率从6.1%降至0.8%,场景通过率升至91%
- PhysForge:VLM输出层级物理蓝图,扩散模型联合生成外观与运动学参数,打破几何与物理后处理拼接壁垒
- 南洋理工:生成阶段直接嵌入物理仿真,输出资产可直接接入RoboTain执行训练任务
数据与标注体系(PhysForge)
- PhysDB资产库:基于15万Objaverse资产构建,覆盖家用、工业、车辆等七大类别
- 四层细粒度标注:涵盖场景尺度、部件材质、功能状态机及交互关节轴标记
- 应用价值:自带完整结构与运动学属性,可直接接入Unity等引擎执行复杂操作
3.5 3D生成与空间计算
3D世界生成技术突破与产品进展
新智元(20260405) | 机器之心(20260408) | AI有道(20260410) | 腾讯混元(20260416) | 量子位(20260416) | 财联社AI daily(20260416) | AI前线(20260416) | 智东西(20260416) | 智东西(20260416) | 钛媒体AGI(20260416) | 量子位(20260417) | APPSO(20260417) | 机器之心(20260418) | 袋鼠帝AI客栈(20260418) | JackCui(20260418) | 特工宇宙(20260424) | 新智元(20260426) | 机器之心(20260501) | 沃垠AI(20260506) | CVer(20260510) | DeepTech深科技(20260513) | 机器之心(20260514) | 量子位(20260416) | 机器之心(20260521) | 极市平台(20260521) | 量子位(20260527) | 新智元(20260608) | 新智元(20260617) | 极市平台(20260624) | 新智元(20260706)
- 近期大厂密集发布:腾讯、阿里、英伟达、魔芯、高德等同期推出3D世界模型,赛道进入爆发期
核心产品与技术指标对比
| 产品 | 核心特点与优势 | 性能/生成耗时 |
|---|---|---|
| 腾讯 HY-World 2.0 | 首个多模态开源模型,支持单图直出多格式3D资产并对接UE | 场景一致性94%,耗时约1-12分钟 |
| 阿里 HappyOyster | 主动式实时交互,无需重置即可响应声画同步指令 | 导演模式3分钟/漫游1分钟 |
| 英伟达 Lyra 2.0 | 单图输入无限延展,免费开源,可直接用于机器人训练 | 4步去噪蒸馏生成,分辨率832×480 |
| World Labs Marble | 支持2D/3D双输入及全景编辑,引入分层定价 | 生成3-10分钟,消耗1500 credits |
| 魔芯 KOKONI-World | 纯隐式数据驱动(14B参数),少数已有实际收入团队 | 支持2000帧记忆,1080P实时交互 |
| 高德 ABot-Earth 0.5 | 单张卫星图生成原生3DGS城市,成本降至1% | 10分钟生成,效率提升1000倍 |
关键底层技术突破
- VGGT架构与原生3D编辑:实现O(1)恒定显存无限长序列重建,原生3D编辑较传统加速120倍
- 物理仿真引入:PAT3D首创闭环优化,物理合理性达88.5;高德DreamX-World首创视锥重叠几何检索解决转头穿帮
- 流式生成与稳定性:HappyOyster采用持续状态复用防遗忘;MagicWorld以光流约束解决误差累积,Overall Score达0.8547
- 密度控制可学习化:VAST与清华提出DeG范式,所需高斯数量减少50%以上
4D生成终极形态与AI涌现能力
- 顶刊TPAMI指出4D是终极形态,受限于4D数据近乎为零,2D大模型先验是高维生成的核心语义引擎
- Fable 5仅用1600行代码生成完整水下曼哈顿场景,展现AI空间重构与基础物理理解的涌现能力
商业化落地与交互式影游探索
- LinearGame与Yoroll平台验证AI影游闭环:仅需一句话提示,15分钟内可自动生成包含交互逻辑的3D可玩空间或完整ARPG游戏
3.6 3D资产骨骼绑定与动画化生成
骨骼绑定与动画化技术体系
CVer(20260403) | 机器之心(20260420) | 量子位(20260422) | 新智元(20260422) | 具身智能之心(20260612) | CVer(20260506)
- 统一生成取代串行:几何、骨架、蒙皮联合优化避免误差累积,彻底消除AIGC资产穿模与脱臼痛点,实现“生成即绑定”
- 拓扑泛化关键:关节数量解耦特征表达,使同一套算法统一处理角色、动物与机械臂等任意拓扑结构
核心模型与技术对比
| 模型 | 核心机制 | 输入 | 输出与工业价值 |
|---|---|---|---|
| AniGen (SIGGRAPH) | S³ Fields三场统一,置信度防脱臼 | 单图 | 生成即绑定,直导Maya/UE,覆盖多类别 |
| TokenRig (清华&VAST) | SkinTokens离散化+GRPO强化学习 | 网格 | 蒙皮准确率提升98%~133%,达生产级精度 |
| MonoArt (南洋理工) | 四阶段渐进式推理,3D空间隔离部件 | 单图(20.5s) | 直入IsaacSim机械臂仿真,提升稳定性 |
| DancingBox (CHI提名) | SAM2+CoTracker3+π3 三模型协同 | 手机RGB视频 | 精准估计3D包围盒运动,支持新手创作 |
| SimArt (SIGGRAPH) | 聚焦3D铰链物体生成瓶颈 | 仅需30% Token | 高效打破算力限制 |
关键技术突破
- AniGen防脱臼:置信度衰减机制自动剔除骨骼歧义区域噪声,底层解决脱臼与穿模,覆盖柔性植物与非真实角色
- TokenRig统一自回归:单Transformer顺序生成骨架与蒙皮,GRPO无标注迭代提升17%~22%,形变平滑
- MonoArt特征隔离:运动推理均在3D空间,triplet loss拉开部件特征距离提升稳定性
- DancingBox动捕生成:PointNet保证特征顺序无关,ControlNet向MDM注入包围盒控制信号
生态与开源
- 全链路开源:AniGen提供GitHub源码与HuggingFace在线Demo体验,MonoArt支持导入IsaacSim
3.7 单图/文生3D模型资产与商业化
单图/文生3D模型:产品化能力与技术突破
AI信息Gap(20260401) | AI产品银海(20260413) | 趣谈AI(20260413) | 字节跳动Seed(20260423) | 火山引擎(20260423) | "财联社AI daily"(20260423) | 火山引擎(20260424) | 探索AGI(20260427) | 趣谈AI(20260518) | 优设AIGC(20260604) | 量子位(20260605) | 智能涌现(20260623) | "Z Potentials"(20260623) | 新智元(20260624) | APPSO(20260625) | 量子位(20260625) | 卡尔的AI沃茨(20260626) | 深度学习与NLP(20260624) | 硅星人Pro(20260629) | "Founder Park"(20260629) | AI产品银海(20260630) | 硅星人Pro(20260723)
- Rodin Gen-2.5原生3D架构:影眸核心产品采用3D原生DiT架构,摒弃传统2D升维。全球首个千万面级3D生成模型,最快4秒出百万面,80秒出千万面,产出高精度母版向下派生轻量版本
- 12K原生PBR贴图:材质突破传统投影限制,从模型原生“长出”,实现360度无死角物理材质覆盖,还原毛孔级微结构,几何与材质保真度超越实景扫描
- Test-time Scaling引入:首次将类LLM“先思考再生成”范式引入3D,根据复杂度自适应分配算力,提供
4秒到80秒五档思考深度 - 智能拆件与连接:支持语义级结构理解自动拆分独立零件,并自动生成榫卯、铆钉、球关节等连接件,解决多色多材质3D打印痛点
主流生成模型对比
| 模型/平台 | 核心优势 | 技术特点与精度 |
|---|---|---|
| 影眸 Rodin Gen-2.5 | 千万面母版,12K贴图 | 3D原生DiT,Test-time Scaling |
| 字节 Seed3D 2.0 | 盲测偏好率超69% | MoE+VLM先验,支持关节化建模 |
| 火山方舟 Hitem3D 2.0 | 直出3D打印STL | 1536³分辨率,最高200万面 |
| Neural4D 2.5 | 一站式模型到视频 | 最高100万面,AI自动生成PBR |
| HiCAD 2.0 | 自然语言参数化建模 | 生成可编辑CAD代码,浏览器端渲染 |
商业化与产业落地
- 影眸商业化爆发:Rodin上线首月订阅与ARR环比增超400%,B端营收领跑全赛道,近千万全球用户,海外营收占80%,B端续费近100%
- 资本与生态双重验证:一年完成三轮数亿元融资(凯辉、字节、美团等跟投)。作为英伟达唯一入选初创产品,深度接入Unity、Canva、Figma等专业工具链
- 全链路工作流成型:打通“AI生图→多视角→3D模型→智能拆件→连接件生成→排盘打印”闭环,支持零素材起步
- 跨领域应用延伸:从游戏/影视资产制作,延伸至具身智能仿真训练、电商/AR展示及工业3D打印代工(约0.35元/克)
- 底层加速优化:Fast-SAM3D框架摒弃统一跳步,将算力精准分配至边缘高熵区域,场景级生成时间从462秒降至230秒
3.8 AI 3D 商业化生态与行业演进
AI 3D 商业化标杆与行业演进
Z Potentials(20260410) | 硅星人Pro(20260423) | 机器之心(20260427) | 量子位(20260427) | 硅星人Pro(20260610) | 量子位(20260611) | 深度学习与NLP(20260611) | 硅星人Pro(20260702) | 第一新声(20260708) | 机器之心(20260714) | 智东西(20260720) | 硅星人Pro(20260721)
赛道演变与竞争格局
- 估值跃升:赛道最大融资额两年增超250倍(2024年Kaedim 1500万至2026年Meshy近4亿美元)
- 头部分化:Luma AI放弃3D转做视频,全球曾仅极少数团队专注商业化
- 范式转移:竞争焦点从单一模型质量转向全链路综合交付与入口之争
标杆企业:Meshy的商业验证
| 核心维度 | 数据表现 | 行业意义 |
|---|---|---|
| 融资与估值 | 近4亿美元B轮,投后超百亿,IDG/经纬等领投 | 刷新赛道最大单笔融资纪录 |
| 营收与毛利 | ARR破4000万美元(年增超12倍),毛利85% | 接近成熟SaaS,成赛道罕见盈利样本 |
| 极致生产效率 | 单模型2分钟/1美元,切片通过率97% | 较传统外包两周/千美元实现千倍跃升 |
| 客户与规模 | 注册超1200万,生成破1亿模型,全球前十科技巨头半数为客户 | 规模化采用并渗透主流游戏工业 |
- 底层根基:清华姚班与MIT博士胡渊鸣创立,主导开源图形库「太极」
- 终极愿景:发布全球首个3D Agent,通过多轮对话自动拆解任务并适配全链路导出
多维度产业探索与竞品路线
- VAST:获超10亿元A3轮融资,吉利与头部游戏厂入场,攻坚资产Agent化
- 极顶:成鸿蒙首个3D大模型AI原生应用,实现移动端秒级生成直连打印
- Viggle:摒弃纯视频路线采用JST架构,4个月Discord用户即破450万
硬件革新与生态飞轮重构
- 资本破局:快造完成10亿元C轮,U1配置4独立工具头,效率提升5倍且耗材锐减80%
- 四层飞轮:构建“硬件入口→耗材复购→内容社区→AI降门槛”闭环,重构商业逻辑
3.9 结构化3D生成:从内容生成到离散组合优化
LegoACE:自回归范式驱动的LEGO结构化生成引擎
- 核心突破:LegoACE(SIGGRAPH Asia 2025)由VAST联合浙大、清华、KAUST、港大提出,首创隐式学习砖块组合规则,彻底摆脱人工标注连接点。
- 技术范式:采用LEGO Native Tokenization,将砖块编码为位置、旋转、类型三个token,基于decoder-only Transformer按空间顺序自回归生成。
- 数据支撑:构建LegoVerse数据集,包含55,000个模型、9,314种砖块类型(含车轮、门窗等不规则专用件)、48种旋转变换,规模远超以往数据集。
- 双模态生成:支持文字(CLIP提取语义)与多视角法线图(DINOv2提取特征)双模态输入,端到端直接输出无需中间格式转换。
- 训练策略:随机截取子序列渲染法线图做数据增强,采用DPO算法以Chamfer Distance为偏好标准进行对齐优化。
- 范式演进:不显式编码连接关系而由模型自主学习组合规律,标志着从传统内容生成向离散结构组合优化的跨越。
传统LEGO生成方法对比:
| 方法 | 核心思路 | 核心瓶颈 |
|---|---|---|
| 体素建模 | 转为带连接关系的三维体素 | 需人工标注连接点,扩展性差 |
| BrickGPT | 将LEGO序列化为文本微调LLM | 仅支持规则方块,难处理不规则件 |
4. 视频生成商业化与生态
4.1 AI视频商业化应用
AI视频商业化全景:营收突破与市场验证
探索AGI(20260330) | 量子位(20260403) | 机器之心(20260403) | AI信息Gap(20260406) | 量子位(20260409) | 脑极体(20260410) | 硅星人Pro(20260413) | 雷峰网(20260421) | 智能涌现(20260424) | 可灵AI(20260424) | 硅基观察Pro(20260424) | 可灵AI(20260425) | 可灵AI(20260425) | 莫理(20260426) | AI信息Gap(20260428) | 硅星人Pro(20260501) | AI寒武纪(20260504) | 小互AI(20260506) | 数智前线(20260506) | 花叔(20260506) | 智能涌现(20260507) | 量子位(20260507) | 硅星人Pro(20260508) | AI产品银海(20260511) | 莫理(20260512) | 智能涌现(20260512) | AI寒武纪(20260513) | 优设AIGC(20260513) | 船长AI视界(20260513) | AI异类弗兰克(20260514) | 路人甲TM(20260514) | 量子位(20260516) | 新智元(20260517) | 网罗灯下黑(20260517) | 小互AI(20260518) | 花叔(20260517) | 公子龙(20260518) | 沃垠AI(20260518) | 莫理(20260518) | 优设AIGC(20260518) | AI科技评论(20260519) | AI异类弗兰克(20260519) | APPSO(20260520) | 优设AIGC(20260520) | 新智元(20260520) | AI新榜(20260520) | "财联社AI daily"(20260520) | 开源AI项目落地(20260520) | 火山引擎(20260521) | 划重点KeyPoints(20260521) | "Z Potentials"(20260521) | 阿里云(20260521) | 量子位(20260522) | 商汤科技SenseTime(20260522) | 百度文心(20260522) | 钛媒体AGI(20260523) | 莫理(20260526) | 甲木未来派(20260527) | 莫理(20260527) | 花叔(20260527) | 优设AIGC(20260528) | 十字路口Crossing(20260528) | 路人甲TM(20260602) | 机器之心(20260604) | AI产品阿颖(20260609) | 莫理(20260610) | AI新榜(20260610) | 量子位(20260611) | 脑极体(20260611) | 袋鼠帝AI客栈(20260611) | 有新Newin(20260611) | 优设AIGC(20260612) | 路人甲TM(20260612) | 莫理(20260614) | 硅星人Pro(20260617) | 昆仑万维集团(20260623) | "AGI Hunt"(20260626) | "Z Potentials"(20260627) | 光锥智能(20260629) | 甲子光年(20260629) | 硅星人Pro(20260629) | 量子位(20260629) | AI寒武纪(20260629) | 逛逛GitHub(20260630) | 阿枫科技(20260701) | 沃垠AI(20260702) | "Z Potentials"(20260702) | 可灵AI(20260703) | 量子位(20260706) | AI新榜(20260706) | 智能涌现(20260707) | AI新榜(20260707) | 老金带你玩AI(20260708) | 可灵AI(20260709) | 优设AIGC(20260712) | AIGC开放社区(20260719) | 第一新声(20260720)
- 高投入特效倒挂:总投资3.8亿近半砸向特效(1200+镜头),却因失去重力感遭批;反观《少林足球》威亚加粗糙CG因叙事热血更显真实
- 资源错配致奇观失灵:群像缺乏生活困境铺垫致视觉沦为炫技,口碑两极本质是观众评价标尺从电影本身偏移到记忆投射
全球AI视频竞争格局与商业指标
- 中美路线分化:硅谷转向底层推理单点收缩(Sora算力承压下载大跌66%),国内加速商业化落地与工作流整合
- 国内头部吸金:可灵ARR超3亿美元拟分拆IPO,字节Seedance传闻年化收入达20亿,毛利率70%-90%
| 产品 | 商业营收与进展 | 产能突破与降本成效 |
|---|---|---|
| Seedance | 强制千万年框,大客单充5000万 | 生成约0.38元/秒,占国内80%日消耗 |
| 可灵AI | 70%收入来自海外 | 4K原生直出交付级,单条成本12-36元 |
| LibTV | 上线一月单日营收破百万美金 | 获超300家B端短剧客户标配使用 |
| DramaWave | 6亿美元ARR,超1亿MAU | AI月产能从20部真人提升至200+部AI剧 |
| AniShort | 获近亿元赛道最大单笔融资 | 付费转化率64.8%,制作成本降低85% |
工作流重塑与商业化破局
- 演进三阶段:2024模型秀场拼生成→2025平台接入嵌入工作流→2026业务深度整合
- Agent+画布成标配:进化至画布内透明决策,支持角色三视图锁定、九宫格分镜推演与节点级精控
- 极致产能释放:百万字剧本3分钟100%准确拆解,短剧成本从50万降至3-5万,效率提升超800%
- 一站式平台爆发:火山剧创等实现剧本到成片自动化,Lumen Flow支持10万字一键生成100集
- 同质化致低爆款率:商业化瓶颈在场景而非纯技术,AI漫剧爆款率仅约0.1%,超九成短剧公司亏损
- 重构商业模式:从单一卖积分向技术+服务、按效果付费、分佣转移以深度绑定客户
- Know-How成新壁垒:底层模型趋同后,导演思维与视听语言等专家知识成为差异化核心
4.2 视频创作生态与行业动态
AI视频创作生态演进与工业化全景
哩布哩布AI(20260330) | AI新榜(20260330) | AI新榜(20260331) | 可灵AI(20260401) | 机器之心(20260403) | 智能涌现(20260403) | AI新榜(20260404) | 前沿在线(20260404) | 量子位(20260404) | AI故事计划(20260407) | APPSO(20260408) | 可灵AI(20260408) | AI新榜(20260413) | 硅星人Pro(20260414) | AI新榜(20260414) | APPSO(20260422) | "MiniMax 稀宇科技"(20260423) | 钛媒体AGI(20260423) | 可灵AI(20260428) | AI新榜(20260430) | 量子位(20260501) | AI新榜(20260507) | APPSO(20260512) | AI新榜(20260513) | 硅星人Pro(20260514) | 雷峰网(20260514) | 硅星人Pro(20260515) | 可灵AI(20260518) | AI前线(20260518) | InfoQ(20260518) | AI新榜(20260519) | 沃垠AI(20260521) | 优设AIGC(20260521) | 路人甲TM(20260522) | 优设AIGC(20260524) | AI新榜(20260526) | AI新榜(20260527) | 公子龙(20260531) | 网罗灯下黑(20260531) | 优设AIGC(20260601) | AI产品阿颖(20260601) | JackCui(20260601) | 卡尔的AI沃茨(20260601) | 沃垠AI(20260601) | AI产品银海(20260602) | AI新榜(20260605) | AI产品银海(20260605) | 量子位(20260610) | AI新榜(20260612) | 网罗灯下黑(20260615) | 莫理(20260615) | AI产品银海(20260615) | 沃垠AI(20260616) | 阿枫科技(20260616) | AI异类弗兰克(20260617) | AI故事计划(20260618) | 硅星人Pro(20260619) | "财联社AI daily"(20260622) | APPSO(20260623) | 曼话AI(20260623) | 优设AIGC(20260624) | 钛媒体AGI(20260628) | 新智元(20260628) | 硅星人Pro(20260630) | AI新榜(20260701) | 可灵AI(20260702) | 苍何(20260703) | 光锥智能(20260703) | 莫理(20260704) | 优设AIGC(20260706) | 甲子光年(20260720)
爆款案例与情感共鸣
- 叙事驱动情感共鸣:《纸手机》3天/3人制作全网曝光超2亿,AI内容完成从技术展示向大众共情的跨越
- 低成本个人验证:《丧尸清道夫》约3000元/10天制作获超千万播放,单人单兵产出影视级内容路径已跑通
- AI IP孵化提速:二创IP“咕咕嘎嘎”30天播放超15亿,IP孵化周期从数年压缩至数月,周边迅速变现
成本断崖与工业化拐点
- 生产门槛降级:传统数十人/数十万的影视制作,AI赋能下降至1-3人/数天/1-3.4万元
- 微短剧工业化:2026年Q1新上线微短剧中AI制作占比破95%,低成本促使高产测试,核心转向情绪锚点与爽点密度
技术突破与可控性
- 原生画质破局:可灵推出原生4K直出无需超分,群像细节与物理流体达影视级标准
- 3D导演台:以“先摆后生成”替代盲目提示词,3D画布拖拽精调机位与站位,有效解决空间穿帮并降低废片率
- 角色一致性:提取角色三视图(正/侧/背)及场景线稿轨迹作为参考,配合节点化画布(如MVLAND),实现从分镜到剪辑闭环
商业格局与大厂之战
| 维度 | 代表动态 | 关键数据/影响 |
|---|---|---|
| 字节跳动 | Seedance+红果+番茄 | 720P生成降至0.16-0.5元/秒,构建算力到变现闭环 |
| 快手可灵 | 分拆冲刺IPO | 估值超180亿美元,海外收入占比近70%,每赚1元烧1.73元 |
| 长视频平台 | 爱优腾芒全面入局 | 漫剧成本降50%-90%,产能翻5倍 |
| 产业利润 | 基础设施收网 | 利润重心转向卖算力与流量,爆款内容变现仍存断层 |
生态演进与创作演进
- 内容反向反哺:真人COS AI水果剧及“华强买瓜”二创破亿播放,形成“AI生成→真人模仿”模因循环
- 系列化IP成主流:告别单条爆款,固定角色与世界观连载成竞争核心,观众焦点转向剧情讨论
- 核心壁垒转移:技术操作经验贬值,导演思维、人生阅历与审美成创作者唯一不可替代的护城河
4.3 AI影视信任危机与行业阵痛
AI影视信任危机、合规治理与行业门槛重塑
财联社AI daily(20260402) | 阑夕(20260401) | 钛媒体AGI(20260420) | 光子星球(20260507) | 优设AIGC(20260519)
- 监管常态化与源头追责:广电总局统筹部署,微信3月清理3800条AI魔改视频(第六期公告);红果Q1下架1718部违规漫剧,从被动响应升级为对出品方主动追责。
- 侵权认定面临客观困境:出品方微调角色规避审核,平台对知名IP侵权查处快,但缺乏普通人肖像库,主观侵权高度依赖权利人举证。
- “AI艺人库”引爆信任危机:爱奇艺“纳逗Pro意向库”被误读为艺人已授权,张若昀等紧急辟谣维权,折射出行业对AI替代真人表演的深层焦虑。
- 平台倒逼供给侧精品化:红果取消中小方保底转纯分成,构建“番茄IP→AI模型→红果分发”闭环;爱奇艺转型社交媒体,AI制作成本已降至传统10%。
- AI重构短剧生产管线:传统多工种协同被“抽卡师”概率筛选取代(以大学生为主),复杂镜头仍频发跳切穿帮,核心能力转向前置剪辑。
- 人文创作凸显AI短板:《给阿嬷的情书》以1400万成本斩获豆瓣9.1分、预测票房破15亿,证明真实生活沉淀的情感细节是AI模式化输出的核心盲区。
红果短剧分成系数分层调整
| 内容类型 | 调整前系数 | 调整后系数 |
|---|---|---|
| AI仿真人短剧 | 60 | 40 |
| 3D动画漫剧 | 50 | 40 |
| 2D动画漫剧 | 40 | 40 |
AI生成与人文创作的核心差异
| 维度 | AI生成现状 | 人文创作(《给阿嬷的情书》) |
|---|---|---|
| 情感来源 | 数据训练的模式化输出 | 创作者真实生活体验的沉淀 |
| 文化细节 | 缺乏地方文化内在理解 | 潮汕方言、侨批文化深度嵌入 |
| 情绪节奏 | 依赖算法优化感官刺激 | 人工克制,删减精彩片段防透支 |
| 成本与表现 | 极低成本但细节频发失真 | 1400万成本,豆瓣9.1分逆袭15亿 |
AI+医学循证的口腔护理产品矩阵与行业标准化
- 市场背景与核心理念:2024年口腔市场近2500亿(预计2030破4300亿),但成年人牙周健康率仅16.1%且存在「重治疗轻预防」倒挂格局;usmile以「医学循证+主动预防」切入,手握750余项专利
- PrevenTech™预防科技体系:覆盖检测、功效、行为三大维度,构建含清洁、美白、护龈的全场景口腔护理矩阵
- 核心产品与技术参数对比
| 产品 | 核心定位 | 关键技术 | 核心参数与实证 |
|---|---|---|---|
| Y50 | AI陪伴刷牙 | 巨浪2.0+AI虚拟角色 | 60°扫幅,语音导航漏刷区,早晚双效动态调节力度 |
| P70 | 智能动力旗舰 | 巨浪3.0(联合哈工大) | 560gf·cm峰值扭矩,14800Gs永磁铁(超主流新能源车),较P10提升4.53倍 |
| L30 | 冷光美白组合 | 410nm冷光+Oxy-white活氧 | 区别院线460nm(能量更强不伤牙釉质),28天牙釉质无差异,1天媲美院线美白 |
| C50 | 台式级冲牙器 | 高速涡流扩容专利 | 一杯水实现台式机冲洗时长,获ADA及MDSAP认证 |
- Y50 AI陪伴机制:内置可自定义的虚拟陪伴角色,利用「新鲜感维持习惯」解决用户刷不满两分钟的依从性痛点
- L30院线级美白下探:采用双管分仓设计的活氧牙膏(挤出瞬间激活PMS成分),联合中山大学实证安全性,推动品类边界消融
- 新国标T/CHEAA 0009.4-2024:首次纳入磨尖率(≥90%)、植毛块牢固度(≥50N)、震手位移(≤0.03mm)等硬指标,推动行业从参数竞争转向功效竞争
4.4 AI视频电商带货实操工作流与模型参数化
AI视频电商带货实操:工具选型、工作流闭环与功能实测
饼干哥哥AGI(20260415) | 饼干哥哥AGI(20260427) | 苍何(20260515) | APPSO(20260515) | 袋鼠帝AI客栈(20260527) | 卡尔的AI沃茨(20260615) | 特工宇宙(20260615) | 沃垠AI(20260615) | 船长AI视界(20260615) | AIZ小朱(20260615) | 硅星人Pro(20260617) | 优设AIGC(20260613)
商业化跑量与成本控制
- 极低成本爆单:AI种草视频单条成本约3-35元,矩阵铺量+爆款复刻,单日GMV超5万美金
- 情绪钩子为王:用户零预期刷内容,产品一致性达60分即可,核心精力投入3秒痛点可视化
- 模型按需选型:无最强模型,Veo 3画质最高但废片率80%,Sora 2接近iPhone实拍质感
视频模型选型与API整合
| 场景 | 推荐模型 | 单条成本 | 核心优势与局限 |
|---|---|---|---|
| 投流素材 | Grok | ¥0.5 | 量大管饱 |
| 种草UGC | Sora 2 | ¥3 | 接近iPhone实拍质感 |
| 品牌宣传 | Veo 3 | ¥15 | 画质最高,但废片率达80% |
| 故事叙事 | Seedance 2.0 | — | 转场自然,提示词需极简 |
- API打包整合:火山引擎Agent Plan将文、图、视频打包为单一API调用,适合多轮规划与自动化开发
OiiOii 2.0的Agent自动化与资产沉淀
- 一句话生成短片:内置7个Agent(编剧/角色/场景等)自动接力,端到端生成215秒短片并支持局部精准微调
- 自动拉片复刻:2-3分钟自动拆解视频18个维度生成报告,替换元素出新片,完成度约90%
- 角色资产锁死:自动生成Face ID与三视图存库,1分钟6分镜角色外观全程锁定,解决换脸痛点
- Skill库:内置电商广告、自媒体等模板,按行业分类自动读取领域资源,对话式出片
导演思维提示词与运镜控制
- 核心认知:摒弃描述画面,采用给摄影师下指令,越像导演指令越出电影感
- 导演六层框架:镜头类型+主体轨迹+环境反馈+材质互动+光影氛围+技术规格协同控制
- Image2五层法:定角色、设物理场景、明画幅构图、精确文字字体、仅设单一主风格并适度留白
- Seedance极简原则:提示词上限2000字,过长易致跟图与听文冲突;爆款交Gemini逐帧分析复用
- 零成本轨迹运镜:生图结合手绘轨迹,经AI解析渲染四步即可免费实现精准运镜控制
4.5 视频虚拟换衣(VVT)技术前沿
KeyTailor:关键帧驱动的视频虚拟换衣新SOTA(CVPR 2026)
2026顶会VVT前沿:关键帧驱动、免训练修复与4D自由视角的范式跃迁
核心架构设计
- KeyTailor(CVPR 2026):关键帧驱动,纯LoRA融合特征,不修改DiT架构实现视频换衣
- PG-VTON(CVPR 2026):重构为受控修复,基于冻结FLUX.1-Fill单次推理,零训练零微调
- TryOnCrafter(ECCV 2026):2D试衣先验蒸馏至3DGS人体,结合SMPL-X与背景点云对齐
推理控制与核心策略
- KeyTailor:IKS模块筛选高信息锚点;GDDE注入动态褶皱;CBDO双分支融合全局与局部背景
- PG-VTON:PIP在扩散早期贴入服装patch锚定身份;RAA增强注意力层对参考服细节感知
- TryOnCrafter:基于Wan2.1-I2V-14B,结合4D渲染先验、CRA适配器与多模态语义补全
性能与计算开销对比
| 方案 | 核心指标 | 计算开销与数据集 |
|---|---|---|
| KeyTailor | VFID 7.53, SSIM 0.91 | ViT-HD(810×1080, 1.5万样本) |
| PG-VTON | Street场景FID 21.03 | 零训练(基于FLUX.1-Fill) |
| TryOnCrafter | 360°环绕等自由视角 | 代理构建38.9s,重渲染仅需14.3s |
复用性与数据基准
- 轨迹复用:TryOnCrafter更换轨迹重渲染仅需14.3s/20.3GB,无需重建代理
- 数据基准:KeyTailor配套ViT-HD含1.5万个高清视频样本,覆盖全品类服装
4.6 交互式世界模型与实时多人生成
Agora-1:首个多人实时交互世界模型与仿真-渲染解耦架构
仿真-渲染解耦架构(Agora-1)
- 双函数设计:仿真层基于《GoldenEye 007》内部状态学习动态转移,渲染层(DiT)以共享状态生成画面,确保多人一致性。
- 底层可控:共享状态可被直接操控,支持生成全新关卡并完整保留源游戏动态体验。
- 早期验证:支持网页端4人实时FPS交互(致敬N64),概念验证意义重大,但当前画质模糊、延迟高。
因果生成范式与双脑协同(LingBot-World 2.0)
- MoBA混合注意力:替代传统双向注意力,当前帧仅依赖历史上下文,从根本解决长时自回归误差累积问题。
- 实时推理优化:通过consistency distillation与DMD将多步扩散压缩为少步生成,结合异步VAE解码大幅降低延迟。
- Agentic双脑驱动:VLM充当大脑观察提议事件,视频模型充当小脑转化画面,实现世界主动自演化。
多人生成技术路线对比
| 方案 | 核心思路 | 关键局限 |
|---|---|---|
| Multiverse | 分屏图像粗暴拼接 | 一致性差 |
| Solaris | 序列维度沿自回归展开拼接 | 上下文爆炸,扩展性极差 |
| Agora-1 | 共享状态驱动,仿真与渲染解耦 | 概念验证期,画质与操控延迟粗糙 |
核心产品形态与产业背景
| 模型/产品 | 核心特性与参数 | 研发主体与状态 |
|---|---|---|
| Agora-1 | 网页端4人实时FPS交互 | Odyssey(总融资2700万美元),早期验证阶段 |
| Starchild-1 | 视觉与听觉实时同步多模态生成 | Odyssey同日发布,处于早期演示阶段 |
| LingBot-World 2.0 | 720p/60fps小时级稳定输出,单卡运行1.3B | 蚂蚁灵波,非商用开源发布 |
4.7 AI长视频广告制作工作流:资产前置与分段生成方法论
品牌广告AI长视频全链路实操:资产前置→分镜生成→剪辑拼装
核心工作流:单次AI生成上限约15秒→资产前置→分镜生成→剪辑转场→后期配音。案例:Laura Geller口红广告(115秒,4个年龄段女性,全AI无实拍生成)
资产前置体系(跨段一致性的根基)
| 资产 | 必备产出 | 核心目的 |
|---|---|---|
| 人物 | 全身三视图+半身+3表情+服装细节图 | 锁住跨段人脸与穿着一致性 |
| 场景 | 全/中/近三景空镜+360°环视视频 | 统一光线色调与空间关系 |
| 产品 | 正/侧/45°/使用态/logo特写五类图 | 确保品牌露出准确无偏差 |
| 音色 | 30秒样本+音色ID存档 | 全片统一不可中途更换 |
分镜生成三策略(按镜头类型灵活选用)
| 方式 | 适用场景 | 要点提示 |
|---|---|---|
| 纯提示词 | 开场/全新场景 | 提示词须含主体+行为+景别+运镜+禁止项 |
| 分镜模式 | 多镜头快切 | 镜头间无需强连续,独立出片即可 |
| 尾帧衔接 | 剧情连续段 | 提取前段尾帧续写,确保动作顺接 |
剪辑转场规则(按场景逻辑匹配,非一刀切)
| 场景关系 | 推荐转场 | 参数控制 |
|---|---|---|
| 同场景近景别 | 硬切 | 无需特效 |
| 跨场景转换 | 叠化 | ≤0.5秒 |
| 情绪转折点 | 闪白/闪黑 | 0.2-0.3秒 |
| 明显拼接断档 | 补拍过渡镜头 | 禁靠特效硬掩盖 |
后期配音铁律
- 配音顺序:拼素材→修衔接→加字幕→最后配音频,提前配音必返工
- 混音层级:音量控制为旁白>对白>环境音>BGM,BGM须压至旁白30%以下
- 工具推荐:出图首选Image2(质量)或豆包(试错);视频生成用Seedance 2.0或Veo 3.1
4.8 第一人称POV AI短视频:爆款逻辑与制作流水线
情绪代入机制与三步复刻法
情绪代入机制
- 私人记录漏洞:低清晃动的第一人称画面被大脑归类为私人记忆,绕过理性防御实现瞬间共情
- 决定因素转移:技术达“不出戏”阈值后,爆款核心从工具参数转向创作者的故事嗅觉与类型选择
- 四象限击穿:题材集中于亲情、离别、重逢、冒险,越日常越能调动观众已有记忆
- 逆向差异化:避开赛博朋克/科幻扎堆,切入美式青春校园(如《和讨厌的人灵魂互换了》全网超1500万播放)
- 提示词表演控制:为角色加“自信”等标签实现“皮囊不变、灵魂改变”,单条提示词可达数千字
- 评论区即矿场:提取网友真实经历喂给AI,情绪质感远优于纯虚构
五大核心赛道与爆款数据
| 赛道 | 爆款案例 | 核心数据 |
|---|---|---|
| 青春校园 | 《和讨厌的人灵魂互换了》 | 全网播放超1500万 |
| 未来科幻 | 《零号档案》系列 | 总播放超1.5亿 |
| 恐怖悬疑 | 《禁忌家园》 | B站合集超2000万播放 |
| 视角反转 | 《渔村里的画家》 | 抖音434万赞/103万转 |
| 升维语境 | 《当爱豆走进现实》 | 小红书超10万赞,成本约2000元 |
三步复刻制作流水线
- 剧本生成:从日常场景切入提取真实经历,配合WorkBuddy+Claude+QClaw工具组合
- 分镜预演:打磨含景别机位与质感的光影提示词,采用手绘→智能分镜→抽卡出片工作流
- 镜头三关键:加抖动模拟呼吸感,左右扫视模拟视线转移,配脚步风声构建空间感
- 单人降本:单人单电脑即可完成全流程,成本约2000元,门槛大幅降至个人创作者
虚拟IP商业化闭环
- 虚构人物IP化:TikTok账号打造AI女演员Brooke Sullivan,凭怀旧风格单条获百万点赞
- 视觉做旧:用低分辨率模糊噪点模拟千禧年录像质感,规避版权与舆情风险
- 反差感广告:韩国账号404product用日常痛点→荒诞产品→严肃广告公式,凭虚构样片承接真实品牌订单
5. 视频生成底层技术与工具
5.1 视频生成前沿技术
视频生成与理解前沿:音视频同步、交互生成与评测基准
量子位(20260414) | 极市平台(20260423) | AIGC开放社区(20260424) | AI有道(20260518) | 新智元(20260520) | 机器之心(20260523) | 人工智能学家(20260523) | AIGC开放社区(20260527) | 量子位(20260611) | 机器之心(20260615) | PaperWeekly(20260616) | 量子位(20260620) | 新智元(20260623) | 开源AI项目落地(20260626)
| CoInteract (清华&阿里) | DiT引入辅助HOI结构流解决穿透 | 交互合理性0.72(超SOTA 33%),零额外推理开销 |
| Wan-Streamer (阿里) | 首个原生流式全双工实时交互大模型 | 模型端延迟~200ms,25fps原生音画同步 |
- 架构演进:从U-Net演替至DiT,双向交叉注意力实现跨模态对齐,突破25ms人类感知错位底线
- AVI全景演进:十余子领域统一为感知/生成/交互三主线;工业界走向端到端,开源模型差距悬殊(如Qwen3-Omni仅73.6%)
实时交互与流式推理范式
| 框架/模型 | 核心创新 | 关键指标 |
|---|---|---|
| MaineCoon (猫薄荷) | 三阶段训练+三智能体协同控制 | 22B单卡47.5 FPS,推理成本$0.00025/s |
| JoyAI-VL (京东开源) | 模型自主决定交互时机,非规则硬编码 | 8B实现94ms延迟,监控预警胜率100% |
- 动态Token与记忆:JoyAI-VL采用AdaCodec动态分配预算(关键帧
256,预测帧16),结合分层记忆覆盖约12小时上下文 - 高质量数据构建:OmniVideo-100K通过结构化剧本+证据链构建10万QA数据,线索引导时间跨度达144.75s,提升跨模态推理
数字人推理延迟逼近极限
| 框架/模型 | 核心创新 | 关键指标 |
|---|---|---|
| Boson AI (李沐团队) | 全栈自研Audio+Avatar双引擎 | 单帧延迟16ms(单H100支持8路并发) |
| FloodDiffusion (盛大) | 定制化扩散强制与下三角时间调度 | 恒定1帧推理延迟,FID达0.057 |
| LongCat-Video-Avatar 1.5 (美团) | 编码器升级Whisper结合DMD2蒸馏 | 压缩至8步,主观胜率超OmniHuman等闭源 |
- 单帧与流式突破:盛大FloodDiffusion恒定1帧推理延迟,在HumanML3D上FID达0.057,根本性解决训练-推理不一致问题
全模态奖励建模与多模态食物识别适配
Omni-RRM:全模态结构化奖励建模(ECCV 2026)
- 核心问题:现有奖励模型以视觉为中心、依赖人工标注、将复杂偏好压缩为单一标量,缺乏可解释性
- 方法设计:构建Omni-Preference数据集,双教师模型基于五维Rubric(流畅性/相关性/准确性/推理/安全性)自动标注;SFT+GRPO两阶段训练,强化低margin样本判别
- 实验结果:五维benchmark平均准确率70.4%,接近Gemini-2.5-Pro;视频任务80.2%、音频任务66.8%均领先
多模态食物识别适配(TMM 2026,CCF-A)
| 方法 | 核心思路 | 关键性能 |
|---|---|---|
| IADR | 分类头替换+文本指令领域适配 | 六大数据集平均91.22%,提升6.14% |
| VMR | 外部视觉记忆库检索增强 | 4-shot场景提升10.26% |
| AGR | 属性引导生成式微调(颜色/纹理) | 可解释性强 |
关键洞察
- 奖励建模正从标量评分转向Rubric-based多维可解释评估,跨模态联合训练能提升奖励边界稳定性
- 双教师+五维Rubric的自动标注机制取代人工标注,直接降低RLHF数据成本
- 大模型专业适配无固定最优解:少样本用检索增强(VMR),追求极限性能用判别式微调(IADR),方法选择应由数据规模和部署约束驱动
歌歌AI:十亿参数端到端华语音乐模型
- 十亿参数端到端模型:歌歌AI从零预训练,输入歌词+风格即可生成3分钟立体声歌曲,同步输出人声与伴奏分轨
- 原生双流独立生成:人声与伴奏各走独立链路,通过跨流注意力机制实时对齐节奏与和声,模拟真人歌手即兴调整,告别事后硬叠
- 音素时序软对齐:生成前构建拼音-时间轴“位置地图”作为先验知识注入,每个字的起止时间有明确上下文,大幅降低音节错位
- 分层多维条件控制:采用AdaLN-Zero机制逐层调制,每个维度配备独立引导强度旋钮,可同时设定贴紧歌词情绪与旋律自由发挥
- 汉语vs英语演唱差异对比:
| 维度 | 英语 | 汉语 |
|---|---|---|
| 声调 | 无固定音高走势 | 四声决定字义 |
| 音节边界 | 可弹性拉伸 | 一字一音节,边界清晰 |
| 助词处理 | 可拖长演唱 | 轻声助词不可拖长 |
| 演唱风格 | 发音连贯奔放 | 含蓄细腻 |
- 商业闭环:与字节跳动签订版权分成合作,AI内容可上架抖音/剪映/汽水音乐等平台,涵盖会员付费、数字专辑等渠道
- 民乐计划:启动民乐专属AI模型研发,实地采集秦腔、评弹、葫芦丝、唢呐等非遗传承人原声作为训练数据
视觉语言模型高效推理与Token压缩
PaperAgent(20260331) | CVer(20260411) | 极市平台(20260414) | 机器之心(20260424) | CVer(20260508) | CVer(20260714)
- 多轮VQA压缩易失效:Prompt依赖型方法仅基于首轮筛选Token,后续轮次丢弃视觉信息导致性能断崖下跌
主流视觉Token压缩与推理加速框架
| 框架 | 核心机制 | 关键性能表现 | 适用场景 |
|---|---|---|---|
| RedundancyLens | 动态FFN+局部注意力 | 视觉FLOPs降约50%,图像/视频免训练 | 图像/视频 |
| FlashVID | 时空关联树解除位置限制 | 保留10%Token维持99.1%性能,预填充加速6.3x | 视频,免训练 |
| HERMES | 浅中深层差异化KV Cache保留 | 减Token 68%,TTFT 10x加速 | 流式视频,免训练 |
| MetaCompress | 数据驱动元生成器学习压缩映射 | 90%压缩率下SOTA,额外开销近零 | 多轮VQA与视频 |
微调范式对比:对抗鲁棒性优化
| 对比维度 | 传统分类引导微调 | 新兴对齐引导微调(AGFT) |
|---|---|---|
| 监督信号 | 下游One-hot硬标签 | 预训练概率分布软标签 |
| 对齐影响 | 破坏连续语义与跨模态对齐 | 保护跨模态语义结构 |
| 计算开销 | 常规微调 | 两次前向+单次反向 |
| 核心效果 | 零样本泛化能力退化 | 15个零样本基准准确率均升3.1% |
华科CCIIP ACM MM 2026免训练推理优化
- RankKV(KV缓存压缩):两阶段去冗(CountSketch粗筛+QR精去),64-token预算提升9.2pp
- RumiA(注意力校准):利用2B小模型浅深层对比生成软校准引导7B大模型,ChartQA提升10.48%
- AFRG(残差门控):发现FFN残差是视觉脱锚根源,自适应残差门控使Qwen3-VL-4B多模态幻觉率降至0.26
Mureka V9.5:从"更满"到"克制"的AI音乐质量跃迁
- 核心转向:放弃“更满更复杂”生成策略,转向“克制、真实”,重点解决声部争抢、人声编配脱节;指令精准度从6.92升至7.62
- 双层架构:V9.5底座模型提升基础质量上限,O3推理扩展方案在生成中持续比较选优,将“好听”转化为可复现的系统能力
- 底座核心能力:通过MusiCoT音乐思维链(先定结构与情绪再编排细节),实现结构编配、语义跟随、情绪匹配与复杂意图控制
- O3检查维度:验证局部旋律是否服务全曲、编配是否遮盖人声、情绪是否提前释放、段落结构是否偏离提示词
- Studio版本化:支持围绕同一创意快速生成多版本,满意部分保留、不合适单独替换,创作者重心从“操作”转向“审美判断”
- 商业化场景:已开放API服务,重点切入游戏工业化、短剧量产、音乐创作平民化及影视降本增效等场景
核心技术与性能
- BARD-VL:首个系统化将预训练 AR-VLM 平滑转换为同架构扩散 VLM 的框架,基于 Qwen3-VL 转换,代码/权重/HuggingFace 全面开源
- 渐进式范式迁移:按块大小序列 4→8→16→32 逐阶段扩大并行解码粒度,避免"跃迁式失败";用前一阶段扩散锚点模型(而非原 AR 模型)做教师蒸馏,监督信号匹配度显著高于传统 KL 蒸馏
- 工程优化:混合噪声调度器(掩码噪声 + 可见 Token 均匀破坏)使模型同时习得"补全"与"修正";Packed Sequence Layout 封装上下文/clean/noisy response 于同一序列,优化长序列训练显存
- 性能:BARD-VL 8B 在 7 项 benchmark 中 6 项超越原 Qwen3-VL 8B(MME +14、MMStar +5.1、MMMU +1.6);全面超越同规模开源扩散 VLM(LLaDA-V 8B、Dimple-VL)
- 推理加速:解码吞吐量最高提升 3 倍,票据结构化任务仅需 6 次 diffusion refinement vs 原模型 35 步自回归解码
- 训练数据:基于 LLaVA-OneVision-1.5 与 FineVision 清洗构建,共 4.4M 高质量样本
5.2 长视频与多镜头生成
长视频与多镜头生成前沿技术
机器之心(20260410) | 量子位(20260410) | 机器之心(20260415) | 极市平台(20260416) | 智东西(20260605) | 机器之心(20260606) | 量子位(20260607) | 机器之心(20260607) | AIGC开放社区(20260610) | CVer(20260723)
核心技术路线对比:
| 框架 | 核心机制 | 关键数据 |
|---|---|---|
| OneStory (Meta/哥本) | next-shot自回归+自适应记忆筛选 | CVPR 2026,支持10镜头连贯 |
| JoyAI-Echo (京东/北大/清华) | 7槽位配对记忆+三段后训练蒸馏 | 身份一致性0.7793,语音0.8646,7.5倍加速 |
| VideoClaw (哈工大/阿里) | 结构化场记库+VLM闭环质检 | 支持无限续写,GitHub 1.3K Star |
| OmniRoam | 全景统一表示+两阶段轨迹解耦 | 预览81帧约7秒,641帧一致性验证 |
OneStory 记忆机制:
- Next-shot生成:重构自回归范式,逐镜头推进,统一文生与图生
- 双模块协同:Frame Selection语义选帧 + Adaptive Conditioner自适应压缩
JoyAI-Echo 核心创新:
- 远锚近联策略:7槽位(前3锚点+近4上下文)绑定视觉与音频防混淆
- OmniNFT对齐:优势路由解决音视频奖励冲突,切断梯度防泄漏,发声区加权
- 数据体系:100万+身份原型去重,100个故事/3000镜头评测基准,2K超分
VideoClaw 多智能体闭环:
- 场记状态库:角色与场景信息沉淀为可复用资产,支撑剧情无限续写
- VLM双重审查:比对剧本与逻辑偏移,未达标触发回溯重生
OmniRoam 轨迹解耦:
- 全景坐标建模:去除相机自旋仅留平移,提供全局空间约束
- 粗到精生成:首阶段轨迹控制预览,次阶段visibility mask抑制误差累积
- 核心突破:PDR(连续高斯场)方法将视频预测速度突破 1000 FPS,重塑视频预测范式
- 技术路线:采用连续高斯场建模,替代传统离散帧预测方式
- 会议:入选 ECCV 2026
5.3 视频编辑与自动化创作工具
AI视频自动化编辑与精修工具
PaperWeekly(20260416) | AI信息Gap(20260424) | 智能涌现(20260424) | 卡尔的AI沃茨(20260506) | 莫理(20260506) | 饼干哥哥AGI(20260602) | 逛逛GitHub(20260610) | 量子位(20260620) | 船长AI视界(20260708) | PaperWeekly(20260714)
- 行业痛点转移:视频核心矛盾从“做不出”转为“不知哪里烂”,生成技术成熟后审片与审美能力比技术本身更稀缺
- Buzzy商业模式:定位视频版Photoshop,主打对话式局部精修,ARR达2000万美金,英文提示成功率约90%
- Buzzy技术路径:基于RLHF训练专用小模型提升意图理解,将视频创作从线性流程转变为迭代式工作流
- CutClaw盲测领先:2000份样本中49.8%认为视觉最佳,53.0%认为视听和谐度最优,得票达第二名两倍以上
- Crayotter状态外化:将剪辑过程转为7类可检查工件链,故障精准归因到特定片段,五维度显著优于CutClaw等基线
- aidirectorbrain审片:主打时间戳级诊断,量化留存与情绪曲线,支持点击时间点探讨张力并输出运镜/BGM提示词
AI视频编辑工具矩阵对比
| 工具 | 定位 | 核心数据/技术亮点 |
|---|---|---|
| Buzzy | 对话式局部精修 | ARR 2000万$,英文提示成功率约90% |
| CutClaw | 全自动粗剪与卡点 | 2000人盲测近50%认为最佳,多智能体协作 |
| Crayotter | 工件驱动的长轨剪辑 | 外化7类工件,故障定位到片段级 |
| aidirectorbrain | 导演级审片诊断 | 时间戳级定位,量化留存与情绪曲线 |
| HyperFrames | 确定性渲染基建 | HeyGen开源2.5万Star,同一HTML同一视频 |
| html-video | 模板与工作流封装 | 21套商用模板,定位“HTML版剪映” |
| Remotion | React驱动的精品打磨 | 逐帧组件描述,支持复杂动画 |
5.4 视频目标消除与修复
视频目标消除与抠图技术前沿
- 视频抠图核心矛盾:需同时兼顾高层语义追踪(跨帧锁定)与底层细节估计(半透明/极细边界),单一模型难以兼顾
- 微调困境:在V-HIM2K5数据集微调会破坏tracker泛化能力,从头训练则数据不足
SAM2Matting(复旦):解耦两阶段设计
- 冻结VOS Tracker:保留泛化追踪能力,提供稳定掩码与多尺度特征,支持mask/point/box/scribble/text多模态提示
- ROI Detector:自适应定位发丝、肢体间隙等不规则抠图区域
- Progressive Alpha Predictor:逐级精修产生高质量alpha抠图结果
- 零样本SOTA:仅用图像抠图数据训练,即零样本刷新视频抠图SOTA
SAM2Matting 性能参数
| 模型版本 | 分辨率 | FPS | 显存 |
|---|---|---|---|
| SAM2.1-Tiny | 1080p | ~40 | ~3.61GB |
SVOR(小米):真实场景视频目标消除
- MUSE机制:时间窗口内联合遮罩替代逐帧处理,免训练解决快速运动致遮罩不完整
- DA-Seg模块:去噪感知持续补全缺失掩码,兼容AI分割偏差与手绘遮罩
- 课程式训练:真实背景自监督预训练转合成数据精调,解决阴影与反射残留
- 竞赛表现:获CVPR 2026物理感知视频实例消除挑战赛冠军(18支队伍),三项指标大幅领先
5.5 3D重建与动作生成
3D重建与空间感知技术前沿
量子位(20260330) | 极市平台(20260401) | 机器之心(20260412) | 机器之心(20260416) | 量子位(20260416) | CVer(20260417) | 具身智能之心(20260419) | CVer(20260421) | 量子位(20260424) | 机器之心(20260506) | PaperWeekly(20260514) | 机器之心(20260519) | CVer(20260606) | 极市平台(20260609) | CVer(20260609) | AI科技评论(20260612) | 机器之心(20260626) | 深度学习与NLP(20260421)
技术范式跃迁
- VLM³验证三维视觉Bitter Lesson:仅需焦距与像素空间归一化即超越专家模型SOTA
- 生成式先验突破:VEGA-3D将视频扩散模型作世界模拟器,零3D监督多视角一致性达97.04%
稠密深度与单图重建
- Meta SAM 3D:双模型级联单图生成3D网格,SA-3DAO基准较此前最优提升44%
- 腾讯DepthVLM:原生输出稠密深度,δ₁=0.876远超GPT-5.5(0.407),推理约0.42秒
- SpatialPoint框架:深度图复用RGB主干,实点预测误差降至17.2mm实现零样本泛化
大尺度与流式实时重建
- Scal3R:全局上下文记忆对齐,单卡4090实现公里级万帧3D重建,轨迹误差降至4.45m
- LingBot-Map:三层记忆压缩Token近80倍,实现20FPS实时推理与13.28GB恒定显存
- 低成本单目建图:几十元级单摄跑超万帧实现整栋楼级3D地图构建,验证大尺度室内流式重建可行性
3DGS材质与暗光极限突破
- 3DReflecNet:首发22TB非漫反射数据集,揭示材质光学特性与极线几何结构冲突为失效根因
- AmbiSuR:球谐高阶系数模长量化光度多义性,DTU倒角距离0.46全面超越基线
- NIRGB-GS:近红外主导几何、暗光RGB恢复色彩,攻克极暗区域纹理重建难题
- UniSHARP:摆脱针孔假设统一四类相机几何表示,配套30万张ERP全景数据集
人体运动与多模态感知
- M4Human:首发999段高保真毫米波人体mesh数据集,跨遮挡感知延迟仅2.74ms
- RAM框架:端到端融合卡尔曼滤波与Transformer,实现复杂遮挡下zero-shot稳定身份跟踪
- 灵视P1空间相机:融合多目视觉与激光雷达,打破索尼垄断并落地影视与具身智能
5.6 3D渲染引擎与底层技术
3D渲染引擎架构与神经压缩技术
CVer(20260330) | 量子位(20260415) | APPSO(20260415) | 机器之心(20260415) | 智东西(20260415) | 财联社AI daily(20260415) | 极市平台(20260415) | AIGC开放社区(20260417) | AI寒武纪(20260418) | 机器之心(20260425) | 量子位(20260427) | 机器之心(20260525) | 逛逛GitHub(20260527)
| 引擎 | 开发者 | LOD架构 | 场景上限 | 核心优势 |
|---|---|---|---|---|
| Spark 2.0 | World Labs | Splat-based | 1亿高斯点 | 首个跨设备兼容的Web端亿级渲染 |
| Aholo Viewer | 群核科技 | Chunk-based | 10亿高斯点 | 3亿点测试:内存仅Spark一半,速度快3倍 |
Spark 2.0 跨设备渲染架构
- 恒定渲染预算:设定固定splat上限(移动端50万、桌面端250万),帧率与场景总量无关
- 连续LoD树:自下而上合并消除离散跳变,结合注视点渲染集中算力至视线中心
- GPU虚拟内存分页:LRU策略管理1600万节点池,多场景共享物理内存避免浏览器OOM
- RAD流式格式:分块独立压缩支持网络随机访问,首块64K splat即可呈现粗略轮廓
- 多物体统一渲染:全局坐标系统一后经Wasm后台排序,单条实例化指令完成绘制
Aholo Viewer 区块化调度路线
- Chunk-based LOD:以Chunk数据块为单位层级切换,缓存命中更优,扩展性可达城市级
- 按需加载与裁剪:视锥内按需加载,10亿点级别场景无需一次性装入显存
- 工程化工具链:兼容多格式自动LOD生成,支持射线检测与物理碰撞
- 云端混合渲染:支持3DGS与Mesh同场景串流,打通图/文生3D等业务API
NDGI 动态光照神经压缩
- 时空解耦编码:2D三平面锁定高频细节,3D特征捕捉光照时序低频变化
- 硬件协同压缩:训练主动模拟BC7编码损失并补偿,无缝兼容GPU纹理采样
- 极致压缩性能:0.68 BPP下达46.69 dB(比NTC高3dB),RTX 4060解码1024×1024仅0.2ms
3D重建产业演进趋势
- 从离线到流式在线:LongStream实现公里级18FPS流式重建,LingBot-Map前馈恢复位姿
- 输出形态升级:从本地点云转向可在线访问与嵌入的空间内容,支撑机器人仿真
- 生产力工具转型:其域创新LCC解耦编解码将体积压至PLY的8%,进入影视虚拟拍摄
6. 多模态模型底座与训练推理加速
6.1 闭源多模态模型发布与行业动态
多模态模型能力跃迁与架构创新
PaperAgent(20260408) | AGI Hunt(20260409) | 硅星人Pro(20260409) | 腾讯研究院(20260420) | 智东西(20260429) | CVer(20260429) | 夕小瑶科技说(20260429) | 量子位(20260429) | AIGC开放社区(20260506) | 花叔(20260506) | 火山引擎(20260506) | 刘小排r(20260506) | GLM大模型(20260508) | 机器之心(20260513) | 赛博禅心(20260513) | 网罗灯下黑(20260513) | 新智元(20260513) | PaperWeekly(20260513) | 逛逛GitHub(20260513) | 卡尔的AI沃茨(20260513) | AI产品银海(20260513) | GitHubDaily(20260513) | AI寒武纪(20260514) | APPSO(20260525) | 量子位(20260526) | 卡尔的AI沃茨(20260531) | CVer(20260607) | 量子位(20260610) | InfoQ(20260622) | 船长AI视界(20260706)
- 豆包 Seed-2.0-lite:全模态性价比,能力达Pro版95%,价格仅1/5,总token成本降20%
- GLM-5V-Turbo:Agent基座,感知-推理联合RL,MMSearch-Plus分数提升近8倍
- MiniCPM-V 4.6:端侧新标杆,1.3B参数仅耗6G内存,吞吐量达2624 token/s
- Gemma 4 12B:无编码器设计,极简视觉嵌入器替代27层ViT,单次微调更新全模态
端侧部署与极致推理优化
- 端侧参数上限:8GB手机可用内存仅2-3GB,INT4量化下1.3B模型权重约0.65GB,1-2B为实用上限
- Token自适应压缩:MiniCPM-V 4.6将压缩前置至ViT内部降55.8%算力,支持4倍/16倍混合压缩
- 长上下文稀疏注意力:快手Keye-VL-2.0引入DSA,512帧准确率升至42.44%,长序列Prefill成本降50%
- 警惕粗暴剪枝:FastV等浅层剪枝易致幻觉;COAST保留22%视觉token仍维持98.64%性能
推理范式演进与训练瓶颈
- 视觉原生推理:DeepSeek提出“视觉原语思考”,将800×800图片压至约90个KV缓存,反超GPT/Claude
- 物理空间反直觉现象:商汤指持续增加多模态数据反固化语言先验,须转向“Predict Next View”突破瓶颈
- 企业级落地成本:异构数据接入融合成本占70-80%,端到端闭环交付(如小浣熊日均1500万用户)成存活核心
国产轻量模型生产实测
- 生产可用性验证:Step 3.7 Flash等模型在流程图理解与发票提取场景达标,单次成本均低于1分钱
- 轻量模型成本分化:Step 3.7 Flash两场景成本均最低,仅为MiniMax M3的36%(流程图场景)
- 缓存机制影响Token:MiniMax M3 input Token消耗异常偏高(27.9K),推测与缓存写入机制直接相关
- 核心指标关注点:多款模型响应速度差距不大,但input Token消耗差异达数十倍,直接决定规模化成本
6.2 视觉分词器与基础表征预训练
视觉分词器架构创新与基础表征预训练
机器之心(20260330) | 机器之心(20260424) | 机器之心(20260427) | 极市平台(20260625)
视觉分词器与表征预训练前沿突破对比
| 模型/工作 | 核心机制 | 性能表现 |
|---|---|---|
| VTP | 联合重建+自监督+图文对齐三目标 | gFID 1.11刷新纪录,打破缩放退化悖论 |
| MacTok | 图像与表征双空间协同注入语义 | 64 token实现gFID 1.44,压缩64倍 |
| InfoTok | 基于香农定理与ELBO路由动态分配Token | 推理提速11倍,无损节省20% Token |
| TIPSv2 | iBOT++全Token损失+多粒度文本防走捷径 | 1.1B参数全面超越1.7倍大体量竞品 |
VTP:破解预训练缩放退化悖论
- 直击退化诅咒:纯重建目标扩算力反致生成退化,VTP联合三目标首破此悖论
- 刷新生成纪录:ImageNet 256×256上gFID达1.11,收敛速度显著优于VA-VAE
MacTok:根治连续分词器后验坍塌
- 直击坍塌根源:强KL正则致编码器放弃写入语义,MacTok双空间协同直接注入语义
- 极致压缩表现:仅用64个Token实现gFID 1.44,128 Token即匹敌1024基线
InfoTok:信息论驱动动态按需分配
- 突破静态分配:基于香农定理证明最优Token分配以信息熵为下界,按场景复杂度伸缩
- 极致推理提速:推理速度提升11倍,无损节省20% Token,入选ICLR 2026 Oral
TIPSv2:颠覆密集对齐监督范式
- 突破监督范式:发现对可见Patch显式监督是对齐关键,颠覆仅计算Mask损失传统
- 防捷径学习:交替使用多粒度文本描述训练,零样本分割mIoU飙升14.1
- 极致效率表现:TIPSv2-g(1.1B)击败参数量大56%且数据多47倍的PE-core
6.3 AI Agent 平台架构与多智能体协作
AI Agent 平台架构与多智能体通信机制
TRAE.ai(20260401) | 人工智能学家(20260408) | 玄姐聊AGI(20260409) | 阿里云开发者(20260409) | 量子位(20260430)
Agent 平台三层解耦架构(Anthropic)
| 层级 | 定位 | 核心机制与表现 |
|---|---|---|
| Session | 外置记忆 | Append-only事件流,崩溃可从任意位置恢复 |
| Harness | 无状态编排 | 换底层模型/算法不中断上层,崩溃自动重醒 |
| Sandbox | 标准接口 | 推理提前启动,首Token延迟p95下降超90% |
- 商业模式转型:定价从 Token 计费转向 $0.08/会话小时,定位为 Agent 基础设施提供商
多智能体通信瓶颈与语义治理
| 方案 | 核心问题 | 效果 |
|---|---|---|
| 思科 CFN | MAS停留在自然语言点对点通信,语义易漂移 | HotPotQA/MuSiQue 提升 10%+ |
| 三态通信协议 | 1人+6Agent+52个cron任务产生分布式ACK风暴 | 保障 7x24 稳定运行 |
- CFN 语义中间件:Cognitive Sidecar 边车部署,逻辑集中维护全局 Memory 与安全策略
- 自治系统工程瓶颈:90% 精力花在工程基础设施而非 AI 模型本身能力
多智能体视觉幻觉抑制(ViF)
- 幻觉滚雪球:纯文本传递致视觉信息丢失,关键视觉令牌占比从第1轮1.22%骤降至第20轮0.10%
- ViF 即插即用:直传中层单峰视觉令牌保留原生证据,仅增 8.1%~13.4% 延迟(入选 ICLR 2026)
- 实测效果:8大基准、4种MAS结构平均提升 2.4%~3.8%,幻觉滚雪球分数(HS)降超 30%
端云协同 Agent 架构
- 端云算力分工:端侧(酷睿 Ultra)负责视频解码、VLM 推理等重算力,云端大模型负责叙事编排等轻决策
- 平台能力进化:TRAE Skills 机制从程序员工具扩展为通用 AI Agent 平台,视频剪辑为首例示范
6.4 产业级视觉语言模型工程化实践
Stellaris-VL-4B:细粒度定位感知的产业视觉语言模型
产业痛点洞察:80%产业视觉需求为细粒度定位感知(OVD/REC),模型推动从1500+碎片化算法向统一架构演进
商业落地规模:覆盖100+行业、服务3000+政企客户,已在智慧城市、能源等场景规模化验证
端侧架构优势:4B参数支持单卡边缘部署断网低延迟推理,精准融合目标获取分支以兼顾理解与定位
闭环数据引擎:依托10亿+真实业务数据,经清洗、标注、验证、反哺四阶段闭环,使产业数据集性能翻倍
分阶段训练策略:SFT阶段打基础,RL阶段引入GSPO与IoU定制奖励函数,重点强化定位精度并抑制幻觉
核心能力评测表现:
| 能力维度 | 性能表现 |
|---|---|
| 通用VQA | 对话与指令遵循能力不退化,小幅领先同量级开源模型 |
| 开放词汇检测(OVD) | 覆盖1000+场景构建100k数据集,mAP@0.5:0.95显著更优 |
| 指代表达理解(REC) | 创新目标框Token化,复杂环境精准定位(如压线车辆) |
| 小目标识别 | 统一视觉编码器处理多尺度特征,抗背景干扰能力增强 |
工程平台赋能:极星平台支持一句话自定义提示词,快速适配多业务场景需求
权威认可:入选CCIG 2026图像图形先锋金牌榜,46项基准任务效率领先
6.5 古文字OCR评测基准与VLLM感知短板
Chronicles-OCR:中国古文字识别评测揭示多模态感知悖论
- 首个古文字评测基准:腾讯混元联合发布 Chronicles-OCR,覆盖甲骨至草书完整演化,含 2,800 张图像(每体 400 张),已开源
- 多模态模型识别遇瓶颈:评测 28 个 VLLM(含 GPT-5、Gemini 3.1 Pro),端到端检测 H-mean 最高仅 16.5
- 细粒度识别天花板低:画框辅助认字最高准确率仅 27.1%,甲骨文上 Gemini 3.1 Pro 仅 14.0%
- 阶段自适应标注:古早字体(甲骨/金文/篆)用字符级精细 bbox 与汉字映射;成熟字体(隶/楷/行/草)用行级逐字转写
- 数据源权威:甲骨文源自安阳师范重点实验室,金文/篆书由博士团队整理,成熟字体取自故宫博物院
四大核心任务与最佳表现
| 核心任务 | 适用字体 | 最佳表现 |
|---|---|---|
| 跨时代字符检测 | 甲骨/金文/篆 | H-mean 16.5 |
| 细粒度古字识别 | 甲骨/金文/篆 | Exact Match 27.1% |
| 古文转写 | 全部七体 | 楷书 |
| 字体分类 | 全部七体 | 古早 96.7%,成熟 77.0% |
- 揭示感知悖论:模型靠载体纹理分类(龟甲纹理→甲骨 96.7%),楷行草皆在宣纸上失去区分力(降至 77.0%),在看纹理而非读字
- Reasoning 放大幻觉:开启 thinking 模式后表现反降(Spotting 从 7.8 降至 2.1),感知基础不稳时推理只会放大不确定性
7. 视频生成平台工具与创作工作流
7.1 视频生成工具与 Agent 客户端
AI 视频生成与编辑产品矩阵及 Agent 编排流水线
开源AI项目落地(20260415) | 歸藏的AI工具箱(20260417) | 开源AI项目落地(20260418) | 新智元(20260420) | 优设AIGC(20260421) | 优设AIGC(20260422) | AI信息Gap(20260424) | 莫理(20260429) | 量子位(20260507) | 十字路口Crossing(20260508) | 沃垠AI(20260509) | 优设AIGC(20260512) | 优设AIGC(20260507) | 硅星人Pro(20260603) | 海外增长圈(20260607) | 袋鼠帝AI客栈(20260611) | AI有道(20260705) | 莫理(20260710) | AI异类弗兰克(20260711) | 有新Newin(20260714) | 曼话AI(20260714) | 船长AI视界(20260430)
AI视频生成正向Agent编排演进,全链路自动化与全能编辑器正将创作门槛与成本压缩至极低水平。
Agent编排与长篇叙事突破
- 流水线重塑:OpenMontage提供400+技能,60秒动画成本仅1.33美元;MoneyPrinterTurbo获9万+Star
- 长篇连载突破:Zopia集中资产库支撑64集长篇;LibTV内含100+Skill且提供1000万激励,累计播放超100亿
- AI原生范式:HeyGen Hyperframes用HTML/CSS替代Diffusion渲染并反哺数字人,结合Claude实现单次对话批量产出20条脚本
- 全能编辑降本:免费AI视频编辑器集成超长视频生成、数字人、MV、PPT转视频及海量模板与提示词,实现全链路极简创作
代表产品与核心优势对比
| 产品 | 定位 | 核心能力与数据 |
|---|---|---|
| Buzzy | 视频版Photoshop | 对话式局部精修与非破坏性编辑,融资2000万 |
| 生数Vidu | 全链路生成 | 5天广告制作压缩至1天,百元产出百万质感 |
| OiiOii 2.0 | 拉片复刻 | 自动拆解参考视频18维度,10秒视频5分钟出片 |
| MVLAND | MV自动生成 | 音乐节拍与视觉转场精准咬合,数万成本降至30分钟 |
| Flova | 原生创作Agent | 支持资产跨项目复用、Prompt预审与任务并行 |
垂类场景极致降本提效
- 电商与轻量化起稿:VidAU支持860+数字人与120+语言换脸;InVideo和DreamVid主打一键将图文创意转为多平台初稿
- 工作流沉淀与复用:LibTV支持自定义Skill沉淀,打通多样化视频创作工作流闭环
7.2 Seedance 2.0 与 LibTV 平台生态
Seedance 2.0 技术能力、平台生态与第三方工具集成
甲木未来派(20260401) | 火山引擎(20260402) | 花叔(20260402) | 开源AI项目落地(20260402) | GitHubDaily(20260402) | 逛逛GitHub(20260402) | AI范儿(20260403) | AI异类弗兰克(20260403) | 船长AI视界(20260403) | AI产品银海(20260410) | AI信息Gap(20260411) | 莫理(20260411) | 优设AIGC(20260412) | 公子龙(20260412) | AI寒武纪(20260413) | 火山引擎(20260414) | 财联社AI daily(20260414) | AIZ小朱(20260415) | 量子位(20260417) | AI早餐汇(20260427) | "Z Finance"(20260519) | AI故事计划(20260526) | 饼干哥哥AGI(20260529) | 袋鼠帝AI客栈(20260601) | 火山引擎(20260603) | 火山引擎(20260605) | 火山引擎(20260610) | 智东西(20260616) | "财联社AI daily"(20260623) | 火山引擎(20260623) | AI寒武纪(20260623) | 曼话AI(20260623) | 优设AIGC(20260624) | 第一新声(20260707) | 火山引擎(20260715) | AI新榜(20260717) | AI新榜(20260521)
-
版本演进:Seedance 2.0支持原生4K与10-bit直出(约100元/条,2-3分钟);2.5版单次时长将达30秒,支持50个素材输入及局部编辑
-
产品矩阵对比:
2.0满血版:高端质感(216积分),语义遵循与质感极佳
2.0 Fast版:轻量草稿(176积分,低约15%),易出物理错误
Mini版:批量短视频(0.16元/秒),API价格较2.0低50% -
生态基建对比:
LibTV平台:第三方工作流(0.35元/秒),独立算力免排队及版权校验
nexu客户端:开源IM集成(MIT协议),打通微信/飞书等6大渠道零门槛生成 -
制作降本显著:抽卡出片率大增(传统约2000元,2.0均价3次出片);漫短剧降本70%-90%提效80%-90%;2分钟科幻片仅330.6元,30秒广告30-45元
-
爆款与商业化:98分钟《人类进化史》抖音破亿;约1万元算力产出超7000万播放;AIGC素材ARPU提升80.2%;火山方舟上线版权平台引入周星驰IP
-
市场与底层渗透:日均算力消耗份额超80%;深度嵌入剪映/CapCut;LibTV兼容Maya解决空间表达;豆包大模型日均Token超120万亿
-
戛纳电影节里程碑:火山引擎携2.0亮相第79届戛纳,8部AI影片展映
-
长片成本颠覆:全球首部95分钟AI长片《HELL GRIND》由15人14天完成,成本不足50万美元,约为传统同级1%
-
国际巨头合作:吕克贝松SEEN工作室宣布用Seedance结合实拍造动画长片;Outpost VFX、WPP、Magnific等机构已披露合作
7.3 AI短剧与漫剧工业化平台及产业链
AI短剧与漫剧工业化平台生态
AIZ小朱(20260330) | 昆仑万维集团(20260331) | AI产品银海(20260402) | AI异类弗兰克(20260403) | 卡尔的AI沃茨(20260404) | 优设AIGC(20260404) | 卡尔的AI沃茨(20260407) | AI大模型工场(20260408) | Z Finance(20260408) | 特工宇宙(20260408) | 机器之心(20260408) | AI新榜(20260409) | 智东西(20260409) | 梦飞 AI(20260409) | 钛媒体AGI(20260410) | 机器之心(20260410) | APPSO(20260410) | AI前线(20260410) | 量子位(20260411) | 卡尔的AI沃茨(20260411) | 小互AI(20260413) | InfoQ(20260413) | 船长AI视界(20260413) | 莫理(20260415) | 路人甲TM(20260415) | 船长AI视界(20260415) | 摸鱼小李(20260416) | APPSO(20260419) | 网罗灯下黑(20260419) | AI异类弗兰克(20260420) | 商汤科技SenseTime(20260421) | 曼话AI(20260421) | TRAE.ai(20260422) | AI新榜(20260424) | APPSO(20260427) | 智东西(20260427) | 阿里云(20260427) | 千问APP(20260427) | 机器之心(20260427) | AI科技评论(20260427) | 十字路口Crossing(20260427) | AI异类弗兰克(20260427) | 袋鼠帝AI客栈(20260427) | 新智元(20260427) | AI信息Gap(20260428) | 硅星人Pro(20260428) | 第一新声(20260428) | AI前线(20260428) | AI新榜(20260428) | JackCui(20260428) | 商汤科技SenseTime(20260429) | 火山引擎(20260430) | 阿枫科技(20260430) | AI产品银海(20260506) | 路人甲TM(20260507) | AI信息Gap(20260513) | 莫理(20260514) | 甲木未来派(20260527) | 商汤科技SenseTime(20260609) | AI产品阿颖(20260609) | 莫理(20260610) | 阿枫科技(20260611) | 智东西(20260622) | 阿枫科技(20260705) | 深度学习与NLP(20260428)
核心架构与实测表现
- 统一架构:15B参数40层Transformer原生音视频联合生成,取代级联拼接,文生视频Elo达1391
- 极致效率:DMD-2蒸馏(8步去噪),单张H100生成1080p视频仅需38秒,创历史新高引发股价波动
- 实测长板:擅长电影级中近景光影、微表情精控与长镜头连贯,支持7语种原生唇形同步
- 实测短板:物理规律拟真弱(碰撞翻车、流体失真),画面文字乱码严重
视频生成模型格局与定价梯队
- 阿里快乐小马:音视频同步登顶,720P低至0.44元/秒(首批上手),短板为物理逻辑差
- 字节Seedance:综合可用率超90%,1080p成本约2-3.6元/秒,短板为成本偏高
- OpenAI Sora:日烧1500万美元,目前已全面关停
一站式Agent平台与工业化
- 极致降本增效:短剧周期从15-30天压缩至1-3天,单集5分钟算力成本仅240-300元
- 平台生态涌现:Seko、OiiOii、AniShort等实现从剧本到成片全链路闭环(Seko 2月破10万用户)
- Agent细粒度分工:内置编剧、分镜等7个专业Agent,用户一句话即可驱动整套班底
- 多模型混合调度:常组合豆包(剧本)、Vidu(量产)、Seedance(修Bug)平衡成本
突破跨镜头一致性与资产管理
- 数字资产库:角色多视图绑定(正/侧/背/特写)及720°全景影棚,彻底解决“变脸”痛点
- 无限画布工作流:Seko等平台支持节点式多机位推演与资产一键复用,保障多剧集画风连贯
- 自动审查闭环:引入独立Agent从冲突密度、水集检测等10+维度自动博弈优化,大幅降低返工率
商业化变现与市场验证
- 跨行业渗透:从娱乐短剧转为保险、教培行业高完播率获客工具,单人单机即可实现量产
- 市场爆款频出:大学生3个月AI短片破亿播放;巨日禄作品占年度漫剧榜近50%,单部达2.5亿播放
7.4 AI视频与漫剧创作全流程工作流实操
AI视频与漫剧创作全流程工作流实操与案例解析
船长AI视界(20260330) | APPSO(20260331) | AI大模型工场(20260331) | 卡尔的AI沃茨(20260331) | 船长AI视界(20260331) | 哩布哩布AI(20260401) | AI信息Gap(20260402) | AI产品银海(20260402) | AI寒武纪(20260402) | 公子龙(20260402) | 路人甲TM(20260402) | 哩布哩布AI(20260402) | 火山引擎(20260402) | 船长AI视界(20260401) | 优设AIGC(20260402) | 沃垠AI(20260402) | 探索AGI(20260402) | 莫理(20260402) | 小互AI(20260402) | AIZ小朱(20260402) | 阿枫科技(20260402) | 网罗灯下黑(20260402) | GitHubDaily(20260402) | 逛逛GitHub(20260402) | 船长AI视界(20260402) | 袋鼠帝AI客栈(20260403) | JackCui(20260403) | 特工宇宙(20260403) | APPSO(20260404) | APPSO(20260404) | 船长AI视界(20260404) | 曼话AI(20260405) | 卡尔的AI沃茨(20260407) | 阿枫科技(20260406) | 优设AIGC(20260407) | 优设AIGC(20260407) | 苍何(20260406) | 琢磨事(20260407) | 莫理(20260407) | AI产品银海(20260407) | AI新榜(20260415) | 莫理(20260420) | AI新榜(20260421) | AI新榜(20260515) | 曼话AI(20260517) | 船长AI视界(20260410) | "梦飞 AI"(20260605) | 莫理(20260630) | 路人甲TM(20260702) | AI异类弗兰克(20260703) | 沃垠AI(20260714)
- 核心模型与多模态能力跃升:以Seedance 2.0、PixVerse V6为代表的模型支持文/图/音/视频四模态混合输入,原生具备物理规律理解、光影控制及多镜头连贯叙事,最高输出2K电影质感。
- 排队痛点与极速破局:官方平台高负载下常需排队数小时甚至出现降智现象,经LibTV等第三方平台底层优化后,15秒1080p视频生成缩短至2-3分钟且支持多任务并行。
- 全链路Agent自动化制片:OiiOii、LibTV、StepClaw等平台引入模拟工作室多Agent协作,无限画布串联剧本、三视图与分镜。支持一句话指令(如王家卫风格)全自动生成5分钟漫剧,最快30分钟出片。
- 角色与空间一致性突破:全面告别“抽卡式盲跑”。通过角色锚点系统、九宫格分镜前置约束、3D导演台(素模空间站位)以及物理级质感重计算,精准控制人物变脸、背景穿帮与“塑料脸”痛点。
- 工业化降本增效与数据验证:AI技术渗透率达60%-85%,漫剧制作成本下降50%-75%(如Seedance生成0.24元/秒)。创作周期极速压缩,黑客松团队36小时即可产出商用级短片。
- 商业生态演进与创意核心化:API全面开源并接入IM端(微信/飞书),B站等巨头入局加剧生态角逐。随着技术门槛抹平,行业核心壁垒已全面转向“叙事能力与导演意识”。
主流工具生态与商业化数据对比
| 工具/平台 | 核心定位与突破 | 关键效率与成本数据 |
|---|---|---|
| Seedance 2.0 | 四模态输入,原生音画同步与物理推演 | 官方日均超13万人排队,豆包大模型日均Token超120万亿 |
| LibTV | 无限画布,3D导演台与多Agent自动化调度 | 2000字剧本几十秒拆解分镜,5分钟筹备缩至40分钟 |
| PixVerse V6 | 物理仿真跃升,推出Mini Apps零门槛电商出片 | 15秒1080p生成约2分钟,成本约0.04美元/秒 |
| OiiOii / Flova | 内置编剧/分镜等7个专业Agent,全链路一键出片 | 最快30分钟出片,视频成本降至0.24元/秒 |
| LTX2.3 | 重构VAE模型,支持超长本地部署生成 | 缓解AI自行发挥通病,22B模型仅需32GB显存 |
8. 多模态推理与视觉理解
8.1 多模态推理范式与视觉语言模型前沿
多模态推理范式与能力评测系统性反思
PaperAgent(20260330) | 字母AI(20260401) | 新智元(20260410) | PaperWeekly(20260413) | AI有道(20260414) | AIGC开放社区(20260424) | ScienceAI(20260430) | 机器之心(20260430) | 花叔(20260430) | 智东西(20260430) | Datawhale(20260430) | AI寒武纪(20260430) | PaperAgent(20260501) | 机器之心(20260504) | 极市平台(20260507) | AI科技评论(20260512) | CVer(20260513) | 机器之心(20260515) | AI科技评论(20260515) | PaperWeekly(20260515) | "Z Potentials"(20260517) | CVer(20260527) | 量子位(20260614) | CVer(20260616) | CVer(20260625) | CVer(20260524) | CVer(20260717) | 新智元(20260725) | "Z Potentials"(20260729)
- 视觉推理范式:ATLAS用单个离散Functional Token统一隐式推理与智能体操作
- 非文生图精细推理:主流大模型纯彩铅逐笔绘画均现过度修改,完成7幅画成本差20倍
多维模型能力对比
| 模型/框架 | 核心优势 | 关键基准表现 |
|---|---|---|
| DeepSeek (V4-Flash) | 空间推理与压缩 | 迷宫导航66.9%,7项基准均分77.2% |
| Gemini-3-Pro | 视频理解上限 | Video-MME-v2非线性计分从66.1%暴跌至49.4% |
| S1-VL-32B | Thinking with Images | 推理中主动调用代码裁剪/放大图像,获5项SOTA |
| ATLAS | 视觉推理Token范式 | 单个离散 Functional Token 统一隐式推理与智能体操作 |
| EMO-R3 | 轻量情绪推理新范式 | 3B模型域内外情绪推理超越GRPO等RL基线 |
| 主流大模型 | 非文生图精细推理 | 纯彩铅逐笔绘画均现过度修改,完成7幅画成本差20倍 |
认知局限与可靠性瓶颈
- 视频生成即推理缺陷:Sora-2媲美顶级VLM,但仅13.91%推理过程完全正确
- 视觉深搜可靠性低:VistaHop视觉深搜任务Pass@1仅为24.31%
- 细粒度感知断崖:在动作测试中人类少样本提升13.6%而VLM仅2.9%
- 视觉幽默理解受限:模型严重依赖文本线索,理解卓别林默片比UGC更难
- 自我评估与修正缺陷:GPT-5.6等模型逐笔画最终版均不如中途最佳版
- 工程落地启示:多步Agent任务应引入“质量回退”机制,优于追求最终收敛
底层特征解耦与新模态
- 多模态特征解耦:兰大DeSa2VA将隐藏状态拆解为独立子空间解决模态纠缠
- 统一分割架构:X2SAM覆盖7类分割任务,计算成本大幅降低36.5%
- 手语翻译拓展:港理工构建1311小时香港手语数据集,翻译BLEU提升至19.55
- 嗅觉跨模态统一:NOSE框架统一分子结构、嗅觉受体与语言,达11项SOTA
8.2 视频理解模型与评测
视频理解前沿架构与垂直领域突破
量子位(20260413) | 机器之心(20260421) | 量子位(20260426) | 机器之心(20260428) | 机器之心(20260526) | 极市平台(20260529) | 机器之心(20260603) | 机器之心(20260604) | 量子位(20260608) | PaperWeekly(20260625) | 机器之心(20260703) | 新智元(20260627) | CVer(20260711) | 极市平台(20260703)
- Video-o3:原生交错工具调用,三阶段推理,延迟较VideoChat-R1.5降40%+
- VideoTemp-o3(快手):Agentic框架统一时序定位与深度理解,多轮自我修正验证证据
- OV2-8B:采用Codec码流替代均匀抽帧,固定Token预算下时间定位增益+9.7分
- LFS(华为):126K参数CNN帧选择器,助Qwen3-VL-8B准确率达75%,斩获8项SOTA
- MOSS-VL(复旦):11B模型,交叉注意力提取视觉token并引入绝对时间戳,专攻证据级任务
- VAM(UCL):免训练外挂,51天视频仅保留0.06%帧,Agent式检索压制幻觉
流式实时交互与时序推理
| 框架 | 核心机制 | 关键性能 |
|---|---|---|
| AURA | 双滑动窗口统一流式架构 | 端到端延迟312.2ms,超越GPT-4o |
| Response-G1 | 场景图对齐解决“何时开口” | OVO-Bench主动任务提升12.8% |
| OmniVTG | 2124h数据集+自我纠错链 | 四基准全面SOTA,填补语义盲区 |
| TaRO | 时序敏感奖励+渐进课程 | 揭露CoT推理无效,TVGBench提升8.4% |
- TaRO核心警示:视频大模型带CoT推理路径与直出答案性能无差异,需强制锚定时间戳
医疗视频理解垂直突破
| 模型 | 核心机制 | 关键性能 |
|---|---|---|
| uAI Nexus | MedGRPO强化学习 | CVS评估mIoU达89.7%(GPT仅16.4%) |
| SurgMotion | V-JEPA潜空间运动预测 | 过滤烟雾反光,动态理解F1+16.5% |
- uAI Nexus:4B/7B单卡部署,配套MedVidBench(53万指令对)建立首个医疗公共标尺
- SurgMotion(中科院):全球首个十亿参数级手术模型,1500万帧预训练覆盖17项核心任务
Video-MME-v2:组级非线性评分揭示视频理解评测失真
南京大学团队发布 Video-MME-v2 评测基准,引入组级非线性评分机制,精准暴露传统逐题准确率指标的严重虚高现象,揭示多模态模型在深层逻辑连贯性上的真实短板。
三层递进评测架构
- C1 信息聚合:提取帧、音频、字幕等分散线索,为高级认知提供事实基础
- C2 时序理解:捕捉动作序列、状态变化及事件逻辑,超越静态画面识别
- C3 复杂推理:结合世界知识进行多步推断,最接近人类真实理解水平
组级非线性评分机制
- 能力一致性组:同知识点4题连环发问,采用(N/4)²计分公式,蒙对1题仅得6.25%
- 推理连贯性组:多步推理实施首错截断机制,中间出错后续不计分,清理伪正确
核心发现与能力短板
- 高分泡沫破裂:传统准确率指标严重虚高,模型碎片化识别和盲猜刷榜被粉碎
- 纯视觉盲区:无字幕纯视觉设定下,部分模型开启 Thinking 反而出现性能退化
- 层级递减规律:模型从C1到C3呈显著性能衰减,高层薄弱源于底层误差累积
| 测评对象 | 传统Acc | 非线性得分 | 折损幅度 |
|---|---|---|---|
| 人类专家 | 94.9 | 90.7 | ~4.5% |
| Gemini-3-Pro | 66.1 | 49.4 | ~25% |
| Gemini-3-Flash | 61.1 | 42.5 | ~30% |
8.3 视觉理解前沿技术与评测基准
视觉理解前沿技术与评测基准
AI产品银海(20260330) | 量子位(20260330) | 极市平台(20260331) | 极市平台(20260410) | CVer(20260411) | 百度文心(20260413) | 极市平台(20260413) | 极市平台(20260421) | 机器之心(20260424) | 量子位(20260424) | 量子位(20260424) | 新智元(20260424) | CVer(20260424) | AI科技评论(20260427) | 机器之心(20260429) | 商汤科技SenseTime(20260429) | 新智元(20260429) | APPSO(20260429) | AI异类弗兰克(20260429) | 商汤科技SenseTime(20260506) | CVer(20260509) | CVer(20260514) | 机器之心(20260522) | 极市平台(20260604) | CVer(20260622) | 新智元(20260622) | AIGC开放社区(20260623) | CVer(20260623) | 机器之心(20260623) | 量子位(20260623) | 极市平台(20260623) | 极市平台(20260623) | 机器之心(20260624) | 极市平台(20260626) | PaperWeekly(20260628) | 新智元(20260703) | 机器之心(20260726)
视觉推理与多模态突破
- 推理范式重构:CVPR 2026转向按需推理(VideoAuto-R1输出减3.3倍)与潜在空间去语言化推理(LIVR)
- 多模态断崖:港中文CUHK-X(7模态64K样本)揭示VLM在雷达/IMU等非RGB模态存在严重能力断崖
- 夜间极端场景:EgoNight揭示顶级VLM夜间VQA准确率暴跌至约30.9%
文档与OCR解析革新
- 视觉前端范式革新:MonkeyOCRv2提出视觉编码器转为「证据保留器」,仅优化前端即带来13.2分跃升(57.2 vs 44.0)
- 长程与极限解析:百度Unlimited OCR(3B)实现40+页无失忆解析(OmniDocBench 93.92%);PaddleOCR破译5000年前楔形文字
- 轻量化登顶:PaddleOCR-VL-1.5(0.9B)以94.5分登顶全球第一
统一架构与底层演进
- 多任务统一分割:X2SAM统一7类分割任务(视频超SoTA 14.2点,成本降36.5%);IBISAgent将医学分割转为马尔可夫决策(IoU提35.13%)
- 感知与生成统一:SenseNova U1原生统一理解与生成(推理效率提27%);Vision Banana实现生成式统一感知(mIoU 0.699)
- 极简与轻量化:YOLO26移除NMS(1.7ms延迟,mAP 57.5);DepthVLM单次前向推理预测深度(0.42秒,8B版本δ₁达0.876)
- 零样本与弱监督:WISER无训练实现检索Recall@1提升56.98%;北大CPL++弱监督定位超SOTA 5.81%
前沿视觉评测与检测
- 深度伪造检测:BCNet与AAP解决AI图像检测的语义捷径依赖与MLLM表征漂移问题
- 长尾异常检测:动态Prompt合成刷新异常检测SOTA(I-AURO 92.5%);CARPRT零样本重加权全面优于MPE/WPE
- 跨域融合特征:UniStitch融合几何与语义特征实现零样本跨域SOTA
8.4 多模态检索与长文档理解范式
多模态检索与长文档理解新范式
CVer(20260330) | 量子位(20260406) | 极市平台(20260415) | 机器之心(20260429) | CVer(20260510)
- 主动探索式文档理解:Doc-V*让模型自主翻页,破解RAG输入页数增加先升后降的退化难题,多页QA平均提升49.7%
- 视觉RAG分层决策:UniDoc-RL将检索建模为“搜索-精选-聚焦”三层动作,配合密集多奖励,3B/7B模型相比基线均提升约17.5%
- 化解范式冲突:ReCALL提出“诊断-生成-校准”闭环,修复大模型被压缩为单向量导致的细粒度推理退化,CIRR数据集R@1达55.52%
- 先想象后检索:DreamPRVR引入扩散模型生成全局语义背景过滤局部噪声,截断扩散仅10步,在三大长视频基准全面刷新SOTA
- 双路径表征对齐:TARA用判别式基础模型指导大模型学习类别树,实现多粒度分层识别,粗到细各层级准确率全面提升
核心性能与效率对比
| 模型 / 范式 | 核心指标 | 性能表现 |
|---|---|---|
| Doc-V* (多页文档QA) | 平均提升 | 49.7%(80页场景领先RAG约10个点) |
| UniDoc-RL | 相比基线VRAG-RL | 提升17.5%以上(3B/7B模型均适用) |
| ReCALL (CIRR数据集) | R@1 | 55.52%(相对提升+8.38%,细粒度子集SOTA) |
| DreamPRVR (ActivityNet) | SumR | 156.1(SOTA,截断扩散仅10步保持低延迟) |
| TARA (iNaturalist) | 各层级准确率 | 粗到细全面提升,新类泛化性显著改善 |
9. 图像与视觉生成训练优化及加速
9.1 图像生成底层技术与推理加速
扩散模型推理加速与长视频生成校正
机器之心(20260401) | 机器之心(20260410) | 极市平台(20260410) | AI科技评论(20260414) | AI科技评论(20260417) | AI科技评论(20260425) | 量子位(20260612) | 极市平台(20260707) | 量子位(20260708) | 新智元(20260722)
核心范式:2025年扩散模型加速呈现“免训练、即插即用”趋势,从损失函数、特征缓存、多分辨率到引导控制全面突破。
代表方法与性能对比
| 方法 | 机构 | 技术路线 | 核心成果 |
|---|---|---|---|
| PFM | - | 感知损失替代MSE | 免蒸馏实现4-8步生成,决定少步能力的是监督空间几何 |
| MeanCache | 中联通/南大 | 平均速度修正轨迹漂移 | FLUX.1提速4x,HunyuanVideo提速3.6x |
| TC-Padé | 阿里/浙大 | Padé有理函数预测层间残差 | FLUX.1提速2.88x,Wan2.1提速1.72x,低步数极稳 |
| MrFlow | - | 低清生成+像素超分+高清修缮 | Qwen-Image端到端提速超10x(叠加蒸馏达25x) |
| C²FG | vivo/上交大 | 指数控制适配score衰减 | SiT-XL FID降16%,破解固定CFG理论缺陷 |
| CFG-Ctrl | 清华 | 引入滑模控制做非线性反馈 | 消除高guidance振荡,模型越大优势越显著 |
视频生成专属加速
- 帧间异步去噪(RhymeFlow):关键帧完整计算,非关键帧少算,DiT提速1.5-1.8x,叠加SAP达1.93x
- 盲测高保真:82人双盲测试中62.5%用户无法区分RhymeFlow与原始模型差异
- 交互式加速(Light Interaction):浙大/NVIDIA提出相机轨迹语义化为调度信号,最高提速2.59x
- 动态计算分配:探索新区域时减历史依赖,回访旧区域直接复用去噪输出
长视频退化校正(FreeLOC)
- 退化根因:长视频质量下降本质为位置与上下文双重分布外(O.O.D)问题
- 分层适配:按Transformer层敏感度分配模块(TSA控上下文,VRPR重编码位置)
- 效果显著:Wan2.1和HunyuanVideo在4倍长度时,图像质量领先Direct方法8.2分
9.2 图像生成策略优化与强化学习对齐
图像生成策略优化:从强化学习对齐到可微损失函数
机器之心(20260409) | 机器之心(20260410) | CVer(20260412) | 机器之心(20260416) | 量子位(20260423) | AIGC开放社区(20260424) | CVer(20260427) | CVer(20260503) | 机器之心(20260506) | AI科技评论(20260507) | 机器之心(20260515) | 极市平台(20260515) | 机器之心(20260529) | CVer(20260530) | 量子位(20260729)
- 多参考动态奖励优化:DyRef采用难度自适应与差异化奖励分离,仅14K数据将Qwen-Image-Edit在OmniRef-Bench从4.97提升至8.38,超越Seedream4.5
- 多参考约束协同:DyRef有效解决多类参考图同时满足时的冲突问题,参考图越多缓解效果越显著,且未损害单图编辑能力,反提升整体理解
- OmniRef-Bench评测基准:提供395个专家标注样本,覆盖5类参考类型10种组合,最多4类参考同时约束,填补复杂多参考场景评测空白
- 双精度训练加速:Sol-RL采用FP4快速探索与BF16精训解耦,将扩散RL后训练收敛速度最高提升至4.64倍
- 统一自适应生成:AdaGen将四大生成范式统一建模为MDP,极轻量策略网络实现17%-54%性能提升,计算开销<0.4%
- 熵信号双重加速:Drift-AR利用连续空间预测熵同时加速AR与视觉解码,单一生成信号实现3.8-5.5倍加速
- 方向低秩蒸馏:WaDi借鉴RoPE仅调整方向,以10%参数达单步SOTA,下游加速86%
- 多任务蒸馏解耦:DiffusionOPD证明闭式KL蒸馏与PPO梯度期望等价但无方差,兼容ODE并全面超越联合RL
- 在线自蒸馏防遗忘:D-OPSD采用双分支协同优化策略,解决少步扩散模型微调时的灾难性遗忘
- 评测指标可微化:FD-Loss将FID解耦为统计估算与梯度回传并转化为可微损失,FID从2.29降至0.77,推理零开销
- 少步生成RL突破:TDM-R1拆分代理奖励与生成器双轨学习,4步GenEval达0.92,全面超越GPT-4o
核心方法与性能对比
- MILR:隐空间测试时推理,零参数更新获GenEval 0.95
- SOAR:数据驱动轨迹纠偏,完全免奖励模型,Aesthetic达5.94
- PromptEcho:冻结VLM直接做Reward,免训练提升+7pp文字准确率
9.3 阶跃 Step Image Edit 2:轻量级图像编辑模型训练范式
多专家自演化学习与分布匹配强化学习(DARL)
性能表现
- 轻量碾压:3.5B参数在KRIS-Bench综合排名第一,超越12B-20B级开源模型
- 极速响应:单次生图仅需0.5-2s,以极低资源成本逼近大模型表现
- 能力全覆盖:支持中英文渲染、局部编辑、视觉推理、主体一致性、风格迁移
三大技术创新机制
| 机制 | 核心思路 | 解决痛点/效果 |
|---|---|---|
| 多专家自演化(MESE) | 衍生细分专家差异化训练,迭代自蒸馏聚合回基座 | 不增参数实现能力非线性跨越 |
| 分布匹配强化学习(DARL) | 输出分布与参考分布全面对齐 | 解决传统RL奖励稀疏、方差大问题 |
| 三级数据质控 | 智能体自动清洗→大模型评估→人工筛选 | 保障训练数据质量与分布达标 |
数据工程构建
- 图像编辑数据:超5000万条(真实挖掘+定向合成+高质量开源)
- 文字渲染数据:2000万条(自研排版系统生成),攻克行业文字渲染难点
9.4 扩散模型预测目标反思:JiT 直接预测原图(CVPR 2026)
JiT:从噪声预测到图像预测的范式重构
- 核心反思:何恺明团队CVPR 2026提出JiT(Just image Transformers),指出扩散模型主流的“预测噪声”范式偏离本质,应直接预测原图
- 极简架构:纯像素输入+标准ViT直接预测原图,无VAE、Tokenizer、CLIP对齐及额外损失
- 高维崩溃现象:低维下各目标表现相当,但高维空间(Patch 16×16及以上)预测噪声彻底崩溃
- 反直觉发现:输入端加瓶颈层降维反而提升生成质量,契合流形学习过滤噪声的本质
- SOTA性能:ImageNet 256×256和512×512上分别达FID 1.82和1.78,完全不依赖复杂组件
预测目标范式对比
| 预测目标 | 目标分布 | 容量需求 | 高维Patch表现 |
|---|---|---|---|
| 预测噪声 | 均匀弥散高维空间 | 极高,易崩溃 | FID指数级飙升 |
| 预测速度场 | 一半流形一半外 | 较高 | 逐渐恶化 |
| 预测原图(JiT) | 集中低维流形 | 低,天然擅长 | 扩展至64×64仍稳健 |
研究脉络与启示
- 脉络传承:从ResNet→MAE→JiT一脉相承,坚持极简架构与“预测目标”的本质探索
- 范式启示:暗示当前扩散模型复杂的工程技巧,可能只是在补偿错误的预测目标
10. 视觉认知推理与渲染引擎
10.1 ReasonBrain:假设性指令图像编辑推理框架(ICML 2026)
ICML 2026 图像编辑推理前沿:ReasonBrain 与 HOI-Edit
- 框架定位:ReasonBrain与HOI-Edit标志着图像编辑从"改像素"向"改交互、改推理"升级,均已被ICML 2026接收
- ReasonBrain框架:首个专攻假设性指令的编辑框架,能理解"冰块融化"等需结合物理与因果规律的隐含意图
- HOI-Edit基准:首个层级化人-物交互评测体系,推动编辑模型同时满足身份保持、空间指代、动作推理多重约束
- 轻量融合策略:ReasonBrain仅通过LoRA微调即可高效适配,无需修改MLLM与扩散模型底层架构
核心数据与性能表现
| 评测维度 | 关键指标 | 具体表现 |
|---|---|---|
| 因果推理(ReasonBrain) | Ins-Align | 从0.501跃升至0.858 |
| 推理编辑(ReasonBrain) | IP(身份保留) | 9.72(排名第一) |
| 基础交互(HOI-Edit L1) | 交互分数 | 提升约22%超越闭源基线 |
| 上下文理解(HOI-Edit L2) | 约束成功率 | 提升约26%超越闭源基线 |
| 因果推理(HOI-Edit L3) | 约束成功率 | 提升约22%超越闭源基线 |
数据集与评测创新
- Reason50K数据集:含51,039个样本,填补物理/时间/因果/故事四大深度推理场景的数据空白
- HOI-Eval协议:基于成对区域定位目标,Pearson相关性显著优于CLIPScore等全局相似度指标
- 细粒度推理提取:含视觉与文本双分支,通过ID控制器锚定目标物体,解决多相似物体的语义歧义
SCPE自纠错框架核心
- 闭环机制:四智能体(Generator-Analyzer-Reflector-Curator),利用I2V模型视频轨迹暴露交互失败原因
- 工具书机制:将个例失败经验沉淀为跨样本策略,下轮编辑显式强调目标与物理后果
- 消融关键发现:官方Prompt Enhancer导致身份漂移,完整SCPE(交互0.8199/身份0.8954)优于去工具书版,证明经验沉淀是提升核心
- 泛化验证:接入TurboDiffusion及独立评测器性能趋势一致,优势源于白盒诊断与经验积累
10.2 视觉生成的推理-执行解耦架构
Unified Thinker:思考与执行解耦的视觉生成推理架构(ACL 2026)
- 核心瓶颈:开源视觉生成模型的短板不在生成器,而在缺乏独立推理模块;紧耦合训练不稳定,外挂 LLM 易致语义-视觉错位
- 解耦架构:浙大&阿里提出 Unified Thinker(ACL 2026 Oral),Thinker 拆解意图输出可执行计划,Generator 专注高精度像素合成
| 模块 | 角色 | 核心职责 |
|---|---|---|
| Thinker | 大脑 | 分层拆解意图,输出结构化的可执行计划 |
| Generator | 双手 | 接收指令,专注像素合成与视觉保真 |
- 数据工程:构建 4 万样本的 HieraReason-40K 数据集,推理链路固定为意图拆解→逻辑具体化→视觉转译
- 编辑法则:Prompt 严禁描述未改变区域,从源头切断多余视觉信号干扰,有效减少语义漂移
- 训练策略:推理导向阶段使用 GRPO 强化学习(结合多路径探索与视觉质量反馈);生成导向阶段使用随机采样策略提升复杂指令执行保真度
- 实验表现:在 RISEBench(推理图像编辑)与 WiseBench(知识密集型文生图)上显著优于开源基线,时间演化与空间定位任务接近闭源模型水平
- 跨模型迁移:Thinker 挂载于未参与训练的底座(如 Qwen-Image、BAGEL)仍能显著提升逻辑执行准确度
- 开源信息:代码已开源(GitHub: LivingFutureLab/UnifiedThinker)
10.3 AesFormer:美学照片重构任务与美学理解-执行解耦架构(ICML 2026)
美学照片重构:从表层修饰到结构级重构的范式跃迁
- 任务定义:北大首提「美学照片重构」,将美化从调色/美颜表层升级为构图/视角/姿态的结构级重构(ICML 2026)
- 数据集构建:AesRecon含9071对严格语义对齐的「普通原片→出彩成片」人像样本,由拍照教学视频挖掘获得
VCMP四阶段语料挖掘流水线
| 阶段 | 核心任务 |
|---|---|
| 出彩成片定位 | 在视频中定位最终展示的高质量成片 |
| 普通原片匹配 | 为成片匹配语义一致但效果欠佳的原片 |
| 照片去干扰 | 去除字幕、图标、辅助线等遮挡元素 |
| 拍摄事件对齐 | 过滤非同一拍摄事件的照片对 |
- 解耦架构:分离美学规划器(AesThinker生成方案)与美学编辑器(AesEditor像素执行)
- 美学规划:AesThinker基于Qwen3-VL-8B,采用冷启动SFT+美学引导GRPO,沿七个递进摄影维度生成优化方案
- GRPO三类奖励:格式奖励、语义对齐奖励、美学创意奖励,鼓励模型探索多样优化路径
- 美学执行:AesEditor基于Qwen-Image-Edit-2511,按规划方案执行像素级重构
- 专门训练不可替代:GPT-4o+通用编辑器未能稳定提升,证明美学理解与执行均需专门训练
- 性能表现:全面优于开源模型,多数指标超越Google闭源商业模型Nano Banana Pro
10.4 移动端神经渲染:Arm GPU 架构转型与 MegaLights 落地
移动端神经渲染管线与 Mali GPU 架构演进
-
神经渲染嵌入移动图形管线:Arm与Sumo Digital联合发布《光影新生》技术演示,首次将神经图形技术完整嵌入真实移动端开发流程,验证移动设备可承担此前仅限高端PC/主机的实时光照计算
-
核心技术与渲染收益:
| 技术模块 | 功能定位 | 效果收益 |
|---|---|---|
| NSSD(神经超采样与降噪) | 低分辨率渲染后AI恢复细节 | 降低GPU负载,保图像质量 |
| NFRU(神经帧率提升) | 神经网络生成中间帧 | 提升动态流畅度,降渲染开销 |
| MegaLights(UE5.5光照) | 支持大量实时动态光源+光追阴影 | 移动端实现主机级动态光照 |
- 功耗预算重分配:传统移动端受功耗墙限制,Arm转变思路,先低成本基础渲染,由神经网络恢复细节,省出的功耗空间转投给更复杂光照与场景效果
- AI下沉为渲染模块:思路与PC端DLSS/FSR同源,AI不参与游戏逻辑,而是作为渲染管线组成部分嵌入图形管线
- 光照升级为玩法核心:MegaLights动态光照系统在移动端落地,使光线突破传统限制,在游戏中承担氛围营造、导航和交互提示功能
- Mali GPU架构转型:下一代Mali GPU将首次集成专用神经加速器,GPU负责图形计算,加速器负责AI推理,标志移动GPU向图形+神经协同架构转变
- 已纳入Arm CSS平台:专用神经加速器已纳入今年推出的移动端Arm CSS平台,现有UE项目可通过插件逐步引入神经渲染管线
交叉引用
- ai-agent - AI Agent与智能体
- ai-coding - AI编程与开发
- ai-industry - AI行业与商业
- llm-frontier - 大模型前沿
- embodied-ai - 具身智能与机器人
- ai-products - AI产品与落地