Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
DiT
DiT
技术
DiT,基于 Transformer 架构的扩散模型,用自注意力机制替换传统 U-Net 用于图像和视频生成
29 次提及
33 个连接
最近出现: 2026-07-24
关系图谱
关系 (33)
使用技术 (30)
FLUX.1-Fill
C²FG
Sora
ChangeBridge
Omni2Sound
PAE
Qwen3VL-4B-GR00T
KeyTailor
Leadde
Agora-1
可灵
Bernini
BLM
BWM-Fast
PE-Field
位置编码
VAM 1.0
可灵 AI
可灵1.0
ICRDrag
Wan2.1-I2V-14B
LingBot-World 2.0
文生视频模型
V2Fun
PixVerse V6
Xiaomi-Robotics-1
AAAI视频一致性挑战赛
HiDream-I1
Transformer
扩散模型
应用于 (3)
视频生成
3D生成
多模态理解
相关文章 (29)
1.
极市平台 - CVPR2026|北大彭宇新团队开源免训练虚拟试衣框架PG-VTON,通过推理控制解锁预训练修复模型“隐藏的虚拟试衣能力
2.
AI科技评论 - 上交大xvivo团队:一个简单改动,让diffusion全面提升丨CVPR2026
3.
AI科技评论 - Sora之父「跑路」背后的五大真相是什么?
4.
AI科技评论 - 独家|华为系帧跃科技完成千万美金天使轮融资,将发布视频产品Leadde
5.
AIGC开放社区 - 字节开源王炸Bernini!轻松拿捏各类视频编辑任务
6.
智东西 - 近30亿,阿里领投了一位字节老将
7.
暗涌Waves - 15亿元押注原生全模态,资本究竟看中什么?
8.
CVer - CVPR2026武汉大学提出ChangeBridge:遥感多模态控制时空图像生成框架
9.
机器之心 - CVPR2026Highlight清华打破多模态音频生成的「通才困境」:Omni2Sound音频基础模型开源!
10.
极市平台 - 重建好≠生成好!交大&阿里提出PAE:从流形几何重塑VAE潜空间,训练提速13倍、gFID1.03新SOTA
11.
新智元 - VLA模型为何忽视语言?破解指令跟随幻觉,分布外场景泛化新突破
12.
极市平台 - CVPR2026|视频虚拟换衣新SOTA!KeyTailor实现高保真动态细节与背景一致性双提升
13.
量子位 - 抢先李飞飞!世界模型能多人联机玩FPS游戏了
14.
硅星人Pro - 快手拆了可灵,字节拆豆包还会远么
15.
AIGC开放社区 - 字节开源王炸Bernini!轻松拿捏各类视频编辑任务
16.
PaperAgent - 开源第1、闭源第2!同济世界模型登顶WorldArena
17.
AI科技评论 - ICLR2026|美图提出位置编码场PE-Field,让DiT感知和控制3D空间
18.
量子位 - 24小时直播,只靠一张照片?虎牙实时多模态数字人VAM1.0率先突围行业三堵墙
19.
"Z Finance" - 独家|「可灵」即将完成30亿美元融资,中东基金或领投
20.
光锥智能 - 快手装不下180亿美元的可灵AI
21.
机器之心 - 上海交大提出ICRDrag:首个上下文区域拖拽模型,实现精准可控图像编辑
22.
AI科技评论 - 专访上交大牛力团队ECCV2026新作:基于上下文学习的区域拖拽模型,重塑高精度图像编辑|GAIRPaper109
23.
机器之心 - ECCV'26为视频虚拟试衣解锁自由视角,TryOnCrafter玩转4D试衣代理
24.
APPSO - LingBot-World2.0实测:无限时长、随机变化的世界,终于来了?
25.
新智元 - 全球首个小时级世界模型来了!中国造,已开源
26.
PaperWeekly - 视觉版「下一个token预测」找到了?何恺明等押注视频生成
27.
机器之心 - 鸿蒙为何选中一家世界模型「狂想者」?拆解极顶数创的AI3D底牌
28.
卡尔的AI沃茨 - 小米10万小时喂出来的机器人大脑,我来验收一把
29.
极市平台 - 对话贾旭教授:一位跨界的视觉内容生成持续探索者