Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
视觉语言模型
视觉语言模型
技术
多智能体系统中用于视觉理解和交互的基座模型
11 次提及
13 个连接
首次出现: 2026-04-30
最近出现: 2026-07-29
关系图谱
关系 (13)
使用技术 (9)
ViF
PAT3D
PAT3D
BridgeACT
GPT-4V
IGen
KeyTailor
SUGAR
SemiEarth
应用于 (4)
多模态理解
具身智能
医疗AI
半监督语义分割
相关文章 (11)
1.
量子位 - 终结多智能体视觉幻觉“滚雪球”!新国立等提出ViF:无需改造模型,即插即用
2.
机器之心 - ICLR2026|CMU等团队让AI生成的3D场景真正「站得住」:PAT3D把文生3D从能看推进到能模拟、能交互
3.
机器之心 - ICLR2026|CMU等团队让AI生成的3D场景真正「站得住」:PAT3D把文生3D从能看推进到能模拟、能交互
4.
具身智能之心 - BridgeACT指出了人类数据虽然很多,但机器人却几乎用不上的“根因”
5.
具身智能之心 - 如何从人类视频中学习机器人操作?近400篇工作一览数据配置、学习方式、核心挑战!
6.
具身智能之心 - XsparkAI一篇长达37页的具身系统综述和分级,全面盘点可信赖的具身智能
7.
具身智能之心 - CVPR’26从互联网图片到机器人策略学习的那堵墙被IGen拆掉了
8.
极市平台 - CVPR2026|视频虚拟换衣新SOTA!KeyTailor实现高保真动态细节与背景一致性双提升
9.
具身智能之心 - 为什么人类视频很多,人形机器人却仍然学不会操作?SUGAR给出了答案
10.
DeepTech深科技 - MIT黑客松冠军让AI控制了人的手,被全网传成“AI夺舍人体”,我们和当事人聊了聊
11.
CVer - 遥感顶刊TGRS2026!SemiEarth:将视觉语言模型引入到遥感半监督语义分割