Wesum AI
首页
图谱
主题百科
首页
/
图谱
/
LLaVA
LLaVA
模型
LLaVA,开源社区开发的多模态大模型,结合视觉编码器与LLM实现图像和文本理解
3 次提及
4 个连接
首次出现: 2026-04-14
最近出现: 2026-07-04
关系图谱
关系 (4)
使用技术 (3)
TransPrune
多模态指令微调
注意力机制
应用于 (1)
多模态理解
相关文章 (3)
1.
AI科技评论 - GAIRPaper106|追踪视觉Token的演化轨迹,实现无损压缩与60%推理加速|CVPR2026
2.
极市平台 - 多模态大模型真能看懂“细粒度”世界吗?FG-BMK揭示LVLM细粒度视觉理解瓶颈
3.
量子位 - 只用15%数据,多模态指令微调反超全量训练15.8%!