作者丨张璐
编辑丨岑峰
01
告别“只读不练”:多模态 AI
如何从“看懂视频”跨入“具身体验”?
02
Show-o 架构突破:
用单个 Transformer
打通“文本生成”与“高效绘图”
▎纯自回归范式
▎连续扩散范式
03
从静态生成到动态视频:
Show-2 破解多模态统一的三大技术瓶颈
▎双向反哺:不仅用“理解”教生成,更用“生成”提精理解
▎帧间流畅度革命:3D Tokenizer 与时空双向注意力
▎兼顾“高层语义”与“像素细节”的双路径架构
04
大脑落地物理世界:
从多模态大模型到机器人闭环控制
-
VLA 策略模型:在 VLM 底座的基础上加入动作调制层,能够根据视频输入和指令直接预测机器人应采取的物理动作。 -
世界模型(World Model):能够以当前视觉和动作输入为条件,预测未来环境的像素级变化。 -
世界动作模型(World Action Model, WAM):将两者融为一体,实现了“既预测动作,又预测未来动作产生的视觉结果”的闭环。
05
现场互动 Q&A
▎问:在 Show-2 中,团队将视觉理解与生成统一到了同一个模型架构中,并展现出了极高的灵活性与效率。请问在特定领域数据相对稀缺(Data Scarce)的场景下,这种统一理解与生成的架构,是否能比分立的模型带来更显著的性能提升?
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」?
-
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
-
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
-
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
-
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。