作者丨张 璐
编辑丨幸丽娟
-
算力与显存边界的硬性制约:基于标准 Transformer 自注意力机制的计算与 KV Cache 显存开销随序列长度呈二次方级攀升。在长达数十分钟甚至数小时的连续视频输入下,即便采用先进的长序列优化策略,端侧受限硬件也很容易因为显存急剧膨胀而无法继续运行。 -
时序下采样对几何连续性的破坏:工程中常用的均匀抽帧或关键帧截取方案,本质上是以牺牲细粒度时序信号为代价来换取计算效率。但 3D 空间关系高度依赖连续的视差与几何线索,大幅跳帧会让模型直接漏掉关键的空间信息,而且事后很难补回来。
01
为什么不能全用 TTT?
3:1 混合架构的取舍
▎纯 TTT 会伤语义对齐,所以保留 25% 全注意力层
-
3:1 的层级交织:在 Decoder 里,每 4 层注意力中有 3 层改成 TTT 层,专门负责长视频里空间时序信息的动态压缩和增量更新; -
保留 25% 的全注意力锚点层:这些层继续做全局注意力,参数不更新,主要负责跨模态特征的全局对齐和逻辑推理,用很低的计算代价保住预训练模型原有的推理能力。
▎大块更新提升效率,滑动窗口补回局部连续性
-
主干路(TTT 分支):负责跨 Chunk 的长程记忆,通过持续更新快权重来保存长期的空间环境信息; -
旁路(滑动窗口注意力 SWA):和 TTT 分支共享?、?、?投影,窗口大小? 不小于 Chunk 大小?。SWA 负责覆盖 Chunk 内部的因果注意力,把单帧内部以及相邻帧之间的细粒度时空关系补回来。
02
让快权重真正“看懂”三维空间:
3D 卷积与稳定更新
-
空间结构被打碎:视频被切块、展平成一维序列后,逐点投影把原本相邻的像素和体素拆成了互不相干的点。局部视差、边缘连续性、深度梯度这些天然存在的空间关系,在进入快权重更新之前就已经丢失了。 -
缺少空间先验,只能硬猜:快权重本质上是靠拟合当前块的 ?和?来记东西。如果 ? 和?本身没有局部空间信息,它就只能从一堆孤立的点里硬推 3D 结构,既容易造成梯度震荡,学到的空间表示也不稳定。
▎用 3D 卷积给视觉特征加入局部几何信息
▎用 Muon 优化器让在线更新更稳定
03
训练数据怎么选?
从稀疏问答到密集场景描述
▎传统空间问答数据的问题:监督信号太弱
▎用密集场景描述提供更强的训练信号
-
全局场景环境:说明房间类型和整体布局,先让快权重建立起宏观空间框架; -
实体清单与精准计数:详细列出视野中出现过的所有物体类别和数量,促使快权重在长时序中持续追踪每个实例,避免物体移出视野后就被忘掉; -
物体空间关系:描述物体之间的相对方位和距离,引导快权重记录它们的空间布局关系。
▎两阶段训练:先打基础,再做任务精炼
04
实验结果:2B 模型在空间基准
和长视频上的表现
▎ VSI-Bench 与 MindCube 上的表现
▎120 分钟长视频测试:能否扛住显存压力
▎显存和计算量:从二次方到线性
-
滑动窗口 KV Cache:仅维护固定长度?的局部上下文,超出的历史键值对直接丢弃,显存占用恒定; -
TTT Pending 缓存:仅作为增量累积单元,一旦达到 Chunk 大小? 便触发一次快权重更新,随后立即清空。
05
结束语:
流式空间记忆的意义和待解问题
为了方便大家抱团交流、互通会议消息,我们专门建了 ECCV 2026 参会交流群!进群你会解锁这些「福利」?
-
会议情报站:投稿 DDL、格式规范、评审进度……关键节点第一时间送达,再也不怕错过 deadline,投稿准备稳稳的。
-
同行茶话会:天南海北的同行都在群里,聊心得、碰思路、攒人脉,科研路上我们同行。
-
前沿补给站:最新研究成果、热点方向实时同步,结合会议主题帮你捋清投稿脉络,给论文灵感加满油。
-
现场后援团:(会议期间专属开启):到了会场也不用慌——
路线导航:场馆分布、报告厅怎么走,群里随时问;
议题共读:热门 session、Keynote 现场探讨,错过也能追;
Poster 汇编:现场海报精华整理,一键收藏不遗漏;
约局广场:约饭局、采访局、交流局……想唠嗑、想合作、想面基,群里发起就成。
? 进群传送门: 扫码进群或添加微信Qvv0909777,备注:ECCV + 单位/学校+姓名+方向。
搞科研/搞技术,信息差很重要。
来,一起快人一步!
上车,带你看遍全球 AI 顶会精华
可独家畅览:
专家演讲PPT
大会报告全文
热门论文解读
学术新星访谈
扫描上方二维码
或点击「阅读原文」关注专区。