论文核心信息
arXiv:2608.13578v1 Announce Type: new
摘要
Transformer架构依赖密集的自注意力机制来建模长距离依赖关系,但这种机制在序列长度上表现出二次方复杂度。我们提出了BCMT(Blockwise Causal Memory Transformer,分块因果记忆Transformer),一种用于长上下文语言建模的架构,它将局部token交互与全局上下文传播解耦。
密集因果自注意力在局部块内独立应用,同时每个块通过指数因果记忆生成一个自适应摘要进行聚合。该记忆随后被注入回token表示中,从而在不依赖显式全局注意力的情况下,实现长距离上下文信息的高效传播。
与标准Transformer和循环记忆架构不同,BCMT既不维持远距离token之间的密集交互,也不维护学习得到的记忆状态。其记忆机制完全可并行化,并且与标准密集自注意力的实现兼容。
在上下文长度高达1024个token的语言建模实验中,BCMT取得了与密集Transformer相当的验证性能,同时显著提高了训练吞吐量并降低了内存消耗。一项消融研究进一步证实,这些改进源于所提出的记忆机制。
这些结果表明,由分块摘要构建的指数因果记忆,为长上下文语言建模中的密集全局注意力机制提供了一种有效的替代方案。