多模态大语言模型的安全格局演变:新兴威胁与防护措施综述
arXiv:2608.07535v1 公告类型:新 摘要:多模态大语言模型(MLLMs)通过模态对齐与融合整合异构模态,实现更强的理解与推理能力。然而,这种架构转变重塑了机器学习的安全格局。模型复杂性的增加和跨模态交互引发了新型威胁,包括模态整合受损、模态错位以及融合安全风险,反映了威胁建模在单模态假设之外的转变。这些转变反过来对安全解决方案施加了新的约束,而这些约束并未被根植于单模态学习的现有框架所涵盖。基于这些挑战,本综述对MLLMs安全格局的演变进行了系统分析。我们首先提出了一种基于多模态的安全威胁分类法,并分析了威胁模型的变化,涵盖对抗性攻击、数据投毒、越狱和幻觉。随后,我们总结了更新后的安全假设,并据此整理了MLLM安全策略的最新进展。最后,我们讨论了开放性挑战和未来方向,以推动多模态系统更原则化、可扩展的安全机制的发展。