近日,国家网络安全学院2022级博士生张神轶撰写的论文被第33届ACM计算机与通信安全会议(ACM Conference on Computer and Communications Security,ACM CCS 2026)录用。论文题目为“MMAligner: Safeguarding Multimodal Large Language Models through Representation Calibration”(《通过表征校准防护多模态大语言模型》),指导老师为国家网络安全学院王骞教授(通讯作者)、赵令辰副教授,与西安交通大学沈超教授合作完成。国家网络安全学院2022级本科生李学彬、计算机学院2022级本科生汪子皓参与了该成果的研究工作。
图1 基于表征校准的多模态大语言模型安全加固方法概览
随着多模态大语言模型(Multimodal Large Language Models,MLLMs)在开放式生成任务中的广泛应用,其安全对齐能力也面临新的挑战。研究发现,面对语义等价的有害请求,模型往往能够拒绝纯文本输入,却可能在多模态输入下生成危险内容。针对这一问题,作者提出了一种基于表征校准的多模态安全加固方法MMAligner。该研究首先从模型内部表征的几何结构出发,分析不同模态下安全行为差异的根本原因。作者发现,多模态安全失效的关键原因在于有害图文输入的内部表征发生了显著偏移,落在拒答边界之外,从而绕过了模型已有的安全机制。基于这一发现,MMAligner通过表征校准将有害多模态输入重新映射至已有拒答边界内。该方法利用硬下界约束确保危险表征能够跨越边界并触发拒答,引入软上界约束避免表征过度偏移,同时对良性输入实施实例级和统计级保持约束以维持模型的通用性能。实验结果表明,MMAligner在主流开源模型上均表现出良好的安全增强效果,使多模态有害输入的平均拒答率提升至99%,同时将通用能力下降控制在2%以内。该研究不仅揭示了多模态安全退化的表征机制,也为构建高效、低损耗且具有可解释性的多模态大模型安全防护提供了新的技术路径。
据悉,本届ACM CCS会议将于2026年11月15日至19日在荷兰海牙召开。ACM CCS于1993年首次举办,已有三十多年历史,是国际公认的信息安全领域旗舰会议,与IEEE S&P、USENIX Security、NDSS并称为信息安全领域国际四大顶级学术会议,也是中国计算机学会(CCF)推荐的A类会议,被录用的稿件反映了网络安全领域国际最前沿的研究水平。
来源:武汉大学国家网络安全学院
《信息网络安全》创刊于2001年,是由公安部主管,公安部第三研究所、中国计算机学会主办,面向国内外公开发行的国内首批信息安全类期刊之一,于2015年成为中国科技核心期刊,2017年成为中国科学引文数据库来源期刊,2018年成为中文核心期刊,2022年入选CCF计算领域高质量科技期刊分级目录。中文核心期刊
中国科技核心期刊
中国科学引文数据库来源期刊
CCF计算领域高质量科技期刊