我院在机器学习领域取得新进展,相关成果发表于NeurIPS
近日,我院工程中心刘祥根副教授课题组在人工智能安全领域取得重要进展。相关研究成果“BayesAT: Bayes-Guided Progressive Distillation for Semi-Supervised Adversarial Training”被机器学习领域国际顶级会议 Conference on Neural Information Processing Systems接收。刘祥根副教授为该论文通讯作者,2025级硕士研究生郭一墨为第一作者。
背景:深度神经网络在图像识别等任务中表现优异,但其对对抗扰动的脆弱性一直是制约模型安全落地的核心问题。对抗训练(Adversarial Training)是目前最有效的防御方法之一,然而其高度依赖大规模标注数据,标注成本高昂。半监督对抗训练(Semi-Supervised Adversarial Training, SSAT)通过引入未标注数据缓解了这一瓶颈,通常采用“教师-学生”框架,由教师模型为未标注数据提供伪标签监督。然而,现有方法普遍采用静态监督信号——无论是硬伪标签还是固定温度的软标签,整个训练过程中监督强度保持不变,无法适应学生模型不断进化的学习能力。特别是在教师模型性能进入平台期后,其过度自信的预测会放大监督信号的方差,严重制约学生的鲁棒泛化性能。
方法:论文从贝叶斯知识蒸馏的全新视角重新审视半监督对抗训练问题,提出了贝叶斯引导的渐进蒸馏框架BayesAT。如图1所示,BayesAT主要包含两个核心模块:两阶段渐进蒸馏与置信度自适应样本重加权。

图1:本文提出的BayesAT框架示意图
其中,研究团队将SSAT形式化为从贝叶斯教师出发的知识蒸馏过程,推导了学生模型鲁棒泛化间隙的上界,揭示了监督信号中固有的、随训练阶段变化的偏差-方差权衡:低温度产生尖锐分布、偏差低但方差高,高温度则平滑分布、控制方差但引入偏差。据此,BayesAT设计了从低到高的温度升温调度策略——训练初期采用低温度,利用高置信度监督帮助学生快速建立可靠的决策边界;训练后期逐步升高温度,通过平滑的监督信号控制方差并刻画类间关系。同时,团队设计了置信度自适应样本重加权机制,根据教师预测的置信度衡量样本偏差,使训练焦点从可靠样本逐步过渡到模糊样本,与温度调度形成互补。二者协同实现了偏差与方差的动态平衡。
实验:研究团队在CIFAR-10、CIFAR-100和ImageNet-200三个基准数据集上开展了系统实验,并与Standard、TRADES、MART、RST、SGLR、WSCAT等多种代表性方法进行了全面比较,采用FGSM、PGD、CW、Auto Attack等多种攻击进行鲁棒性评估。结果表明,BayesAT在多项核心指标上展现出优异的综合性能。同时,消融实验进一步验证了温度升温调度、软标签与置信度重加权各组件的有效性,证实了理论驱动的动态监督策略优于固定温度或降温调度。

图2:BayesAT在部分数据集上的实验结果与消融实验结果
该研究针对半监督对抗训练中静态监督导致的偏差-方差失衡问题,通过贝叶斯视角下的理论分析指导温度调度设计,为提升深度模型的对抗鲁棒性、降低标注依赖提供了新的研究思路,在自动驾驶感知、医学影像分析等安全敏感场景中具有潜在应用价值。
作者简介:

刘祥根,四川大学副教授,博士生导师,入选天府峨眉计划青年人才计划(四川省“千人计划”),国家重点研发计划“工业软件”课题负责人,四川大学计算机组成与结构虚拟教研室副主任,四川大学学报(自然科学版)青年编委。2021年于清华大学获得博士学位,同年被四川大学人才引进为副教授。研究方向包括文本生成、模式识别、AI药物设计等,在Nature Communications等国际重要期刊会议上发表学术论文 30 余篇,其中一篇少样本表征学习论文被列为高被引文章。以第一作者发表在人工智能顶级会议ACL上的文本可控生成的文章单篇被引100余次。担任中国生物工程学会计算生物与生物信息专委会委员、中国药学会麻醉药物专委会委员等职务,常年担任AAAI、IJCAI、ICML、NeurIPS、ICCV、ACL、ICLR、EMNLP、ACM MM、NLPCC、IEEE Transactions on Neural Networks and Learning Systems(TNNLS)、 TCBB等20余种国际权威会议和期刊的审稿人,并多次在著名国际、国内会议上做学术报告和讲习班报告。

郭一墨,四川大学计算机学院(软件学院)2025级硕士研究生,研究方向为自然语言处理、神经网络基础理论等,相关研究成果已被CVPR2026,NeurIPS2026等顶级会议录用。
