KDD 2026|破碎的记忆:利用劣化效应识别并缓解扩散模型的训练集图像复刻风险
本文提出了一套实时检测与自适应缓解框架:不依赖训练集比对,不修改用户提示词,也不需要中断后重新生成,直接在生成过程中监测模型状态,并在记忆风险出现时进行轻量修正,使生成轨迹回到稳定、安全的非记忆分布。
本文提出了一套实时检测与自适应缓解框架:不依赖训练集比对,不修改用户提示词,也不需要中断后重新生成,直接在生成过程中监测模型状态,并在记忆风险出现时进行轻量修正,使生成轨迹回到稳定、安全的非记忆分布。
本文提出 3D-ANC,希望为 3D 点云模型装上一块“磁力分拣盘”:借助神经坍缩机制,让同类点云特征自动聚向自己的类别磁极,让容易混淆的异类进一步拉开距离,从模型内部提升点云识别的对抗鲁棒性。
USENIX Security 2026 我实验室将有 8 篇论文在会上进行分享!
USENIX Security 2026 我实验室将有 8 篇论文在会上进行分享!
团队提出Unified Visual Safety Regulator(UVR)。UVR 在生成过程中主动定位不安全视觉区域,并对相关危险信息流进行调控,从而统一提升图像生成与图像编辑任务的安全性。该方法无需重新训练模型,却能够在安全性、图像质量和编辑能力之间取得良好平衡。
复旦大学系统软件与安全实验室面向新生组织开展“系统安全专项实验课”
复旦白泽夏季运动会纪实
复旦大学系统软件与安全实验室对小程序模板化开发带来的安全风险进行了系统性研究,揭示了恶意行为借助模板大规模传播的现象,并开发了自动化检测工具加以识别。
团队提出了AgentGuard,一套面向工具调用型智能体的轻量级访问控制框架。AgentGuard 能够无缝集成到现有智能体系统中,用户可通过可视化界面,以表单化方式根据实际需求灵活配置安全规约;系统则对工具调用请求与安全规约进行匹配,对未授权或高风险调用进行识别与拦截,并完整记录执行轨迹,从而支持事后审计与安全溯源。
团队发表于 ICLR 2026 的工作 PRISON,首次系统研究了大模型在复杂社交博弈环境中的行为风险。研究发现:当模型面对利益冲突、信息不对称和生存压力时,它们不仅会“完成任务”,还可能表现出欺骗、推责、操控甚至策略性联盟等行为倾向。