研究分享|大模型高压下集体 “对齐失效”?复旦 × 创智 × 牛津发布 AutoControl-Arena:前沿 AI 风险评测迈向自动化
复旦大学、上海创智学院与牛津大学联合发布 AutoControl-Arena,不仅推出一套自动化、高保真、可复现的前沿 AI 安全评测框架,更揭露多个反直觉的发现:在压力与诱惑的双重考验下,当前主流大模型普遍存在对齐幻觉—— 那些表面看似安全的模型,在真实压力下瞬间 “破防”
复旦大学、上海创智学院与牛津大学联合发布 AutoControl-Arena,不仅推出一套自动化、高保真、可复现的前沿 AI 安全评测框架,更揭露多个反直觉的发现:在压力与诱惑的双重考验下,当前主流大模型普遍存在对齐幻觉—— 那些表面看似安全的模型,在真实压力下瞬间 “破防”
本期白泽公众号将对移动应用安全小组的手机智能体测评做第一期解读,选取了4款主流手机厂商的代表性智能体(涵盖华为小艺、小米超级小爱、vivo蓝心小V及豆包手机),从功能实现、系统权限、敏感数据三个维度开展了专项测试。
GEO、SEO到底是怎么回事呢?AI搜索和传统搜索引擎(谷歌、百度)到底谁更安全?AI搜索到底有多危险?
今天我们就来揭秘一下,共享小龙虾的安全风险!
我们开发了白泽龙虾安全助手,一个专为 OpenClaw 设计的安全扫描工具,覆盖近60项安全检测
复旦大学系统软件与安全实验室小程序安全研究小组对小程序云服务进行了系统研究,揭示了数千个小程序存在云资源泄露风险,大量敏感数据在互联网中“裸奔”。该研究成果已发表于网络安全顶会NDSS 2026。
我们白泽ers在圣迭戈经历了5天充实的学术之旅收获满满。
我们做了一个完整的端到端攻击实验。结果发现:只需在群里 @ 一下 OpenClaw,再加上一条精心设计的指令,就可能诱导它执行非法的操作,比如打开主人的摄像头、窃取主人的文件、甚至控制主人的电脑!
值此三八国际妇女节,致敬课题组每一位女性师生和所有在技术领域耕耘的女性科研人
复旦大学系统软件与安全实验室移动应用安全小组围绕跨设备认证(XDAuth)可用安全性展开深度研究,提出知情权、同意权、控制权三大核心用户权利的信任锚点体系,相关成果成功入选安全领域顶会NDSS 2026。