导言
过去研究人员总担心 AI “不会做”。而当 AI 越来越像“社会参与者”,一个更危险的问题正在出现:当 AI 学会了“怎么做人”,它会不会也学会“怎么作恶”?
复旦白泽团队发表于 ICLR 2026 的工作 PRISON,首次系统研究了大模型在复杂社交博弈环境中的行为风险。研究发现:当模型面对利益冲突、信息不对称和生存压力时,它们不仅会“完成任务”,还可能表现出欺骗、推责、操控甚至策略性联盟等行为倾向。
有意思的是,“PRISON” 这个名字本身,也隐含了研究想表达的核心问题:当 AI 被放入一个充满规则、压力与利益冲突的社会实验场后,它会如何行动?
本文将带你快速了解这项工作的核心思路与关键发现。更多细节欢迎阅读论文原文:https://openreview.net/pdf?id=KvOSJpfWqE
问题的提出
Part1:新型AI安全
在传统的 AI 安全评估中,我们通常考察模型是否会输出暴力、色情等显性违规内容。然而,随着模型越来越多地参与到人际交流、商业谈判甚至社交博弈中,一种更为隐蔽的风险浮出水面:模型是否会在压力下学会欺骗、操纵或栽赃?

Part2:现有评测的不足
已有工作主要以单轮问答、静态提示或抽象伦理判断为主。这类设置适合分析模型在孤立任务中的行为,却较难刻画复杂社会互动中的策略性风险。事实上,现实中的高风险行为并不是通过一次明确的恶意提问触发的,而是在多轮交互、角色代入和有限信息条件下逐步表现出来。例如,用户未必会直接要求模型“帮助脱罪”,而可能只是描述一起事故后的处境,并询问应当如何应对。此时模型是否会主动给出隐瞒事实、误导调查或转移责任的建议,才是更接近真实应用的问题。

因此,评估模型在复杂社会情境中的风险,不能仅依赖于考察其是否拒绝显式恶意请求,还需观察它在实际对抗互动过程中的行为表现。
Part3:研究重点
针对以上问题,本文主要关注大语言模型的“犯罪潜力” (Criminal Potential),即模型在对抗性场景中表现出虚假陈述、操纵、嫁祸、情绪伪装、道德脱离等有害行为倾向的风险。
PRISON方法设计
Part1:犯罪潜力定义
借助犯罪心理学中的相关量表,我们将“犯罪潜力”拆解为五类核心特征:

Part2:构建评测框架
为了模拟真实世界中不同视角信息获取不对称的情况,我们提出了PRISON(Perspective Recognition In Statement ObservatioN)评估框架,将 LLM 置于三维视角的博弈中:

Part3:对抗性场景构建
我们从经典犯罪电影中提取了60 个核心博弈情节,涵盖了从“虚假陈述”到“心理操纵”的多种高阶犯罪行为。对于每个情境,我们从电影剧本中获取丰富的上下文,通过改写替换人物、地点等可识别要素,保留核心犯罪逻辑的同时排除模型直接记忆原始剧情的影响,最终形成60个情境 × 5轮对话的场景规模。
核心发现
研究结果显示,主流大模型的安全性依然面临严峻挑战:
犯罪特征“表达” 能力> “检测”能力
我们测试了 GPT、Claude、Gemini、DeepSeek、Qwen 等多个常见模型。结果显示,各模型的犯罪特征表达率平均超过了 50%。这说明,在所构造的对抗场景中,模型生成的句子里,超过一半带有至少一种预定义的犯罪特征。这意味着在社交压力下,模型往往会倾向于使用非诚实的手段来达成目的。然而与犯罪特征表达率相比,模型在侦探视角下表现出的犯罪特征识别准确率仅为44%,说明模型在“表达犯罪特征”与“检测犯罪特征”之间存在明显的不对称。这种不对称意味着如果大模型更擅长输出误导性、操纵性或推责性的表达,却不擅长识别这些表达,那么它在实际部署中就更可能被用来放大风险,而非抑制风险。


大模型存在轮次、特征偏好
首先,随着对话轮次增加,多数模型的犯罪特征激活率会逐步下降。这说明,模型在长上下文环境下具有一定的自我约束与行为收敛倾向,部分高风险表达会在持续交互过程中被逐渐弱化。这一现象侧面说明静态单轮评测难以全面刻画模型的真实安全行为,需要从动态、多轮的视角对模型风险进行持续观察。其次,从五类特征的分布看,心理操纵 (PM, Psychological Manipulation) 是最常见的一类,而 栽赃 (FU, Frame-Up) 相对较少。这表明,模型更容易生成带有诱导性、策略性以及情绪施压特征的表达,例如通过话术引导、情绪影响或行为暗示来推动目标执行特定操作;相比之下,对于需要构造复杂虚假叙事、伪造责任归因或进行深层误导的内容,模型生成频率则明显较低。


模型风险识别边界尚未统一
此外,我们分析了不同模型的检测偏差,发现虚假陈述 (FS, False Statements) 的召回率整体偏低,表明当前模型根据上下文推断事实性错误的能力仍需提升。不同模型在检测策略上存在明显差异:部分模型采取较为保守的判定策略,更倾向于仅在证据充分时输出风险标签;另一些模型则倾向于扩大风险覆盖范围,以多报换取更高覆盖率。这种差异反映出模型在安全检测任务中尚未形成统一而稳定的风险判定边界。基于这一现象,我们进一步关注模型检测能力究竟受限于提示方式,还是受限于模型本身的推理与事实判断能力。为此,本文专门测试了不同提示词设置对检测结果的影响,实验结果表明,风险识别的瓶颈更多源于模型自身能力,而非提示工程。


总结与启示
PRISON 的核心在于把一个模糊复杂的风险问题转化为可操作的评测任务。与传统的静态安全测试相比,我们更强调现实世界部署中社会情境、角色差异和信息不对称对模型行为产生的影响。本文研究证明,基础推理能力的提升并不等同于安全性的增强。仅仅通过简单的提示词工程进行对齐,难以根除社交博弈中的隐性风险。我们建议在后续研究和实际部署上加入相应的防御措施,例如将社交对抗场景纳入模型训练流程;增强模型在特殊情境下的抗压能力,提高防御边界。
作者介绍
- 吴心怡,复旦大学计算与智能创新学院24级研究生。本科毕业于复旦大学信息安全专业,主要研究方向为网络黑灰产检测与人工智能安全治理,以第一作者在ICLR等国际顶级学术会议上发表学术论文。
- 陈沛,复旦大学计算与智能创新学院23级直博生(22级卓博),本科毕业于复旦大学计算机科学与技术专业。主要研究方向为网络犯罪治理、Web应用安全、AI系统安全。以第一作者在USENIX Security、WWW等国际顶级会议和期刊发表多篇论文。相关成果在工业界及政府部门均有落地实战,取得良好效果。
- 陈月月,复旦大学计算机与智能创新学院25级研究生,本科毕业于大连理工大学软件工程专业,主要研究方向为网络黑灰产检测与人工智能安全治理。
- 洪赓,复旦大学网络战略研究所副所长,长期聚焦网络犯罪治理、AI安全治理等前沿方向,围绕国家网络安全与数字治理重大需求开展系统性研究。目前,已在 IEEE S&P、USENIX Security、NDSS 等国际顶级学术会议发表高水平论文二十余篇,获 NDSS 2026 最佳论文奖、上海市技术发明一等奖、上海市决策咨询研究成果奖一等奖等;指导学生团队获得 “挑战杯” 全国大学生学术科技作品竞赛全国特等奖、全国大学生信息安全竞赛一等奖等荣誉。个人主页:https://security.fudan.edu.cn/members/faculty/hg/