录用速递|我实验室8篇论文被USENIX Security'26接收!

📢 USENIX Security 2026 我实验室将有 8 篇论文在会上进行分享! 🎉🎉🎉🎉🎉🎉🎉🎉🎉🎉

📌 USENIX Security Symposium 是系统安全领域四大顶会之一,与 S&P、CCS、NDSS 并列它不仅是 CCF-A 类会议,更是每年安全研究者们最关注的学术舞台之一。

👀 想知道我们都中了哪些论文?马上来一波论文大公开👇👇👇

Towards Generality: Task-Adaptive Binary Analysis via Semantic Retrieval and Verifiable Reasoning
迈向通用性:基于语义检索与可验证推理的任务自适应二进制分析

作者:刘宇哲,刘志杰,于正民,王舒,蒋灵,聂森,吴石,汤战勇,张源
摘要:
剥离符号的二进制文件(stripped binaries)在真实世界的安全分析中占据主导地位:商用现成软件(COTS)、固件和恶意软件在发布时往往不含符号信息,从而掩盖了程序语义。近期基于大语言模型的方法针对的是范围狭窄、预先定义好的任务,限制了其在意图驱动分析(intent-driven analysis)中的适用性。应对通用目的二进制分析需求,智能体化的大语言模型提供了一个自然的发展方向,然而实现通用性仍然颇具挑战:分析意图难以在剥离符号的二进制中落地,且高效的基于工具做精确分析也难以实现。
我们提出 BinReX,这是首个面向通用、全自动静态二进制分析的智能体框架。BinReX 引入双编码器流水线,为剥离符号的函数补充语义上下文,并搭配分层规划将分析意图分解为可执行的子任务。它利用代码合成将待分析子任务转化为 IDAPython 脚本,并通过迭代验证机制加以执行,最终将各项输出整合为人读报告。
我们在 BinREval 上对 BinReX 进行评估——该基准包含跨越七类 COTS 软件、共 72 项任务,并配有可机器校验的判定。BinReX 取得了 83.3% 的成功率,优于各基线方法(Codex:27.8%;Codex 结合 IDA:43.1%),同时将总分析时间从 87.9 小时缩短至 36.1 小时。在领域基准(Juliet、NYU CTF)上,BinReX 与特定任务所用方法相比仍具竞争力。人类研究与工业界落地部署(腾讯安全科恩实验室)进一步印证了其实用价值:BinReX 首次检出 395 个在野恶意软件样本,且相较专家平均实现了 96 倍的效率提升。

KernelRCA: Facilitating Root Cause Analysis of Memory Corruptions in Linux Kernel with Contextual Causality Chain
KernelRCA:通过上下文因果链辅助Linux内核内存漏洞的根因分析

作者:顾康正,张一帆,张源,杨珉
摘要:
随着漏洞挖掘技术的进步,漏洞发现速度与日俱增。然而,漏洞分析与修复仍依赖大量人力工作。为此,自动化漏洞根因分析(Root Cause Analysis,RCA)备受关注。然而,现有的漏洞根因表示方法由于其分散孤立的特点而难以直观解释漏洞成因。分析人员仍需根据孤立的漏洞成因表示手工推断漏洞的发生过程并理解其成因。Linux 操作系统内核漏洞的根因分析由于内核的复杂性变得更为困难。
本文提出了一种新型漏洞根因表示方法上下文因果链(Contextual Causality Chain,CC-chain),可以直观反映 Linux 内核内存破坏漏洞的触发过程并解释其成因。上下文因果链通过展示漏洞触发过程中的内核异常行为及相应的指令序列,结合指令的调用上下文与数据依赖关系,帮助分析人员快速理解漏洞成因。为自动生成上下文因果链,本文设计了一种新型内核漏洞根因分析系统 KernelRCA,包含选择性追踪、上下文信息重建及链式根因分析三个步骤。该系统成功诊断了 54 个真实内核漏洞的根因,准确率和精确度均优于原生内核崩溃报告和 KASAN 报告,以及内核漏洞分析实践中常用的二分根因定位工具 Syzbot Cause Bisection。用户调研显示,KernelRCA 生成的上下文因果链显著提升了分析人员对漏洞的理解,并对漏洞修复具有一定的辅助作用。

Khost: KVM-based Near Native MCU Firmware Rehosting
Khost: 基于KVM的近原生MCU固件重托管框架

作者:王春霖,杨镒丞,张源,肖浩宇,张一帆,戴嘉润
摘要:
微控制器(MCU)设备构成了物联网基础设施中的关键层,因此保障其安全性至关重要。基于重托管(Rehosting)的 MCU 固件动态分析是保障此类设备安全的一种有效方法。然而,现有重托管框架要么由于仿真带来显著的性能开销,要么由于执行范围受限而无法完整分析固件。
为解决上述问题,本文提出 Khost,一种能够提供近原生性能且保留完整执行范围的 MCU 固件重托管框架。它通过扩展 KVM,引入轻量级扩展 CPU、辅助页表以及软中断控制器,使 MCU 固件能够以极低开销在高性能平台上运行。与此同时,Khost 提供用于高效处理外设交互的 MMIO 监控器和用于使能覆盖率收集以及与现有模糊测试引擎的灵活集成的封装器。在两个标准基准测试集上的评估结果表明,与 QEMU 相比,Khost 在复杂计算任务中可将运行开销降低 90.0%~95.5%,在 MCU 系统级操作中最高可降低 98.5% 的开销。此外,在 12 个真实世界MCU固件上的模糊测试实验表明,Khost 的测试吞吐量最高可提升 197.5 倍,基本块覆盖率相比现有模糊测试工具提升最高可达 6 倍。此外,Khost 成功发现了 5 个此前未知的漏洞。

Patch-Guided Vulnerability Detection: Extracting Java API Security Rules via Attack–Defense Cross-Analysis
补丁引导的漏洞检测:通过攻防交叉分析提取Java API安全规则

作者:陈波妃,廖双,张磊,张驰斌,Mathias Payer,张源
摘要:
安全敏感 API 是现代 Java 应用程序的重要组成部分,其误用往往会导致远程代码执行等严重安全漏洞。因此,自动生成准确的 API 安全规则对于检测零天漏洞具有重要意义。然而,现有方法通常依赖于缺少安全描述的开发文档,或根据源代码中的局部不一致性推断 API 使用模式,难以生成准确且完整的安全规则。
本文提出 VulGenie,一种补丁驱动的 API 安全规则提取与漏洞检测框架。该框架从已确认的安全补丁中自动提取精确的 API 安全规则,并利用这些规则检测API误用漏洞。具体而言,VulGenie 首先提出一种新颖的”修改行为依赖补丁图”数据结构,从包含大量无关修改的安全补丁中精准定位被违反的安全约束及与防御机制相关的代码变更;随后,通过攻防交叉验证联合分析漏洞利用逻辑与补丁防御逻辑,识别补丁所保护的安全敏感 API,并自动合成相应的 API 安全规则;最后,提出自适应偏差引导静态分析方法,根据分析过程中观测到的偏差动态调整分析策略,在保证检测精度的同时兼顾分析效率,实现对大规模代码库的高效分析。
我们在 150 个最新的 Java 安全补丁上对 VulGenie 进行了全面评估。实验结果表明,VulGenie 共提取出 198 条正确的 API 安全规则,精确率达到 81.82%,其中 177 条规则为 CodeQL 尚未覆盖的新规则。在 10 个主流 Java 应用程序上的实验中,VulGenie 共发现 46 个零日漏洞,检测效果显著优于现有最先进的方法。通过负责任的漏洞披露,目前已有 27 个漏洞得到官方修复,并获得了 10 个 CVE 编号。

Autonomy Comes with Costs: Detecting Denial-of-Service Vulnerabilities Caused by Resource Abusing in LLM-based Agents
自主性的代价:检测基于大语言模型的智能体中因资源滥用导致的拒绝服务漏洞

作者:罗嘉骐,戴嘉润,刘丰毓,彭松洋,施游堃,步桐,洪赓,潘旭东,张源
摘要:
基于大语言模型(LLM)的智能体(Agent)近年来备受关注。这类智能体利用 LLM 的语义理解能力,能够根据用户请求自主执行复杂任务,例如下载文件并进行总结。然而,由于缺乏完善的资源管理机制,智能体容易被攻击者滥用,进而导致资源耗尽并引发拒绝服务(DoS)攻击。
本文首次对智能体的资源管理开展了系统性的安全研究。我们识别出三种典型的资源生命周期管理模式,并发现每种模式都可能为拒绝服务攻击提供不同的利用路径。基于这些发现,我们提出了 AgentDoS ——一种新型的定向灰盒模糊测试框架,旨在检测智能体中由资源耗尽引起的拒绝服务漏洞。AgentDoS 首先分析智能体内部的资源生命周期,随后利用 LLM 生成包含特定功能语义的提示词(prompt),诱导智能体过度消耗资源,从而触发拒绝服务。我们使用 AgentDoS 对 20 个主流开源智能体进行了评估,发现了 36 个零日漏洞,影响 16 个智能体,其中 15 个在 GitHub 上的 star 数超过 10,000。截至目前,这些漏洞已被分配了 15 个 CVE 编号。

Wormholes in the File System: Understanding the Misunderstanding of Symlinks
文件系统中的黑洞:分析软链接机制中的误解与误用

作者:刘永横,张磊,赵宇航,何雨珘
摘要:
软链接(符号链接),作为一个四十多年前就被操作系统底层支持的文件系统机制,已深植于整个软件栈之中,成为成为现代计算环境不可或缺的组成部分。软链接机制具有极高的灵活性,允许引用文件系统中的几乎任意位置,并支持复杂的路径解析行为。然而,这种灵活性也导致开发者对其工作原理存在诸多误解,从而造成广泛的错误使用,并进一步成为文件处理软件中关键安全漏洞的主要成因,导致任意文件写入和任意代码执行等漏洞后果。
本文系统性地研究了软链接处理不当的具体表现及其带来的安全威胁。具体而言,我们分析了编程语言标准库在使用与符号链接相关的系统调用时存在的不当实践,并研究了这些错误认知和误用如何传播至下游应用程序,从而导致各种不充分的路径校验。为了进一步评估这些路径校验缺陷在真实环境中的可利用性,我们设计并实现了五种路径验证绕过方案以及三种任意文件写入方法。在对 85 个开源项目进行评估的过程中,共发现了 16 个任意文件写入漏洞,其中两个漏洞已被分配高危级别的 CVE 编号。我们还展示了这些漏洞在现实场景中的严重影响,并提出了多种缓解与防御策略。我们已按规范将这些问题披露给了受影响的厂商。

When Fun Turns Toxic: A First Look at Aggressive Advertising in Mini-games
当快乐变质:小游戏激进广告行为的首次系统研究

作者:陈沛,洪赓,覃逸成,王华哲,邬梦莹,杨珉,赵紫如,朱远鹏,苏涛
摘要:
小游戏已成为超级应用生态中的一种主流应用形态,使休闲游戏等轻量级服务能够快速触达数以百万计的用户。尽管平台提供的官方广告接口降低了开发者的商业化门槛,但广告集成的便利性以及平台监管不足,也催生了激进甚至具有欺骗性的广告行为,严重损害了用户体验。激进广告虽然并非恶意软件,却通过滥用平台提供的合法接口绕过审核机制、操纵用户交互并破坏平台信任,从而突破了平台既有的安全边界。这类行为并非单纯的违规运营问题,而是一种具有系统性的安全风险。
本文首次对小游戏中的激进广告行为开展了系统性的安全研究。我们分析了九个小游戏平台的政策规范与开发者能力,对激进广告行为进行了系统刻画;进一步,我们设计了可扩展的检测框架 MAAD,并对微信小游戏、Facebook Instant Games 和快游戏三大平台开展了大规模测量。结果表明,49.95% 的小游戏存在激进广告行为,其中包括多个拥有超过 10 万条用户评论的热门游戏。进一步的分析发现了激进广告的一系列典型行为模式,包括跟随游戏状态触发广告、过于频繁的弹窗展示、具有误导性的交互设计,以及针对平台审核的对抗性绕过策略。研究结果揭示了激进广告已成为一种广泛存在的平台滥用行为,其根源在于当前平台治理机制中存在结构性监管盲区。最后,我们针对平台治理、自动化检测以及生态系统的长期安全性提出了具有实践价值的改进建议。

MATE: Policy-Aware Security Auditing for Mobile Agents via Synthesis-Driven Trajectory Learning
MATE:基于合成轨迹学习的规则感知型手机智能体轨迹安全审计

作者:蒋昌跃,王家熠,文鑫,戴嘉润,洪赓,潘旭东
摘要:
手机智能体可根据用户指令在移动设备上自主执行跨应用、多步骤任务,但其行为轨迹可能违反安全边界或用户定义规则。现有轨迹级安全审计方法主要依赖 Prompt-based LLM 或人工编写的静态规则:前者成本高、延迟大且存在隐私风险,后者难以刻画长轨迹中的隐性语义风险。
本文提出 MATE,一种轻量级、规则感知的手机智能体轨迹审计模型。MATE 以任务指令、执行轨迹和自然语言安全规则为输入,判定轨迹是否违反给定规则,并生成可解释的审计依据。通过将安全规则作为可编辑文本输入,而非固化在模型参数中,MATE 可在无需重新训练的情况下适配应用策略更新、用户自定义规则和新的安全场景。MATE 提供 0.5B/1.5B/3B 三种规模,资源开销低、响应延迟小,支持本地化部署,从而降低审计成本与隐私风险。为训练和评估 MATE,本文从全球上百个热门移动应用中提取功能描述、操作工作流等知识,并提出知识驱动的多阶段轨迹合成流水线,生成超过 14 万条语义真实、规则标注的中英文手机智能体轨迹。本文进一步构建 MATEBench,覆盖 14 类风险场景,包含两个合成子集和一个人工采集的真实子集。实验结果表明,MATE 在 MATEBench 上取得超过 95% 的审计准确率,在 R-Judge、ASSEBench 等通用智能体轨迹级安全基准上准确率超 90%,并在审计智谱 AutoGLM、阿里巴巴 Mobile-Agent 等真实手机智能体轨迹时达到95%以上准确率,较现有最强方法提升超过 20%。