哇,我们居然在大模型安全能力国际排行榜排第九了!
团队开发的白泽智能体 Whitzard,基于GLM-5.1-FP8 量化版本(能力弱于GLM-5.1满血版),在单任务两小时的时间上限内(其他上榜单位普遍采用四小时上限),完成了 CyberGym 全部 1,507 道任务的评测,最终生成1,038 个经过验证的 PoC,成绩达到68.9%。
团队开发的白泽智能体 Whitzard,基于GLM-5.1-FP8 量化版本(能力弱于GLM-5.1满血版),在单任务两小时的时间上限内(其他上榜单位普遍采用四小时上限),完成了 CyberGym 全部 1,507 道任务的评测,最终生成1,038 个经过验证的 PoC,成绩达到68.9%。
本文将通过两个典型案例,直观呈现政务智能体可能面临的安全威胁,并进一步介绍 AgentGuard 如何构建可靠的安全边界,确保智能体的每一次行动都可信、可控、可追溯、可审计。
本文提出了一套高质量Web漏洞基准数据集自动化合成技术:PHPBench。PHPBench将数据集构建过程划分为真实漏洞根因提取、层级化漏洞变体生成、真实应用功能植入以及PoC自动合成与验证四个阶段,共同支撑高质量数据集的持续维护、动态更新、真实场景、连续难度和标签验证五项要求。
复旦白泽青年学者论坛
梅雨季的艳阳天
本文分享了一份研究生科研入门指南,带领大家重新理解“读论文”这件事。
本文正式推出AgentGuard 2.1,助力开发者与企业一站式落地《指引》要求。AgentGuard 2.1 以“零信任”为架构基石,为智能体提供覆盖全生命周期的安全治理能力,确保每一次自主执行都安全、合规、可控。
本文分析了GPT-5.6在Web渗透上的能力。
本文设计了AgentCyberRange:一套面向真实网络攻击能力的评估与数据生产平台,覆盖Web 渗透、内网渗透、权限提升、防御对抗等多类场景,并记录完整攻击轨迹用于复盘与模型能力提升。目前,我们已积累数十套渗透靶场、超过500台靶机,并持续进行了数月的测试和数据收集。
本文把信息梳理、关联,并沉淀成一套可以直接使用的情报系统。