凌晨两点,一杯已经冷掉的咖啡,加上屏幕前几十份排版精美、逻辑看似严密,却在真实环境里根本无法复现的 AI 漏洞报告——这大概是当下每一个尝试将LLM与 Agent 引入自动化代码审计的安全研究员,都曾经历过的破防瞬间。
在 Agent 技术快速落地的当下,安全行业的分享中写满了效率提升与范式革新。但当你把 AI 拉到真实 Web 业务代码的实战场景中验证时,现实给出的答案格外骨感:AI 并不缺少生成漏洞候选的能力,它真正缺的是证明漏洞真实存在的硬核证据。
漫天飞舞的 "CVE Slop"、永远只差一步的执行路径、一跑就报错的 PoC…… 当海量无法落地的漏洞报告成为耗尽安全团队精力的无底洞,我们究竟需要一套怎样的工程体系来破局?
2026年8月28日,XCon2026大会现场,来自DARKNAVY的安全工程师,同时也是deepsec Web安全的核心研发者王海慧,将带来他们在一线工程的硬核实践,分享议题《从发现到复现:AI 驱动的 Web 漏洞挖掘验证工程》,直面 AI 漏洞挖掘从 "找得到" 到 "验得真" 的核心痛点。
议题简介
LLM 与 Agent 在安全领域的应用正进入关键落地阶段。无论是真实 CVE 自动复现实验的落地挑战、o3模型发现ksmbd UAF漏洞背后的信噪比问题,还是Big Sleep与FFmpeg社区围绕"CVE Slop"的公开争议,都在指向同一个行业共识 —— 安全团队真正需要的不是更多 "看起来像漏洞的报告",而是可定位、可触发、可复现的实打实证据。AI 漏洞挖掘的瓶颈,正在从 "生成候选" 阶段转向 "验证候选" 阶段。
本议题主张 "可复现性 > 发现数" 的务实技术理念。演讲者将深度结合一线工程实践,完整拆解一条专为 Web 漏洞挖掘设计的 Agent 验证流水线。你将看到系统如何精准锁定审计起点;如何结合知识库、SAST技术与动态审计策略收敛候选空间;如何让多 Agent 分工完成路径验证、PoC 构造与环境复现,沉淀可追溯的完整证据链,并最终用复现率、触发稳定性和误报过滤率来衡量一个finding是否真正成立。
议题亮点
从 "AI 找洞数量" 转向 "漏洞可复现性"
当Agent可以批量生成finding,行业稀缺的早已不是候选数量,而是证据质量。议题将提出一套面向 Web 漏洞挖掘的可复现性评估框架,以代码定位准确性、PoC 可执行性、触发稳定性与复现率为核心指标,定义 AI 漏洞挖掘系统的有效性标准。
多 Agent 不再协作 "写报告",而是协作 "验证证据"
候选筛选、深度审计、PoC 复现、环境构建、证据打包、报告生成 —— 每个环节交由不同角色的 Agent 承担,各环节之间通过结构化快照交接代码位置、调用链、工具输出、失败原因与复现状态,每一步输出都将进入下一步的程序化校验;运行时还会根据漏洞类型、证据完整度、失败次数和复现成本动态选择验证策略,从机制上避免多个模型互相复述、互相强化幻觉。
从 Finding Slop 到 Verified PoC 的完整工程闭环
议题将现场展示一条完整的验证链路:审计起点锁定 → SAST 辅助收敛 → Agent 路径验证 → PoC 自动生成 → Docker / 隔离运行时环境复现 → Evidence Pack 落盘 → 复现率统计。对每个 finding 执行 "可定位、可触发、可复现" 三阶段验证;无法复现的,将显式标记失败原因,绝不将一段自然语言分析包装成漏洞结论。整个系统的核心目标从来不是模型如何 "说服人",而是系统如何 "证明结论为真"。
演讲人介绍
王海慧(怕踩的土豆雷)
DARKNAVY 安全工程师 /deepsec Web安全核心研发
专注于Web 漏洞挖掘、实战攻防对抗AI Agent开发与安全治理,是deepsec安全AI系统Web漏洞挖掘与渗透攻防模块的核心研发成员。长期探索AI能力与真实攻防场景的融合落地,参与自动化漏洞研究链路、攻击面分析与验证闭环等技术实践。
DARKNAVY·深蓝,总部上海·新加坡,独立的网络安全研究服务机构,deepsec 安全 AI 系统的创立者、对抗研判和量化安全的首倡者与推动者,同时也是 GEEKCON 国际黑客大赛的创办者。多年专注于操作系统、芯片、AI、移动及 IoT领域等的深入和前沿安全对抗经验,让我们多次创造中国及世界安全赛事和原创技术成果纪录,并成长为服务于包括华为、大疆、vivo、微信、小米、字节、支付宝、OPPO、极氪等在内的行业领军企业最多的专业安全研究机构。
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...