ALIBABA AI RED TEAM
REAL 智能体
统一风险矩阵
与自动化红队实践
当 AI Agent 出了事,怎么分类、怎么测、怎么治
演讲人:阿里 AI 红队负责人 — 宋奇钊(胖錿)
AiCon · 全球人工智能开发与应用大会
行业不缺风险清单,
缺的是能分类、能测、能治的统一坐标系。
AI 红队收集了 49 款产品的 133 条公开漏洞,风险仍在急剧增长。面对千变万化的 Agent 攻击形态,阿里提出了 REAL Matrix——一个三维坐标系,把风险锁定到「根因 × 影响 × 位置」,让攻击形态再怎么变,坐标系不用改。
▎ABOUT THE TEAM
阿里 AI 红队:国内最早系统性开展智能体安全研究
阿里巴巴人工智能治理与可持续发展研究中心(AAIG)是阿里巴巴集团旗下 AI 顶级研发团队。AI 红队是 AAIG 专攻 AI 安全攻防的核心团队,在主流 AI 产品中持续发现重大安全漏洞,成果发表于多个权威安全与 AI 顶会,并深度参与国家 AI 安全标准制定。
▎CONTENTS
为什么需要体系化?
49
款产品收集
133
条公开漏洞
↑↑↑
风险急剧增长
从制造 Token、运输 Token 到消费 Token,每一层都在被打穿。行业里有各种各样的风险清单,但问题是——这些清单能不能分类?能不能测?能不能治?
💡 经纬度只有两个数字,却能定位地球上任何一个点。
我们需要类似的东西——把千变万化的 Agent 风险,锁定到三个维度。
REAL Matrix:三维坐标系
一个坐标系,回答三个问题:根因(R) × 影响(E) @ 位置(L)
R×E@L
R · Root Cause
因为什么
E · Effect
造成什么影响
L · Location
发生在哪里
R 维度 — 根因(为什么出事)
E 维度 — 影响(出了什么事)
| E | 类型 | 数量 |
| I | 101 (62%) | |
| C | ||
| A | ||
| S |
L 维度 — 位置(在哪出事)
| L | 层级 | 数量 |
| L0 | 69 | |
| L1 | ||
| L2 | ||
| L3 | 66 |
▎核心发现
R1 注入 + R3 基建 = 87%,两大主风险面;R1.2 间接注入(35 条)最高频
I 完整性占 62%,说明攻击者追求的是代码执行 / 控制权
L0 + L3 = 69%:主战场在运行环境与工具调用两端
R × E 交叉矩阵:外部漏洞 vs 内部实战
★ = 实测高频高危;△ = 系统无缺陷,治理层问题
| RE | C 机密性 | I 完整性 | A 可用性 | S 无害性 |
| R1 注入 | ||||
| R2 幻觉 | ||||
| R3 基建 | ||||
| R4 滥用 |
基于外部漏洞与内部实战,风险分布高度一致——这说明 REAL Matrix 不是理论模型,而是实战验证过的工具。
实战分析
一条链打穿一个系统,一条链感染数千人。
▼ 纵向穿透:四道防线,从顶到底被打穿
▶ 横向扩散:Cline 供应链攻击
一个标题注入,横穿多个层面——从单个恶意文档标题,到 Agent 解析、工具执行、横向感染其他用户。
💡 形状完全不同,但同一套坐标标得清清楚楚。不同的案例,同一套坐标系。
从矩阵到自动化红队
以 Agent 测 Agent · 安全水位度量
困境:一个产品,一个专家
人力不可扩展
产品线 N 倍增长,红队专家无法 N 倍复制
经验难复用
一条高价值攻击链,换个产品或过段时间即沉没
速度追不上
利用窗口已坍缩到数小时,人工逐个打靶天然慢于攻击者
▎出路
把专家攻击经验编码进矩阵,再让 Agent 自动化执行——
环形回路:从经验到自动化的闭环
💡 一条链靠专家手打 + 标坐标都不轻松。10+ 条产品线、每格都要覆盖——把实战经验沉淀为按坐标组织的测试用例库,让 Agent 自动跑,从按坐标打靶走向规模化自动红队。
发展曲线与展望
挡 → 围 → 盯
挡住它说错话
内容安全 · 输出过滤 · 对齐
当前主流阶段:聚焦模型输出的安全性,防止有害内容生成。
围住它做错事
Agent 行为边界 · 权限管控 · 沙箱
正在进入:Agent 开始调用工具、执行操作,需要行为级围栏。
盯住它每一个自主决策
全链路监控 · 可审计 · 可追溯
未来方向:Agent 自主性越来越高,安全重心从静态防御转向动态监控每一个决策节点。
💡 坐标系不变,安全重心随 Agent 的自主性与连接性同步迁移。
REAL Matrix 的三个核心价值
能分类
R×E@L 三维坐标,把千变万化的 Agent 风险锁定到固定网格
能测
以 Agent 测 Agent,专家经验编码进用例库,自动批量执行 + 回归
能治
安全水位度量 → Leaderboard 排行 → 态势感知,闭环驱动安全治理
▎五大行动建议
✅ 用统一坐标系替代零散清单,维度固定,攻击再变坐标不改
✅ 格子空着的地方,就是下一个要打的靶
✅ 把专家攻击经验编码进矩阵,让 Agent 自动跑
✅ 建立环形回路:发现→编码→执行→回归→新风险再沉淀
✅ 安全重心随自主性迁移:挡→围→盯
探索 AI 应用边界
Explore the limits of AI applications
本文提供33页完整版文件下载,请点击文末“阅读原文”。
「智盾矩阵·大模型安全智库」帮会是FreeBuf知识大陆的重量级帮会,目前已入选FreeBuf钻石星选帮会——官方认证高信誉与高质量,帮会聚焦人工智能与大模型安全领域,致力于打造全球视野下的专业资源聚合平台。截止目前帮会已累计更新4700+文档资源,为从业者提供从理论到实践的全维度知识支持。
公众号已发表帮会资源展示:
①政策、标准
②行业解决方案
③行业技术报告
④行业技术白皮书
⑤行业技术论文
⑥实务手册指南
点分享
点收藏
点在看
点点赞
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...