当大模型从“会生成内容”走向“能执行任务”,安全治理也正在从内容识别走向全链路防护。
近日,由中国人工智能产业发展联盟(AIIA)安全治理委员会主办的"智守安全·内容求真"2026AIIA安全治理专题会在北京召开,围绕生成式人工智能、AI生成内容、深度合成与智能体应用带来的安全治理挑战展开交流。
网易智企·易盾受邀出席大会,围绕大模型安全围栏发表主题演讲,并获中国信通院大模型安全围栏能力检验"优秀级"评定,同时作为共建方参与可信AI"众鉴平台"发布仪式,以技术实力与产业担当深度参与AI安全治理进程。
受邀分享,解构大模型安全围栏
防护体系
网易智企·易盾内容安全负责人饶晓艳受邀出席会议,并围绕《多模态大模型安全围栏防护体系建设》进行内容分享,系统介绍了易盾如何通过独立、实时、可运营的外置安全护栏,覆盖大模型输入输出、多模态关联检测、敏感数据保护和智能体行为管控等环节,为企业AI应用构建安全控制面。
伴随人工智能技术持续演进,企业需要保护的对象已经发生明显变化。
过去,安全治理主要聚焦文本、图片、音频、视频等内容风险;进入大模型时代后,提示词攻击、算力消耗、大模型输入输出风险、敏感信息泄露以及智能体行为失控等问题不断出现,安全防护需要覆盖更加复杂的模型和应用链路。
从实际业务场景来看,当前大模型应用主要面临三类典型挑战:
一是模型本身具有一定不可控性,输出结果可能存在不稳定和不可预测的问题;
二是部分数据和中间状态不可见,例如RAG知识库、联网检索结果及相关URL中可能隐藏风险内容;
三是智能体能够调用MCP、Skill等外部工具,其权限、行为和任务执行链路更加复杂,风险也可能由内容层进一步传导至业务系统。
尤其在智能体场景中,模型已经不再只是生成一段文字或回答一个问题,而是能够获取外部信息、调用工具并执行具体任务。一旦遭遇恶意提示词、间接提示词注入或权限滥用,风险可能沿着工具调用链路持续扩散。因此,企业AI安全治理需要从单一的内容检测,升级为覆盖算法、数据、内容、智能体和实际应用的系统性防护。
基于长期安全实践,网易智企·易盾认为,企业需要在模型之外建立一套相对独立、能够实时运行并持续运营的外置安全护栏。它与模型内置安全能力相互协同,同时不依赖模型自身版本更新,可以根据实际业务风险实时热更新规则和策略,并对防护效果进行评测,对检测结果进行追溯。
围绕大模型应用全生命周期,易盾已将安全能力覆盖至训练语料安全治理、模型安全评测、上线前检测以及上线后的输入防护、输出防护、安全代答、多模态关联检测和智能体安全等环节,在不同节点配置相应的防护方案。
在输入侧,易盾可识别提示词中的有害指令、恶意指令和算力攻击。例如,要求模型循环输出大量内容、生成超长文本等指令,可能对模型服务造成资源消耗。同时,对于隐藏在MCP、Skill及其他外部信息源中的间接提示词注入,系统也可结合智能体调用链路进行检测。
在数据安全方面,易盾可提供50余种个人敏感信息标签检测,对模型输入和输出中的敏感信息进行识别与阻断,降低多类信息组合后定位到具体个人所带来的隐私泄露风险。
对于风险内容,外置安全护栏并非简单拦截,而是结合风险等级、用户身份、业务场景和内容呈现位置进行综合判断。系统可根据实际风险采取放行、降权、正向引导、安全代答、人工接管或直接阻断等差异化措施,让安全治理更加精细、灵活。
在技术路径上,易盾采用小模型、小参数大模型与多模态大模型协同的方式,根据不同任务进行路由和组合判断。以隐晦图片检测为例,系统可以先通过小模型完成OCR识别,再分别对图片和文字信息进行分析,最终由大模型完成图文关联和整体观点理解,在兼顾检测效果的同时提升处理效率。
针对来源日益多样的Skill,易盾已建立覆盖14个大类、100余个细分检测项的安全检测能力。安装前,可对代码、功能描述和权限声明进行扫描;运行过程中,则进一步校验Skill实际调用的权限和行为是否与原始说明一致,及时发现越权调用及异常执行风险。
获评"优秀级",大模型安全围栏能力
获权威认可
会上,网易智企·易盾凭借在大模型安全围栏领域的技术能力与产品实践,通过中国信通院与中国泰尔实验室联合开展的大模型安全围栏能力检验,并获评"优秀级",体现了权威机构对其产品技术能力与落地实践的高度认可。
此前,艾瑞咨询报告显示,网易智企·易盾位居中国第三方大模型内容风控服务商市场首位,也从市场维度印证了其规模化服务能力。此次"优秀级"评定,进一步从标准化评测角度验证了易盾在大模型安全围栏领域的技术领先性。
参与共建,可信AI"众鉴平台"
正式发布
大会期间,由中国信通院牵头、联合产业机构共建的可信AI——"众鉴平台"正式发布。该平台面向全行业开放,汇聚多方鉴伪技术、数据和能力资源,提供统一、权威、可复用的多模态生成合成内容检测服务,旨在构建产业协同的AI内容可信治理基础设施。
网易智企·易盾作为参与共建的产业机构,受邀出席发布仪式,将把自身在多模态内容检测领域的技术积累和实战经验注入平台,与产业各方共同推动AI生成内容的可识别、可追溯与可治理,为构建更加透明、可信的AI内容生态贡献力量。
深耕AI安全,以技术与标准
护航产业前行
从主题分享到能力获评,从标准参与到平台共建,易盾在本次大会上的多维度亮相,背后是对AI安全领域的长期深耕与持续投入。依托20余年内容安全治理经验,网易智企·易盾正将能力从传统内容审核延伸至大模型内容风控、输入输出防护、多模态风险识别、安全测评和智能体安全治理等场景,持续助力企业在可信、可控的基础上推进AI应用落地。
未来,网易智企·易盾将持续完善独立、实时、可运营、可评测的外置安全护栏,并依托众鉴平台等产业协同机制,与行业伙伴共同推进AI生成内容的可信治理,让大模型保持创造力的同时,通过持续演进的安全能力为企业提供更加确定的保障,推动AI更安全、更可靠地进入真实业务场景!
活动推荐
作为网易旗下一站式企业 AI 应用服务提供商,网易智企倾力打造企业 AI 实战栏目——「AI 实战派」,聚焦 AI 在真实业务中的落地应用,通过实战教学、案例拆解、研讨交流等多元形式,将前沿的 AI 技术转化为真实的业务动能,为企业管理者、业务决策者和一线实践者提供可迁移、可复用的实战方法论与深度洞察。
关于我们
免费下载干货资料
推荐站内搜索:最好用的开发软件、免费开源系统、渗透测试工具云盘下载、最新渗透测试资料、最新黑客工具下载……




还没有评论,来说两句吧...