网易智企重磅发布《AI 安全白皮书》,让 AI 看得见、管得住、测得出、追得回

摘要

它正在进入客服、投研、教育、办公、内容生产、代码开发、智能终端、业务运营等真实场景,开始读取企业知识库、调用 API、操作工具、生成代码、触发流程,甚至以 Agent 形态自主拆解任务、连续执行动作。

2026 年,AI 已经不再只是写文案、做总结、生成图片的效率工具。

它正在进入客服、投研、教育、办公、内容生产、代码开发、智能终端、业务运营等真实场景,开始读取企业知识库、调用 API、操作工具、生成代码、触发流程,甚至以 Agent 形态自主拆解任务、连续执行动作。

换句话说,AI 正从「会回答问题的工具」,变成「能连接业务系统的数字操作者」。

但问题也随之而来:当一个 AI 不只会「说错话」,还可能「做错事」,企业该如何保证它看得见、管得住、测得出、追得回?

网易智企携手金山办公、Minimax 正式发布《AI 安全白皮书》。白皮书系统梳理 AI 技术演进、风险变化、全球治理趋势与企业落地路径,提出面向智能体时代的 AI 安全治理体系,为企业构建可信、可靠、可控的 AI 应用提供方法论与实践参考。

搜索网易智企-易盾可领取完整版《AI 安全白皮书》

01 告别「裸奔式创新」,AI 安全迎来四大核心变革

过去几年,行业对 AI 的讨论大多围绕能力展开:模型参数更大、推理更强、生成更快、成本更低。

但当 AI 真正进入业务深水区,企业会发现:决定 AI 能不能规模化落地的,不只是模型能力,而是安全治理能力。

白皮书指出,AI 安全正在发生四个关键变化

变化一:风险对象变了,从「内容风险」到「行为风险」。

过去,企业主要担心模型输出违规内容、虚假信息、敏感表达。现在,随着 Agent 能够调用工具、读写文件、访问数据库,风险已经从「说错」升级为「做错」。

一个客服 Agent 可能给出不当承诺,一个办公 Agent 可能误删文件,一个代码 Agent 可能提交高危代码,一个业务 Agent 可能越权访问核心数据。

AI 安全的重点,正在从审核一段内容,升级为治理一次完整行为。

但这并不意味着内容安全的重要性下降。恰恰相反,在 AI 治理体系中,内容安全正在成为连接输入、输出、模型行为与合规审计的关键抓手。从用户输入到模型输出,从文本到图片、音频、视频等多模态内容,内容安全控制面既是防止 AI 造成实际业务损失的最后一道防线,也是品牌危机、诈骗风险、违规生成和监管审计中的重点环节。

换句话说,AI 安全不是从内容安全「跳到」行为治理,而是在内容治理基础上,进一步扩展到工具调用、权限执行和业务行为治理。

变化二:攻击边界变了,从「代码漏洞」到「语义诱导」。

传统安全更多关注漏洞、流量、权限和恶意代码;但 AI 系统面对的是自然语言、上下文、意图和推理链路。

攻击者不一定需要入侵系统,只需要把恶意指令藏进网页、邮件、文档、知识库或多轮对话中,就可能诱导模型忽略规则、泄露信息或执行非预期操作。

白皮书认为,AI 安全必须具备理解语义意图的能力。未来的防御体系,不能只识别「危险代码」,还要识别「危险意图」。

变化三:治理方式变了,从「事后补丁」到「原生内嵌」。

单靠模型自身对齐,无法应对快速变化的攻击方式、业务规则和合规要求;单靠输出端过滤,也无法覆盖训练数据、知识库、工具调用和权限执行等复杂链路。

AI 安全必须从研发训练、部署上线、运营服务、迭代更新到下线销毁,贯穿全生命周期。

安全不再是 AI 系统上线后的外挂,而要成为 AI 架构的一部分。

变化四:竞争门槛变了,从「模型可用」到「系统可信」。

企业真正需要的不是一个能演示的 AI Demo,而是一个能进入生产环境、服务核心业务、承受真实对抗、满足合规审计的 AI 系统。

这意味着,安全合规不再只是成本项,而是 AI 时代的核心竞争力。谁能把 AI 用得更稳、更准、更可控,谁才有机会把技术红利转化为长期生产力。

02 五层五维框架,让 AI 风险不再是一团乱麻

很多企业并非没有意识到 AI 风险,而是不知道风险该如何分类、如何排序、如何治理。

提示注入、模型幻觉、数据泄露、RAG 污染、深度伪造、供应链投毒……风险越来越多,治理资源却始终有限。到底什么必须优先解决?什么可以分阶段治理?

《AI 安全白皮书》提出「五层风险框架+五维半定量评估体系」

在风险分类上,白皮书将 AI 风险划分为五层:

数据层,关注训练数据、知识库、隐私、版权、数据投毒与数据质量问题;

模型层,关注幻觉、越狱、安全绕过、偏见歧视、模型后门与能力误估;

应用层,关注提示注入、敏感信息泄露、RAG 污染、不安全输出处理与有害内容生成;

智能体层,关注过度授权、工具误用、跨系统越权、长链任务失控、多 Agent 级联失败与运行时不可观测;

生态层,关注深度伪造、虚假信息、AI 辅助网络攻击、影子 AI、模型和数据供应链风险。

在风险评估上,白皮书引入发生概率、影响程度、检测难度、修复成本与扩散能力五大维度,并将风险划分为 P0、P1、P2 三个优先级。

这套框架的价值在于,它让企业从「感觉哪里都有风险」,走向「知道先治理哪里」。

AI 安全不再只是专家经验判断,而可以变成可盘点、可度量、可排序、可执行的工程体系。

03 不止防内容,企业需要长出一个「AI 安全控制面」

当 AI 深度接入业务,企业不能只在输出端加一道审核。

白皮书提出,企业需要构建覆盖数据层、模型层、应用层的「三个控制面」,并围绕四条主线形成闭环治理。

第一条主线是「看得见」。

企业要先建立 AI 资产清单,看清内部有哪些模型、应用、插件、Agent、知识库、向量库、数据源和外部供应商。摸清 AI 资产全貌,是开展合规治理的前置基础。

第二条主线是「管得住」。

企业需要围绕「人+AI」双主体建立身份认证和最小权限机制,管住数据访问、工具调用、网络连接、执行频率和高风险动作,避免 AI 在无边界状态下进入核心系统。

第三条主线是「测得出」。

企业要贯穿「安全左移建设思路」,通过模型安全测评,通过模型安全测评、红蓝对抗、提示注入测试、越狱测试、数据投毒测试和行为契约校验,在上线前发现模型与应用的风险边界。

第四条主线是「追得回」。

AI 的每一次输入、检索、推理、工具调用、输出和处置结果,都应形成完整日志和证据链。当风险发生时,企业能够复盘过程、定位责任、优化策略。

这也是白皮书反复强调的一个判断:AI 安全不是一个单点能力,而是一套长期运营机制。

在此基础上,白皮书进一步提出 AI 合规体系成熟度模型。该模型基于易盾数字内容风控技术经验积累,并结合 AI 安全治理实践,将数字内容安全能力成熟度模型与 AI 安全合规体系构建路径相结合,帮助企业构建可评估、可演进的 AI 原生安全合规体系。

这套模型的核心变化,是把治理对象从「内容风险」扩展到「AI 系统风险」。它不仅关注企业有没有内容审核能力,也关注企业是否具备覆盖组织管理、关键控制面和生命周期管理的综合治理能力。

这意味着,AI 合规不再是上线前的一次检查,也不是出问题后的补救动作,而是一种持续建设、持续评估、持续优化的原生能力。

04 从「内生安全+围栏防护」到 Agent 管控,易盾给出落地解法

方法论之外,白皮书也给出了易盾在 AI 安全治理中的前沿实践。

白皮书指出,AI 安全治理不能只依靠企业内部自建体系。一方面,企业内部安全团队更理解自身业务,但在 AI 对抗样本、模型评测、内容风控、合规审查和动态风险运营等方面,往往容易受到技术能力、样本覆盖和自测偏差限制;另一方面,第三方专业机构可以承担安全技术供给与独立外部审查监督双重角色,帮助企业形成更完整、可靠的合规闭环。

因此,面向 AI 规模化落地,企业需要构建「内外兼修」的安全防护体系:内部建立治理制度、权限边界和运营流程,外部引入专业安全能力、评测机制和持续对抗经验,通过内外协同提升 AI 系统的可信水位。

基于多年数字内容风控与安全对抗经验,网易智企-易盾在白皮书中提出「内生安全+围栏防护」的双重防御体系

内生安全,解决的是模型在训练阶段「学到了什么」。易盾通过多模态训练数据清洗、安全数据标注、安全语料库、模型安全评测等能力,帮助企业从源头降低偏见、违规生成、隐私泄露、越狱攻击等风险。

围栏防护,解决的是模型在真实业务中「如何持续安全运行」。在输入侧,识别恶意提示词、越狱攻击、隐性诱导和多模态攻击;在输出侧,通过流式实时检测、幻觉与事实性检测、多模态融合检测、安全智能代答等能力,让模型输出有边界、可追溯、可处置。

面向 Agent 场景,易盾进一步推出 AI Agent 安全管控平台,形成「理、控、隔、断」四层行为防护

理,是梳理 Agent 资产、工具、服务、接口和风险暴露面;

控,是对交互输入、工具调用和敏感信息进行实时意图审计;

隔,是通过安全沙箱限制 Agent 的影响范围;

断,是在危险行为发生时触发内核级熔断,终止违规操作。

当 Agent 真正成为企业的「数字员工」,企业就不能只问它能做什么,还必须明确它不能做什么、什么时候必须停下来、出了问题如何追责。

05 AI 安全不是创新的「绊脚石」,而是高质量发展的「压舱石」

白皮书判断,未来几年 AI 安全将呈现六大趋势:生成式 AI 重塑认知安全;智能体从试点走向生产核心;AI 加持的网络攻击进入自动化与机器速度阶段;多模态与具身智能把风险边界扩展至物理世界;模型供应链与算力基础设施成为战略安全问题;全球治理从原则倡导走向标准与技术对抗。

这意味着,AI 的下一阶段竞争,不只是模型之争、应用之争、成本之争,更是治理能力之争。

未来的企业 AI 系统,将不再是一个个孤立工具,而会成为连接知识、流程、权限、业务和人的智能网络。人类员工负责判断、授权和监督,数字员工负责执行、协作和反馈。组织的运行方式会因此被重构。

但越是如此,安全越不能缺席。

只有当 AI 资产看得见,数据和权限管得住,模型边界测得出,行为责任追得回,AI 才能从短期热闹的试点项目,变成真正可持续的核心生产力。

网易智企发布《AI 安全白皮书》,正是希望为行业提供一套可理解、可评估、可落地的 AI 安全治理路径。

AI 时代,真正先进的企业,不只是敢用 AI 的企业,而是能安全地、持续地、规模化地用好 AI 的企业。

来源:互联网

最新文章

极客公园

用极客视角,追踪你不可错过的科技圈.

极客之选

新鲜、有趣的硬件产品,第一时间为你呈现。

张鹏科技商业观察

聊科技,谈商业。