并不存在 NIST AI 安全框架

The NIST AI Risk Management Framework: Mapping the Core Suite to Security Practice

从业者、厂商与政策制定者越来越将「NIST AI 安全框架」当作单一控制基线。事实并非如此。

自 2023 年起,NIST 发布了一系列自愿性 AI 文件。该表述至少指三种不同事物:Artificial Intelligence Risk Management Framework(AI RMF)本身;后来的 Cybersecurity Framework Profile for Artificial Intelligence(NIST IR 8596);以及更宽泛地,上述文件与对抗性机器学习指南及常规网络安全控制的并集。混为一谈会导致两种失败模式:想要安全项目的团队只做了治理工作坊;想要可信 AI 的团队只做了模型加固清单。

本文是对一篇映射论文的导览。我们阅读截至 2026 年 8 月的公开 NIST 文献。我们不评估模型,也不声称任何产品实现了 AI RMF。

三点观察

套件即框架。 AI RMF 1.0(NIST AI 100-1)于 2023 年 1 月发布,附带 Playbook、Roadmap、可信 AI 特性的详细说明,以及通过 Trustworthy and Responsible AI Resource Center 提供的社区目录。将 AI 100-1 视为整个项目,会低估 NIST 在 2023 年第一季度发布的内容。

安全是特性之一,而非整体框架。 NIST 列出七项可信 AI 特性。Secure and resilient 是其中一行。四项功能 — Govern、Map、Measure、Manage — 是组织追求全部七项(含彼此张力)的方式。

网络安全文书是接入而非替代。 CSF 2.0、Cyber AI Profile 草案、AI 100-2、AI 600-1 与 SP 800-53 深化网络安全与生成式 AI 实践。NIST 自身说明 CSF 2.0、AI RMF 与 Cyber AI Profile 应一并使用。

原始套件

NIST 2023 年 1 月的发布是一个包,而非单一文件:

资源角色
AI RMF 1.0(AI 100-1)规范核心:风险框架、七项特性、四项功能
Playbook各子类别的建议行动 — 自愿,非清单
Roadmap后续议程:配置文件、TEVV、权衡、有效性
可信 AI 特性Measure 中衡量的质量门槛(AI 100-1 第一部分)
AIRC / 社区目录用例、对照表与贡献的实现

Govern 是横切的。Map、Measure、Manage 针对给定 AI 系统形成循环。Core 描述的是成果,而非工具。「MEASURE 2: AI systems are evaluated for trustworthy characteristics」并未点名 red team 供应商或对抗鲁棒性指标。这些选择属于 Playbook、组织配置文件或 AI 100-2 等补充文件。

七项之一:安全

可信 AI 系统整体上应具备:valid and reliable;safe;secure and resilient;accountable and transparent;explainable and interpretable;privacy-enhanced;以及 fair(harmful bias managed)。

Secure and resilient 与经典 CIA 三要素及 CSF 成果重叠。它本身并不涵盖:模型声明目标是否与部署者价值观一致;拒答是否充分;解释是否忠实;评估是否统计有效。对抗性机器学习处于边界 — 因此 NIST 撰写了专门分类体系,而非将 AML 完全纳入 CSF。

仅从安全角度解读四项功能仍有内容:谁负责模型风险与应用安全;AI 系统实际包含什么(模型、提示、工具、检索、人员);针对 jailbreak、注入、外泄与投毒有哪些测试;缓解后残余风险 — 包括永不会出现在 SIEM 中的危害。

哪份文件回答哪个问题

实务问题不是哪份是「那个」框架,而是哪份文件回答哪个问题:

  1. 我们应交付哪些成果? → AI RMF 1.0 + 配置文件(AI 600-1 或行业)
  2. 如何追求这些成果? → Playbook + AIRC 示例
  3. 网络安全成果是什么? → CSF 2.0 + Cyber AI Profile(IR 8596)
  4. 模型可能发生什么? → AI 100-2(+ ATLAS)
  5. 哪些控制具体落实? → SP 800-53 / 叠加 / ISO 27001

跳过某一行很常见;声称已覆盖被跳过的行才是常见错误。

实例:智能体式聊天系统

考虑一个托管助手:检索私有文档、调用工具、跨多轮行动。

Map. 系统不是「模型」。它是模型、系统提示、检索语料、工具 API、会话记忆、评估器与人工操作者。AI 600-1 的生成式 AI 风险清单在范围内。

Govern. 应用安全、模型与提示变更控制、安全策略、供应商模型分别指定负责人。Third-party Govern 对基础模型 API 与对 SaaS 同样适用。

Measure. AI 100-2 的 misuse 与 privacy 类涵盖 jailbreak、经检索文档的 prompt injection、经工具的数据外泄。不涵盖无攻击者却伤害用户的 confabulation。只统计攻击成功率的 red team 报告相对 AI 600-1 是不完整的 Measure。

Manage. 事件类型包括传统泄露以及已完成的 harmful 工具操作。恢复可能意味着回滚提示或模型,而不仅是轮换凭据。

四种失败模式

我们在公开声明中观察到四类反复出现的范畴错误:

  • PDF 合规。 将填完的 Playbook 表格当作 MEASURE 2 的实现。
  • 安全提喻。 将 AI RMF 实现等同于对抗鲁棒性评估。
  • 伦理提喻。 将 AI RMF 实现等同于无事件路径的 fairness 仪表盘。
  • 认证表演。 宣传「NIST AI RMF certified」,尽管 NIST 并未为 1.0 提供此类认证。

最后一项最具误导性。ISO/IEC 42001 是可认证的 AI 管理体系。AI RMF 是自愿性成果框架,可与该体系对齐 — 绝不可对其「认证」。

为何需要这张地图

一并使用时,这些文件是连贯的;当作同义词使用时,会得到要么带伦理词汇的安全项目,要么无事件路径的伦理项目。最廉价的纠正是语言层面:说明哪份文件回答哪个问题,并停止声称其余部分已覆盖。

AI RMF 1.0 正在 White House AI Action Plan 下修订;Playbook 将随修订更新。读者应将其视为 1.0 时代套件加截至 2026 年中已发布补充的地图 — 而非对 2.0 文本的冻结。

完整细节、表格与完整使用程序见论文全文。

阅读全文

引用

@online{violet2026nistairmf,
  author = {Haigh, John},
  title = {The NIST AI Risk Management Framework: Mapping the Core Suite to Security Practice},
  date = {2026-09-12},
  year = {2026},
  url = {https://www.violetai.ca/zh-Hans/research/nist-ai-rmf/paper},
}