并不存在 NIST AI 安全框架
The NIST AI Risk Management Framework: Mapping the Core Suite to Security Practice
从业者、厂商与政策制定者越来越将「NIST AI 安全框架」当作单一控制基线。事实并非如此。
自 2023 年起,NIST 发布了一系列自愿性 AI 文件。该表述至少指三种不同事物:Artificial Intelligence Risk Management Framework(AI RMF)本身;后来的 Cybersecurity Framework Profile for Artificial Intelligence(NIST IR 8596);以及更宽泛地,上述文件与对抗性机器学习指南及常规网络安全控制的并集。混为一谈会导致两种失败模式:想要安全项目的团队只做了治理工作坊;想要可信 AI 的团队只做了模型加固清单。
本文是对一篇映射论文的导览。我们阅读截至 2026 年 8 月的公开 NIST 文献。我们不评估模型,也不声称任何产品实现了 AI RMF。
三点观察
套件即框架。 AI RMF 1.0(NIST AI 100-1)于 2023 年 1 月发布,附带 Playbook、Roadmap、可信 AI 特性的详细说明,以及通过 Trustworthy and Responsible AI Resource Center 提供的社区目录。将 AI 100-1 视为整个项目,会低估 NIST 在 2023 年第一季度发布的内容。
安全是特性之一,而非整体框架。 NIST 列出七项可信 AI 特性。Secure and resilient 是其中一行。四项功能 — Govern、Map、Measure、Manage — 是组织追求全部七项(含彼此张力)的方式。
网络安全文书是接入而非替代。 CSF 2.0、Cyber AI Profile 草案、AI 100-2、AI 600-1 与 SP 800-53 深化网络安全与生成式 AI 实践。NIST 自身说明 CSF 2.0、AI RMF 与 Cyber AI Profile 应一并使用。
原始套件
NIST 2023 年 1 月的发布是一个包,而非单一文件:
| 资源 | 角色 |
|---|---|
| AI RMF 1.0(AI 100-1) | 规范核心:风险框架、七项特性、四项功能 |
| Playbook | 各子类别的建议行动 — 自愿,非清单 |
| Roadmap | 后续议程:配置文件、TEVV、权衡、有效性 |
| 可信 AI 特性 | Measure 中衡量的质量门槛(AI 100-1 第一部分) |
| AIRC / 社区目录 | 用例、对照表与贡献的实现 |
Govern 是横切的。Map、Measure、Manage 针对给定 AI 系统形成循环。Core 描述的是成果,而非工具。「MEASURE 2: AI systems are evaluated for trustworthy characteristics」并未点名 red team 供应商或对抗鲁棒性指标。这些选择属于 Playbook、组织配置文件或 AI 100-2 等补充文件。
七项之一:安全
可信 AI 系统整体上应具备:valid and reliable;safe;secure and resilient;accountable and transparent;explainable and interpretable;privacy-enhanced;以及 fair(harmful bias managed)。
Secure and resilient 与经典 CIA 三要素及 CSF 成果重叠。它本身并不涵盖:模型声明目标是否与部署者价值观一致;拒答是否充分;解释是否忠实;评估是否统计有效。对抗性机器学习处于边界 — 因此 NIST 撰写了专门分类体系,而非将 AML 完全纳入 CSF。
仅从安全角度解读四项功能仍有内容:谁负责模型风险与应用安全;AI 系统实际包含什么(模型、提示、工具、检索、人员);针对 jailbreak、注入、外泄与投毒有哪些测试;缓解后残余风险 — 包括永不会出现在 SIEM 中的危害。
哪份文件回答哪个问题
实务问题不是哪份是「那个」框架,而是哪份文件回答哪个问题:
- 我们应交付哪些成果? → AI RMF 1.0 + 配置文件(AI 600-1 或行业)
- 如何追求这些成果? → Playbook + AIRC 示例
- 网络安全成果是什么? → CSF 2.0 + Cyber AI Profile(IR 8596)
- 模型可能发生什么? → AI 100-2(+ ATLAS)
- 哪些控制具体落实? → SP 800-53 / 叠加 / ISO 27001
跳过某一行很常见;声称已覆盖被跳过的行才是常见错误。
实例:智能体式聊天系统
考虑一个托管助手:检索私有文档、调用工具、跨多轮行动。
Map. 系统不是「模型」。它是模型、系统提示、检索语料、工具 API、会话记忆、评估器与人工操作者。AI 600-1 的生成式 AI 风险清单在范围内。
Govern. 应用安全、模型与提示变更控制、安全策略、供应商模型分别指定负责人。Third-party Govern 对基础模型 API 与对 SaaS 同样适用。
Measure. AI 100-2 的 misuse 与 privacy 类涵盖 jailbreak、经检索文档的 prompt injection、经工具的数据外泄。不涵盖无攻击者却伤害用户的 confabulation。只统计攻击成功率的 red team 报告相对 AI 600-1 是不完整的 Measure。
Manage. 事件类型包括传统泄露以及已完成的 harmful 工具操作。恢复可能意味着回滚提示或模型,而不仅是轮换凭据。
四种失败模式
我们在公开声明中观察到四类反复出现的范畴错误:
- PDF 合规。 将填完的 Playbook 表格当作 MEASURE 2 的实现。
- 安全提喻。 将 AI RMF 实现等同于对抗鲁棒性评估。
- 伦理提喻。 将 AI RMF 实现等同于无事件路径的 fairness 仪表盘。
- 认证表演。 宣传「NIST AI RMF certified」,尽管 NIST 并未为 1.0 提供此类认证。
最后一项最具误导性。ISO/IEC 42001 是可认证的 AI 管理体系。AI RMF 是自愿性成果框架,可与该体系对齐 — 绝不可对其「认证」。
为何需要这张地图
一并使用时,这些文件是连贯的;当作同义词使用时,会得到要么带伦理词汇的安全项目,要么无事件路径的伦理项目。最廉价的纠正是语言层面:说明哪份文件回答哪个问题,并停止声称其余部分已覆盖。
AI RMF 1.0 正在 White House AI Action Plan 下修订;Playbook 将随修订更新。读者应将其视为 1.0 时代套件加截至 2026 年中已发布补充的地图 — 而非对 2.0 文本的冻结。
完整细节、表格与完整使用程序见论文全文。
引用
@online{violet2026nistairmf,
author = {Haigh, John},
title = {The NIST AI Risk Management Framework: Mapping the Core Suite to Security Practice},
date = {2026-09-12},
year = {2026},
url = {https://www.violetai.ca/zh-Hans/research/nist-ai-rmf/paper},
}