安全
安全团队将公开标准与自愿性框架映射到生成式与智能体式 AI 系统的实践。
我们的研究探讨如何治理、度量并保护生成式 AI 系统——使强大工具保持可用,而不至于变得无法验证。
安全团队将公开标准与自愿性框架映射到生成式与智能体式 AI 系统的实践。
生命、健康、财产与环境。
系统是否做到其所声称的能力,并记录局限。
谁负责,他人能否核查发生了什么。
人们能否理解输出与行为。
匿名、保密与对数据的控制。
有害偏见与歧视风险。
过滤器不是边界。本文比较工具型智能体的隔离、允许列表与输出过滤,并将有害行动归入人身安全,而不是越狱分数。
并不存在一份题为 AI Security Framework 的单一 NIST 文件。本文梳理 AI RMF 1.0 套件,定位安全在七项可信特性中的位置,并说明后续 NIST 文书如何衔接而不替代主框架。
开关不等于 Measure 计划。本文描述工作区信任层模式——策略、网关闸门、诚实的覆盖条带与同请求事件——在工具型智能体上落实 *secure and resilient*,而不声称覆盖 Safety 或完整 AI RMF。