安全
安全團隊將公開標準與自願性框架對應到生成式與代理式 AI 系統的實務。
我們的研究探討如何治理、度量並保護生成式 AI 系統——使強大工具保持可用,而不至於變得無法驗證。
安全團隊將公開標準與自願性框架對應到生成式與代理式 AI 系統的實務。
生命、健康、財產與環境。
系統是否做到其所聲稱的能力,並記錄局限。
誰負責,他人能否查核發生了什麼。
人們能否理解輸出與行為。
匿名、保密與對資料的控制。
有害偏見與歧視風險。
過濾器不是邊界。本文比較工具型代理的隔離、允許清單與輸出過濾,並將有害行動歸入人身安全,而不是越獄分數。
並不存在一份題為 AI Security Framework 的單一 NIST 文件。本文梳理 AI RMF 1.0 套件,定位安全在七項可信特性中的位置,並說明後續 NIST 文書如何銜接而不替代主框架。
開關不等於 Measure 計畫。本文描述工作區信任層模式——策略、閘道閘門、誠實的覆蓋條帶與同請求事件——在工具型代理上落實 *secure and resilient*,而不聲稱覆蓋 Safety 或完整 AI RMF。