セキュリティ
セキュリティチームは、公開標準と任意の枠組みを生成型・エージェント型 AI システムの実践に対応づけます。
当社の研究は、生成 AI システムをいかに統治・測定・保護するかを探り、強力なツールが検証不能にならず有用であり続ける方法を追究します。
セキュリティチームは、公開標準と任意の枠組みを生成型・エージェント型 AI システムの実践に対応づけます。
人命、健康、財産、環境。
システムは主張どおりに動き、限界は文書化されているか。
誰が責任を負い、他者が何が起きたかを検証できるか。
人は出力と振る舞いを理解できるか。
匿名性、機密性、データの制御。
有害バイアスと差別リスク。
フィルタは境界ではない。本論文はツール利用エージェント向けに隔離・許可リスト・出力フィルタを比較し、有害な行為をジェイルブレイク得点ではなく安全性の問題として位置づける。
「AI Security Framework」という単一の NIST 文書は存在しません。本論文は AI RMF 1.0 スイートを整理し、7 つの信頼性特性のうちセキュリティの位置を示し、後続の NIST 文書が親プログラムに代わることなくどう接続するかを示します。
トグルは Measure プログラムではありません。本論文はワークスペースのトラストレイヤー・パターン — ポリシー、ゲートウェイ上のゲート、正直なカバレッジ表示、同一リクエストのイベント — を示し、ツール利用エージェント向けに *secure and resilient* を運用化しつつ、Safety や AI RMF 全体を主張しません。