AIレッドチーミング

敵対的テストで実現する信頼できるAI
AIサービスに潜む不正利用経路やセーフガードの不備を、実際の攻撃者の視点から再現・検証します
AIが脅威にさらされる前に
セキュリティを確立
AIレッドチーミングはAIサービスに潜む不正利用経路やセーフガードの不備を、実際の攻撃者の視点から再現・検証します。プロンプト攻撃、RAGからの情報流出、AIエージェントの不正利用など、 実際の攻撃を想定したシナリオを再現します。サービスのリリース前に、AIのセキュリティ上の脆弱性やポリシー回避の可能性を検証し、安全なAI運用を支援します。

入力から実行までのAIリスクと、未検証のガードレール
入力から実行に至る、検証されていないAIリスク
AIサービス導入・リリース前のセキュリティ検証の不十分
- 社内AIサービスの導入・リリーススケジュールは決まっているものの、プロンプト操作やポリシー回避など、実際の不正利用シナリオにおいてセーフガードが機能することを証明する根拠が不足しています。
- 実際のユーザーが試みる可能性のある回避入力を再現し、どのような条件でポリシーや制御が無効化されるのかを検証するプロセスが必要です。
権限の境界を越えたAI応答による情報流出
- 文書のアクセス権限を設定していても、AIが回答を生成する過程で権限外の情報が意図せず混入していないかを確実に検証することは容易ではありません。
- アクセス権限のない文書の内容が要約として露出したり、機密情報が回答内に再構成されたりすることを防ぐため、検索から最終回答に至るまでの権限境界を検証する必要があります。
AIエージェントにおけるプロンプトから実行までのリスク
- AIエージェントがAPIや業務システムまで呼び出すようになり、1つのプロンプトが実際の処理の実行につながるようになりました。
- 悪意のある入力や外部文書に埋め込まれた指示がツールの呼び出しにつながる事態に備え、実行権限・呼び出し条件・承認プロセス・ログによる追跡まで一貫して点検する必要があります。
AI攻撃経路の検証と
セーフガードテスト
AIへの攻撃経路を検証し、安全対策の有効性を確認
AIレッドチーミングとは?
AIレッドチーミングとは、生成AI・LLM・RAG・AIエージェントサービスが実際の利用環境でどのように不正利用・誤用される可能性があるかを、攻撃者の視点から検証するセキュリティテストです。 プロンプト操作・ポリシー回避・機密情報の露出・権限の不正利用・意図しない処理の実行可能性を、実践的なシナリオに基づいて点検し、サービス運用に必要な対応体制と改善策を提示します。
AI攻撃経路の特定
AIサービスにおける入力・応答・データ参照・権限処理・外部ツール連携の一連の流れを分析し、従来のWeb・アプリケーション診断では発見が難しい、AI特有の攻撃経路や悪用リスクを特定します。
敵対的入力によるセーフガードテスト
AIサービスに適用されているセキュリティポリシーやセーフガードが、攻撃的な入力や回避の試みに対しても設計どおりに機能するかを検証し、リリース前または運用中に生じる可能性のある制御の不備を確認します。
ビジネス影響度に基づくAIリスクの優先順位付け
AIの誤作動や不正利用の可能性を、技術的な深刻度とビジネス影響度に基づいて分析し、個人情報の露出・社内機密情報の流出・未承認処理の実行といったリスクを軽減するための改善優先順位を提示します。
AIレッドチーミングの検証プロセス
01
AIサービスの対象範囲の定義とリスクマッピング
- AIモデル・プロンプト・データソース・RAG構成・API連携・権限体系・外部ツールとの接続状況を把握
- サービスの目的・ユーザー権限・取り扱うデータの機密性・運用環境に基づき、主な検証範囲と優先順位を設定
02
攻撃シナリオの設計とシミュレーション
- プロンプトインジェクション・ポリシー回避・機密情報を引き出す試み・権限を超えた要求・データ抽出のシナリオを、サービスの特性に合わせて設計
- 実際のユーザーが入力し得る自然言語基盤の攻撃パターンや回避手法を用いて、AIサービスの応答と処理フローを検証
03
悪用可能性の評価と失敗原因の分析
- AIサービスの構成と利用状況に基づき、主な脆弱性と不正利用の可能性を点検
- シナリオの各段階における攻撃成功の要因と防御体制の不備を分析し、実効性のある改善ポイントを特定
04
セーフガードの改善とモニタリング基準の策定
- 発見された脆弱性や不正利用経路に基づき、プロンプトポリシー・権限制御・データアクセス制限・承認プロセスなど、補強が必要なセーフガードを設計
- AIサービスの運用中に継続的な確認が必要となるリスク指標・ログ項目・検知基準を定め、再発リスクを軽減
05
リスク報告と改善ガイダンス
- 発見された脆弱性と不正利用の可能性を、技術的な深刻度とビジネス影響度に基づいて整理したレポートを提供
- プロンプトの改善・ポリシーの強化・権限制御・データアクセス制限・ロギング・監視体制の改善など、実行可能な対策をまとめた実務ガイドを提供
国際基準に基づくAI検証と、
インテリジェンス主導のシナリオ
国際基準と脅威インテリジェンスを組み合わせたAIセキュリティ検証
AIリスクに基づく セキュリティ検証体制
S2Wは、「OWASP Top 10 for LLM Applications」などの国際基準を基に、お客様のサービス構成・データの機密性・権限体系・運用環境を考慮して検証範囲を設計します。特にLLM・RAG・AIエージェントについて、サービスごとの攻撃対象領域と運用リスクを区別し、実際の環境に即した検証基準を適用します。
国際的なAIセキュリティリスク基準を反映
国際的なAIセキュリティリスク基準を取り入れた検証体制を適用
サービスの種類に応じた検証体制の構築
LLM・RAG・AIエージェントなど、サービスの種類に応じた検証項目を設定
カスタマイズされた診断設計
サービス構成とデータの機密性を考慮した診断範囲を個別に設計

脅威インテリジェンスに基づく 攻撃シナリオ設計
AIレッドチーミングは、単なるプロンプトテストではなく、実際の攻撃者による回避・悪用手法を再現する実践的なセキュリティ検証です。S2Wは、統合分析センター「TALON」の分析力を活用し、ダークウェブやハッキングフォーラム、各種脅威チャネルから収集した最新の攻撃手法やLLMを悪用するペイロードを、AIサービスの評価シナリオに反映します。
最新の脅威インテリジェンスとの連携
CTIに基づく最新の攻撃手法および脅威アクターのTTPを分析
ヒドゥンチャネルで確認されたLLM悪用ペイロードを反映
ダークウェブやハッキングフォーラムで確認されたLLM攻撃ペイロードを反映
高度な侵入シナリオの設計
プロンプトインジェクション・ポリシー回避・機密情報の引き出しを想定したシナリオを設計
実質的な不正利用の可能性を検証
実際の脅威環境を反映し、AIサービスが不正利用される可能性を検証

1/2
