Skip to main content
Implement monitoring capabilities to detect and enable responding to adversarial inputs and prompt injection attempts
Keywords
MonitorAdversarialJailbreakPrompt Injection
Application
Supplemental
Frequency
Every 3 months
Type
Detective
Capabilities
Universal
Crosswalks

Control activities

Typical evidence

Should include?

Establishing detection and alerting. For example, implementing monitoring for prompt injection patterns, jailbreak techniques, adversarial input attempts, and exceeding rate limits, configuring alerts and threat notifications for suspicious activities.

B002.1 Config: Adversarial input detection and alerting

Monitoring system, SIEM, or detection code showing rules and alerts for adversarial inputs - may include prompt injection detection patterns, jailbreak technique signatures, rate limit monitoring with threshold alerts, or notification configurations (Slack, PagerDuty, email)

Typical location
Engineering Code
Capabilities
Universal

Implementing incident logging and response procedures. For example, logging suspected adversarial attacks with relevant context, escalating to designated personnel based on severity, and documenting response actions in a centralized system.

B002.2 Logs: Adversarial incident and response

Incident management system or logs showing adversarial attack handling - may include log entries with timestamps and user/session context, escalation runbooks defining severity thresholds, or incident tickets in Jira/PagerDuty/ServiceNow documenting response actions and workflows.

Typical location
LogsEngineering Tooling
Capabilities
Universal

Maintaining detection effectiveness through quarterly reviews. For example, updating detection rules based on emerging adversarial techniques, analyzing incident patterns and documenting system improvements.

B002.3 Documentation: Updates to detection config

Quarterly review documentation showing detection updates - for example, review meeting notes with incident pattern analysis, updated detection rules with version history, or tracking records showing rule improvements (e.g. GitHub/Jira tickets).

Typical location
Engineering PracticeInternal processes
Capabilities
Universal
May include?

Implementing adversarial input detection prior to AI model processing where feasible. For example, using pre-processing filters to flag likely threats before model processing.

B002.4 Config: Pre-processing adversarial detection

Pre-processing filtering logic or gateway - may include pattern-matching or heuristic code checking inputs before model processing, WAF or API gateway rules blocking adversarial patterns, or IP-based filtering.

Typical location
Engineering Code
Capabilities
Universal

Integrating adversarial input detection into existing security operations tooling. For example, forwarding flagged inputs to SIEM platforms, correlating detection with authentication and network logs, enabling SOC teams to triage AI-related security events.

B002.5 Config: AI security alerts

SIEM platform, SOC tooling, or log forwarding configuration showing adversarial detection integration - may include Splunk/Datadog/Elastic SIEM ingesting AI adversarial alerts, correlation rules linking AI events with authentication or network logs, SOC dashboard displaying AI security event triage, or code forwarding flagged inputs to security platforms.

Typical location
Engineering Tooling
Capabilities
Universal

Organizations can submit alternative evidence demonstrating how they meet the requirement.