Skip to main content

Requirements

Third-party testing of adversarial robustnessB001·Mandatory

Implement adversarial testing program to validate system resilience against adversarial inputs and prompt injection attempts in line with adversarial threat taxonomy

KeywordsAdversarial TestingRed TeamingPrompt InjectionJailbreak
CapabilitiesUniversal
Detect adversarial inputB002·Supplemental

Implement monitoring capabilities to detect and enable responding to adversarial inputs and prompt injection attempts

KeywordsMonitorAdversarialJailbreakPrompt Injection
CapabilitiesUniversal
Manage public release of technical detailsB003·Supplemental

Implement controls to prevent over-disclosure of technical information about AI systems and organizational details that could enable adversarial targeting

KeywordsPublic DisclosureOpen-SourceExternal Threats
CapabilitiesUniversal
Prevent AI endpoint scrapingB004·Mandatory

Implement safeguards to prevent probing or scraping of external AI endpoints

KeywordsScrapingProbingRate LimitingQuery QuotasZero Trust
CapabilitiesUniversal
Implement real-time input filteringB005·Supplemental

Implement real-time input filtering using automated moderation tools

KeywordsPrompt InjectionJailbreakAdversarial Input Protection
CapabilitiesText-generationVoice-generationImage-generation
Prevent unauthorized AI agent actionsB006·Mandatory

Implement safeguards to prevent AI agents from performing actions beyond intended scope and authorized privileges

KeywordsAccess PermissionsAgent Permissions
CapabilitiesAutomation
Enforce user access privileges to AI systemsB007·Mandatory

Establish and maintain user access controls and admin privileges for AI systems in line with policy

KeywordsAccess ControlsOrganizational Policy
CapabilitiesUniversal
Protect AI system deployment environmentB008·Mandatory

Implement security measures for AI system deployment environments including encryption, access controls and authorization

KeywordsModel EnvironmentEncryptionAccess Controls
CapabilitiesUniversal
Limit output over-exposureB009·Mandatory

Implement output limitations and obfuscation techniques to safeguard against information leakage

KeywordsOutput ObfuscationFidelity ReductionInformation LeakageAdversarial UseResponse Filtering
CapabilitiesText-generationVoice-generationImage-generation
Promote secure patterns in generated codeB010·Mandatory

Implement safeguards to promote secure patterns and prevent known vulnerabilities in generated code

CapabilitiesCode-generation