Anthropic的越狱挑战如何测试AI安全防御
hackerone.com | 博客 | #ai-security | #ai-safety | #red-teaming | #jailbreak | #llm | #claude | #hackerone | #ai-red-teaming | #anthropic | #constitutional-classifiers | #cbrn
摘要
Anthropic 与 HackerOne 在演示版 Claude 3.5 Sonnet 上举办 AI 红队挑战,检验其宪法分类器(Constitutional Classifiers)能否抵御针对 CBRN 内容的通用越狱攻击。挑战吸引 339 名研究者、逾 30 万次对话,四个团队合计获得 5.5 万美元赏金。
- 发布时间
- 收录时间
Skip to content