非影资讯
面向安全从业者的中英双语安全研究与漏洞情报精选。

Anthropic的越狱挑战如何测试AI安全防御

摘要

Anthropic 与 HackerOne 在演示版 Claude 3.5 Sonnet 上举办 AI 红队挑战,检验其宪法分类器(Constitutional Classifiers)能否抵御针对 CBRN 内容的通用越狱攻击。挑战吸引 339 名研究者、逾 30 万次对话,四个团队合计获得 5.5 万美元赏金。
发布时间
收录时间

原文 ↗

相关内容

返回