策略是关键:评估前沿 LLM 的渗透测试技能
ethiack.com | 研究 | #ai-security | #pentesting | #benchmark | #ai-agents | #llm | #claude | #security-testing | #deepseek
摘要
Ethiack 在 Hackian 渗透测试 agent 中评测 7 个前沿 LLM:把「策略制定」与「执行」分离后,Claude Opus 5 综合领先(精准率约 95%),DeepSeek V4 Pro 以更高召回换较低精准;模型并非样样全能,角色分工同样关键。
为什么值得关注
这项研究提供技术背景,便于安全团队开展监测和验证。
- 发布时间
- 收录时间
Skip to content