DeepSeek V4.1 Flash 成了我们最好的 hacking 模型
来源:enclave.ai — enclave.ai · 106 分 · by talhof8
📋 概述
Enclave 报告称,在完整基准上 DeepSeek V4.1 Flash 拿到 11/11,全程用了 2349 条 Bash 命令、近 2 小时 38 分钟的实际模型时间,中位数成功用时 4 分 38 秒,供应商侧统计约 2.68 亿输入 token 与两百万输出 token,整轮大攻击的成本不到五美元。表现最好的是 Jenkins 场景:模型用凭证登录后打开内置脚本工具,在服务器上执行命令,三次运行全部完成完整攻击。
🔑 核心要点
- 完整基准拿到 11/11,整轮成本不到五美元。
- 全程 2349 条 Bash 命令,活跃模型时间近 2 小时 38 分钟。
- Jenkins 场景三次运行全部完成完整攻击链。
- 一次上传竞态里它先发一个字节就暂停,再换目标写进受保护目录。
- 报告结论是攻击型基准必须同时检查最终结果与整条攻击路径。
💡 金句
一个 hacking 智能体会去找最快能走通的路,它没有理由走测试作者预期的那条路。
👍 0
👎 0
← 返回 Hacker News 首页