我为提示注入写了测试:测试通过了,攻击却照样得手
来源:dev.to — 2026-08-20
📋 概述
作者维护一个名为 llm-council 的小型 CLI,让多个模型互评答案以作为对抗式审阅工具。当他让工具审阅自己的仓库时,发现了两个问题:一是自身提示词里的提示注入漏洞,二是更令人不安的——他为该漏洞写过的测试居然是绿色的。作者剖析了漏洞根源:当模型链式调用时,前一阶段的可信输出会成为下一阶段的新提示词,而无防护的文本可以被当作指令注入。他强调仅靠分隔符围栏(fencing)并不足够,真正的加固需要理解模型信任边界的本质。
🔑 核心要点
- 链式调用模型时,前一阶段的文本会直接拼接进下一阶段的提示词,这是 OWASP LLM01 的典型形态。
- 作者已经写了针对提示注入的测试,测试通过,但攻击依然有效——绿色测试并不等于安全。
- 标准缓解手段是围栏(fencing):用分隔符包裹不可信内容,并明确告诉模型那是引用数据而非指令。
- 真正的教训在于:模型会把文本当作数据还是指令,取决于上下文,测试若没覆盖真实攻击路径就形同虚设。
💡 金句
一个通过了的测试看起来像是证明,但在提示注入面前,绿色未必意味着安全。
👍 0
👎 0
← 返回 dev.to 首页