dev.to | 📄 原文链接 | 2026-08-21 收录

我为提示注入写了测试:测试通过了,攻击却照样得手

来源:dev.to — 2026-08-20

📋 概述

作者维护一个名为 llm-council 的小型 CLI,让多个模型互评答案以作为对抗式审阅工具。当他让工具审阅自己的仓库时,发现了两个问题:一是自身提示词里的提示注入漏洞,二是更令人不安的——他为该漏洞写过的测试居然是绿色的。作者剖析了漏洞根源:当模型链式调用时,前一阶段的可信输出会成为下一阶段的新提示词,而无防护的文本可以被当作指令注入。他强调仅靠分隔符围栏(fencing)并不足够,真正的加固需要理解模型信任边界的本质。

🔑 核心要点

💡 金句

一个通过了的测试看起来像是证明,但在提示注入面前,绿色未必意味着安全。
← 返回 dev.to 首页