dev.to | 📄 原文链接 | 2026-09-01 收录

我的 LLM 评审每次都翻脸——没关系,决定致命与否的是个 frozenset

来源:dev.to — 2026-09-01

📋 概述

作者实测发现 LLM 评审对完全相同的输入每次给出不同判定(label_flip_rate=1.0),却从未放过一个有缺陷的计划(underclaim_approvals=0)——两个数字同时为真,是因为架构把"少报"和"多报"两个方向交给了不同权威,而它们都不是 LLM。确定性门禁负责少报方向(解析 AST 而非散文,无法被提示注入),代码强制的白名单负责多报方向:即使 LLM 把 severity 标为 blocker,只要所属 family 不在 frozenset 内就被降级为 warning。结论:提示词只是辅助,frozenset 才是契约。

🔑 核心要点

💡 金句

提示词是有帮助的,但 frozenset 才是契约。LLM 可以自由地对严重程度犯错——反正代码从不相信它的严重程度标签。
← 返回 dev.to 首页