药房系统有一条比准确更要紧的规则:可以说「我不知道」,不允许「确信却是错的」。由于判断者是语言模型,同一请求五次返回 0.03、0.03、0.03、0.04、0.04,基于精确比较的性质检查毫无用处。作者因此按建数据库的方式来建:先写 TLA+ 规范并做模型检验推出仲裁上界,由规范派生 AsyncAPI 契约、生成 Rust 内核,把模型放在单一 trait 之后当 oracle,最后在带种子的混沌下跑 1680 次模拟用药决策。