作者为自己的开源分析平台 InsightTrack 做模型选型。平台里的 AI 分析师 Pulse 会回答「上周 /pricing 的流量为什么掉了」这类问题,需要背后有个语言模型。他不想靠感觉选,于是把 Pulse 的真实工作变成基准:480 道题自动评测,标准答案直接由 InsightTrack 自己的代码生成。文章的核心论点是分析助手会「自信地犯错」,而且只有两种错法都很贵——凭空编一个原因,或者漏掉真正的问题;两者都比老实说「我不知道」更糟。