作者运行着住在 iMessage 里的 AI 助手 Olly,累计处理超过 1800 万条消息,其中约三分之一跑在 OpenRouter 的开源模型上——这个量级足以把每种边界情况都撞上一遍。他先厘清词汇:模型是权重,供应商才是真正给你分配 GPU、决定精度与「专有优化」、还带着自己那套 XML/工具解析器(以及自己那串 bug)的一方。于是同一个 deepseek/deepseek-v4-flash 请求,背后可能是二十家你基本没听过的公司。实测差异惊人:同一份权重的 GPQA 与 TAU-Bench 成绩,第一方 DeepSeek 是 90%/81%,DigitalOcean 只有 75%/58%;对智能体而言 TAU 才是关键指标,20 分的差距不是噪声。他还发现视觉模型会遇上「看不见图的供应商」,以及某些宿主对 reasoning.effort 完全当没看见。