让它数,还是自己算:工具返回行清单时,数得对的模型花掉了 token
来源:dev.to — 2026-09-28
📋 概述
这是 Kaggle 基准挑战赛的参赛作品,测的是每个智能体都在做、却几乎没人测的一步:数清楚工具返回了什么。智能体的搜索、数据库或 API 工具通常返回一批记录,当用户问「有多少条」时,计数由模型完成。这个基准用同一批 68 个计数问题、两种工具版本问了十个模型:count_ids 直接返回准确计数,list_ids 返回匹配的 id。给出计数时,除一个模型外所有模型对大约 330 个 id 的每个问题都答对,成本还基本持平;给出 id 清单时,模型分成两拨——每问花 2700 到 8200 个输出 token 的模型能把 21 组清单数对 15 到 21 组,而在 600 token 内作答的只对 0 到 10 组。
🔑 核心要点
- 阵容里最贵的 Claude Opus 5 只花了 579 个 token、数对 9 组,而 26B 开源的 Gemma 4 花了 8153 个 token、数对 20 组。
- 榜单顺序与直觉相反:答案质量与「愿不愿意在计数上花 token」高度相关,而不是与模型价格相关。
- 这类失败极其隐蔽,因为模型发出了正确的查询、并信心十足地报出一个数字,没有任何东西会把它标出来。
- 作者的工程结论很直接:让工具在返回值里带上计数,而不是让模型自己数,成本平坦且结果可靠。
💡 金句
给工具加一个返回计数的接口,比指望模型把三百个 id 数对要便宜得多。
👍 0
👎 0
← 返回 dev.to 首页