dev.to | 📄 原文链接 | 2026-09-30 收录

让它数,还是自己算:工具返回行清单时,数得对的模型花掉了 token

来源:dev.to — 2026-09-28

📋 概述

这是 Kaggle 基准挑战赛的参赛作品,测的是每个智能体都在做、却几乎没人测的一步:数清楚工具返回了什么。智能体的搜索、数据库或 API 工具通常返回一批记录,当用户问「有多少条」时,计数由模型完成。这个基准用同一批 68 个计数问题、两种工具版本问了十个模型:count_ids 直接返回准确计数,list_ids 返回匹配的 id。给出计数时,除一个模型外所有模型对大约 330 个 id 的每个问题都答对,成本还基本持平;给出 id 清单时,模型分成两拨——每问花 2700 到 8200 个输出 token 的模型能把 21 组清单数对 15 到 21 组,而在 600 token 内作答的只对 0 到 10 组。

🔑 核心要点

💡 金句

给工具加一个返回计数的接口,比指望模型把三百个 id 数对要便宜得多。
← 返回 dev.to 首页