AI 智能体的隐藏成本:给生产 Laravel 应用建一套 token 预算框架
来源:dev.to — 2026-09-06
📋 概述
作者点出 AI 智能体不会像普通功能那样失败,而是乘法式失败:你的 Laravel 应用加了一个 agent,真实租户连上共享收件箱/工单线程/文档库后,agent 开始「调查」——调搜索、读记录、再调搜索、每轮重发同一份 40KB 会话、超时后重试。用户只看到一次点击,计费面板却看到一场针对钱包的分布式拒绝服务。一条 agent 端点的成本由一个循环决定:第 1 条 prompt 通常便宜,第 10 轮(历经六次工具调用与三篇检索文档)才是账单开始变得「有个人色彩」的地方。
🔑 核心要点
- 核心主张:生产级 AI 智能体需要的是 token 预算框架而非一个 max_tokens 参数——成本由「回合循环」决定,等于每轮的输入+输出+被塞回上下文的工具输出之和
- 把 token 当钱而不是调试日志:TokenBudget 对象要作为一等运行时值贯穿 agent 执行路径,预算超支抛 BudgetExceededException,就像请求配额与限流一样
- 危险场景都很日常而非猎奇:客服 agent 每次工具调用后重读整封长邮件线程、文档助手捞十块其实两块就够、数据库 agent 返回原始 JSON 而非摘要、被提示注入的页面让 agent 循环调用工具、队列任务因瞬时超时重试三遍
- 一个框架要回答五问:谁拥有预算(用户/租户/特性/agent/请求)、预算是多少(每轮/每会话/每天/每月)、何时检查、耗尽后怎么办(停/降级/摘要/请示)、怎么看烧钱速度(日志/指标/告警/后台)
- 落地清单从务实处入手:计量真实提供商用量而非估算、给 agent 循环设上限而非只限 completion、上下文组装预算感知、工具输出严格节流、按任务路由到最便宜能胜任的模型、为稳定上下文缓存但要小心 agent 状态、按租户限额、在财务发现前监控 burn rate
💡 金句
第一个 prompt 通常是便宜的;到第十轮——历经六次工具调用和三篇检索文档之后——账单才开始看起来像是冲着你个人来的。
👍 0
👎 0
← 返回 dev.to 首页