0 元预算造 3 个 AI agent:关于工具调用、RAG 与代码执行的领悟
来源:dev.to — 2026-09-07
📋 概述
计算机科学毕业生为申请数据科学/AI 硕士,想证明自己理解现代 AI 系统底层运作而非只会调 API。于是他造了三个小 agent,每个演示 LLM 与外界交互的一种核心模式:web 搜索、对自己的数据做检索、实时代码执行,全部跑在 Google Gemini 免费层,总成本 0 美元。最大体会是:真正的工程努力大部分不在「AI」部分,而在那些无聊的管道上——优雅处理免费层限流、合理切分文档、决定什么不进版本控制;「让 LLM 调用工具」的逻辑常常最简单,让它稳定又便宜才最花时间。
🔑 核心要点
- Agent 1 研究助手(工具调用):给模型一个工具、让它自己决定何时用——只在判断需要当前或特定信息时才调 web_search,否则直接用自己的知识答;「教模型何时不调工具」与集成本身同样重要,盲目总是搜索既费调用还会把答案带偏
- Agent 2 RAG Q&A:摄取自有文档、切重叠 chunk、用 Gemini embedding 向量化、ChromaDB 本地存储;提问同样嵌入后取语义最近 chunk 作为上下文,且被要求只用该上下文作答并注明来源文件——这个接地把幻觉压下去,答案不在其中时模型会诚实说明
- Agent 3 数据分析(代码执行):不信任模型自己的算术(LLM 对精确计算出了名地不可靠),让它把英文问题翻译成真实 pandas 代码、对 CSV 执行、报告实际计算出的可核验结果而非黑箱猜测
- 三个 agent 共享同一下层模式:模型决定何时调工具、使用它、再对结果推理;作者最惊讶的是真功夫都在无聊管道而非「AI」
- 免费层对学生项目确实可用:三个仓库全部公开,无需花一分钱就能学到 agentic 系统如何真正运作
💡 金句
The actual "make an LLM call a tool" logic was often the easiest part; making it work reliably and cheaply was where the real learning happened.
👍 0
👎 0
← 返回 dev.to 首页