Sentry 追踪暴露了一个静默重试:5 个 Agent 中一个耗时 22.6 秒
来源:dev.to — 2026-07-24
📋 概述
作者构建了一个 AWS 安全态势评估的多 Agent 流水线,发现 SecurityScanner 耗时 22.6 秒而其他 Agent 平均 5 秒。通过 Sentry 的 span 层级分析定位到根因:IAM 分析工具将 59 个角色序列化为 27KB 的 JSON 直接塞给 LLM,导致上下文窗口过载触发重试。修复后工具输出减少 42%,Agent 提速 21%。
🔑 核心要点
- 5 个 Agent 流水线:ResourceDiscovery → SecurityScanner → ComplianceChecker → RiskScorer → RemediationPlanner
- SecurityScanner 慢 4 倍的原因是 IAM 工具将 27KB JSON(59 个角色)直接作为工具输出传给 LLM
- LLM 上下文窗口过载触发 CrewAI 内部重试,导致二次推理开销
- Sentry 的 gen_ai.invoke_agent 和 gen_ai.execute_tool span 精确定位了瓶颈工具
- 修复方案:分页 + Token 预算守卫,IAM 工具输出减少 42%,API 调用减少 66%
- 修复后流水线总耗时从 62 秒降至 57.7 秒,安全发现数量保持 97 条不变
💡 金句
我的第一反应是责怪 Bedrock 延迟——每当系统变慢,你不总是先怀疑 LLM 吗?但 Sentry 的追踪瀑布流告诉我一个不同的故事。
👍 0
👎 0
← 返回 Dev.to 首页