我的定时任务每 5 分钟报告一次"成功",持续三周,而里面的进程从头到尾都在崩溃
来源:dev.to — 2026-08-23
📋 概述
作者经营一家一人 AI 公司,用 Claude Code 写代码、在 Windows 任务计划程序上让多个交易机器人无人值守地每 5 分钟轮询一次券商 API。他发现监控本身的两种失败:第一种是断路器真实触发、仓位真的平了,但收盘操作没写进交易历史文件,导致每日报告把"早已关闭"的仓位误读为可能崩溃。第二种更严重:一个机器人的定时任务连续三周每次都报告退出码 0,计划程序日志一片绿,实际内部 Python 进程几乎每个周期都在因券商 API 的认证错误崩溃,累计堆出 18000 多条 traceback,三周内零笔真实交易——包装进程确实没崩溃,所以监控从没变红。作者由此意识到,"进程退出码 0"和"agent 完成了它的工作"是两个不同的论断。
🔑 核心要点
- 包装进程从未崩溃且一直在 ping,所以传统死锁开关("每 N 分钟 ping 一次否则告警")也会整三周显示绿色。
- 断路器真实触发、仓位确实平了,但收盘没写进历史文件,导致报告把早已关闭的仓位误读为崩溃。
- 一个进程每 5 分钟跑一次、连续三周报告退出码 0,内部却堆了 18000 多条 traceback、零笔真实交易。
- 存活监控回答"它活着吗",却没人问更有用的问题"它还在做它该做的事吗",对无人值守的 agent 尤其关键。
💡 金句
一个你在场时称职的 agent,和一个你一旦移开目光失败就会被你发现的 agent,并不是同一个属性。
👍 0
👎 0
← 返回 dev.to 首页