周五部署事故:一部讲给新人的 CI/CD 第一课
来源:dev.to — 2026-08-03
📋 概述
这是一套 CI/CD 科普连载的开篇,用“资深工程师带新人”的对话形式,讲述一次真实的周五部署事故。开发者在 6:45 直接 SSH 进生产服务器改了“一行小修复”,结果引发支付故障和 52 分钟的排障。文章借此展开:手动部署为什么不规模化、PM2 进程管理、npm ci vs npm install、PagerDuty 值班、日志与关联 ID、以及 CI/CD 流水线的本质——把重复的检查清单自动化。
🔑 核心要点
- 排查比修复贵:修复只花 8 分钟,找到问题却花了 52 分钟——代码不是大头,调查才是
- 手动部署不规模化:失败模式不是缺技能而是重复劳动,检查清单自动化的目的就是摆脱记忆与注意力依赖
- 集成风险在 PR 之间:三份各自通过的 PR 合并当晚一起爆炸,因为从没有被放在一起测试过
- npm ci vs install:生产环境应使用 npm ci 安装 lockfile 精确版本,保证可复现
- 流水线绿 ≠ 生产健康:部署成功只代表流程没报错,与线上是否健康是两回事
💡 金句
The code is rarely the expensive part. The investigation is.
👍 0
👎 0
← 返回 Dev.to 首页