git.kernel.org 的 AI 爬虫之灾:五分之一算力在给爬虫打工
来源: people.kernel.org — 2026-08-29
概述
内核维护者 Konstantin Ryabitsev 用硬数据展示 AI 爬虫对 git.kernel.org 的冲击:跨 5 个地理节点的 90 个 CPU 核心中,有 14-16 个核心(约 20% 容量)在持续渲染 git 提交页面供爬虫抓取。讽刺的是,这些数据本可「git clone」轻松获取,爬虫却选择了最愚蠢的方式逐提交渲染 HTML。面对封锁,机器人从伪装浏览器到分散到数百万住宅/移动 IP(很可能是通过电视等家电的「代理 SDK 变现」),甚至已能解出 Anubis 挖矿难度的挑战。目前每天约 600 万请求,真正合法流量估计仅占 2%。
核心要点
- 90 个核心中 14-16 个(约 20%)在持续为爬虫渲染提交页面
- 爬虫用最蠢方式逐提交渲染 HTML,而非高效地 git clone
- 机器人已从伪装浏览器进化到分散住宅 IP、破解 Anubis 难度 5
- 每天约 600 万请求,合法流量估计仅占 2%
- 无简单解法,正关闭功能以减少可爬取 URL
金句
爬虫像蝗虫群一样扑来,猛烈冲击直到系统崩溃,然后转向下一个目标,直到你恢复,然后它们又回来了。
👍 0
👎 0
返回 Lobsters 首页