你的工具 User-Agent 太笼统了:识别不了身份就别来抓我的站
来源:utcc.utoronto.ca — 2026-04-18
📋 概述
Chris Siebenmann 说明他正在实验性屏蔽 User-Agent 过于笼统或可疑的高频爬虫(其中相当一部分为 LLM 训练采集数据)。他强调所有 User-Agent 都该清楚表明自身身份,非浏览器的工具还要注明具体的使用者是谁,自称 bot 或 compatible 的工具必须附带一个可访问的、解释自己用途的 URL。
🔑 核心要点
- 2025 年初起出现大量高流量爬虫,目的常为采集数据喂给 LLM 训练——这意味着站主需要区分善意抓取与批量采集,才能决定是否放行
- 像 Go-http-client/1.1 这样笼统的值已不再被接受——这说明笼统的 UA 让站主无法判断对方是谁、来做什么,出于谨慎只能选择屏蔽
- 带 Mozilla/5.0 (compatible; ...) 标记的工具必须给出真实可访问的说明 URL——这样做的好处是站主可以一键查看用途并信任来源,而不是把每一个兼容标记都当作伪装者
- 自称 bot 的工具必须有能解释自身的可用链接,仅留邮箱地址是不够的——这说明邮箱无法证明意图也无法批量核查,一个可访问的说明页才是建立信任的基础
💡 金句
所有 HTTP User-Agent 都应当清楚标明自己是什么。
👍 0
👎 0
← 返回 Lobsters 首页