大多数 Googlebot 都是假的
来源:digitalseams.com — 2026-07-26
📋 概述
很多人抱怨 Googlebot 的爬虫流量把网站搞垮了,但作者指出这些流量大多并非来自真正的 Google,而是其他人假冒 Googlebot 的 User-Agent 头进行恶意爬取。User-Agent 只是一行自愿申报的字符串,任何人都可以伪装。Google 提供了官方验证方法(反向 DNS 查询),但大多数开发者只看日志中的 User-Agent 就断定是 Google 干的。当你看到网站被"Googlebot"攻击时,极大概率是其他人的爬虫在冒名顶替。
🔑 核心要点
- 从 HTTP 请求的 User-Agent 头中看到的 "Googlebot" 不一定是真的,任何人都可以设置这个字符串。
- Google 官方推荐的验证方式是通过 反向 DNS 查询 确认请求 IP 确实来自 googlebot.com 域。
- 大量假冒 Googlebot 的流量来自 AI 训练爬虫 和竞争对手的数据抓取工具。
- 简单地屏蔽 User-Agent 中声称是 Googlebot 的请求会把 真正的 Googlebot 也误伤,导致网站从搜索结果中消失。
- 在互联网上,没有人知道你是条狗——这个经典原则在爬虫身份伪装上同样适用。
💡 金句
在互联网上,没有人知道你是条狗——反过来,我可以随时声称自己是一条狗(或一个 Googlebot)。
👍 0
👎 0
← 返回 Lobsters 首页