AI风向

【AI风向】黑客伪装AI爬虫大规模扫站,专偷AI编程工具的密钥

过去一周,有人冒充ClaudeBot、GPTBot、Googlebot等AI爬虫身份,对数千个网站发起漏洞扫描,目标直指AI编程工具的凭据和配置文件。你服务器日志里的ClaudeBot,可能根本不是Anthropic。

发生了什么

网络安全数据公司Known Agents(knownagents.com)在它的Agentic Web Index里挂出一条醒目的活跃威胁告警:正在观察一场大规模行动,攻击者伪装成AI机器人身份扫描网站漏洞,目标锁定AI编程工具使用的凭据和配置路径。

这条告警背后是实打实的数据异常:过去一周,数千个互不相关的网站同时出现一种特定的伪装爬虫流量激增。这些请求的User-Agent声称自己是ClaudeBot、GPTBot、Googlebot、ChatGPT-User、PerplexityBot,但全都通不过这些官方爬虫的身份验证——要么IP对不上官方公布的ASN段,要么过不了Web Bot Auth签名校验。数据显示,被伪装最多的身份是Googlebot(0.5%),其次是ChatGPT-User、GPTBot、OAI-SearchBot、PerplexityBot等。

HN上这条消息拿到201分、128条评论,开发者们吵翻了天。有人觉得水是湿的,互联网上随时都有人扫漏洞,不值得大惊小怪。但反方抓住了要害:这次不是普通随机扫描,而是数千个无关网站、同一周、同一伪装模式的统计显著性激增,说明总规模远大于被观测到的样本。

为什么目标是AI编程工具的密钥

真正让人脊背发凉的是被扫描的路径。HN评论里多位站长确认,这批扫描请求里有相当一部分指向新兴AI编程工具的配置路径。

背后的逻辑链很现实:vibe coding(靠感觉用AI写代码)的流行,让大量开发者——尤其是一人公司和独立开发者——习惯性地把.env文件、API密钥、MCP配置、Claude Code和Cursor的配置文件直接commit进公开仓库,或暴露在没做访问控制的服务器上。攻击者赌的就是总有人会把密钥和配置泄露出来。

一位HN评论者一句话点破动机:黑掉别人的agent,比花自己的token划算得多。偷到一个Claude API密钥,等于免费蹭别人的算力跑agent任务;偷到一套MCP配置,等于摸清对方的工具链和凭据,可以横向渗透。

更值得警惕的是伪装手段本身。开发者普遍对AI爬虫有豁免心态:很多网站为了被Claude、ChatGPT引用,会在robots.txt里对ClaudeBot、GPTBot放行。攻击者正是利用这种信任,套上ClaudeBot的User-Agent,绕过那些默认放行AI爬虫的规则,混在正常AI流量里。换句话说,你出于SEO考虑主动给AI爬虫开的门,正在被攻击者当后门用。

三个必须纠正的认知

认知一:robots.txt不是安全边界。robots.txt只是给守规矩的爬虫看的礼仪文件,伪装者根本不会遵守。你不可能靠禁止ClaudeBot来挡住伪装成ClaudeBot的攻击者,真正的防御是验证身份,而不是相信User-Agent字符串。

认知二:User-Agent等于自报家门,不等于身份。任何请求都能随便写User-Agent。判断一个ClaudeBot是不是真的,要看它的来源IP是否落在Anthropic官方公布的IP段内,以及是否通过Web Bot Auth这类签名验证。IP验证是最简单可靠的一层,也是这条新闻里官方数据判断"伪装"的依据。

认知三:你的AI工具配置就是新的攻击面。2024年之前,攻击者扫的是WordPress后台、phpMyAdmin、.git目录;2026年,攻击面多了一大块——AI编程工具的密钥和配置。因为这里藏着最高价值的战利品:能直接调用大模型的付费密钥。一个被盗用的Claude或OpenAI密钥,几分钟内就能跑出成百上千美元的账单。

具体防御清单(立刻可做)

第一,审计你的仓库和服务器。用git log --all检查历史提交里有没有误提交的.env和配置文件,再用TruffleHog、gitleaks这类开源工具扫一遍全量历史。已经泄露的密钥必须立刻吊销重发,光删文件没用,因为攻击者可能早就拿到了。

第二,用IP而不是UA做判断。拿到请求IP后,用免费库(IPinfo Lite免费档、geoacumen-country开源版)反查ASN,属于VPS、数据中心、云厂商IP段的直接403或限流。伪装AI爬虫的攻击流量大多来自廉价VPS,屏蔽这些段能挡掉大部分噪音。

第三,对AI爬虫启用身份验证。Cloudflare的Bot Management、Web Bot Auth可以校验声称是ClaudeBot、GPTBot的请求是否真的来自官方,不要无条件放行AI爬虫。

第四,上蜜罐和黑名单。开源蜜罐(如knock-knock.net这类项目)能收集扫描节点的IP,产出blocklist直接喂给防火墙,比手工拉黑高效得多。

第五,检查你自己AI agent的配置暴露面。Claude Code的.claude目录、MCP server的启动参数、Cursor和Copilot的登录态,这些都不该出现在公开可访问的位置。

一个更深的信号

这件事表面是安全新闻,底层却是一个趋势的注脚:当AI agent大规模进入生产,围绕agent的凭据和配置会形成一个全新的黑产链条。攻方在伪装AI身份,守方必须学会验证AI身份。

还有一个容易被忽略的副产品:HN评论里有人提到,很多站长以为自己的网站流量爆了,其实是被Cloudflare Pages统计的机器人请求骗了——CF显示一天几千访问,Google Analytics一看真人只有三四个。当AI爬虫和伪装爬虫一起涌入,流量数据的失真会进一步加剧,做内容创业的人尤其要警惕,别把bot流量当成真实增长。

对AI创业者来说,这条新闻真正的提醒只有一句:从今天起,把你托管的每一个密钥、每一份agent配置,都当成"会被人主动来找"的东西来保护。攻击者已经在这么做了,你还没开始,就是白送。