🌀 AIBB-Flywheel

新闻数据飞轮
← 返回文章列表
ithome 国际 采集 2026-09-01T04:09:41+00:00

Kernel.org维护者称约98%流量疑似来自爬虫

原始标题:日请求 600 万次,Kernel.org 维护者称约 98% 流量疑似来自爬虫

来源
ithome
发布时间
2026-09-01T03:39:54
采集批次
2026-09-01-04
字数
763
URL 指纹
3f2b059f07376e61

📌 AI 总结(272 字)

Linux内核代码托管站点git.kernel.org正遭受大规模自动化抓取压力,日均收到约600万次访问请求,维护方估算其中约98%疑似爬虫流量。站点全球部署5个分布式节点、90个CPU核心,其中14至16个核心持续用于将Git提交转换为HTML以供爬虫抓取,占总计算能力约20%。面对伪装成普通浏览器、利用住宅与移动代理分散请求的高级爬虫,Kernel.org部署了Anubis工作量证明系统,但仍约33%的请求能通过难度4计算抵达主站。维护者指出爬虫本可通过Git克隆在本地高效完成,却选择逐页请求HTML,给服务器带来巨大实时渲染负担。
📄 正文(763 字)
IT之家9月1日消息,科技媒体Linuxiac昨日(8月31日)发布博文,报道称Linux内核项目的代码托管站点git.kernel.org正承受大规模自动化抓取压力,站点每天约收到600万次随机提交页面访问请求。

在负载方面,Kernel.org在全球分布5个分布式节点,配置90个CPU核心,其中14至16个核心始终忙于将Git提交转换为HTML以供爬虫抓取,维护方据此估算,爬虫相关渲染约占总计算能力20%。

Linux主仓库linux.git目前约有148万次提交。git.kernel.org还托管约922个分叉仓库,尽管后端大量复用相同Git对象,但网页端仍可生成大量可访问链接。

除提交页面外,站点还提供补丁、纯文本版本及任意提交之间的差异对比。单个分叉仓库即可衍生海量URL,多个分叉叠加后形成数十亿级别的潜在抓取地址。

维护方指出,这些数据本可通过Git直接克隆并在本地处理。部分爬虫却按提交逐页请求并解析HTML,显著增加服务器的实时渲染负担。

项目早期通过识别User-Agent、封禁可疑IP和网络段来拦截爬虫。随后,自动化请求开始伪装成普通浏览器,并分散到住宅和移动代理网络。

维护者称,部分代理IP仅发送4至5次请求便不再出现。这种分布式方式使维护方难以依靠持续封禁IP来降低流量。

Kernel.org随后部署Anubis,要求访问者完成SHA-256相关的工作量证明。爬虫起初放弃访问,但数月后开始通过难度4和难度5的挑战;难度5会让移动设备花费数秒计算,并带来更高能耗。

Anubis可立即拦截约66%的相关请求,但约33%的请求仍能完成计算并抵达主站。在作出一系列宽松假设后,报告称合法请求仅约占git.kernel.org流量的2%,其余(约98%)都是爬虫抓取程序请求。