Kernel.org维护者称git.kernel.org约98%流量来自自动化爬虫

在作出一系列宽松假设后,报告称合法请求仅约占 git.kernel.org 流量的 2%,其余(约 98%)都是爬虫抓取程序请求。

Linux 内核项目的代码托管站点 git.kernel.org 正承受大规模自动化抓取压力。据科技媒体 Linuxiac 8 月 31 日报道,该站点每天约收到 600 万次随机提交页面访问请求,维护方估算其中约 98% 的流量来自爬虫程序,合法请求仅占约 2%。

Kernel.org 在全球分布 5 个分布式节点,配置 90 个 CPU 核心。其中 14 至 16 个核心始终忙于将 Git 提交转换为 HTML 以供爬虫抓取,维护方据此估算,爬虫相关渲染约占总计算能力的 20%。Linux 主仓库 linux.git 目前约有 148 万次提交,git.kernel.org 还托管约 922 个分叉仓库。尽管后端大量复用相同 Git 对象,但网页端仍可生成大量可访问链接。除提交页面外,站点还提供补丁、纯文本版本及任意提交之间的差异对比。

单个分叉仓库即可衍生海量 URL,多个分叉叠加后形成数十亿级别的潜在抓取地址。维护方指出,这些数据本可通过 Git 直接克隆并在本地处理,但部分爬虫却按提交逐页请求并解析 HTML,显著增加服务器的实时渲染负担。这种抓取方式不仅消耗计算资源,还导致大量无效的页面渲染工作。

项目早期通过识别 User-Agent、封禁可疑 IP 和网络段来拦截爬虫。随后,自动化请求开始伪装成普通浏览器,并分散到住宅和移动代理网络。维护者称,部分代理 IP 仅发送 4 至 5 次请求便不再出现。这种分布式方式使维护方难以依靠持续封禁 IP 来降低流量。

为应对这一情况,Kernel.org 部署了 Anubis 工作量证明系统,要求访问者完成 SHA-256 相关的计算挑战。爬虫起初放弃访问,但数月后开始通过难度 4 和难度 5 的挑战。难度 5 会让移动设备花费数秒计算,并带来更高能耗。据维护方数据,Anubis 可立即拦截约 66% 的相关请求,但约 33% 的请求仍能完成计算并抵达主站。

这一事件反映了开源基础设施面临的普遍挑战。随着 AI 训练数据获取需求增长,代码托管平台成为自动化爬虫的重点目标。与普通网站流量不同,git.kernel.org 的访问者多为开发者,其数据获取需求完全可以通过 Git 协议实现批量克隆,逐页抓取 HTML 的行为缺乏合理用途,却造成显著的计算资源浪费。

对于依赖社区贡献和有限资源运行的开源项目而言,此类流量挤占计算能力可能影响正常用户的访问体验。Kernel.org 维护团队通过部署工作量证明机制和持续调整拦截策略,试图在保障合法访问与抵御自动化请求之间取得平衡。随着爬虫技术不断演进,此类对抗预计将持续,开源基础设施的防护成本也可能随之上升。

该文观点仅代表作者本人,企服科学平台仅提供信息存储空间服务。

(0)
科大讯飞开源星火X2.5端侧模型,支持百万Token上下文
上一篇 2小时前
2500小时人形机器人操作数据集免费开放,行业竞争焦点转向场景作业能力
下一篇 2小时前

相关推荐

发表回复

登录后才能评论
分享本页
返回顶部