
Um problema crescente com crawlers de IA tem gerado preocupações sérias na comunidade de desenvolvimento do Linux, especialmente em relação ao impacto que esses bots têm nos servidores. Em síntese, o uso excessivo de ciclos de CPU para gerar commits que são utilizados exclusivamente por esses crawlers tem se tornado insustentável. "Estamos consumindo mais ciclos de CPU para renderizar commits para scrapers do que para qualquer outro tipo de acesso legítimo, incluindo clones do git."
O site git.kernel.org é especialmente interessante para os crawlers devido à sua abundância de dados acessíveis. O desenvolvimento do Linux ocorre de maneira aberta, permitindo que repositórios e arquivos de discussão sejam facilmente acessados. Para um modelo de linguagem, essa riqueza de dados é um verdadeiro tesouro, pois oferece conteúdo puro e não contaminado por outras fontes de IA.
Uma das soluções iniciais adotadas foi monitorar os logs para identificar IPs de bots e bloqueá-los. Contudo, os crawlers rapidamente mudaram suas táticas, disfarçando-se como navegadores comuns. Isso levou ao bloqueio de sub-redes inteiras, o que, embora justificável em alguns casos, também prejudicou usuários legítimos que tentavam acessar os dados.
Quando os crawlers começaram a utilizar milhões de IPs residenciais e móveis, a situação se agravou. Esses bots realizavam algumas requisições e desapareciam dos logs, dificultando a identificação e o bloqueio. "Eles atacam como enxames de gafanhotos, derrubando o sistema antes de seguir para o próximo alvo."
Para combater essa infestação, inicialmente foi implementado um sistema que obrigava os bots a resolverem um problema matemático, conhecido como desafio Anubis. Isso se mostrou eficaz por um tempo, mas os bots logo se adaptaram e começaram a resolver os desafios de dificuldade crescente.
Atualmente, cerca de 6 milhões de requisições diárias são feitas ao site git.kernel.org, e surpreendentemente, 33% delas estão passando pelo desafio Anubis. Com base em suposições generosas, apenas 2% do tráfego é considerado legítimo, enquanto o restante fica a cargo dos crawlers.
Apesar do cenário alarmante, a infraestrutura ainda consegue manter um desempenho aceitável, mas a quantidade de ciclos de CPU sendo ocupados por esses bots é alarmante. Em média, 20% da capacidade total está sendo utilizada exclusivamente para atender a esses crawlers, o que é insustentável a longo prazo.
A solução para esse problema não é simples. Há uma expectativa de que a demanda por dados diminua à medida que a bolha de IA estoura, mas isso é incerto. Enquanto isso, algumas funcionalidades podem ser desativadas para reduzir a quantidade de URLs acessíveis. Embora a equipe do projeto não queira limitar o acesso, a situação atual exige ações difíceis. A promessa de continuar disponibilizando os dados para download permanece, mas os usuários podem precisar enfrentar mais obstáculos para obtê-los.
Confira os últimos vídeos publicados no canal