Um inusitado problema digital foi reportado por John, administrador de um vasto 'content farm' localizado em https://www.web.sp.am/. Segundo ele, um bot denominado GPTBot tem extraído dados de forma excessiva do site, chegando a coletar mais de 3 milhões de páginas em apenas um dia. John aponta que, desse total, 1,8 milhão de acessos foram tentativas de leitura do arquivo robots.txt, que orienta os mecanismos de busca sobre como interagir com o site.
Curiosamente, o content farm de John não é um site convencional, mas sim uma coleção de quase 7 bilhões de sites individuais, cada um contendo uma única página. Ele destaca que, apesar da quantidade massiva de dados extraídos pelo GPTBot, os sites são quase idênticos e operam sob o mesmo certificado SSL, o que, em teoria, facilitaria o reconhecimento de padrões e prevenção de acessos indesejados por bots.
Este não é o primeiro incidente do tipo relatado por John, que menciona um episódio anterior com um spider da Amazon que também ficou preso em seu web farm. A situação foi resolvida após John conseguir contato com um responsável da empresa. Agora, ele busca alguém com conexões na OpenAI, a organização por trás do GPTBot, para tentar solucionar o atual transtorno.
Em tom de brincadeira, mas talvez com um fundo de verdade, John sugere que, se alguém estiver curioso sobre o que está alimentando o treinamento do próximo GPT-5, poderia encontrar algumas pistas no comportamento faminto do GPTBot em seu site. "Se você estava se perguntando com o que eles estão treinando o GPT-5, bem, agora você sabe", conclui ele, suscitando debates sobre as fontes de dados utilizadas para treinar modelos de inteligência artificial.
Confira os últimos vídeos publicados no canal