
O motor de pesquisa do ChatGPT recorre a um índice próprio que apresenta conteúdos de websites sem qualquer contrato de licenciamento exatamente com o mesmo formato, extensão e atualização oferecidos aos parceiros oficiais. A conclusão resulta de uma análise realizada pela consultora de SEO Resoneo, que examinou 1.249 respostas geradas pelo assistente durante o mês de julho.
Os registos do fluxo de dados da OpenAI identificavam cada resultado com o nome da infraestrutura responsável pela recolha, sendo uma das opções a "labrador", a designação do índice interno da empresa. Ao comparar as páginas processadas por este sistema, os investigadores constataram que a existência de um acordo financeiro não alterou a forma como os artigos surgem aos utilizadores nas contas gratuitas.
O funcionamento do índice interno Labrador
O índice "labrador" alimenta-se através de feeds de imprensa e arquivos de ciência aberta, garantindo acesso direto por parte do sistema sem necessidade de pagar a serviços de terceiros. Nas contas gratuitas, questões com respostas consolidadas, negócios locais e produtos foram servidos quase na totalidade por este mecanismo próprio. Por outro lado, as notícias dividiram-se entre o índice interno e a recolha direta proveniente do motor de pesquisa da Google.
O comportamento altera-se nas contas pagas em modo de raciocínio. Num conjunto de 16.407 resultados registados, a recolha via Google respondeu por cerca de 75% das citações, enquanto o índice da casa representou aproximadamente 24%. Esta descoberta reforça a correção feita pelo especialista Suganthan Mohanadasan, que inicialmente julgava que a infraestrutura se limitava a uma lista restrita de grandes publicações parceiras. Contudo, por volta de 21 de julho, a tecnológica desativou as etiquetas que permitiam identificar a origem exata de cada ligação.
O formato dos excertos extraídos das páginas web
A investigação avaliou ainda 534 páginas citadas pelo assistente para perceber o que o modelo consegue extrair. Nas 463 páginas que apresentavam um cabeçalho H1, o excerto guardado pelo sistema incluiu esse elemento em 83,6% dos casos. O texto capturado sofre um corte logo após os 200 caracteres, sendo habitualmente retirado do início do conteúdo principal e não da descrição meta.
A estrutura das páginas influencia diretamente o espaço útil do excerto. O título H1 analisado tinha uma extensão média de 51 caracteres, restando cerca de 150 caracteres para o corpo do texto. Elementos acessórios colocados antes do cabeçalho principal, como marcadores de secção (presentes em 29% das páginas), datas de publicação (11%) ou texto alternativo de imagens (9%), consomem espaço valioso antes do parágrafo inicial. Quando uma página não tem marcação H1, o que ocorreu em uma em cada sete páginas analisadas, a plataforma recolhe o primeiro subtítulo disponível no código.












Nenhum comentário
Seja o primeiro!