1. TugaTech » Internet e Redes » Noticias da Internet e Mercados
  Login     Registar    |                      

Siga-nos


ChatGPT com pesquisa

O motor de pesquisa do ChatGPT recorre a um índice próprio que apresenta conteúdos de websites sem qualquer contrato de licenciamento exatamente com o mesmo formato, extensão e atualização oferecidos aos parceiros oficiais. A conclusão resulta de uma análise realizada pela consultora de SEO Resoneo, que examinou 1.249 respostas geradas pelo assistente durante o mês de julho.

Os registos do fluxo de dados da OpenAI identificavam cada resultado com o nome da infraestrutura responsável pela recolha, sendo uma das opções a "labrador", a designação do índice interno da empresa. Ao comparar as páginas processadas por este sistema, os investigadores constataram que a existência de um acordo financeiro não alterou a forma como os artigos surgem aos utilizadores nas contas gratuitas.

O funcionamento do índice interno Labrador

O índice "labrador" alimenta-se através de feeds de imprensa e arquivos de ciência aberta, garantindo acesso direto por parte do sistema sem necessidade de pagar a serviços de terceiros. Nas contas gratuitas, questões com respostas consolidadas, negócios locais e produtos foram servidos quase na totalidade por este mecanismo próprio. Por outro lado, as notícias dividiram-se entre o índice interno e a recolha direta proveniente do motor de pesquisa da Google.

O comportamento altera-se nas contas pagas em modo de raciocínio. Num conjunto de 16.407 resultados registados, a recolha via Google respondeu por cerca de 75% das citações, enquanto o índice da casa representou aproximadamente 24%. Esta descoberta reforça a correção feita pelo especialista Suganthan Mohanadasan, que inicialmente julgava que a infraestrutura se limitava a uma lista restrita de grandes publicações parceiras. Contudo, por volta de 21 de julho, a tecnológica desativou as etiquetas que permitiam identificar a origem exata de cada ligação.

O formato dos excertos extraídos das páginas web

A investigação avaliou ainda 534 páginas citadas pelo assistente para perceber o que o modelo consegue extrair. Nas 463 páginas que apresentavam um cabeçalho H1, o excerto guardado pelo sistema incluiu esse elemento em 83,6% dos casos. O texto capturado sofre um corte logo após os 200 caracteres, sendo habitualmente retirado do início do conteúdo principal e não da descrição meta.

A estrutura das páginas influencia diretamente o espaço útil do excerto. O título H1 analisado tinha uma extensão média de 51 caracteres, restando cerca de 150 caracteres para o corpo do texto. Elementos acessórios colocados antes do cabeçalho principal, como marcadores de secção (presentes em 29% das páginas), datas de publicação (11%) ou texto alternativo de imagens (9%), consomem espaço valioso antes do parágrafo inicial. Quando uma página não tem marcação H1, o que ocorreu em uma em cada sete páginas analisadas, a plataforma recolhe o primeiro subtítulo disponível no código.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?

Não perca nenhuma novidade!

Junte-se a milhares de leitores e receba as últimas notícias de tecnologia, análises e dicas diretamente no seu email.

Nenhum comentário

Seja o primeiro!





Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech