1. TugaTech » Internet e Redes » Noticias da Internet e Mercados
  Login     Registar    |                      

Siga-nos


robot perto de teclado

A Digital Content Next (DCN), uma entidade que representa editores digitais nos Estados Unidos, enviou uma notificação judicial à Common Crawl Foundation. O objetivo é travar de imediato a recolha de conteúdos para o treino de modelos de inteligência artificial e forçar a eliminação do material já armazenado, segundo avança o Search Engine Journal.

Direitos de autor não são um sistema de exclusão

Desde 2007 que a Common Crawl analisa milhares de milhões de páginas mensais para construir um arquivo público gratuito. Esta vasta base de dados tem sido uma peça fundamental para treinar muitos dos modelos de linguagem atuais. O próprio documento do GPT-3 da OpenAI indica que a versão filtrada deste arquivo representou cerca de 60% da mistura de treino do modelo.

A notificação enviada por Jason Kint, diretor executivo da DCN, exige que a organização deixe de extrair, reter ou partilhar conteúdos protegidos por direitos de autor, com acesso pago ou exclusivos para subscritores. Os editores defendem que a lei dos direitos de autor não funciona por exclusão voluntária. Ou seja, as empresas não deveriam ter de pedir para ser retiradas, mas sim dar autorização prévia para a inclusão do seu trabalho.

Atualmente, bloquear o bot da empresa, o CCBot, impede apenas as recolhas futuras. O processo não afeta a informação que já se encontra integrada no arquivo histórico e que qualquer pessoa pode continuar a descarregar.

Remoções complexas e a utilidade dos bloqueios

A eficácia do processo de remoção também levanta dúvidas entre os advogados da entidade. No passado, conteúdos de meios como o The New York Times e jornais dinamarqueses continuaram disponíveis mesmo após a Common Crawl ter concordado com a sua eliminação.

Rich Skrenta, diretor executivo da Common Crawl, recusa as acusações de que a organização recolha material pago de forma intencional ou que minta aos editores. O responsável justifica que o formato de ficheiro do arquivo não pode ser editado após a publicação sem quebrar a sua integridade técnica. Em alternativa, o método utilizado passa por remover e filtrar os endereços afetados em rastreios subsequentes, tornando-os inacessíveis através dos índices públicos.

A questão central reside na eficácia dos bloqueios efetuados pelas próprias plataformas noticiosas. Informações partilhadas pela Cloudflare indicam que o CCBot está entre os sistemas de pesquisa com o maior número de diretivas de bloqueio ativas nos principais domínios. Contudo, a DCN argumenta que o esforço não deve recair sobre os criadores e que a permanência dos arquivos passados continua a alimentar sistemas sem as devidas compensações.

Foto do Autor

Aficionado por tecnologia desde o tempo dos sistemas a preto e branco

Ver perfil do usuário Enviar uma mensagem privada Enviar um email Facebook do autor Twitter do autor Skype do autor

conectado
Encontrou algum erro neste artigo?

Não perca nenhuma novidade!

Junte-se a milhares de leitores e receba as últimas notícias de tecnologia, análises e dicas diretamente no seu email.

Nenhum comentário

Seja o primeiro!





Aplicações do TugaTechAplicações TugaTechDiscord do TugaTechDiscord do TugaTechRSS TugaTechRSS do TugaTechSpeedtest TugaTechSpeedtest TugatechHost TugaTechHost TugaTech