Blog / Extração de dados da web

A extração de dados da web é legal? Um guia prático para empresas

"Isso é legal?" é a primeira pergunta que todo cliente sério faz antes de iniciarmos um projeto de web scraping, e merece uma resposta concreta em vez de um simples sim ou não, porque realmente depende do que você está a recolher e como.

Dados disponíveis publicamente geralmente apresentam menor risco

A recolha de dados publicamente visíveis sem necessidade de login — como preços de produtos, avaliações públicas e anúncios de emprego — é a categoria de menor risco, e tribunais em diversas jurisdições têm considerado essa prática permissível, principalmente quando não envolve burlar os controlos de acesso.

Dito isso, "menor risco" não significa "sem risco" -- os próprios termos de serviço de um site ainda podem criar problemas contratuais, mesmo para dados públicos, independentemente da questão legal de se o acesso aos dados em si era permitido.

O que realmente aumenta o risco?

Os verdadeiros sinais de alerta são: extrair dados por trás de um login (ignorando a autenticação), ignorar uma diretiva de proibição explícita no robots.txt, extrair dados pessoais protegidos por regulamentações de privacidade (GDPR, CCPA) ou extrair dados em um volume/velocidade que funciona como um ataque de negação de serviço ao site alvo.

Revender conteúdo protegido por direitos de autor de terceiros por grosso é um risco adicional e distinto, que se soma à própria questão da extração de dados.

Como abordamos isso

Cada projeto de web scraping que realizamos começa com uma rápida análise dos termos e do ficheiro robots.txt do site alvo, uma limitação de taxa razoável para não sobrecarregar seus servidores e uma clara separação entre recolher dados factuais públicos e reproduzir conteúdo protegido por direitos de autor.

Se o seu caso de uso envolver dados pessoais ou uma fonte protegida por login, a conversa muda consideravelmente, e informaremos antecipadamente se um projeto precisa de uma análise jurídica antes de o desenvolvermos.

Informações públicas e factuais geralmente não apresentam problemas. O verdadeiro risco reside em informações pessoais, protegidas por login ou direitos de autor.

Precisa de ajuda com isso?

Conte-nos sobre o seu projeto e entraremos em contacto com você para os próximos passos.

Explorar Extração de dados da web