Il web scraping è legale? Una guida pratica per le aziende
"È legale?" è la prima domanda che ogni cliente serio ci pone prima di iniziare un progetto di web scraping, e merita una risposta concreta piuttosto che un semplice sì o no, perché dipende davvero da cosa si sta estraendo e da come lo si fa.
I dati disponibili pubblicamente sono generalmente a minor rischio
L'estrazione di dati pubblicamente visibili senza necessità di autenticazione, come prezzi dei prodotti, recensioni pubbliche e offerte di lavoro, rappresenta la categoria a minor rischio e i tribunali di diverse giurisdizioni tendono a considerarla legittima, soprattutto quando non implica l'elusione dei controlli di accesso.
Ciò detto, "rischio ridotto" non significa "rischio nullo": i termini di servizio di un sito possono comunque creare problemi contrattuali anche per i dati pubblici, a prescindere dalla questione legale se l'accesso ai dati stessi fosse consentito.
Cosa aumenta effettivamente il rischio?
I veri segnali d'allarme sono: lo scraping dietro un login (bypassando l'autenticazione), l'ignorare una direttiva disallow esplicita nel file robots.txt, lo scraping di dati personali tutelati dalle normative sulla privacy (GDPR, CCPA) o lo scraping a un volume/velocità tale da configurarsi come un attacco denial-of-service al sito target.
La rivendita integrale di contenuti protetti da copyright altrui rappresenta un rischio aggiuntivo e distinto rispetto alla questione dello scraping in sé.
Come lo affrontiamo
Ogni incarico di web scraping che intraprendiamo inizia con una rapida analisi dei termini di servizio e del file robots.txt del sito target, con un'adeguata limitazione delle richieste per evitare di sovraccaricare i loro server e una chiara distinzione tra la raccolta di dati pubblici e la riproduzione di contenuti protetti da copyright.
Se il tuo caso d'uso riguarda dati personali o una fonte protetta da login, la situazione cambia considerevolmente e ti informeremo in anticipo se un progetto necessita di una revisione legale prima di essere realizzato.
Di solito, le informazioni pubbliche e fattuali non creano problemi. Il rischio inizia con contenuti personali, riservati o protetti da copyright.
Hai bisogno di aiuto?
Descrivici il tuo progetto e ti ricontatteremo per illustrarti i passi successivi.
Esplora Web scraping