Estrazione di testo e di dati: il tranello dell’accesso lecito e della riserva dei diritti
Analisi automatizzata di testi o dati volta a individuare modelli, tendenze o correlazioni. L’eccezione dell’UE si applica soltanto se si dispone di un accesso lecito e il titolare dei diritti non ha esercitato una riserva dei diritti leggibile meccanicamente.
Ascolta questa pagina (beta)
L’estrazione di testo e di dati (text and data mining, TDM) consiste nell’utilizzare software per esaminare grandi quantità di testi o dati al fine di individuare modelli, tendenze o correlazioni. Nel diritto d’autore dell’UE, il TDM beneficia di un’eccezione specifica, che tuttavia non costituisce un’autorizzazione indiscriminata. La distinzione fondamentale è tra gli organismi di ricerca e tutti gli altri soggetti: per la ricerca non commerciale condotta da università o istituti di ricerca, l’eccezione è obbligatoria e non può essere esclusa contrattualmente. Per gli utenti commerciali o per altre finalità, l’eccezione si applica soltanto se si dispone di un accesso lecito al materiale e il titolare dei diritti non ha formulato una riserva dei diritti leggibile meccanicamente, ad esempio mediante un file robots.txt o metadati che impediscano l’estrazione.
Per evitare i tranelli, ricordate tre aspetti. In primo luogo, «accesso lecito» significa che occorre disporre di un abbonamento, di una licenza o di un diritto di accesso aperto al contenuto: non è possibile estrarre dati da copie pirata. In secondo luogo, la riserva dei diritti deve essere leggibile meccanicamente; una semplice clausola contenuta nelle condizioni di servizio non è sufficiente, a meno che non sia codificata in modo tale da poter essere rilevata dagli strumenti automatizzati. In terzo luogo, per gli organismi di ricerca la riserva dei diritti non è valida: se un editore tenta di impedire l’estrazione effettuata da un’università, l’eccezione prevale. Un rapido modo per verificarlo consiste nel chiedersi se l’utente abbia il diritto legale di visualizzare il contenuto e se il titolare dei diritti abbia predisposto una barriera tecnica, come un file robots.txt.
Per fissare bene questo concetto, immaginate un ricercatore che estrae dati da una banca dati di riviste scientifiche accessibile a pagamento. Se l'università dispone di un abbonamento, il ricercatore ha accesso legittimo e l'editore non può opporsi perché si tratta di ricerca non commerciale. Immaginate ora una startup che estrae dati dalla stessa banca dati per analizzare le tendenze di mercato: la startup deve avere accesso legittimo e verificare l'esistenza di un'esclusione espressa in formato leggibile meccanicamente. Se l'editore dispone di un file robots.txt che impedisce l'estrazione, la startup non può avvalersi dell'eccezione. Questo contrasto aiuta a memorizzare la regola.
Che cos'è l'estrazione di testo e di dati nell'ambito delle discussioni sul diritto d'autore?
L'analisi automatizzata di testi o dati per individuare modelli, tendenze o correlazioni.