AI · Data licensing
Contracte pentru antrenarea AI și licențierea datelor
Valoarea unui dataset depinde de dreptul real de a-l folosi. Contractul trebuie să distingă între proprietatea suportului, drepturile asupra conținutului, drepturile asupra bazei de date, datele personale și informațiile confidențiale.
Ce se licențiază în mod concret
Contractul identifică sursele, versiunea, câmpurile, metadatele, etichetele și documentația. Un link către un bucket care se schimbă continuu nu este un obiect suficient de precis fără reguli de versionare.
Se separă folosirea pentru antrenare, fine-tuning, testare, evaluare, RAG și îmbunătățirea ulterioară. Dreptul de a accesa datele nu implică automat dreptul de a reproduce, extrage și folosi conținutul în toate aceste scopuri.
Copyright, baze de date și text and data mining
Datasetul poate conține opere protejate și poate beneficia de protecția structurii sau de dreptul sui generis asupra bazei de date. Legea nr. 8/1996 și cadrul european trebuie analizate pentru fiecare sursă.
Directiva (UE) 2019/790 permite anumite reproduceri și extrageri pentru text and data mining din conținut accesat legal, dar pentru utilizările generale titularii își pot rezerva drepturile în mod adecvat, inclusiv prin mijloace care pot fi citite automat. Contractul nu trebuie să presupună că orice conținut public este liber pentru antrenare.
Date personale și secrete comerciale
Dacă datasetul conține date personale, părțile trebuie să stabilească rolurile, temeiul juridic, informarea, minimizarea, retenția, drepturile persoanelor și transferurile. Pseudonimizarea nu scoate automat datele din GDPR.
- Originea datelor și așteptările persoanelor vizate.
- Date sensibile, date despre minori și informații privind condamnări.
- Posibilitatea reidentificării și testele de extragere din model.
- Solicitări de acces, rectificare, ștergere și opoziție.
- Secrete comerciale ale furnizorului sau ale terților.
- Măsuri tehnice pentru acces, stocare și medii de antrenare.
Calitate, model, output și încetare
Contractul definește standardele de calitate, reprezentativitate, acuratețea etichetării și documentația limitărilor. O garanție absolută că datele nu conțin nicio eroare este rareori realistă; este mai util un mecanism de raportare și corecție.
Se stabilesc drepturile asupra modelului antrenat, checkpoint-urilor, embedding-urilor, evaluărilor și output-urilor. La încetare se clarifică ștergerea datasetului, păstrarea modelului și situația în care datele ori drepturile unui terț sunt retrase.
Cum decurge colaborarea
- 01Inventar și arhitectură
Clarificăm tehnologia, actorii, fluxurile de date, interfața și rezultatul comercial urmărit.
- 02Încadrare juridică
Stabilim rolurile, regimurile aplicabile, riscurile și informațiile care trebuie completate.
- 03Redactare sau audit
Pregătim contractul de licențiere și documentația datasetului și corelăm documentul cu produsul, procesele tehnice și dovezile disponibile.
- 04Implementare și revizuire
Livrăm forma finală, acțiunile prioritare și reperele care trebuie monitorizate când produsul sau legislația se schimbă.
Întrebări frecvente
Datele publice de pe internet pot fi folosite liber pentru AI?
Nu automat. Accesul public nu elimină drepturile de autor, drepturile asupra bazelor de date, rezervările TDM, GDPR-ul, contractele și secretele.
Pseudonimizarea elimină GDPR-ul?
Nu. Datele pseudonimizate rămân de regulă date personale dacă persoana poate fi reidentificată prin informații suplimentare rezonabil disponibile.
Licența asupra datelor oferă drepturi asupra modelului?
Numai dacă documentul stabilește acest lucru. Datasetul, procesul de antrenare, modelul și output-ul sunt active distincte și trebuie tratate separat.
Ai nevoie de un contract pentru date și antrenarea AI?
Trimite documentele pentru o evaluare juridică și o soluție adaptată obiectivului comercial.
