Cap. 14 Fundamentele IA, IA generativă și competențele de elaborare a prompturilor Terminologie 238 cuvinte

Date de antrenare: modele recurente bazate pe calitate, nu pe cantitate

Datele de antrenare ajustează un model pentru ca acesta să învețe modele recurente; capcana de examen constă în ignorarea modului în care părtinirea, lacunele sau sursele ilegale denaturează rezultatele.

Audio

Ascultați această pagină (beta)

Subtitrări

Datele de antrenare reprezintă setul de exemple pe care îl furnizați unui model pentru ca acesta să poată învăța modele recurente, la fel cum îi arătați unui copil imagini cu pisici pentru a-l învăța cum arată o pisică. Diferența esențială este că un volum mai mare de date nu este întotdeauna mai bun — dacă datele dumneavoastră sunt părtinitoare (de exemplu, includ numai pisici albe), modelul nu va funcționa corect în cazul pisicilor negre. Calitatea înseamnă că datele trebuie să fie reprezentative, exacte și obținute în mod legal, în caz contrar modelul învățând modele recurente greșite.

La examen, fiți atenți la întrebările care sugerează că un model funcționează bine deoarece dispune de multe date — aceasta este o capcană. Verificați, în schimb, dacă datele acoperă toate cazurile relevante (acoperire), nu conțin erori sistematice (părtinire) și au fost colectate cu permisiune (legalitate). Un test mental rapid: dacă dumneavoastră ați fi modelul, v-ar învăța datele regula corectă? De exemplu, un model de recrutare antrenat numai pe CV-uri ale bărbaților va învăța să prefere bărbații, nu pentru că este sexist, ci pentru că datele nu includ exemple de femei.

Pentru a reține acest lucru, imaginați-vă o balanță: pe un taler se află cantitatea datelor, iar pe celălalt calitatea datelor. La examen, balanța se înclină întotdeauna în favoarea calității. O verificare rapidă: întrebați-vă „Aceste date prezintă lacune sau probleme juridice?” Dacă da, rezultatul modelului nu este fiabil, indiferent de volumul datelor de care dispuneți.

Fișă de studiu asociată

Ce sunt datele de antrenare?

Date utilizate pentru antrenarea sau ajustarea unui model, astfel încât acesta să învețe tipare.

Înapoi la fișa de studiu Vedeți toate fișele de învățare