Данни за обучение: закономерности, произтичащи от качеството, а не от количеството
Данните за обучение се използват за настройване на модела, така че той да научи закономерности; изпитната уловка е да се пренебрегне как пристрастията, пропуските или незаконно придобитите източници опорочават резултатите.
Слушай тази страница (бета)
Данните за обучение са наборът от примери, които подавате на модела, за да може той да научи закономерности — подобно на това да показвате на дете снимки на котки, за да го научите как изглежда една котка. Основното разграничение е, че повече данни невинаги означава по-добри резултати — ако данните ви са пристрастни (например съдържат само бели котки), моделът няма да се справя с черни котки. Качеството означава, че данните трябва да са представителни, точни и получени от законосъобразни източници, в противен случай моделът научава погрешните закономерности.
На изпита внимавайте за въпроси, които внушават, че даден модел работи добре, защото разполага с много данни — това е уловка. Вместо това проверете дали данните обхващат всички релевантни случаи (обхват), не съдържат систематични грешки (пристрастия) и са събрани с разрешение (законосъобразност). Бърза мисловна проверка: ако вие бяхте моделът, данните щяха ли да ви научат на правилното правило? Например модел за подбор на персонал, обучен само с автобиографии на мъже, ще се научи да предпочита мъже не защото е сексистки, а защото в данните липсват примери за жени.
За да запомните това, представете си везна: от едната страна е количеството на данните, а от другата — качеството им. На изпита везните винаги се накланят в полза на качеството. Бърза проверка: запитайте се „Има ли в тези данни пропуски или правни проблеми?“. Ако отговорът е „да“, резултатът от модела е ненадежден независимо с колко данни разполагате.
Какво представляват данните за обучение?
Данни, използвани за обучаване или настройване на модел, така че той да усвоява закономерности.