În ML, 80% din muncă e pregătirea datelor, nu algoritmul. Numerele trebuie aduse pe aceeași scală, categoriile transformate în numere, iar valorile lipsă rezolvate — altfel modelul învață strâmb.
Mulți algoritmi (KNN, K-means) folosesc DISTANȚE. Dacă o coloană are valori mari (venit: mii) și alta mici (vârstă: zeci), venitul domină distanța și vârsta devine invizibilă.
Fiecare valoare devine „cât de sus e între minim și maxim". Formula e aceeași pe care ai folosit-o intuitiv la vectori în clasa a IX-a.
Modelele lucrează cu numere, nu cu „roșu"/„verde". One-hot transformă o coloană categorică în câte o coloană binară (0/1) pentru fiecare valoare posibilă.
Aproape orice set real are goluri. Trei strategii; alege și vezi ce se întâmplă cu coloana „nota".
Șase întrebări despre pregătirea datelor.
Pregătirea datelor, condensat.