InfoBook.ro ← Harta anului
Modul 10 · Pregătirea datelor
Modul 10 · Conținut 1.2 · machine learning

Bucătăria din spate: curăță și pregătește

În ML, 80% din muncă e pregătirea datelor, nu algoritmul. Numerele trebuie aduse pe aceeași scală, categoriile transformate în numere, iar valorile lipsă rezolvate — altfel modelul învață strâmb.

🎯 Obiectiv 1Scalezi atributele numerice (normalizare min-max).
🎯 Obiectiv 2Codifici datele categorice în numere (one-hot).
🎯 Obiectiv 3Tratezi valorile lipsă prin imputare sau ștergere.
1

De ce contează scala

Mulți algoritmi (KNN, K-means) folosesc DISTANȚE. Dacă o coloană are valori mari (venit: mii) și alta mici (vârstă: zeci), venitul domină distanța și vârsta devine invizibilă.

Exemplu: între doi oameni, diferența de venit (5000 vs 5200 → 200) copleșește diferența de vârstă (20 vs 60 → 40), deși vârsta poate fi mai importantă. Soluția: aducem toate coloanele pe același interval, de obicei [0, 1].
2

Normalizarea min-max — totul în [0, 1]

Fiecare valoare devine „cât de sus e între minim și maxim". Formula e aceeași pe care ai folosit-o intuitiv la vectori în clasa a IX-a.

x_normalizat = (x − min) / (max − min)
Verificare: valoarea minimă devine mereu 0, iar cea maximă devine 1; restul cad proporțional între ele. (O rudă apropiată e standardizarea: (x − medie) / deviație, care centrează în jurul lui 0.)
3

Codificarea categoricelor — one-hot

Modelele lucrează cu numere, nu cu „roșu"/„verde". One-hot transformă o coloană categorică în câte o coloană binară (0/1) pentru fiecare valoare posibilă.

De ce NU „roșu=1, verde=2, albastru=3": asta ar sugera o ORDINE și că albastru (3) > roșu (1), ceea ce e fals. One-hot evită ordinea falsă. (Excepție: categorii care CHIAR au ordine — mic/mediu/mare — pot fi codificate 1/2/3.)
4

Valorile lipsă — NULL nu se dă modelului

Aproape orice set real are goluri. Trei strategii; alege și vezi ce se întâmplă cu coloana „nota".

alege o strategie pentru golul din coloana „nota" 👆
Când care: media — coloană numerică fără extreme; mediana — când sunt valori extreme (mai robustă); pentru categorice se folosește modul (valoarea cea mai frecventă); ștergerea — doar dacă ai destule date și golurile sunt puține.
5

Verificare rapidă

Șase întrebări despre pregătirea datelor.

6

Fișa de sinteză

Pregătirea datelor, condensat.

Scalarea aduce coloanele pe același interval — vitală pentru algoritmi cu distanțe (KNN, K-means).
Min-max: (x − min) / (max − min) → [0, 1]. Standardizarea: (x − medie) / deviație.
One-hot: o coloană binară pentru fiecare categorie — evită ordinea falsă.
Valori lipsă: imputare cu media/mediana (numeric), modul (categoric), sau ștergere.
Mediana e mai robustă la valori extreme decât media.
Regula: pregătirea proastă a datelor strică orice model — „gunoi la intrare, gunoi la ieșire".
← anteriorModul 09 · Ce înseamnă „a învăța" urmează →Modul 11 · Cei trei algoritmi