InfoBook.ro ← Harta anului
Modul 09 · Ce înseamnă „a învăța"
Modul 09 · Conținut 1.2 · machine learning

Când datele învață singure

Până acum TU scriai regulile (algoritmii). În machine learning, arăți calculatorului multe EXEMPLE, iar el descoperă singur regula. Nu-i programezi soluția — o antrenezi. Astăzi: vocabularul și cele două mari familii de învățare.

🎯 Obiectiv 1Cunoști vocabularul: date, atribute, etichetă, model, antrenare, predicție.
🎯 Obiectiv 2Distingi învățarea supervizată de cea nesupervizată.
🎯 Obiectiv 3Înțelegi de ce împărțim datele în antrenare și testare.
1

Vocabularul — cuvintele pe care le vei folosi tot semestrul

Exemplu fir-roșu: vrem să prezicem dacă un elev PROMOVEAZĂ, pornind de la date despre elevi.

termence eîn exemplul nostru
date (dataset)colecția de exempletabelul cu 500 de elevi
atribut (feature)o coloană de intrareore_studiu, absențe, media_anterioară
etichetă (label)ce vrem să prezicem (ieșirea)promovat: DA / NU
model„regula" învățată din datefuncția care, din atribute, dă eticheta
antrenare (training)procesul de învățare din exemplemodelul vede 400 de elevi cu rezultatul cunoscut
testareverificarea pe date nevăzuteîl încercăm pe alți 100 de elevi
predicțierăspunsul modelului pe un caz nou„acest elev va promova"
Ideea centrală: nu scrii TU regula „dacă ore > 5 și absențe < 10 atunci promovat". Îi dai exemple cu rezultatul cunoscut, iar modelul găsește singur combinația. Tu alegi atributele și verifici calitatea.
2

Supervizat vs nesupervizat — clasifică tu scenariile

Regula simplă: dacă exemplele de antrenare AU etichete (răspunsul corect) → supervizat. Dacă NU au → nesupervizat (cauți structură ascunsă). Încearcă:

Întrebarea-cheie: „am răspunsul corect la exemplele de antrenare?". DA → supervizat (regresie dacă prezici un NUMĂR, clasificare dacă prezici o CATEGORIE). NU → nesupervizat (clusterizare = grupare).
3

De ce împărțim datele: antrenare vs testare

Dacă testezi modelul pe aceleași date pe care l-ai antrenat, e ca și cum ai da elevului la test EXACT exercițiile rezolvate în clasă — nu afli dacă a înțeles cu adevărat.

antrenare:
Supraînvățare (overfitting): un model care „memorează" datele de antrenare (inclusiv zgomotul) merge perfect pe ele, dar cade pe date noi. De-asta măsori performanța pe setul de TESTARE — date pe care modelul nu le-a văzut niciodată. Un split tipic: 80% antrenare / 20% testare.
4

Calitatea datelor — „gunoi la intrare, gunoi la ieșire"

Un model e atât de bun cât îi sunt datele. Trei lucruri contează.

factorde ce contează
cantitateprea puține exemple → modelul nu prinde tiparul (ca un elev care a văzut 3 probleme).
corectitudinevalori greșite/lipsă → modelul învață greșit. Trebuie curățate (Modulul 10).
echilibrudacă 95% din exemple sunt „NU", modelul poate ghici mereu „NU" și pare bun — dar e inutil.
Reprezentativitatea: datele de antrenare trebuie să semene cu cele pe care le vei întâlni în realitate. Dacă antrenezi doar pe elevi de la profil real, modelul nu va merge bine pe cei de la uman.
5

Verificare rapidă

Șase întrebări despre vocabularul ML.

6

Fișa de sinteză

Introducerea în ML, condensat.

Atribut (feature) = intrare; etichetă (label) = ce prezici (ieșirea).
Model = regula învățată din exemple; antrenare = procesul de învățare.
Supervizat = exemple CU etichete (regresie/clasificare); nesupervizat = FĂRĂ (clusterizare).
Antrenare vs testare: testezi pe date NEVĂZUTE (tipic 80/20).
Overfitting = memorează antrenarea, cade la testare.
Calitatea datelor: cantitate, corectitudine, echilibru, reprezentativitate.
← anteriorModul 08 · Python + BD urmează →Modul 10 · Pregătirea datelor