InfoBook.ro ← Harta anului
Modul 12 · Bibliotecile ML
Modul 12 · Conținut 3.3 · machine learning

Uneltele reale: Pandas, Matplotlib, Scikit-learn

Nu-ți scrii singur algoritmii ML — folosești biblioteci. Pandas ține și prelucrează datele, Matplotlib le desenează, iar Scikit-learn antrenează modelul în două linii: fit și predict.

🐼 PandasDataFrame, citire CSV, statistici descriptive.
📊 MatplotlibCele cinci grafice esențiale.
🔬 Scikit-learntrain_test_split, fit, predict.
1

Pandas — DataFrame & statistici

Un DataFrame e o tabelă în memorie (rânduri × coloane) — modelul mixt din clasa a X-a, cu superputeri. describe() îți dă instant statisticile unei coloane.

1import pandas as pd
2df = pd.read_csv("elevi.csv") # încarcă datele din CSV
3df.head() # primele rânduri
4df["nota"].mean() # media unei coloane
5df.describe() # toate statisticile deodată

df["nota"].describe() pe notele: 5, 6, 6, 7, 7, 8, 9, 9

Puntea cu ce știi: df["nota"].mean() e media de la clasa a IX-a; count, min, max le calculai cu bucle. Pandas le face pe toate într-o linie, pe mii de rânduri.
2

Matplotlib — cele cinci grafice

Alege graficul potrivit tipului de întrebare. Apasă și vezi aceleași date desenate în cinci feluri.

3

Scikit-learn — fit și predict

Toți algoritmii din Modulul 11 au aceeași interfață: creezi modelul, îl antrenezi cu fit, prezici cu predict. Exemplul programei: prezicem media finală din orele de studiu.

1from sklearn.model_selection import train_test_split
2from sklearn.linear_model import LinearRegression
3X_tr, X_te, y_tr, y_te = train_test_split(X, y, test_size=0.2)
4model = LinearRegression()
5model.fit(X_tr, y_tr) # antrenează pe 80%
6model.predict([[6]]) # prezice media pt 6 ore
7model.score(X_te, y_te) # cât de bun pe datele de test
model.predict — ore de studiu:
Toată materia se leagă aici: datele vin din baza de date / CSV (arcul 1), le pregătești cu Pandas (Modul 10), le desenezi cu Matplotlib, antrenezi cu Scikit-learn — aceeași fit/predict pentru regresie, KNN sau K-means.
4

Verificare rapidă

Șase întrebări despre biblioteci.

5

Fișa de sinteză

Bibliotecile, condensat.

Pandas: DataFrame (tabelă), read_csv, head(), mean(), describe().
Matplotlib: scatter (relații), line (evoluție), bar (comparații), hist (distribuție), box (rezumat + extreme).
Scikit-learn: creezi model → fit(antrenare) → predict(caz nou) → score(evaluare).
train_test_split împarte automat datele în antrenare și testare.
Aceeași interfață fit/predict pentru toți algoritmii.
Fluxul complet: CSV → Pandas → Matplotlib → Scikit-learn (Modulul 13).
← anteriorModul 11 · Cei trei algoritmi urmează →Modul 13 · Recapitulare & mini-proiect