AAIP – Hoofdstuk 14
Feature Engineering & Data‑voorbewerking
14.1 Waarom dit hoofdstuk essentieel is
Feature engineering en data‑voorbewerking bepalen 80% van het succes van een ML‑model.
Zelfs de beste algoritmen falen op slechte data.
Slechte data + goed model = slechte resultaten
Goede data + simpel model = verrassend goede resultaten
In dit hoofdstuk leer je:
- hoe je ruwe data omzet in bruikbare features,
- hoe je ontbrekende waarden verwerkt,
- hoe je categorische data encodeert,
- hoe je data schaalt en normaliseert,
- hoe je outliers detecteert,
- hoe je feature‑selectie uitvoert,
- hoe je feature‑creatie toepast.
14.2 Data Cleaning
Data cleaning is de eerste stap in elke ML‑pipeline.
14.2.1 Ontbrekende waarden
- verwijderen (als weinig samples ontbreken),
- imputeren met gemiddelde/median,
- categorische imputatie (modus),
- model‑gebaseerde imputatie (KNN, regressie),
- indicator‑features toevoegen (“was_missing”).
14.2.2 Outliers
Outliers kunnen modellen volledig verstoren.
- Z‑score methode,
- IQR‑methode,
- log‑transformaties,
- Winsorizing.
14.3 Encoding van categorische data
14.3.1 One‑Hot Encoding
Maakt voor elke categorie een aparte kolom.
14.3.2 Label Encoding
Zet categorieën om in getallen (alleen veilig bij ordinal data).
14.3.3 Target Encoding
Vervangt categorieën door gemiddelde targetwaarde.
Zeer krachtig, maar gevoelig voor overfitting.
14.3.4 Frequency Encoding
Encodeert categorieën op basis van hun frequentie.
14.4 Schalen & Normaliseren
14.4.1 Standardization (Z‑score)
Brengt data naar gemiddelde 0 en standaarddeviatie 1.
14.4.2 Min‑Max Scaling
Schaal naar bereik 0–1.
Belangrijk voor neurale netwerken.
14.4.3 Robust Scaling
Minder gevoelig voor outliers.
14.5 Feature‑creatie
Feature‑creatie is het proces waarbij je nieuwe features maakt uit bestaande data.
Voorbeelden
- datum → dag, maand, jaar, seizoen, weekend/weekday,
- tekst → lengte, aantal woorden, sentiment, TF‑IDF, embeddings,
- locatie → afstand tot centrum, regio, cluster,
- tijdreeksen → moving averages, trends, lags.
Goede features kunnen een simpel model beter maken dan een complex model.
14.6 Feature‑selectie
14.6.1 Filter‑methoden
- correlatieanalyse,
- chi‑kwadraat test,
- ANOVA.
14.6.2 Wrapper‑methoden
- Forward selection,
- Backward elimination,
- Recursive Feature Elimination (RFE).
14.6.3 Embedded‑methoden
- Lasso (L1),
- Random Forest feature importance,
- Gradient Boosting importance.
14.7 Dimensiereductie
Wanneer er te veel features zijn, wordt het model traag en onnauwkeurig.
Technieken
- PCA,
- t‑SNE,
- UMAP,
- Autoencoders.
14.8 Toepassingen in de praktijk
- fraudedetectie,
- marketing‑segmentatie,
- medische diagnose,
- industrie‑sensoranalyse,
- energie‑optimalisatie,
- tekstclassificatie,
- beeldherkenning.
14.9 Reflectie‑opdracht
Beantwoord de volgende vragen schriftelijk:
- Waarom is feature engineering zo belangrijk?
- Noem drie manieren om categorische data te encoderen.
- Wat is het verschil tussen normalisatie en standaardisatie?
- Noem een feature die jij zelf zou creëren voor een dataset.