AAIP – Hoofdstuk 14

Feature Engineering & Data‑voorbewerking

14.1 Waarom dit hoofdstuk essentieel is

Feature engineering en data‑voorbewerking bepalen 80% van het succes van een ML‑model. Zelfs de beste algoritmen falen op slechte data.

Slechte data + goed model = slechte resultaten Goede data + simpel model = verrassend goede resultaten

In dit hoofdstuk leer je:

14.2 Data Cleaning

Data cleaning is de eerste stap in elke ML‑pipeline.

14.2.1 Ontbrekende waarden

14.2.2 Outliers

Outliers kunnen modellen volledig verstoren.

14.3 Encoding van categorische data

14.3.1 One‑Hot Encoding

Maakt voor elke categorie een aparte kolom.

14.3.2 Label Encoding

Zet categorieën om in getallen (alleen veilig bij ordinal data).

14.3.3 Target Encoding

Vervangt categorieën door gemiddelde targetwaarde. Zeer krachtig, maar gevoelig voor overfitting.

14.3.4 Frequency Encoding

Encodeert categorieën op basis van hun frequentie.

14.4 Schalen & Normaliseren

14.4.1 Standardization (Z‑score)

Brengt data naar gemiddelde 0 en standaarddeviatie 1.

14.4.2 Min‑Max Scaling

Schaal naar bereik 0–1. Belangrijk voor neurale netwerken.

14.4.3 Robust Scaling

Minder gevoelig voor outliers.

14.5 Feature‑creatie

Feature‑creatie is het proces waarbij je nieuwe features maakt uit bestaande data.

Voorbeelden

Goede features kunnen een simpel model beter maken dan een complex model.

14.6 Feature‑selectie

14.6.1 Filter‑methoden

14.6.2 Wrapper‑methoden

14.6.3 Embedded‑methoden

14.7 Dimensiereductie

Wanneer er te veel features zijn, wordt het model traag en onnauwkeurig.

Technieken

14.8 Toepassingen in de praktijk

14.9 Reflectie‑opdracht

Beantwoord de volgende vragen schriftelijk:

  1. Waarom is feature engineering zo belangrijk?
  2. Noem drie manieren om categorische data te encoderen.
  3. Wat is het verschil tussen normalisatie en standaardisatie?
  4. Noem een feature die jij zelf zou creëren voor een dataset.
← Terug naar AAIP landingspagina Ga verder naar Hoofdstuk 15 →