AAIP – Hoofdstuk 9

Reinforcement Learning – Beslissen in Tijd, Beloningen & Optimalisatie

9.1 Wat is Reinforcement Learning?

Reinforcement Learning (RL) is een vorm van machine learning waarbij een agent leert door interactie met een omgeving. De agent ontvangt beloningen voor goede acties en straffen voor slechte.

Reinforcement Learning = leren door trial‑and‑error + beloningen.

RL is de basis van:

9.2 De kerncomponenten van RL

9.2.1 Agent

De entiteit die beslissingen neemt.

9.2.2 Environment

De wereld waarin de agent zich bevindt.

9.2.3 State (S)

De huidige situatie van de omgeving.

9.2.4 Action (A)

Wat de agent kan doen.

9.2.5 Reward (R)

Feedback die de agent ontvangt.

9.2.6 Policy (π)

De strategie van de agent: welke actie kies je in welke toestand?

9.2.7 Value Function (V)

Hoe goed een toestand is op lange termijn.

9.2.8 Q‑Function (Q)

Hoe goed een actie is in een bepaalde toestand.

9.3 Markov Decision Processes (MDP’s)

Reinforcement Learning is gebaseerd op Markov Decision Processes.

Markov‑eigenschap: de toekomst hangt alleen af van de huidige toestand, niet van het volledige verleden.

Een MDP bestaat uit:

9.4 Belangrijke concepten in RL

9.4.1 Discount Factor (γ)

Bepaalt hoe belangrijk toekomstige beloningen zijn.

9.4.2 Exploration vs. Exploitation

De agent moet kiezen tussen:

Slimme agents balanceren tussen ontdekken en benutten.

9.5 Q‑Learning

Q‑Learning is een van de meest invloedrijke RL‑algoritmen.

9.5.1 Q‑waarde

Q(s, a) = verwachte totale beloning van actie a in toestand s.

9.5.2 Update‑regel

Q(s, a) ← Q(s, a) + α [ R + γ max Q(s’, a’) – Q(s, a) ]

Waar:

9.6 Deep Reinforcement Learning

Wanneer Q‑tabellen te groot worden, gebruiken we neurale netwerken:

9.6.1 Deep Q‑Networks (DQN)

Door DeepMind ontwikkeld om Atari‑games te spelen.

9.6.2 Policy Gradient Methods

In plaats van Q‑waarden te leren, leert het model direct de policy.

9.6.3 Actor‑Critic Architecturen

Combineren value‑based en policy‑based methoden.

9.7 Toepassingen van Reinforcement Learning

Reinforcement Learning is de basis van autonome intelligentie.

9.8 Reflectie‑opdracht

Beantwoord de volgende vragen schriftelijk:

  1. Wat is het verschil tussen een policy en een value function?
  2. Waarom is exploration belangrijk?
  3. Leg in je eigen woorden uit wat een Markov Decision Process is.
  4. Noem een toepassing van RL die jij persoonlijk interessant vindt.
← Terug naar AAIP landingspagina Ga verder naar Hoofdstuk 10 →