AAIP – Hoofdstuk 9
Reinforcement Learning – Beslissen in Tijd, Beloningen & Optimalisatie
9.1 Wat is Reinforcement Learning?
Reinforcement Learning (RL) is een vorm van machine learning waarbij een agent
leert door interactie met een omgeving.
De agent ontvangt beloningen voor goede acties en straffen voor slechte.
Reinforcement Learning = leren door trial‑and‑error + beloningen.
RL is de basis van:
- zelfrijdende auto’s,
- robotica,
- spel‑AI (schaken, Go, Atari, StarCraft),
- optimalisatie‑systemen,
- AI‑agenten.
9.2 De kerncomponenten van RL
9.2.1 Agent
De entiteit die beslissingen neemt.
9.2.2 Environment
De wereld waarin de agent zich bevindt.
9.2.3 State (S)
De huidige situatie van de omgeving.
9.2.4 Action (A)
Wat de agent kan doen.
9.2.5 Reward (R)
Feedback die de agent ontvangt.
9.2.6 Policy (π)
De strategie van de agent: welke actie kies je in welke toestand?
9.2.7 Value Function (V)
Hoe goed een toestand is op lange termijn.
9.2.8 Q‑Function (Q)
Hoe goed een actie is in een bepaalde toestand.
9.3 Markov Decision Processes (MDP’s)
Reinforcement Learning is gebaseerd op Markov Decision Processes.
Markov‑eigenschap: de toekomst hangt alleen af van de huidige toestand,
niet van het volledige verleden.
Een MDP bestaat uit:
- een toestandsruimte S,
- een actieruimte A,
- een beloningsfunctie R,
- een transitiefunctie T (wat gebeurt er na een actie?),
- een discount factor γ.
9.4 Belangrijke concepten in RL
9.4.1 Discount Factor (γ)
Bepaalt hoe belangrijk toekomstige beloningen zijn.
9.4.2 Exploration vs. Exploitation
De agent moet kiezen tussen:
- Exploration: nieuwe acties proberen
- Exploitation: bekende goede acties gebruiken
Slimme agents balanceren tussen ontdekken en benutten.
9.5 Q‑Learning
Q‑Learning is een van de meest invloedrijke RL‑algoritmen.
9.5.1 Q‑waarde
Q(s, a) = verwachte totale beloning van actie a in toestand s.
9.5.2 Update‑regel
Q(s, a) ← Q(s, a) + α [ R + γ max Q(s’, a’) – Q(s, a) ]
Waar:
- α = leersnelheid
- γ = discount factor
- R = beloning
- s’ = volgende toestand
9.6 Deep Reinforcement Learning
Wanneer Q‑tabellen te groot worden, gebruiken we neurale netwerken:
9.6.1 Deep Q‑Networks (DQN)
Door DeepMind ontwikkeld om Atari‑games te spelen.
9.6.2 Policy Gradient Methods
In plaats van Q‑waarden te leren, leert het model direct de policy.
9.6.3 Actor‑Critic Architecturen
Combineren value‑based en policy‑based methoden.
9.7 Toepassingen van Reinforcement Learning
- robotarmen die objecten oppakken,
- AI die Go‑kampioenen verslaat,
- energie‑optimalisatie in datacenters,
- zelfrijdende auto’s,
- trading‑algoritmen,
- AI‑agenten in games en simulaties.
Reinforcement Learning is de basis van autonome intelligentie.
9.8 Reflectie‑opdracht
Beantwoord de volgende vragen schriftelijk:
- Wat is het verschil tussen een policy en een value function?
- Waarom is exploration belangrijk?
- Leg in je eigen woorden uit wat een Markov Decision Process is.
- Noem een toepassing van RL die jij persoonlijk interessant vindt.