CONTACT ONS

Cursusaanbod

1. Inleiding tot Diep versterkt leren

  • Wat is versterkt leren?
  • Verschillen tussen supervisie-versterkt en onsuperviseerd leren
  • Toepassingen van DRL in 2025: robotica, gezondheidszorg, financiën en logistiek
  • Het begrijpen van de interactie tussen agent en omgeving

2. Grondslagen van versterkt leren

  • Markov-decisieprocessen (MDP)
  • Begrippen: toestand, actie, beloning, beleid en waarde-functies
  • Het evenwicht tussen verkenning en uitbuiting
  • Monte Carlo-methoden en Temporal-Difference (TD)-leren

3. Implementatie van basis-RL-algoritmen

  • Tabulaire methoden: dynamische programmering, beleidsbeoordeling en iteraties
  • Q-Learning en SARSA
  • Epsilon-greedy-strategieën en het geleidelijk verminderen van de verkenning
  • RL-omgevingen implementeren met OpenAI Gymnasium

4. Overgang naar Diep versterkt leren

  • Beperkingen van tabulaire methoden
  • Het gebruik van neurale netwerken voor functiebenadering
  • Architectuur en werkwijze van het Deep Q-Network (DQN)
  • ervaringsreplaymechanismen en doelnetwerken

5. Geavanceerde DRL-algoritmen

  • Double DQN, Dueling DQN en Prioritized Experience Replay
  • Policy Gradient-methoden: het REINFORCE-algoritme
  • Actor-Critic-architecturen zoals A2C en A3C
  • Proximal Policy Optimization (PPO)
  • Soft Actor-Critic (SAC)

6. Werken met continue actieruimtes

  • Uitdagingen bij continue besturing
  • Het gebruik van DDPG (Deep Deterministic Policy Gradient)
  • Twin Delayed DDPG (TD3)

7. Praktische hulpmiddelen en frameworks

  • Werken met Stable-Baselines3 en Ray RLlib
  • Loggen en monitoren via TensorBoard
  • Hyperparameter-tuning voor DRL-modellen

8. Beloningsengineering en ontwerp van omgevingen

  • Vormgeven van beloningen en balancering van straffen
  • Concepten rond sim-to-real transfer learning
  • Eigen omgevingen bouwen binnen Gymnasium

9. Partiële waarnembare omgevingen en generalisatie

  • Omgaan met onvolledige toestandinformatie (POMDPs)
  • Geheugen-gebaseerde benaderingen zoals LSTMs en RNN's
  • Verbeteren van robuustheid en generalisatie van agenten

10. Speltheorie en Multi-Agent Versterkt Leren

  • Inleiding tot omgevingen met meerdere agenten
  • Samenwerking versus concurrentie tussen agenten
  • Toepassingen in tegenstrijdige training en strategieoptimalisatie

11. Casestudy’s en praktische toepassingen

  • Simulaties van zelfrijdende voertuigen
  • Dynamisch prijsstellen en beleggingsstrategieën in de financiële sector
  • Robotica en industriële automatisering

12. Troubleshooting en optimalisatie

  • Oorzaken bepalen van onstabiele training
  • Omgaan met zeldzame beloningen en overfitting
  • DRL-modellen schalen op GPU’s en distributed systemen

13. Samenvatting en volgende stappen

  • Overzicht van DRL-architecturen en belangrijke algoritmen
  • Huidige trends en onderzoeksrichtingen: bijv. RLHF en hybride modellen
  • Aanvullende bronnen en literatuur voor verdere studie

Vereisten

  • Goede beheersing van Python-programmeren
  • Kennis van wiskunde: calculus en lineaire algebra
  • Basiskennis van kansrekening en statistiek
  • Ervaring met het bouwen van machine learning-modellen met Python, NumPy of TensorFlow/PyTorch

Doelgroep

  • Ontwikkelaars die zich interesseren voor kunstmatige intelligentie en intelligente systemen
  • Datawetenschappers die versterkt leren willen verkennen
  • Machine learning-engineers werkzaam met autonome systemen
 21 Uren

Aangepaste bedrijfsopleiding

Opleidingsoplossingen ontworpen exclusief voor bedrijven.

  • Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
  • Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
  • Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Investering

Prijs per privégroep, online live training, startend vanaf 4800 € + BTW*

Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen

Reviews (3)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën