CONTACT ONS

Cursusaanbod

Inleiding, doelstellingen en migratiestrategie

  • Doelstellingen van de cursus, profielmatching van deelnemers en succescriteria
  • Hoog-niveau migratiebenaderingen en risicoverwagingen
  • Instellen van workspaces, repositories en lab-datasets

Dag 1 — Grondslagen van migratie en architectuur

  • Lakehouse-concepten, overzicht van Delta Lake en Databricks-architectuur
  • Verschillen tussen SMP en MPP en de implicaties voor migratie
  • Ontwerp van Medallion (Bronze→Silver→Gold) en overzicht van Unity Catalog

Dag 1 Lab — Vertalen van een opbergprocedure

  • Hands-on migratie van een voorbeeldopbergprocedure naar een notebook
  • Koppelen van tijdelijke tabellen en cursors naar DataFrame-transformaties
  • Validatie en vergelijking met de oorspronkelijke output

Dag 2 — Geavanceerde Delta Lake & incrementele inlaad

  • ACID-transacties, commit logs, versiebeheer en time travel
  • Auto Loader, MERGE INTO patronen, upserts en schema-evolutie
  • OPTIMIZE, VACUUM, Z-ORDER, partitie-indeling en opslag-tuning

Dag 2 Lab — Incrementele inlaad & optimalisatie

  • Implementeren van Auto Loader-inlaad en MERGE-workflows
  • Toepassen van OPTIMIZE, Z-ORDER en VACUUM; valideren van resultaten
  • Meten van prestatieverbeteringen bij lezen/schrijven

Dag 3 — SQL in Databricks, prestaties & foutopsporing

  • Analytische SQL-functies: vensterfuncties, hogere-ordefuncties, JSON/array-behandeling
  • Lezen van de Spark UI, DAGs, shuffles, stages, taken en diagnose van knelpunten
  • Query-tuningpatronen: broadcast joins, hints, caching en reductie van spill

Dag 3 Lab — SQL-refactoriseren & prestatietuning

  • Een zwaar SQL-proces refactoriseren naar geoptimaliseerde Spark SQL
  • Gebruik maken van Spark UI-sporen om skewedness- en shuffleproblemen te identificeren en op te lossen
  • Benchmarken vóór/ná en documenteren van tuningsstappen

Dag 4 — Tactische PySpark: Vervangen van procedurele logica

  • Uitvoeringsmodel van Spark: driver, executors, luie evaluatie en partitie-strategieën
  • Omzetten van lusjes en cursors naar gevectoriseerde DataFrame-operaties
  • Modularisatie, UDF's/pandas UDF's, widgets en herbruikbare bibliotheken

Dag 4 Lab — Refactoriseren van procedurele scripts

  • Een procedureel ETL-script refactoriseren naar modulaire PySpark-notebooks
  • Introduceren van parameterisatie, unit-achtige tests en herbruikbare functies
  • Code review en toepassing van een checklist voor beste praktijken

Dag 5 — Orchestratie, end-to-end pipeline & beste praktijken

  • Databricks Workflows: jobontwerp, taakafhankelijkheden, triggers en foutafhandeling
  • Ontwerpen van incrementele Medallion-pipelines met kwaliteitsregels en schema-validatie
  • Integratie met Git (GitHub/Azure DevOps), CI en teststrategieën voor PySpark-logica

Dag 5 Lab — Bouwen van een complete end-to-end pipeline

  • Samenstellen van een Bronze→Silver→Gold-pipeline georkestreerd met Workflows
  • Implementeren van logboekvoering, audit, herhalingen en geautomatiseerde validaties
  • Draaien van de volledige pipeline, valideren van outputs en voorbereiden van implementatie-opmerkingen

Operationalisering, governance en productieklaarheid

  • Unity Catalog-governance, afleiding en toegangscontrole beste praktijken
  • Kosten, clustergrootte, autoscaling en job-concurrentiepatronen
  • Implementatie-checklists, terugrolstrategieën en maken van een runbook

Eindcontrole, kennisoverdracht en volgende stappen

  • Presentaties van deelnemers over migratiework en geleerde lessen
  • Gapanalyse, aanbevolen vervolgactiviteiten en overdracht van trainingsmateriaal
  • Referenties, verdere leertrajecten en ondersteuningsopties

Vereisten

  • Verstandhouding van data engineering-concepten
  • Ervaring met SQL en opbergprocedures (Synapse / SQL Server)
  • Bekendheid met ETL-orchestratieconcepten (ADF of vergelijkbaar)

Publiek

  • Technologie managers met een achtergrond in data engineering
  • Data engineers die procedurele OLAP-logica naar Lakehouse-patronen willen overzetten
  • Platform engineers die verantwoordelijk zijn voor de adoptie van Databricks
 35 Uren

Aangepaste bedrijfsopleiding

Opleidingsoplossingen ontworpen exclusief voor bedrijven.

  • Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
  • Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
  • Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Investering

Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*

Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen

Voorlopige Aankomende Cursussen

Gerelateerde categorieën