CONTACT ONS

Cursusaanbod

PySpark & Machine Learning 

Module 1: Big Data en de basisprincipes van Spark

  • Overzicht van het big data-ecosysteem en de rol van Spark in hedendaagse dataprocessingsplatforms
  • Inzicht in de Spark-architectuur: driver, executors, clusterbeheerder, lazy evaluation, DAG en uitvoeringsplanning
  • Verschillen tussen RDD- en DataFrame-API’s en wanneer welke benadering het meest geschikt is
  • Het maken en configureren van een SparkSession, alsook de basisprincipes voor applicatieconfiguratie

Module 2: PySpark DataFrames

  • Het lezen en schrijven van data uit bedrijfsbronnen in diverse formaten zoals CSV, JSON, Parquet en Delta
  • Werken met PySpark DataFrames: transformaties, acties, kolomexpressies, filteren, koppelingen tussen tabellen en aggregaties
  • Het toepassen van geavanceerde technieken zoals windowfuncties, verwerking van datum- en tijdgegevens en omgaan met geneste data
  • Data-kwaliteitscontroles uitvoeren en het schrijven van herbruikbare, onderhoudbare PySpark-code

Module 3: Efficiënt verwerken van grote datasets

  • Basisprincipes voor prestatieoptimalisatie: strategieën rond partitioning, shuffle-gedrag, caching en persistentie
  • Optimisatietechnieken zoals broadcast joins en analyse van de uitvoeringsplannen
  • Best practices voor het efficiënt verwerken van grote hoeveelheden data in schaalbare workflows
  • Inzicht in schema-evolutie en hedendaagse opslagformaten binnen zakelijke omgevingen

Module 4: Feature Engineering op grote schaal

  • Feature engineering met Spark MLlib: omgaan met ontbrekende waarden, coderen van categorische variabelen en feature scaling
  • Het ontwerpen van herbruikbare voorbereidingsstappen en het structureren van datasets voor Machine Learning-pipelines
  • Introductie tot feature selectie en behandeling van onuitgebalanceerde datasets

Module 5: Machine Learning met Spark MLlib

  • Inzicht in de architectuur van MLlib en het onderscheid tussen Estimator- en Transformer-componenten
  • Het trainen van regressie- en classificatiemodellen op grote schaal, waaronder Lineaire Regressie, Logistische Regressie, Besluitbomen en Random Forest
  • Modelvergelijkingen maken en resultaten interpreteren binnen gedistribueerde Machine Learning-workflows

Module 6: End-to-end ML-pipelines

  • Het samenstellen van end-to-end Machine Learning-pipelines waarin preprocessing, feature engineering en modelleren gecombineerd worden
  • Strategieën voor het verdelen in trainings-, validatie- en testdatasets
  • Cross-validation uitvoeren en hyperparameter-tuning door middel van grid search en random search
  • Hoe reproduceerbare Machine Learning-experimenten op te zetten

Module 7: Modelevaluatie & praktische besluitvorming in Machine Learning

  • Toepassing van geschikte evaluatiemetingen voor regressie- en classificatieproblemen
  • Herkennen van overfitting en onderfitting en het nemen van praktische beslissingen bij modelselectie
  • Interpretatie van feature-importantiegegevens en inzicht in gedragingen van modellen

Module 8: Productieomgevingen & bedrijfsmatige praktijken

  • Modellen opslaan en herladen binnen Spark-omgevingen
  • Het implementeren van batch-inference-workflows voor grote datasets
  • Inzicht in de volledige levenscyclus van Machine Learning-modellen binnen bedrijven
  • Introductie tot versiebeheer, experimenttracking en basisstrategieën voor testen

 

Praktische uitkomsten

  • Deelnemers kunnen zelfstandig werken met PySpark
  • Zij kunnen grote datasets efficiënt verwerken
  • Ze beschikken over vaardigheden voor feature engineering op grote schaal
  • Zij zijn in staat om schaalbare Machine Learning-pipelines te ontwikkelen

Vereisten

Deelnemers dienen over de volgende voorkennis te beschikken:

Basiskennis van Python-programmeren, met name het werken met functies, datastructuren en bibliotheken
Fundamentele kennis van data-analyseconcepten zoals datasets, transformaties en aggregaties
Inzicht in SQL en relatiebeheerstechnieken
Eenvoudige kennis van Machine Learning-concepten zoals trainingssets, features en evaluatiemetingen
Kennis van commando-regelsomgevingen en basispraktijken voor softwareontwikkeling is aan te raden

Ervaring met bibliotheken als Pandas of NumPy is nuttig, maar niet verplicht.

 21 Uren

Aangepaste bedrijfsopleiding

Opleidingsoplossingen ontworpen exclusief voor bedrijven.

  • Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
  • Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
  • Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Investering

Prijs per privégroep, online live training, startend vanaf 4800 € + BTW*

Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen

Reviews (1)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën