CONTACT ONS

Cursusaanbod

Databricks-platform en fundamenten van het Lakehouse-concept

  • Lakehouse-architectuur en componenten van Databricks
  • Organiseren van werkruimten en catalogi

Werkruimte en notebooks in Databricks

  • Navigatie in de werkruimte en ontwikkeling gebaseerd op notebooks
  • Structureren van code in herbruikbare notebooks

Apache Spark-architectuur en uitvoering

  • Spark-runtime-architectuur en uitvoeringsmodel
  • Lazy evaluation en de job-DAG

PySpark DataFrames en de DataFrame-API

  • DataFrame-abstraheringen en schema's
  • Kern DataFrame-operaties en kolomexpressies

Vertalen van SQL naar PySpark DataFrames

  • Vertalen van kern-SQL-clauses naar DataFrame-operaties
  • Windowfuncties en aggregaties in PySpark

Gegevens lezen en schrijven in Databricks

  • Lezen van veelvoorkomende bestand- en databronnen
  • Schrijven en partitioneren van gegevens in het Lakehouse

Delta Lake en tabbeheer

  • Delta-tabellen en ACID-transacties
  • Tijdreizen en schema-evolutie

Patronen voor het opschonen en transformeren van gegevens

  • Opschonen van gegevens en typeconversie
  • Bouwen van herbruikbare transformatielogica

Door de gebruiker gedefinieerde functies en modulaire code

  • Python-UDF's en pandas-UDF's
  • Procedurale logica modulariseren tot functies

Prestatieafstelling en optimalisatie

  • Strategieën voor partitioneren en cachen
  • Ongelukken identificeren met de Spark UI

Grondslagen van Structured Streaming

  • Batch- versus streamingverwerkingsmodellen
  • Streaming DataFrames en basisaggregaties

Databricks-jobs en workflow-orkestratie

  • Notebooks plannen als jobs en taken
  • Multistep-workflows bouwen met afhankelijkheden

Unity Catalog en gegevensbeheer

  • Unity Catalog-architectuur en naamruimten
  • Toegangsbeheer en datalijnage

Testen, foutopsporing en productiewerkwijzen

  • Unit-testing van PySpark-logica
  • Foutopsporing en standaarden voor codekwaliteit

End-to-end use cases in de financiële sector

  • Een end-to-end banking-ETL-pipeline bouwen
  • Migreren van legacy SQL-processen naar PySpark

SQL-werklasten migreren naar PySpark

  • Strategie en planningpatronen voor migratie
  • Incriminerende conversie van SQL-workflows naar PySpark

Vereisten

  • Ervaring met Python-programmeertaal, inclusief functies en datatypen
  • Kennis van SQL, inclusief joins, aggregaties en subqueries
  • Geen eerdere ervaring met Databricks of PySpark is vereist

Doelgroep

  • Data engineers, data analisten en data professionals
  • Teams die bestaande op SQL gebaseerde workflows migreren naar Databricks en PySpark
 35 Uren

Aangepaste bedrijfsopleiding

Opleidingsoplossingen ontworpen exclusief voor bedrijven.

  • Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
  • Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
  • Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Investering

Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*

Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen

Reviews (1)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën