Cursusaanbod
Databricks-platform en fundamenten van het Lakehouse-concept
- Lakehouse-architectuur en componenten van Databricks
- Organiseren van werkruimten en catalogi
Werkruimte en notebooks in Databricks
- Navigatie in de werkruimte en ontwikkeling gebaseerd op notebooks
- Structureren van code in herbruikbare notebooks
Apache Spark-architectuur en uitvoering
- Spark-runtime-architectuur en uitvoeringsmodel
- Lazy evaluation en de job-DAG
PySpark DataFrames en de DataFrame-API
- DataFrame-abstraheringen en schema's
- Kern DataFrame-operaties en kolomexpressies
Vertalen van SQL naar PySpark DataFrames
- Vertalen van kern-SQL-clauses naar DataFrame-operaties
- Windowfuncties en aggregaties in PySpark
Gegevens lezen en schrijven in Databricks
- Lezen van veelvoorkomende bestand- en databronnen
- Schrijven en partitioneren van gegevens in het Lakehouse
Delta Lake en tabbeheer
- Delta-tabellen en ACID-transacties
- Tijdreizen en schema-evolutie
Patronen voor het opschonen en transformeren van gegevens
- Opschonen van gegevens en typeconversie
- Bouwen van herbruikbare transformatielogica
Door de gebruiker gedefinieerde functies en modulaire code
- Python-UDF's en pandas-UDF's
- Procedurale logica modulariseren tot functies
Prestatieafstelling en optimalisatie
- Strategieën voor partitioneren en cachen
- Ongelukken identificeren met de Spark UI
Grondslagen van Structured Streaming
- Batch- versus streamingverwerkingsmodellen
- Streaming DataFrames en basisaggregaties
Databricks-jobs en workflow-orkestratie
- Notebooks plannen als jobs en taken
- Multistep-workflows bouwen met afhankelijkheden
Unity Catalog en gegevensbeheer
- Unity Catalog-architectuur en naamruimten
- Toegangsbeheer en datalijnage
Testen, foutopsporing en productiewerkwijzen
- Unit-testing van PySpark-logica
- Foutopsporing en standaarden voor codekwaliteit
End-to-end use cases in de financiële sector
- Een end-to-end banking-ETL-pipeline bouwen
- Migreren van legacy SQL-processen naar PySpark
SQL-werklasten migreren naar PySpark
- Strategie en planningpatronen voor migratie
- Incriminerende conversie van SQL-workflows naar PySpark
Vereisten
- Ervaring met Python-programmeertaal, inclusief functies en datatypen
- Kennis van SQL, inclusief joins, aggregaties en subqueries
- Geen eerdere ervaring met Databricks of PySpark is vereist
Doelgroep
- Data engineers, data analisten en data professionals
- Teams die bestaande op SQL gebaseerde workflows migreren naar Databricks en PySpark
Aangepaste bedrijfsopleiding
Opleidingsoplossingen ontworpen exclusief voor bedrijven.
- Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
- Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
- Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*
Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen
Reviews (1)
Ik vond het fijn dat het praktisch was. Ik hield ervan om de theoretische kennis toe te passen met praktijkvoorbeelden.
Aurelia-Adriana - Allianz Services Romania
Cursus - Python and Spark for Big Data (PySpark)
Automatisch vertaald