CONTACT ONS

Cursusaanbod

Elke sessie duurt 2 uur

Dag-1: Sessie-1: Waarom Big Data Business Intelligence voor overheden?

  • Case studies van NIH en DoE
  • De verspreiding van Big Data-toepassingen binnen overheidsinstellingen en hoe men zich daarop voorbereidt via predictive analytics
  • Brede toepassingsgebieden bij het Ministerie van Defensie, NSA, IRS en USDA
  • Koppeling tussen Big Data en oudere datastromen
  • Inleiding in technologieën die predictive analytics mogelijk maken
  • Dataintegratie en visualisatie via dashboards
  • Fraudebeheer
  • Definiëring van zakelijke regels & automatische fraudedetectie
  • Dreigingsdetectie en -profilering
  • Kosten-batenanalyse bij implementatie van Big Data

Dag-1: Sessie-2: Inleiding tot Big Data-1

  • Belangrijkste kenmerken van Big Data: volume, variëteit, snelheid en veracity; MPP-architectuur voor grote datahoeveelheden.
  • Datamagazijnen – statische schema's en langzaam evoluerende datasets
  • MPP-databases zoals Greenplum, Exadata, Teradata, Netezza en Vertica
  • Oplossingen op basis van Hadoop – geen beperkingen met betrekking tot datastructuur.
  • Typisch gebruik: HDFS, MapReduce voor verwerking; gegevens worden uit HDFS teruggehaald
  • Batchverwerking geschikt voor analytische en niet-interactieve taken
  • Snelheid bij het verwerken van grote hoeveelheden data via CEP-streams
  • Veelgebruikte keuzes: CEP-oplossingen (bijv. Infostreams, Apama, MarkLogic)
  • Minder productierijk: Storm/S4
  • NoSQL-databases – zowel kolomgeoriënteerd als key-value; goed geschikt als aanvulling op datamagazijnen of relationele databases

Dag-1: Sessie-3: Inleiding tot Big Data-2

NoSQL-oplossingen

  • Key-Value stores – Keyspace, Flare, SchemaFree, RAMCloud en Oracle NoSQL Database (OnDB)
  • Key-Value stores – Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb en DovetailDB
  • Hierarchische key-value opslag: GT.m en Cache
  • Gesorteerde Key-Value opslag – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB en Actord
  • Cache-functies op basis van key-values – Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity en Terracoqua
  • Tuple stores – Gigaspaces, Coord en Apache River
  • Objectdatabases – ZopeDB, DB40 en Shoal
  • Documentopslag – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-databanken, ThruDB, CloudKit, Prsevere, Riak-Basho en Scalaris
  • Brede kolomopslag – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase en KDI

Soorten data: Inleiding tot problematiek rond gegevenszuivering bij Big Data

  • RDBMS – statische structuren/schema’s, minder geschikt voor flexibele verkenning.
  • NoSQL – semi-gestructureerde data; genoeg orde om zonder volledig schema te kunnen opslaan
  • Problemen bij gegevenszuivering

Dag-1: Sessie-4: Inleiding tot Big Data-3 – Hadoop

  • Wanneer is Hadoop een goede keuze?
  • STRUCTUREERDE data kan in datamagazijnen of -databanken worden opgeslagen, maar dit brengt veel kosten met zich mee; bovendien beperkt het vrije onderzoek.
  • SEMI-STRUCTUREERDE gegevens zijn moeilijk te verwerken via traditionele systemen.
  • Opslag in datamagazijnen vereist enorme inspanningen en blijft statisch na implementatie
  • Voor de combinatie van grote hoeveelheden data met variëteit: Hadoop op standaardhardware.
  • Basisvoorwaarde om een Hadoop-cluster te bouwen is het gebruik van goedkope standaard-hardware

Inleiding tot MapReduce en HDFS

  • MapReduce verdeelt berekeningen over meerdere servers.
  • HDFS zorgt ervoor dat data lokaal beschikbaar is voor verwerking (met redundantie).
  • Data mag ongestructureerd of zonder schema zijn – anders dan bij RDBMS.
  • De ontwikkelaar draagt de verantwoordelijkheid voor het begrijpen van gegevenscontext.
  • Programmeren met MapReduce vereist kennis van Java (voor- en nadelen), en handmatige inlading in HDFS.

Dag-2: Sessie-1: Big Data-ecosysteem – Opbouw van ETL-verwerking: verschillende Big Data-hulpmiddelen – welke wanneer gebruiken?

  • Hadoop versus andere NoSQL-systemen
  • Interactieve, willekeurige toegang tot data
  • HBase (kolomgeoriënteerde database) gebaseerd op Hadoop
  • Willekeurige toegang mogelijk, hoewel er een limiet van 1 PB is.
  • Niet handig voor ad-hoc-analyses; geschikt voor logging, telling en tijdreeksen.
  • Sqoop – import uit databases naar Hive of HDFS (via JDBC/ODBC).
  • Flume – stroomgegevens (zoals logdata) doorsturen naar HDFS

Dag-2: Sessie-2: Big Data-beheersystemen

  • Bewegingen en storingen van computernodes worden geregeld via ZooKeeper; dit zorgt voor configuratie, coördinatie en naamgeving.
  • Oozie regelt gecompliceerde werkstromen met afhankelijkheden tussen verschillende taken.
  • Ambari ondersteunt implementatie, configurering, clusterbeheer en upgrades (voor systeembeheerders).
  • In cloudomgevingen is Whirr beschikbaar

Dag-2: Sessie-3: Predictive analytics binnen Business Intelligence – 1: Basistechnieken en Machine Learning als basis voor BI:

  • Inleiding tot machine learning
  • Technieken rond classificatie leren
  • Bayesian Prediction – voorbereiden van trainingsbestanden
  • Support Vector Machines
  • KNN p-Algebra en vertical mining
  • Neuronale netwerken
  • Random Forest (RF) voor problemen waarbij veel variabelen spelen in Big Data-context
  • Meerdere modellen combineren via Random Forest: multi-model ensemble RF
  • Automatisering met behulp van Soft10-M
  • Tekstanalyse hulpmiddel Treeminer
  • Flexibele leermethodes
  • Leren op basis van agenten
  • Gedistribueerd leren
  • Inleiding tot open source tools voor predictive analytics: R, Rapidminer en Mahut

Dag-2: Sessie-4 Predictive analytics-ecosysteem-2: Veelvoorkomende analyseproblemen binnen de overheid

  • Inzichtsanalyse
  • Visuele analyse
  • Gestructureerde predictive analytics
  • Ongestructuurde predictive analytics
  • Profilering van dreigingen, fraude en leveranciers
  • Aanbevelingsmechanismen
  • Patroonherkenning<\/li>
  • Regel- en scenario-identificatie – foutdetectie, fraudebestrijding, optimalisatie
  • Oorzaakanalyse
  • Sentimentanalyse
  • CRM-analyse
  • Netwerkanalyse
  • Tekstanalyse
  • Technologische ondersteuning bij documentanalyse
  • Fraudeanalyse
  • In realtime analyseren

Dag-3: Sessie-1: In realtime schaalbare analytics via Hadoop

  • Waarom standaardanalysetools falen bij gebruik in Hadoop/HDFS
  • Apache Hama – geschikt voor bulk-synchronous gedistribueerde berekeningen
  • Apache SPARK – clustercomputing gericht op realtime analytics
  • CMU Graphics Lab2 – grafische benadering van asynchrone gedistribueerde verwerking
  • KNN p-Algebra van Treeminer: besparing van hardwarekosten bij dataverwerking

Dag-3: Sessie-2: Hulpmiddelen voor eDiscovery en forensische analyse

  • Bijeenkomst van Big Data versus traditionele gegevensbronnen – vergelijking tussen kosten en prestaties.
  • Predictive coding en technologisch ondersteunde documentanalyse (TAR).
  • Een live demonstratie met vMiner laat zien hoe TAR versnelt documentanalyse.
  • HDFS verhoogt snelheid bij indexeren van data
  • Natuurlijke taalverwerking – diverse technieken en open source-oplossingen
  • Verwerking van documenten in vreemde talen: specifieke technologieën hiervoor

Dag-3: Sessie 3: Big Data BI voor cyberbeveiliging – Compleet beeld ontstaan door snelle dataverzameling en dreigingsdetectie

  • Basisprincipes van security analytics – aanvalspuntanalyse, misconfiguraties, beschermingen op systemenniveau
  • Netwerkinfrastructuur, grote datastromen en reactieve ETL-verwerking voor realtime analyse
  • Prescriptief versus predictief – vaste regels tegenover automatische dreigingsdetectie uit meta-data

Dag-3: Sessie 4: Big Data in de landbouw bij USDA

  • Inleiding tot IoT voor landbouw – sensorgegevens en datagebruik op veldniveau
  • Satellietbeelden en hun toepassingen binnen de landbouw.
  • Gebruik van data uit sensoren en satellietfoto's om grondkwaliteit, teeltadviezen en voorspellingen te bepalen
  • Landbouwverzekering en Big Data
  • Oogstverliesprognoses

Dag-4: Sessie-1: Fraudepreventie via Big Data BI in overheidscontext – Fraudeanalyse:

  • Verschillen tussen regelgebaseerde en predictive fraudeanalyses
  • Supervised versus unsupervised machine learning voor fraudedetectie
  • Leveranciersfraude en overfacturering
  • Fraude binnen Medicare en Medicaid – technieken om claims te controleren
  • Fraudes met betrekking tot reisvergoedingen
  • Fraudes rond belastingteruggaven via IRS
  • Waar mogelijk volgen er case studies en live demonstraties.

Dag-4: Sessie-2: Sociale media-analyse – Informatieverzameling en -interpretatie

  • Het gebruik van Big Data ETL-API’s voor het extraheren van social media-gegevens.
  • Analyse van tekst, afbeeldingen, metadata en video's
  • Sentimentanalyse op basis van sociale media-berichten
  • Filtering naar context of niet-contextuele gegevens uit online feeds
  • Een dashboard voor geïntegreerde weergave van verschillende sociale kanalen
  • Automatische profilering van gebruikers op social media
  • Elke vorm van analyse wordt gedemonstreerd met behulp van Treeminer.

Dag-4: Sessie-3: Big Data-analyse bij beeldverwerking en video-feeder

  • Opslagtechnieken voor enorme hoeveelheden afbeeldingsdata – oplossingen die petabytes aan data kunnen verwerken.
  • Gebruik van LTFS en LTO-architecturen
  • GPFS-LTFS – lagenmodel voor opslag van grote hoeveelheden afbeeldingsdata.
  • Basisprincipes van beeldanalyse
  • Objectherkenning
  • Segmentatie van beelden
  • Bewegingsanalyse in video’s
  • 3-D reconstructie van objecten uit beelden

Dag-4: Sessie-4: Toepassingen van Big Data bij het NIH:

  • Nieuwe ontwikkelingen in bio-informatica
  • Problematiek rond metagenomica en data-mining.
  • Predictive analytics bij farmacogenomica, metabolomics en proteomics.
  • Toepassing van Big Data binnen volgende stappen van genomische analyses.
  • Hoe predictive analytics op grote data een rol kan spelen in de volksgezondheid

Een Big Data Dashboard voor snelle toegankelijkheid en weergave:

  • Integratie van bestaande applicatiesystemen met het Big Data Dashboard.
  • Gebruik van datamanagementtools binnen het dashboard.
  • Case studies – bijvoorbeeld Tableau en Pentaho als voorbeelden van succesvolle dashboards.
  • Locatiegebaseerde diensten kunnen via Big Data-software aan overheidsorganisaties worden aangeboden.
  • Bijhouden en beheren van gebruikersacties via het systeem.

Dag-5: Sessie-1: Hoe ROI bij Big Data BI implementatie te onderbouwen?

  • Definieren van Return on Investment voor Big Data-investeringen.
  • Case studies – besparing op tijd en productiviteitswinst door efficiëntere databehandeling.
  • Bewijsbaar voordeel qua lagere kosten voor licenties van databases.
  • Winst uit locatiegebaseerde diensten en voordelen op lange termijn.
  • Besparingen door betere fraudepreventie.
  • Eenvoudige spreadsheet-methodiek om ongeveer de kostenverhouding te berekenen ten opzichte van winst of besparing bij implementatie.

Dag-5: Sessie-2: Stappenplan voor vervanging van bestaande datasysteem door een Big Data-platform:

  • Realistisch beeld van de migratiestrategie naar Big Data.
  • Welke basisgegevens zijn noodzakelijk bij ontwerp van een Big Data-oplossing?
  • Hoe kan men volume, snelheid, variëteit en veracity van gegevens meten?
  • Inschatting van toekomstige datagroei.
  • Praktijkvoorbeelden uit de sector.

Dag-5: Sessie 4: Overzicht en beoordeling van Big Data-leveranciers – Vragen en discussies:

  • Accenture
  • APTEAN (voorheen CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (voorheen 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (onderdeel van EMC)

Vereisten

  • Basiskennis over zakelijke werking en datasysteembeheer binnen de overheidssector
  • Algemene kennis van SQL/Oracle of relationele databases
  • Basisbegrip van statistiek (op niveau van spreadsheets)
 35 Uren

Aangepaste bedrijfsopleiding

Opleidingsoplossingen ontworpen exclusief voor bedrijven.

  • Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
  • Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
  • Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Investering

Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*

Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen

Reviews (1)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën