Bedankt voor uw aanvraag! Een van onze medewerkers neemt binnenkort contact met u op
Bedankt voor uw boeking! Een van onze medewerkers neemt binnenkort contact met u op.
Cursusaanbod
Elke sessie duurt 2 uur
Dag-1: Sessie-1: Waarom Big Data Business Intelligence voor overheden?
- Case studies van NIH en DoE
- De verspreiding van Big Data-toepassingen binnen overheidsinstellingen en hoe men zich daarop voorbereidt via predictive analytics
- Brede toepassingsgebieden bij het Ministerie van Defensie, NSA, IRS en USDA
- Koppeling tussen Big Data en oudere datastromen
- Inleiding in technologieën die predictive analytics mogelijk maken
- Dataintegratie en visualisatie via dashboards
- Fraudebeheer
- Definiëring van zakelijke regels & automatische fraudedetectie
- Dreigingsdetectie en -profilering
- Kosten-batenanalyse bij implementatie van Big Data
Dag-1: Sessie-2: Inleiding tot Big Data-1
- Belangrijkste kenmerken van Big Data: volume, variëteit, snelheid en veracity; MPP-architectuur voor grote datahoeveelheden.
- Datamagazijnen – statische schema's en langzaam evoluerende datasets
- MPP-databases zoals Greenplum, Exadata, Teradata, Netezza en Vertica
- Oplossingen op basis van Hadoop – geen beperkingen met betrekking tot datastructuur.
- Typisch gebruik: HDFS, MapReduce voor verwerking; gegevens worden uit HDFS teruggehaald
- Batchverwerking geschikt voor analytische en niet-interactieve taken
- Snelheid bij het verwerken van grote hoeveelheden data via CEP-streams
- Veelgebruikte keuzes: CEP-oplossingen (bijv. Infostreams, Apama, MarkLogic)
- Minder productierijk: Storm/S4
- NoSQL-databases – zowel kolomgeoriënteerd als key-value; goed geschikt als aanvulling op datamagazijnen of relationele databases
Dag-1: Sessie-3: Inleiding tot Big Data-2
NoSQL-oplossingen
- Key-Value stores – Keyspace, Flare, SchemaFree, RAMCloud en Oracle NoSQL Database (OnDB)
- Key-Value stores – Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb en DovetailDB
- Hierarchische key-value opslag: GT.m en Cache
- Gesorteerde Key-Value opslag – TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB en Actord
- Cache-functies op basis van key-values – Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity en Terracoqua
- Tuple stores – Gigaspaces, Coord en Apache River
- Objectdatabases – ZopeDB, DB40 en Shoal
- Documentopslag – CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-databanken, ThruDB, CloudKit, Prsevere, Riak-Basho en Scalaris
- Brede kolomopslag – BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase en KDI
Soorten data: Inleiding tot problematiek rond gegevenszuivering bij Big Data
- RDBMS – statische structuren/schema’s, minder geschikt voor flexibele verkenning.
- NoSQL – semi-gestructureerde data; genoeg orde om zonder volledig schema te kunnen opslaan
- Problemen bij gegevenszuivering
Dag-1: Sessie-4: Inleiding tot Big Data-3 – Hadoop
- Wanneer is Hadoop een goede keuze?
- STRUCTUREERDE data kan in datamagazijnen of -databanken worden opgeslagen, maar dit brengt veel kosten met zich mee; bovendien beperkt het vrije onderzoek.
- SEMI-STRUCTUREERDE gegevens zijn moeilijk te verwerken via traditionele systemen.
- Opslag in datamagazijnen vereist enorme inspanningen en blijft statisch na implementatie
- Voor de combinatie van grote hoeveelheden data met variëteit: Hadoop op standaardhardware.
- Basisvoorwaarde om een Hadoop-cluster te bouwen is het gebruik van goedkope standaard-hardware
Inleiding tot MapReduce en HDFS
- MapReduce verdeelt berekeningen over meerdere servers.
- HDFS zorgt ervoor dat data lokaal beschikbaar is voor verwerking (met redundantie).
- Data mag ongestructureerd of zonder schema zijn – anders dan bij RDBMS.
- De ontwikkelaar draagt de verantwoordelijkheid voor het begrijpen van gegevenscontext.
- Programmeren met MapReduce vereist kennis van Java (voor- en nadelen), en handmatige inlading in HDFS.
Dag-2: Sessie-1: Big Data-ecosysteem – Opbouw van ETL-verwerking: verschillende Big Data-hulpmiddelen – welke wanneer gebruiken?
- Hadoop versus andere NoSQL-systemen
- Interactieve, willekeurige toegang tot data
- HBase (kolomgeoriënteerde database) gebaseerd op Hadoop
- Willekeurige toegang mogelijk, hoewel er een limiet van 1 PB is.
- Niet handig voor ad-hoc-analyses; geschikt voor logging, telling en tijdreeksen.
- Sqoop – import uit databases naar Hive of HDFS (via JDBC/ODBC).
- Flume – stroomgegevens (zoals logdata) doorsturen naar HDFS
Dag-2: Sessie-2: Big Data-beheersystemen
- Bewegingen en storingen van computernodes worden geregeld via ZooKeeper; dit zorgt voor configuratie, coördinatie en naamgeving.
- Oozie regelt gecompliceerde werkstromen met afhankelijkheden tussen verschillende taken.
- Ambari ondersteunt implementatie, configurering, clusterbeheer en upgrades (voor systeembeheerders).
- In cloudomgevingen is Whirr beschikbaar
Dag-2: Sessie-3: Predictive analytics binnen Business Intelligence – 1: Basistechnieken en Machine Learning als basis voor BI:
- Inleiding tot machine learning
- Technieken rond classificatie leren
- Bayesian Prediction – voorbereiden van trainingsbestanden
- Support Vector Machines
- KNN p-Algebra en vertical mining
- Neuronale netwerken
- Random Forest (RF) voor problemen waarbij veel variabelen spelen in Big Data-context
- Meerdere modellen combineren via Random Forest: multi-model ensemble RF
- Automatisering met behulp van Soft10-M
- Tekstanalyse hulpmiddel Treeminer
- Flexibele leermethodes
- Leren op basis van agenten
- Gedistribueerd leren
- Inleiding tot open source tools voor predictive analytics: R, Rapidminer en Mahut
Dag-2: Sessie-4 Predictive analytics-ecosysteem-2: Veelvoorkomende analyseproblemen binnen de overheid
- Inzichtsanalyse
- Visuele analyse
- Gestructureerde predictive analytics
- Ongestructuurde predictive analytics
- Profilering van dreigingen, fraude en leveranciers
- Aanbevelingsmechanismen
- Patroonherkenning<\/li>
- Regel- en scenario-identificatie – foutdetectie, fraudebestrijding, optimalisatie
- Oorzaakanalyse
- Sentimentanalyse
- CRM-analyse
- Netwerkanalyse
- Tekstanalyse
- Technologische ondersteuning bij documentanalyse
- Fraudeanalyse
- In realtime analyseren
Dag-3: Sessie-1: In realtime schaalbare analytics via Hadoop
- Waarom standaardanalysetools falen bij gebruik in Hadoop/HDFS
- Apache Hama – geschikt voor bulk-synchronous gedistribueerde berekeningen
- Apache SPARK – clustercomputing gericht op realtime analytics
- CMU Graphics Lab2 – grafische benadering van asynchrone gedistribueerde verwerking
- KNN p-Algebra van Treeminer: besparing van hardwarekosten bij dataverwerking
Dag-3: Sessie-2: Hulpmiddelen voor eDiscovery en forensische analyse
- Bijeenkomst van Big Data versus traditionele gegevensbronnen – vergelijking tussen kosten en prestaties.
- Predictive coding en technologisch ondersteunde documentanalyse (TAR).
- Een live demonstratie met vMiner laat zien hoe TAR versnelt documentanalyse.
- HDFS verhoogt snelheid bij indexeren van data
- Natuurlijke taalverwerking – diverse technieken en open source-oplossingen
- Verwerking van documenten in vreemde talen: specifieke technologieën hiervoor
Dag-3: Sessie 3: Big Data BI voor cyberbeveiliging – Compleet beeld ontstaan door snelle dataverzameling en dreigingsdetectie
- Basisprincipes van security analytics – aanvalspuntanalyse, misconfiguraties, beschermingen op systemenniveau
- Netwerkinfrastructuur, grote datastromen en reactieve ETL-verwerking voor realtime analyse
- Prescriptief versus predictief – vaste regels tegenover automatische dreigingsdetectie uit meta-data
Dag-3: Sessie 4: Big Data in de landbouw bij USDA
- Inleiding tot IoT voor landbouw – sensorgegevens en datagebruik op veldniveau
- Satellietbeelden en hun toepassingen binnen de landbouw.
- Gebruik van data uit sensoren en satellietfoto's om grondkwaliteit, teeltadviezen en voorspellingen te bepalen
- Landbouwverzekering en Big Data
- Oogstverliesprognoses
Dag-4: Sessie-1: Fraudepreventie via Big Data BI in overheidscontext – Fraudeanalyse:
- Verschillen tussen regelgebaseerde en predictive fraudeanalyses
- Supervised versus unsupervised machine learning voor fraudedetectie
- Leveranciersfraude en overfacturering
- Fraude binnen Medicare en Medicaid – technieken om claims te controleren
- Fraudes met betrekking tot reisvergoedingen
- Fraudes rond belastingteruggaven via IRS
- Waar mogelijk volgen er case studies en live demonstraties.
Dag-4: Sessie-2: Sociale media-analyse – Informatieverzameling en -interpretatie
- Het gebruik van Big Data ETL-API’s voor het extraheren van social media-gegevens.
- Analyse van tekst, afbeeldingen, metadata en video's
- Sentimentanalyse op basis van sociale media-berichten
- Filtering naar context of niet-contextuele gegevens uit online feeds
- Een dashboard voor geïntegreerde weergave van verschillende sociale kanalen
- Automatische profilering van gebruikers op social media
- Elke vorm van analyse wordt gedemonstreerd met behulp van Treeminer.
Dag-4: Sessie-3: Big Data-analyse bij beeldverwerking en video-feeder
- Opslagtechnieken voor enorme hoeveelheden afbeeldingsdata – oplossingen die petabytes aan data kunnen verwerken.
- Gebruik van LTFS en LTO-architecturen
- GPFS-LTFS – lagenmodel voor opslag van grote hoeveelheden afbeeldingsdata.
- Basisprincipes van beeldanalyse
- Objectherkenning
- Segmentatie van beelden
- Bewegingsanalyse in video’s
- 3-D reconstructie van objecten uit beelden
Dag-4: Sessie-4: Toepassingen van Big Data bij het NIH:
- Nieuwe ontwikkelingen in bio-informatica
- Problematiek rond metagenomica en data-mining.
- Predictive analytics bij farmacogenomica, metabolomics en proteomics.
- Toepassing van Big Data binnen volgende stappen van genomische analyses.
- Hoe predictive analytics op grote data een rol kan spelen in de volksgezondheid
Een Big Data Dashboard voor snelle toegankelijkheid en weergave:
- Integratie van bestaande applicatiesystemen met het Big Data Dashboard.
- Gebruik van datamanagementtools binnen het dashboard.
- Case studies – bijvoorbeeld Tableau en Pentaho als voorbeelden van succesvolle dashboards.
- Locatiegebaseerde diensten kunnen via Big Data-software aan overheidsorganisaties worden aangeboden.
- Bijhouden en beheren van gebruikersacties via het systeem.
Dag-5: Sessie-1: Hoe ROI bij Big Data BI implementatie te onderbouwen?
- Definieren van Return on Investment voor Big Data-investeringen.
- Case studies – besparing op tijd en productiviteitswinst door efficiëntere databehandeling.
- Bewijsbaar voordeel qua lagere kosten voor licenties van databases.
- Winst uit locatiegebaseerde diensten en voordelen op lange termijn.
- Besparingen door betere fraudepreventie.
- Eenvoudige spreadsheet-methodiek om ongeveer de kostenverhouding te berekenen ten opzichte van winst of besparing bij implementatie.
Dag-5: Sessie-2: Stappenplan voor vervanging van bestaande datasysteem door een Big Data-platform:
- Realistisch beeld van de migratiestrategie naar Big Data.
- Welke basisgegevens zijn noodzakelijk bij ontwerp van een Big Data-oplossing?
- Hoe kan men volume, snelheid, variëteit en veracity van gegevens meten?
- Inschatting van toekomstige datagroei.
- Praktijkvoorbeelden uit de sector.
Dag-5: Sessie 4: Overzicht en beoordeling van Big Data-leveranciers – Vragen en discussies:
- Accenture
- APTEAN (voorheen CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (voorheen 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (onderdeel van EMC)
Vereisten
- Basiskennis over zakelijke werking en datasysteembeheer binnen de overheidssector
- Algemene kennis van SQL/Oracle of relationele databases
- Basisbegrip van statistiek (op niveau van spreadsheets)
35 Uren
Aangepaste bedrijfsopleiding
Opleidingsoplossingen ontworpen exclusief voor bedrijven.
- Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
- Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
- Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*
Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen
Reviews (1)
De capaciteit van de trainer om de cursus af te stemmen op de eisen van de organisatie, in plaats van de cursus alleen maar voor het geven ervan te bieden.
Masilonyane - Revenue Services Lesotho
Cursus - Big Data Business Intelligence for Govt. Agencies
Automatisch vertaald