Cursusaanbod
Dag 01
Overzicht van Big Data Business Intelligence voor criminale inlichtingenanalyse
- Casestudy’s uit de handhaving: voorspellend politieoptreden
- Het gebruik van Big Data binnen politieorganisaties en hoe zij hun toekomstige werkzaamheden afstemmen op predictive analytics met Big Data
- Nieuwe technologische oplossingen zoals schotdetectiesensoren, bewakingsvideo’s en sociale media
- Het inzetten van Big Data-technologie om informatieoverbelasting te verminderen
- Koppelen van Big Data met legacy-databases
- Basiskennis over technologieën die bij predictive analytics nodig zijn
- Gegevensintegratie en visualisatie via dashboards
- Fraudemanagement
- Zakelijke regels en fraudedetectie
- Dreigingsdetectie en -profilering
- Kosten-batenanalyse bij implementatie van Big Data
Inleiding tot Big Data
- De vier kenmerken van Big Data: volume, diversiteit, snelheid en betrouwbaarheid.
- Massively Parallel Processing (MPP)-architectuur
- Datawarehouses – statische schema’s, langzaam veranderende datasets
- MPP-databases: Greenplum, Exadata, Teradata, Netezza, Vertica enz.
- Oplossingen gebaseerd op Hadoop – geen beperkingen wat betreft datastructuur.
- Typisch patroon: HDFS, MapReduce, en het ophalen van data uit HDFS
- Apache Spark voor streamverwerking
- Batchen zijn geschikt voor analytische doeleinden of niet-interactieve processen.
- Volume: CEP-gestreamde gegevens
- Veelgebruikte keuzes – CEP-producten zoals Infostreams, Apama en MarkLogic
- Minder productierijp – Storm en S4
- NoSQL-databases (kolom- en sleutelwaarde): uitstekend geschikt als aanvulling op datawarehouses of databases.
NoSQL-oplossingen
- Sleutelwaardedatabases: Keyspace, Flare, SchemaFree, RAMCloud en Oracle NoSQL Database (OnDB)
- Sleutelwaardedatabases: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb en DovetailDB
- Hierarchische sleutelwaardedatabases: GT.m en Cache
- Geordende sleutelwaardedatabases: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB en Actord
- Sleutelwaardecaches: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity en Terracoqua<\/li>
- Tuple-databases: Gigaspaces, Coord en Apache River
- Objectdatabases: ZopeDB, DB40 en Shoal
- Documentdatenbanken: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-databases, ThruDB, CloudKit, Prsevere, Riak-Basho en Scalaris
- Breede kolomdatabases: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase en KDI
Verschillende typen gegevens – inleiding tot data cleaning bij Big Data
- RDBMS – statische structuur; niet ideaal voor flexibele verkenning.
- NoSQL – semi-gestructureerde vorm, genoeg structuur om zonder specifiek schema te kunnen opslaan.
- Problemen bij data cleaning
Hadoop
- Wanneer moet Hadoop worden gekozen?
- STRUCTUREERD: Enterprise-databases en -warehouses bieden ruime opslagcapaciteit (tegen hoge kosten) maar vereisen een bepaalde structuur, wat minder geschikt is voor dynamische verkenning.
- SEMI STRUCTUREERD data – moeilijk te verwerken via traditionele oplossingen zoals DW/DB.
- Datawarehousing is tijdrovend en resulteert in een statisch systeem zelfs na implementatie.
- Bij grote hoeveelheden en veelvoudige data zijn commodity computers geschikt voor Hadoop-implementaties.
- Het opzetten van een Hadoop-cluster vereist goedkope standaardhardware.
Inleiding tot MapReduce en HDFS
- MapReduce – verdeelt berekeningen over meerdere servers.
- HDFS – zorgt voor lokale beschikbaarheid van data tijdens verwerking (met redundatie).
- Data kan ongestructureerd of schema-loos zijn (anders dan bij RDBMS).
- De programmeur is verantwoordelijk voor het begrijpen en verwerken van de data.
- MapReduce-programmeren gebeurt met Java (voor- en nadelen); daarna moet de data handmatig naar HDFS worden overgezet.
Dag 02
Het Big Data-ecosysteem – opbouw van ETL-processen (Extract, Transform, Load): welke tools en wanneer gebruiken?
- Hadoop versus andere NoSQL-oplossingen
- Interactieve toegang tot data voor random access
- HBase: kolomgerichte database bovenop Hadoop
- Limieten bij random access tot data (maximaal 1 PB).
- Niet geschikt voor ad-hoc analyse, wel handig voor logging, tellen en tijdreeksanalyse.
- Sqoop – importeren van databases naar Hive of HDFS via JDBC/ODBC-connecties.
- Flume – streamdata (zoals logbestanden) doorsturen naar HDFS.
Gebruik en beheer van Big Data-systemen
- Bewegende onderdelen; compute nodes kunnen starten of falen: ZooKeeper zorgt voor configuratie, coördinatie en naamgeving.
- Complexe workflows – Oozie helpt bij beheer van werkstromen, afhankelijkheden en opeenvolging.
- Implementeren, configureren en clusterbeheer: Ambari biedt ondersteuning aan systeembeheerders.
- In de cloud: Whirr vormt een handige optie.
Predictive Analytics – basisprincipes en machine learning als fundament voor Business Intelligence
- Inleiding tot machine learning
- Leren van classificatietechnieken
- Bayesian-predicties – voorbereiden van trainingsbestanden.
- Support Vector Machine
- KNN p-Tree Algebra en verticale data-mining
- Neuraal netwerk
- Bij grote variabelen: Random Forest (RF)
- Voor automatisering met Big Data: Multi-model ensemble RF
- Automatisering via Soft10-M
- Tekstanalysegereedschap Treeminer
- Agile leerprocessen
- Agent-based learning
- Gedistribueerd leren
- Inleiding tot open source-tools voor predictive analytics: R, Python, Rapidminer en Mahut.
Het Predictive Analytics-ecosysteem in de praktijk bij criminale inlichtingenanalyse
- Technologie en het onderzoeksproces
- Inzichtanalyse
- Visualisatie-analytics
- Gestructureerde predictive analytics
- Ongestructureerde predictive analytics<\/li>
- Profileringssystemen voor dreigingen, fraude of leveranciers.
- Aanbevelingsengine
- Patterns detecteren
- Regels of scenario’s bepalen – falen, fraude of optimalisatie.
- Oorzaakanalyse
- Sentimentanalyse
- CRM-analyse
- Netwerkanalyse
- Tekstanalyse om inzichten te verkrijgen uit verhoorverslagen, getuigenverklaringen en internetcommunicatie.
- Tech-geassisteerd beoordelen van documenten
- Fraud-analyse
- Real-time analyse
Dag 03
Real-time en schaalbare analytics op basis van Hadoop
- Waarom gewone analytische algoritmes vaak falen binnen Hadoop/HDFS.
- Apache Hama – voor bulk, synchrone gedistribueerde berekeningen.
- Apache Spark – voor clustercomputing en real-time analyse.
- CMU Graphics Lab2: grafisch georiënteerde asynchrone methoden voor gedistribueerd rekenwerk.
- KNN p – Treeminer biedt algebraische benadering om hardwarekosten te verlagen.
Gereedschappen voor eDiscovery en forensisch onderzoek
- Vergelijking tussen Big Data-oplossingen en legacy-systemen: kosten en prestaties.
- Predictive coding en Technology Assisted Review (TAR)
- Live demo van vMiner toont hoe TAR sneller informatie oplevert.
- Snellere indexering door gebruik van HDFS – dus grotere datasnelheid.
- NLP – open source-tools en technieken voor natuurlijke taalverwerking.
- Verwerking van vreemde talen in eDiscovery-processen.
Big Data BI toegepast op cyberbeveiliging: een 360°-overzicht, snelle dataverzameling en dreigingsidentificatie
- Inleiding tot security analytics – aanvalspuntanalyse, onjuiste configuraties en beveiliging van host-systemen.
- Netwerkinfrastructuur, grote datastromen en response ETL voor real-time analyse.
- Voorspellende vs prescriptieve modellen: vaste regels versus automatische identificatie van dreigingspatronen.
Het verzamelen van diverse data voor criminale inlichtingenanalyse
- Gebruik van IoT (Internet of Things) als sensoren voor gegevensverzameling.
- Satellietbeelden voor binnenlandse surveillance.
- Bewakings- en beeldmateriaal voor identificatie van criminelen.
- Andere dataverzamelaars: drones, bodycams, GPS-taggers en thermische camera’s.
- Automatisering van gegevenshaalbaarheid naast informatie uit getuigen, verhoren en onderzoek.
- Voorspellen van criminele activiteiten.
Dag 04
Fraudepreventie via Big Data BI bij fraudanalyse
- Basisindelingen binnen fraudanalyse: regelgebaseerd versus predictive analytics.
- Supervised versus unsupervised machine learning voor het ontdekken van fraudepatronen.
- Toepassingen zoals bedrijfstot-bedrijfstruff, medische fraude, verzekeringsfraude en witwassen.
Sociale Media Analytics – informatieverzameling en analyse
- Hoe criminelen sociale media gebruiken om zich te organiseren, rekruteren of plannen maken.
- Big Data ETL-API’s voor het extraheren van social media-data.
- Tekst, beelden, metadata en video’s worden eveneens verwerkt.
- Sentimentanalyse uit social media-feeders.
- Contextuele en niet-contextuele filtering van dergelijke data.
- Een Social Media Dashboard voor diverse platforms.
- Automatische profilering van gebruikersaccounts.
- Elke vorm van analyse wordt gedemonstreerd aan de hand van het Treeminer-veld.
Big Data Analytics bij beeldverwerking en videobeelden
- Opslagmethoden voor grote hoeveelheden beeldmateriaal – oplossingen boven de petabyte-schaal.
- LTFS (Linear Tape File System) en LTO (Linear Tape Open)
- GPFS-LTFS: een laag-over-laag opslagmodel voor big images.
- Basisbeginselen van beeldanalyse
- Objectherkenning
- Beeldsegmentatie
- Motion tracking
- 3-D reconstructie van afbeeldingen.
Biometrie, DNA en de volgende generatie identificatiesystemen
- Verder dan vingerafdrukken en gezichtsherkenning.
- Sprekherkenning, toetsdriftsanalyse (typgedrag) en CODIS – het gecombineerde DNA-indexsysteem.
- Forense DNA-fenotypie: hoe een gezicht wordt gereconstrueerd uit DNA-gegevens.
Big Data Dashboards voor snelle toegang tot diverse informatie:
- Integreren van bestaande applicaties met Big Data-dashboards.
- Beheer van Big Data.
- Casestudy over dashboards: Tableau en Pentaho.
- Gebruik van Big Data-apps om locatiegebaseerde diensten voor de overheid te ondersteunen.
- Tracking- en beheersystemen.
Dag 05
Welke argumenten pleiten voor implementatie van Big Data BI binnen organisaties:
- Het berekenen van de ROI (Return on Investment) bij investeringen in Big Data.
- Casestudy’s: tijdsbesparing en productiviteitsverhoging door automatisering bij data-analyse.
- Besparingen op licentiekosten voor databases door geoptimaliseerde gebruik.
- Inkomensvoordelen via locatiegebaseerde diensten.
- Kostendecrements dankzij fraudepreventie.
- Een vereenvoudigde rekentabel om de kosten tegenover voordelen te vergelijken bij Big Data-implementaties.
Stappenplan voor het vervangen van een legacy-datasysteem door een Big Data-systeem:
- Migratieroadmap voor Big Data
- Welke informatie is noodzakelijk alvorens een systeem te ontwerpen?
- Begrippen en manieren om volume, snelheid, diversiteit en betrouwbaarheid te meten.
- Hoe kan groei van gegevensverzamelingen worden geschat?
- Gebruik van casestudy’s als voorbeeld.
Overzicht van Big Data-leveranciers en hun producten.
- Accenture
- APTEAN (voorheen CDC Software)
- Cisco Systems
- Cloudera
- Dell
- EMC
- GoodData Corporation
- Guavus
- Hitachi Data Systems
- Hortonworks
- HP
- IBM
- Informatica
- Intel
- Jaspersoft
- Microsoft
- MongoDB (voorheen 10Gen)
- MU Sigma
- Netapp
- Opera Solutions
- Oracle
- Pentaho
- Platfora
- Qliktech
- Quantum
- Rackspace
- Revolution Analytics
- Salesforce
- SAP
- SAS Institute
- Sisense
- Software AG/Terracotta
- Soft10 Automation
- Splunk
- Sqrrl
- Supermicro
- Tableau Software
- Teradata
- Think Big Analytics
- Tidemark Systems
- Treeminer
- VMware (onderdeel van EMC)
Vraag en antwoord sessie
Vereisten
- Kennis van handhavingsprocessen en datasysteemarchitectuur
- Basisbegrip van SQL/Oracle of relationele databases
- Basiskennis van statistiek (op spreadsheetniveau)
Doelgroep
- Handhavingsspecialisten met een technische achtergrond
Aangepaste bedrijfsopleiding
Opleidingsoplossingen ontworpen exclusief voor bedrijven.
- Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
- Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
- Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*
Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen
Reviews (3)
basisprincipes en hield van de voorbereide documenten en oefeningen
Rekha Nallam - GE Medical Systems Polska Sp. z o.o.
Cursus - Introduction to Predictive AI
Automatisch vertaald
Deepthi was zeer gevoelig voor mijn behoeften, ze kon aanvoelen wanneer ze extra lagen van complexiteit moest toevoegen en wanneer ze juist moest inhouden en een meer gestructureerde benadering kiezen. Deepthi werkte echt op mijn tempo en zorgde ervoor dat ik de nieuwe functies/tools zelf kon gebruiken, door eerst te demonstreren en me vervolgens te laten oefenen. Dit hielp enorm bij het verankeren van de training. Ik kan niet anders dan zeer tevreden zijn met het resultaat van deze training en met Deepthi's niveau van expertise!
Deepthi - Invest Northern Ireland
Cursus - IBM Cognos Analytics
Automatisch vertaald
hij was goed voorbereid - en hij is zeer sympathiek
Oliver - Post CH AG
Cursus - Splunk Fundamentals
Automatisch vertaald