CONTACT ONS

Cursusaanbod

Dag 01

Overzicht van Big Data Business Intelligence voor criminale inlichtingenanalyse

  • Casestudy’s uit de handhaving: voorspellend politieoptreden
  • Het gebruik van Big Data binnen politieorganisaties en hoe zij hun toekomstige werkzaamheden afstemmen op predictive analytics met Big Data
  • Nieuwe technologische oplossingen zoals schotdetectiesensoren, bewakingsvideo’s en sociale media
  • Het inzetten van Big Data-technologie om informatieoverbelasting te verminderen
  • Koppelen van Big Data met legacy-databases
  • Basiskennis over technologieën die bij predictive analytics nodig zijn
  • Gegevensintegratie en visualisatie via dashboards
  • Fraudemanagement
  • Zakelijke regels en fraudedetectie
  • Dreigingsdetectie en -profilering
  • Kosten-batenanalyse bij implementatie van Big Data

Inleiding tot Big Data

  • De vier kenmerken van Big Data: volume, diversiteit, snelheid en betrouwbaarheid.
  • Massively Parallel Processing (MPP)-architectuur
  • Datawarehouses – statische schema’s, langzaam veranderende datasets
  • MPP-databases: Greenplum, Exadata, Teradata, Netezza, Vertica enz.
  • Oplossingen gebaseerd op Hadoop – geen beperkingen wat betreft datastructuur.
  • Typisch patroon: HDFS, MapReduce, en het ophalen van data uit HDFS
  • Apache Spark voor streamverwerking
  • Batchen zijn geschikt voor analytische doeleinden of niet-interactieve processen.
  • Volume: CEP-gestreamde gegevens
  • Veelgebruikte keuzes – CEP-producten zoals Infostreams, Apama en MarkLogic
  • Minder productierijp – Storm en S4
  • NoSQL-databases (kolom- en sleutelwaarde): uitstekend geschikt als aanvulling op datawarehouses of databases.

NoSQL-oplossingen

  • Sleutelwaardedatabases: Keyspace, Flare, SchemaFree, RAMCloud en Oracle NoSQL Database (OnDB)
  • Sleutelwaardedatabases: Dynamo, Voldemort, Dynomite, SubRecord, Mo8onDb en DovetailDB
  • Hierarchische sleutelwaardedatabases: GT.m en Cache
  • Geordende sleutelwaardedatabases: TokyoTyrant, Lightcloud, NMDB, Luxio, MemcacheDB en Actord
  • Sleutelwaardecaches: Memcached, Repcached, Coherence, Infinispan, EXtremeScale, JBossCache, Velocity en Terracoqua<\/li>
  • Tuple-databases: Gigaspaces, Coord en Apache River
  • Objectdatabases: ZopeDB, DB40 en Shoal
  • Documentdatenbanken: CouchDB, Cloudant, Couchbase, MongoDB, Jackrabbit, XML-databases, ThruDB, CloudKit, Prsevere, Riak-Basho en Scalaris
  • Breede kolomdatabases: BigTable, HBase, Apache Cassandra, Hypertable, KAI, OpenNeptune, Qbase en KDI

Verschillende typen gegevens – inleiding tot data cleaning bij Big Data

  • RDBMS – statische structuur; niet ideaal voor flexibele verkenning.
  • NoSQL – semi-gestructureerde vorm, genoeg structuur om zonder specifiek schema te kunnen opslaan.
  • Problemen bij data cleaning

Hadoop

  • Wanneer moet Hadoop worden gekozen?
  • STRUCTUREERD: Enterprise-databases en -warehouses bieden ruime opslagcapaciteit (tegen hoge kosten) maar vereisen een bepaalde structuur, wat minder geschikt is voor dynamische verkenning.
  • SEMI STRUCTUREERD data – moeilijk te verwerken via traditionele oplossingen zoals DW/DB.
  • Datawarehousing is tijdrovend en resulteert in een statisch systeem zelfs na implementatie.
  • Bij grote hoeveelheden en veelvoudige data zijn commodity computers geschikt voor Hadoop-implementaties.
  • Het opzetten van een Hadoop-cluster vereist goedkope standaardhardware.

Inleiding tot MapReduce en HDFS

  • MapReduce – verdeelt berekeningen over meerdere servers.
  • HDFS – zorgt voor lokale beschikbaarheid van data tijdens verwerking (met redundatie).
  • Data kan ongestructureerd of schema-loos zijn (anders dan bij RDBMS).
  • De programmeur is verantwoordelijk voor het begrijpen en verwerken van de data.
  • MapReduce-programmeren gebeurt met Java (voor- en nadelen); daarna moet de data handmatig naar HDFS worden overgezet.

Dag 02

Het Big Data-ecosysteem – opbouw van ETL-processen (Extract, Transform, Load): welke tools en wanneer gebruiken?

  • Hadoop versus andere NoSQL-oplossingen
  • Interactieve toegang tot data voor random access
  • HBase: kolomgerichte database bovenop Hadoop
  • Limieten bij random access tot data (maximaal 1 PB).
  • Niet geschikt voor ad-hoc analyse, wel handig voor logging, tellen en tijdreeksanalyse.
  • Sqoop – importeren van databases naar Hive of HDFS via JDBC/ODBC-connecties.
  • Flume – streamdata (zoals logbestanden) doorsturen naar HDFS.

Gebruik en beheer van Big Data-systemen

  • Bewegende onderdelen; compute nodes kunnen starten of falen: ZooKeeper zorgt voor configuratie, coördinatie en naamgeving.
  • Complexe workflows – Oozie helpt bij beheer van werkstromen, afhankelijkheden en opeenvolging.
  • Implementeren, configureren en clusterbeheer: Ambari biedt ondersteuning aan systeembeheerders.
  • In de cloud: Whirr vormt een handige optie.

Predictive Analytics – basisprincipes en machine learning als fundament voor Business Intelligence

  • Inleiding tot machine learning
  • Leren van classificatietechnieken
  • Bayesian-predicties – voorbereiden van trainingsbestanden.
  • Support Vector Machine
  • KNN p-Tree Algebra en verticale data-mining
  • Neuraal netwerk
  • Bij grote variabelen: Random Forest (RF)
  • Voor automatisering met Big Data: Multi-model ensemble RF
  • Automatisering via Soft10-M
  • Tekstanalysegereedschap Treeminer
  • Agile leerprocessen
  • Agent-based learning
  • Gedistribueerd leren
  • Inleiding tot open source-tools voor predictive analytics: R, Python, Rapidminer en Mahut.

Het Predictive Analytics-ecosysteem in de praktijk bij criminale inlichtingenanalyse

  • Technologie en het onderzoeksproces
  • Inzichtanalyse
  • Visualisatie-analytics
  • Gestructureerde predictive analytics
  • Ongestructureerde predictive analytics<\/li>
  • Profileringssystemen voor dreigingen, fraude of leveranciers.
  • Aanbevelingsengine
  • Patterns detecteren
  • Regels of scenario’s bepalen – falen, fraude of optimalisatie.
  • Oorzaakanalyse
  • Sentimentanalyse
  • CRM-analyse
  • Netwerkanalyse
  • Tekstanalyse om inzichten te verkrijgen uit verhoorverslagen, getuigenverklaringen en internetcommunicatie.
  • Tech-geassisteerd beoordelen van documenten
  • Fraud-analyse
  • Real-time analyse

Dag 03

Real-time en schaalbare analytics op basis van Hadoop

  • Waarom gewone analytische algoritmes vaak falen binnen Hadoop/HDFS.
  • Apache Hama – voor bulk, synchrone gedistribueerde berekeningen.
  • Apache Spark – voor clustercomputing en real-time analyse.
  • CMU Graphics Lab2: grafisch georiënteerde asynchrone methoden voor gedistribueerd rekenwerk.
  • KNN p – Treeminer biedt algebraische benadering om hardwarekosten te verlagen.

Gereedschappen voor eDiscovery en forensisch onderzoek

  • Vergelijking tussen Big Data-oplossingen en legacy-systemen: kosten en prestaties.
  • Predictive coding en Technology Assisted Review (TAR)
  • Live demo van vMiner toont hoe TAR sneller informatie oplevert.
  • Snellere indexering door gebruik van HDFS – dus grotere datasnelheid.
  • NLP – open source-tools en technieken voor natuurlijke taalverwerking.
  • Verwerking van vreemde talen in eDiscovery-processen.

Big Data BI toegepast op cyberbeveiliging: een 360°-overzicht, snelle dataverzameling en dreigingsidentificatie

  • Inleiding tot security analytics – aanvalspuntanalyse, onjuiste configuraties en beveiliging van host-systemen.
  • Netwerkinfrastructuur, grote datastromen en response ETL voor real-time analyse.
  • Voorspellende vs prescriptieve modellen: vaste regels versus automatische identificatie van dreigingspatronen.

Het verzamelen van diverse data voor criminale inlichtingenanalyse

  • Gebruik van IoT (Internet of Things) als sensoren voor gegevensverzameling.
  • Satellietbeelden voor binnenlandse surveillance.
  • Bewakings- en beeldmateriaal voor identificatie van criminelen.
  • Andere dataverzamelaars: drones, bodycams, GPS-taggers en thermische camera’s.
  • Automatisering van gegevenshaalbaarheid naast informatie uit getuigen, verhoren en onderzoek.
  • Voorspellen van criminele activiteiten.

Dag 04

Fraudepreventie via Big Data BI bij fraudanalyse

  • Basisindelingen binnen fraudanalyse: regelgebaseerd versus predictive analytics.
  • Supervised versus unsupervised machine learning voor het ontdekken van fraudepatronen.
  • Toepassingen zoals bedrijfstot-bedrijfstruff, medische fraude, verzekeringsfraude en witwassen.

Sociale Media Analytics – informatieverzameling en analyse

  • Hoe criminelen sociale media gebruiken om zich te organiseren, rekruteren of plannen maken.
  • Big Data ETL-API’s voor het extraheren van social media-data.
  • Tekst, beelden, metadata en video’s worden eveneens verwerkt.
  • Sentimentanalyse uit social media-feeders.
  • Contextuele en niet-contextuele filtering van dergelijke data.
  • Een Social Media Dashboard voor diverse platforms.
  • Automatische profilering van gebruikersaccounts.
  • Elke vorm van analyse wordt gedemonstreerd aan de hand van het Treeminer-veld.

Big Data Analytics bij beeldverwerking en videobeelden

  • Opslagmethoden voor grote hoeveelheden beeldmateriaal – oplossingen boven de petabyte-schaal.
  • LTFS (Linear Tape File System) en LTO (Linear Tape Open)
  • GPFS-LTFS: een laag-over-laag opslagmodel voor big images.
  • Basisbeginselen van beeldanalyse
  • Objectherkenning
  • Beeldsegmentatie
  • Motion tracking
  • 3-D reconstructie van afbeeldingen.

Biometrie, DNA en de volgende generatie identificatiesystemen

  • Verder dan vingerafdrukken en gezichtsherkenning.
  • Sprekherkenning, toetsdriftsanalyse (typgedrag) en CODIS – het gecombineerde DNA-indexsysteem.
  • Forense DNA-fenotypie: hoe een gezicht wordt gereconstrueerd uit DNA-gegevens.

Big Data Dashboards voor snelle toegang tot diverse informatie:

  • Integreren van bestaande applicaties met Big Data-dashboards.
  • Beheer van Big Data.
  • Casestudy over dashboards: Tableau en Pentaho.
  • Gebruik van Big Data-apps om locatiegebaseerde diensten voor de overheid te ondersteunen.
  • Tracking- en beheersystemen.

Dag 05

Welke argumenten pleiten voor implementatie van Big Data BI binnen organisaties:

  • Het berekenen van de ROI (Return on Investment) bij investeringen in Big Data.
  • Casestudy’s: tijdsbesparing en productiviteitsverhoging door automatisering bij data-analyse.
  • Besparingen op licentiekosten voor databases door geoptimaliseerde gebruik.
  • Inkomensvoordelen via locatiegebaseerde diensten.
  • Kostendecrements dankzij fraudepreventie.
  • Een vereenvoudigde rekentabel om de kosten tegenover voordelen te vergelijken bij Big Data-implementaties.

Stappenplan voor het vervangen van een legacy-datasysteem door een Big Data-systeem:

  • Migratieroadmap voor Big Data
  • Welke informatie is noodzakelijk alvorens een systeem te ontwerpen?
  • Begrippen en manieren om volume, snelheid, diversiteit en betrouwbaarheid te meten.
  • Hoe kan groei van gegevensverzamelingen worden geschat?
  • Gebruik van casestudy’s als voorbeeld.

Overzicht van Big Data-leveranciers en hun producten.

  • Accenture
  • APTEAN (voorheen CDC Software)
  • Cisco Systems
  • Cloudera
  • Dell
  • EMC
  • GoodData Corporation
  • Guavus
  • Hitachi Data Systems
  • Hortonworks
  • HP
  • IBM
  • Informatica
  • Intel
  • Jaspersoft
  • Microsoft
  • MongoDB (voorheen 10Gen)
  • MU Sigma
  • Netapp
  • Opera Solutions
  • Oracle
  • Pentaho
  • Platfora
  • Qliktech
  • Quantum
  • Rackspace
  • Revolution Analytics
  • Salesforce
  • SAP
  • SAS Institute
  • Sisense
  • Software AG/Terracotta
  • Soft10 Automation
  • Splunk
  • Sqrrl
  • Supermicro
  • Tableau Software
  • Teradata
  • Think Big Analytics
  • Tidemark Systems
  • Treeminer
  • VMware (onderdeel van EMC)

Vraag en antwoord sessie

Vereisten

  • Kennis van handhavingsprocessen en datasysteemarchitectuur
  • Basisbegrip van SQL/Oracle of relationele databases
  • Basiskennis van statistiek (op spreadsheetniveau)

Doelgroep

  • Handhavingsspecialisten met een technische achtergrond
 35 Uren

Aangepaste bedrijfsopleiding

Opleidingsoplossingen ontworpen exclusief voor bedrijven.

  • Aangepaste inhoud: We passen de syllabus en praktijkopdrachten aan naar de echte doelen en behoeften van uw project.
  • Voor flexibel schema: Datums en tijden aangepast aan het rooster van uw team.
  • Formaat: Online (live), In-company (bij uw kantoren) of Hybride.
Investering

Prijs per privégroep, online live training, startend vanaf 8000 € + BTW*

Neem contact met ons op voor een exacte offerte en om onze laatste promoties te horen

Reviews (3)

Voorlopige Aankomende Cursussen

Gerelateerde categorieën