Written by students who passed Immediately available after payment Read online or as PDF Wrong document? Swap it for free 4.6 TrustPilot
logo-home
Document preview thumbnail
Preview 3 out of 22 pages
Summary

Data Mining | Rode draad & samenvatting| UA |

Document preview thumbnail
Preview 3 out of 22 pages

Dit document bevat de rode draad en beknopte, overzichtelijke samenvatting voor Data Mining aan de Universiteit Antwerpen. Dit document bevat de 7 hoofdstukken die door professor Pieter Meysman zijn gegeven. Het document bevat de rode draad, samenvatting, wanneer & waarom we bepaalde technieken toepassen,.... Het is een handig document om rap dingen in op te zoeken/ terug te vinden tijdens het open boek examen en om de kernconcepten van de cursus goed te begrijpen.

Content preview

DATA MINING
Chapter 1: Introduction
1. Visie en aanpak van de cursus
De focus van deze cursus ligt op het aanleren van vaardigheden boven passieve kennis.

2. De Realiteit van big data
"Big data" is een disruptieve trend waarbij conventionele computertechnieken niet langer volstaan vanwege de omvang en
complexiteit van de gegevens.
De Vier V's van big data:
 Volume: De enorme hoeveelheid data. Een enkel menselijk genoom geprint op papier (font 4) zou 43.000 karakters per
pagina beslaan en een gigantische stapel boeken vormen. De opslag bij instituten zoals EMBL-EBI bedraagt honderden
petabytes.
 Velocity (snelheid): De snelheid waarmee data binnenkomt. Denk aan sensoren in smartphones (GPS, barometer,
gyroscoop) of de enorme output van moderne DNA-sequencers. Er is een groeiende kloof tussen de hoeveelheid data
en de beschikbare IT-staf om dit te beheren.
 Variety (variëteit): Data is zeer divers en voor 80% ongestructureerd. Voorbeelden zijn DNA-sequenties,
eiwitstructuren, metabole netwerken en medische beelden.
 Veracity (geloofwaardigheid): Dit betreft de onzekerheid en ruis in de data. Data mining-modellen moeten rekening
houden met het feit dat data inherent onnauwkeurig kan zijn.

3. Fundamenten van data: objecten en features
Om data te kunnen analyseren, moet men begrijpen hoe deze is opgebouwd.
 Data-objecten: Ook wel samples, records, punten of entiteiten genoemd.
 Features: De kenmerken van een object, ook wel variabelen, attributen of velden genoemd.
Types features (Meetniveaus):
 Nominaal: Alleen onderscheid tussen waarden (bijv. oogkleur, ID-
nummers, geslacht).
 Ordinaal: Er is een specifieke volgorde (bijv. rankings van 1-10,
kledingmaten zoals tall/medium/short).
 Interval: Verschillen tussen waarden zijn betekenisvol (bijv.
kalenderdata, temperatuur in Celsius).
 Ratio: Er is een absoluut nulpunt en ratio's zijn betekenisvol (bijv.
gewicht, lengte, temperatuur in Kelvin).
Discreet vs. Continu:
 Discreet: Eindige of telbaar oneindige set waarden, vaak integers.
 Continu: Reële getallen als waarden, meestal weergegeven als
floating-point variabelen.

Data types:
1. Record data (gegevens in een rij, basic)
a. Data matrix
i. Kolommen zijn hier vaak nummerieke waarde (zoals lengte, gewicht)
b. Document data
i. Gevens omzetten in cijfers, bv pizza = 0, cola = 1, melk = 2,..
c. Translocation data
i. Lijst van dingen die samen horen, je kijkt naar een verameling, bv transactie 1 = brood, melk, cola

2. Graph
a. Protein interacties  edges & nodes
3. Ordered
a. Spatial data
i. Plaats, positie is belangrijk
b. Termpral data
i. Tijd, wanneer er een bepaalde gebeurtenis is
c. Sequentiial data
i. Volgorde is belangrijk, DNA seq bv
d. Molecular sequences

1

,4. Wat is data mining?
Data mining wordt gedefinieerd als de niet-triviale extractie van impliciete, voorheen onbekende en potentieel nuttige
informatie uit data. Het is het proces van het omzetten van ruwe informatie naar bruikbare kennis.
Het KDD-proces (Knowledge Discovery in Databases):
Dit proces verloopt in fasen: van ruwe data naar selectie, preprocessing (opschoning), transformatie, de eigenlijke data mining
en tot slot interpretatie en evaluatie. Een belangrijk principe hierbij is: "Garbage in is garbage out"; de kwaliteit van de
resultaten hangt af van de kwaliteit van de inputdata.

Relatie met statistiek:
Data mining is gerelateerd aan statistiek, maar niet hetzelfde.
 Statistiek: Gebruikt een toolbox om met onzekerheid om te gaan, verifieert hypotheses en werkt vaak met kleinere,
simpelere datasets.
o = probability theory
o 2 goals
 Description: data summaration
 Inference: extract information
 Data Mining: Is meer gericht op het ontdekken van nieuwe patronen en het genereren van hypotheses in grote,
complexe datasets.


5. Twee hoofdklassen van technieken (!!)
De technieken worden onderverdeeld op basis van het doel van de analyse:
A. Supervised learning (voorspelling)
Hierbij leert het model patronen uit gelabelde data om toekomstige waarden te voorspellen.
 Classificatie: Het voorspellen van een klasselabel (bijv. "is dit een kat of een hond?" of het diagnosticeren van tumoren
op basis van moleculaire profielen).
 Regressie: Het voorspellen van een continue waarde.
 Toepassing: Het ontdekken van diagnostische biomarkers of het voorspellen van bijwerkingen van infecties voor
vaccindesign.
B. Unsupervised learning (beschrijving)
Hierbij ontdekt de computer zelf interpreteerbare patronen in de data zonder vooraf bekende labels.
 Clustering: Het groeperen van objecten op basis van gelijkenis.
 Association rule analysis (market basket mining): Onderzoeken welke items vaak samen voorkomen (bijv. welke
producten vaak samen in een winkelmandje zitten).
 Uitdaging: Naarmate het aantal items toeneemt, groeit het aantal combinaties exponentieel. Bij 100 items zijn
er mogelijke sets, wat "slimme algoritmen" noodzakelijk maakt.
 Outlier detection: Het identificeren van atypische monsters, wat cruciaal is voor kwaliteitscontrole (QC) in bijvoorbeeld
proteomics.

6. Toepassingen en de AI-markt
Data mining is essentieel geworden in de business en geneeskunde.
 Bedrijven: Er is een enorme groei in AI-bedrijven die zich richten op healthcare en farma.
 Toekomst in het ziekenhuis: De rol van AI verschuift van puur onderzoek naar de kliniek, waar het direct zal
ondersteunen bij patiëntenzorg en diagnostiek.




2

, Chapter 2: Data processing
1. De filosofie van data-verwerking: Van rommel naar kennis
In de praktijk is data zelden direct klaar voor gebruik. Men start vaak met een verzameling heterogene bronnen: Excel-
spreadsheets, laboratoriumnotities, handgeschreven documenten en ruwe computerbestanden.
 De gewenste toestand: De ideale dataset voor data mining is schoon, genormaliseerd, gestructureerd, compleet,
consistent en niet-redundant.
 De vereiste vorm: De meeste algoritmen vereisen een sample x feature matrix.
 Rijen (samples/records): Elk object of individu dat wordt bestudeerd.
 Kolommen (features/attributen): De kenmerken van die objecten, bij voorkeur numeriek (ratio) of booleaans
(True/False) .

Het proces volgt de KDD-cyclus (Knowledge Discovery in Databases): Ruwe data wordt geselecteerd, gepreprocessed,
getransformeerd, gemined en uiteindelijk geïnterpreteerd om tot nieuwe inzichten, patronen of voorspellingen te komen. Het
principe "Garbage in, garbage out" is hier leidend: de kwaliteit van de output kan nooit de kwaliteit van de voorbehandelde
input overstijgen.

2. Typologie van data: structuur en vorm
Data kan worden ingedeeld op basis van de mate van organisatie:
A. Gestructureerde data
Deze gegevens zijn georganiseerd volgens een rigide datamodel dat de relaties tussen elementen vastlegt .
 Relationele Databases: Gegevens in tabellen met strikte regels (bijv. schooladministratiesystemen).
 Genexpressie-matrices: Een specifiek biologisch model waarbij genen worden uitgezet tegen monsters .
B. Ongestructureerde Data
Gegevens zonder vooraf gedefinieerd model, wat de analyse bemoeilijkt .
 Tekst: Wetenschappelijke publicaties (PubMed) of patiëntbrieven.
 Beelden: Medische scans (MRI) of weefselcoupes
 Vrije vorm: Handgeschreven examens of labnotities.

3. De Gereedschapskist: veelvoorkomende verwerkingsstappen
Om van ruwe naar bruikbare data te gaan, worden de volgende technieken toegepast:
I. Feature-extractie en transformatie
Dit is de kern van de voorbereiding. Het doel is om kenmerken te vinden die de meest relevante informatie vastleggen voor de
computer.
 Extractie: Het omzetten van kwalitatieve info naar kwantitatieve vragen. Bijvoorbeeld: de bloedgroep "A+" vertalen
naar booleaanse features zoals "Heeft A? TRUE", "Heeft B? FALSE", "Positief? TRUE" .
 Transformatie-functies: Het toepassen van wiskundige bewerkingen of absolute waarden.
o simple functions (log)
o Z-normalization (mean)
o IQR normalization (median)
II. Normalisatie-technieken
Normalisatie zorgt ervoor dat features met verschillende schalen (bijv. gewicht in kg vs. bloedwaarde in microgram)
vergelijkbaar zijn.
 Log-transformatie: Wordt gebruikt om data "normaler" te maken en multiplicatieve effecten (vaak voorkomend in de
biologie) om te zetten in additieve effecten, wat de lineariteit verbetert . –> makkelijk data vergelijken & outliers
spotten
 Z-normalisatie: Brengt het gemiddelde naar 0 en de standaarddeviatie naar 1 .
 IQR-normalisatie: Gebruikt de mediaan en de interkwartielafstand. Dit is essentieel wanneer de data veel uitschieters
bevat, omdat de mediaan minder wordt beïnvloed door extreme waarden dan het gemiddelde .

III. Discretisatie
Het opdelen van continue variabelen in categorieën of "bins" . = van de getallen groepjes maken
 Doel: Ruis verminderen, focussen op relevante intervallen en algoritmen gebruiken die niet met continue getallen
overweg kunnen .
 Strategieën:
o Uniforme width binning: Gelijke intervallen op de x-as, verdeelt de schaal in stukken van gelijke breedte
o Uniforme count binning: Elk interval bevat evenveel datapunten, bv 1e 25%, volgende 25%,…


3

Document information

Study
Uploaded on
June 15, 2026
Number of pages
22
Written in
2025/2026
Type
Summary
$7.20

Wrong document? Swap it for free Within 14 days of purchase and before downloading, you can choose a different document. You can simply spend the amount again.
Written by students who passed
Immediately available after payment
Read online or as PDF

Sold
1
Followers
0
Items
4
Last sold
1 month ago


Why students choose Stuvia

Created by fellow students, verified by reviews

Quality you can trust: written by students who passed their exams and reviewed by others who've used these revision notes.

Didn't get what you expected? Choose another document

No problem! You can straightaway pick a different document that better suits what you're after.

Pay as you like, start learning straight away

No subscription, no commitments. Pay the way you're used to via credit card and download your PDF document instantly.

Student with book image

“Bought, downloaded, and smashed it. It really can be that simple.”

Alisha Student

Working on your references?

Create accurate citations in APA, MLA and Harvard with our free citation generator.

Working on your references?

Frequently asked questions