Geschreven door studenten die geslaagd zijn Direct beschikbaar na je betaling Online lezen of als PDF Verkeerd document? Gratis ruilen 4,6 TrustPilot
logo-home
Document preview thumbnail
Voorbeeld 3 van de 22 pagina's
Samenvatting

Data Mining | Rode draad & samenvatting| UA |

Document preview thumbnail
Voorbeeld 3 van de 22 pagina's

Dit document bevat de rode draad en beknopte, overzichtelijke samenvatting voor Data Mining aan de Universiteit Antwerpen. Dit document bevat de 7 hoofdstukken die door professor Pieter Meysman zijn gegeven. Het document bevat de rode draad, samenvatting, wanneer & waarom we bepaalde technieken toepassen,.... Het is een handig document om rap dingen in op te zoeken/ terug te vinden tijdens het open boek examen en om de kernconcepten van de cursus goed te begrijpen.

Voorbeeld van de inhoud

DATA MINING
Chapter 1: Introduction
1. Visie en aanpak van de cursus
De focus van deze cursus ligt op het aanleren van vaardigheden boven passieve kennis.

2. De Realiteit van big data
"Big data" is een disruptieve trend waarbij conventionele computertechnieken niet langer volstaan vanwege de omvang en
complexiteit van de gegevens.
De Vier V's van big data:
 Volume: De enorme hoeveelheid data. Een enkel menselijk genoom geprint op papier (font 4) zou 43.000 karakters per
pagina beslaan en een gigantische stapel boeken vormen. De opslag bij instituten zoals EMBL-EBI bedraagt honderden
petabytes.
 Velocity (snelheid): De snelheid waarmee data binnenkomt. Denk aan sensoren in smartphones (GPS, barometer,
gyroscoop) of de enorme output van moderne DNA-sequencers. Er is een groeiende kloof tussen de hoeveelheid data
en de beschikbare IT-staf om dit te beheren.
 Variety (variëteit): Data is zeer divers en voor 80% ongestructureerd. Voorbeelden zijn DNA-sequenties,
eiwitstructuren, metabole netwerken en medische beelden.
 Veracity (geloofwaardigheid): Dit betreft de onzekerheid en ruis in de data. Data mining-modellen moeten rekening
houden met het feit dat data inherent onnauwkeurig kan zijn.

3. Fundamenten van data: objecten en features
Om data te kunnen analyseren, moet men begrijpen hoe deze is opgebouwd.
 Data-objecten: Ook wel samples, records, punten of entiteiten genoemd.
 Features: De kenmerken van een object, ook wel variabelen, attributen of velden genoemd.
Types features (Meetniveaus):
 Nominaal: Alleen onderscheid tussen waarden (bijv. oogkleur, ID-
nummers, geslacht).
 Ordinaal: Er is een specifieke volgorde (bijv. rankings van 1-10,
kledingmaten zoals tall/medium/short).
 Interval: Verschillen tussen waarden zijn betekenisvol (bijv.
kalenderdata, temperatuur in Celsius).
 Ratio: Er is een absoluut nulpunt en ratio's zijn betekenisvol (bijv.
gewicht, lengte, temperatuur in Kelvin).
Discreet vs. Continu:
 Discreet: Eindige of telbaar oneindige set waarden, vaak integers.
 Continu: Reële getallen als waarden, meestal weergegeven als
floating-point variabelen.

Data types:
1. Record data (gegevens in een rij, basic)
a. Data matrix
i. Kolommen zijn hier vaak nummerieke waarde (zoals lengte, gewicht)
b. Document data
i. Gevens omzetten in cijfers, bv pizza = 0, cola = 1, melk = 2,..
c. Translocation data
i. Lijst van dingen die samen horen, je kijkt naar een verameling, bv transactie 1 = brood, melk, cola

2. Graph
a. Protein interacties  edges & nodes
3. Ordered
a. Spatial data
i. Plaats, positie is belangrijk
b. Termpral data
i. Tijd, wanneer er een bepaalde gebeurtenis is
c. Sequentiial data
i. Volgorde is belangrijk, DNA seq bv
d. Molecular sequences

1

,4. Wat is data mining?
Data mining wordt gedefinieerd als de niet-triviale extractie van impliciete, voorheen onbekende en potentieel nuttige
informatie uit data. Het is het proces van het omzetten van ruwe informatie naar bruikbare kennis.
Het KDD-proces (Knowledge Discovery in Databases):
Dit proces verloopt in fasen: van ruwe data naar selectie, preprocessing (opschoning), transformatie, de eigenlijke data mining
en tot slot interpretatie en evaluatie. Een belangrijk principe hierbij is: "Garbage in is garbage out"; de kwaliteit van de
resultaten hangt af van de kwaliteit van de inputdata.

Relatie met statistiek:
Data mining is gerelateerd aan statistiek, maar niet hetzelfde.
 Statistiek: Gebruikt een toolbox om met onzekerheid om te gaan, verifieert hypotheses en werkt vaak met kleinere,
simpelere datasets.
o = probability theory
o 2 goals
 Description: data summaration
 Inference: extract information
 Data Mining: Is meer gericht op het ontdekken van nieuwe patronen en het genereren van hypotheses in grote,
complexe datasets.


5. Twee hoofdklassen van technieken (!!)
De technieken worden onderverdeeld op basis van het doel van de analyse:
A. Supervised learning (voorspelling)
Hierbij leert het model patronen uit gelabelde data om toekomstige waarden te voorspellen.
 Classificatie: Het voorspellen van een klasselabel (bijv. "is dit een kat of een hond?" of het diagnosticeren van tumoren
op basis van moleculaire profielen).
 Regressie: Het voorspellen van een continue waarde.
 Toepassing: Het ontdekken van diagnostische biomarkers of het voorspellen van bijwerkingen van infecties voor
vaccindesign.
B. Unsupervised learning (beschrijving)
Hierbij ontdekt de computer zelf interpreteerbare patronen in de data zonder vooraf bekende labels.
 Clustering: Het groeperen van objecten op basis van gelijkenis.
 Association rule analysis (market basket mining): Onderzoeken welke items vaak samen voorkomen (bijv. welke
producten vaak samen in een winkelmandje zitten).
 Uitdaging: Naarmate het aantal items toeneemt, groeit het aantal combinaties exponentieel. Bij 100 items zijn
er mogelijke sets, wat "slimme algoritmen" noodzakelijk maakt.
 Outlier detection: Het identificeren van atypische monsters, wat cruciaal is voor kwaliteitscontrole (QC) in bijvoorbeeld
proteomics.

6. Toepassingen en de AI-markt
Data mining is essentieel geworden in de business en geneeskunde.
 Bedrijven: Er is een enorme groei in AI-bedrijven die zich richten op healthcare en farma.
 Toekomst in het ziekenhuis: De rol van AI verschuift van puur onderzoek naar de kliniek, waar het direct zal
ondersteunen bij patiëntenzorg en diagnostiek.




2

, Chapter 2: Data processing
1. De filosofie van data-verwerking: Van rommel naar kennis
In de praktijk is data zelden direct klaar voor gebruik. Men start vaak met een verzameling heterogene bronnen: Excel-
spreadsheets, laboratoriumnotities, handgeschreven documenten en ruwe computerbestanden.
 De gewenste toestand: De ideale dataset voor data mining is schoon, genormaliseerd, gestructureerd, compleet,
consistent en niet-redundant.
 De vereiste vorm: De meeste algoritmen vereisen een sample x feature matrix.
 Rijen (samples/records): Elk object of individu dat wordt bestudeerd.
 Kolommen (features/attributen): De kenmerken van die objecten, bij voorkeur numeriek (ratio) of booleaans
(True/False) .

Het proces volgt de KDD-cyclus (Knowledge Discovery in Databases): Ruwe data wordt geselecteerd, gepreprocessed,
getransformeerd, gemined en uiteindelijk geïnterpreteerd om tot nieuwe inzichten, patronen of voorspellingen te komen. Het
principe "Garbage in, garbage out" is hier leidend: de kwaliteit van de output kan nooit de kwaliteit van de voorbehandelde
input overstijgen.

2. Typologie van data: structuur en vorm
Data kan worden ingedeeld op basis van de mate van organisatie:
A. Gestructureerde data
Deze gegevens zijn georganiseerd volgens een rigide datamodel dat de relaties tussen elementen vastlegt .
 Relationele Databases: Gegevens in tabellen met strikte regels (bijv. schooladministratiesystemen).
 Genexpressie-matrices: Een specifiek biologisch model waarbij genen worden uitgezet tegen monsters .
B. Ongestructureerde Data
Gegevens zonder vooraf gedefinieerd model, wat de analyse bemoeilijkt .
 Tekst: Wetenschappelijke publicaties (PubMed) of patiëntbrieven.
 Beelden: Medische scans (MRI) of weefselcoupes
 Vrije vorm: Handgeschreven examens of labnotities.

3. De Gereedschapskist: veelvoorkomende verwerkingsstappen
Om van ruwe naar bruikbare data te gaan, worden de volgende technieken toegepast:
I. Feature-extractie en transformatie
Dit is de kern van de voorbereiding. Het doel is om kenmerken te vinden die de meest relevante informatie vastleggen voor de
computer.
 Extractie: Het omzetten van kwalitatieve info naar kwantitatieve vragen. Bijvoorbeeld: de bloedgroep "A+" vertalen
naar booleaanse features zoals "Heeft A? TRUE", "Heeft B? FALSE", "Positief? TRUE" .
 Transformatie-functies: Het toepassen van wiskundige bewerkingen of absolute waarden.
o simple functions (log)
o Z-normalization (mean)
o IQR normalization (median)
II. Normalisatie-technieken
Normalisatie zorgt ervoor dat features met verschillende schalen (bijv. gewicht in kg vs. bloedwaarde in microgram)
vergelijkbaar zijn.
 Log-transformatie: Wordt gebruikt om data "normaler" te maken en multiplicatieve effecten (vaak voorkomend in de
biologie) om te zetten in additieve effecten, wat de lineariteit verbetert . –> makkelijk data vergelijken & outliers
spotten
 Z-normalisatie: Brengt het gemiddelde naar 0 en de standaarddeviatie naar 1 .
 IQR-normalisatie: Gebruikt de mediaan en de interkwartielafstand. Dit is essentieel wanneer de data veel uitschieters
bevat, omdat de mediaan minder wordt beïnvloed door extreme waarden dan het gemiddelde .

III. Discretisatie
Het opdelen van continue variabelen in categorieën of "bins" . = van de getallen groepjes maken
 Doel: Ruis verminderen, focussen op relevante intervallen en algoritmen gebruiken die niet met continue getallen
overweg kunnen .
 Strategieën:
o Uniforme width binning: Gelijke intervallen op de x-as, verdeelt de schaal in stukken van gelijke breedte
o Uniforme count binning: Elk interval bevat evenveel datapunten, bv 1e 25%, volgende 25%,…


3

Documentinformatie

Geüpload op
15 juni 2026
Aantal pagina's
22
Geschreven in
2025/2026
Type
Samenvatting
€6,06

Verkeerd document? Gratis ruilen Binnen 14 dagen na aankoop en voor het downloaden kan je een ander document kiezen. Je kan het bedrag gewoon opnieuw besteden.
Geschreven door studenten die geslaagd zijn
Direct beschikbaar na je betaling
Online lezen of als PDF

Verkocht
1
Volgers
0
Items
4
Laatst verkocht
1 maand geleden


Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Kwaliteit die je kunt vertrouwen: geschreven door studenten die slaagden en beoordeeld door anderen die dit document gebruikten.

Niet tevreden? Kies een ander document

Geen zorgen! Je kunt voor hetzelfde geld direct een ander document kiezen dat beter past bij wat je zoekt.

Betaal zoals je wilt, start meteen met leren

Geen abonnement, geen verplichtingen. Betaal zoals je gewend bent via Bancontact, iDeal of creditcard en download je PDF-document meteen.

Student with book image

“Gekocht, gedownload en geslaagd. Zo eenvoudig kan het zijn.”

Alisha Student

Bezig met je bronvermelding?

Maak nauwkeurige citaten in APA, MLA en Harvard met onze gratis bronnengenerator.

Bezig met je bronvermelding?

Veelgestelde vragen