Bachelor Psychologie
Vrije Universiteit Brussel
Bachelor Psychologie
STATISTIEK IV:
Multivariate Data-Analyse
Prof. Olivier Mairesse
Academiejaar 2025-2026
Samenvatting door Sara Vanderwegen
Samenvatting door Sara Vanderwegen
Samenvatting SVDW 1
,Hoorcollege 1: Inleiding
1) Waarom data-analyse?
- Data-analyse = noodzakelijk voor psychologen
o Maakt inherent deel uit van het wetenschappelijk
proces
o Begrip van + kritische instelling tegenover
vakliteratuur
▪ Cf. data-analyse in de media
- Vaak heb je een bepaalde onderzoeksvraag (gegenereerd op
literatuur of op een empirisch probleem)
o Hier ga je een theorie rond maken (deze verwoord je in hypothesen)
o We gaan variabelen identificeren die we gaan bekijken/onderzoeken
o We gaan meten en data verzamelen
▪ Belangrijk om naar je data je kijken!!!
• Hoe ziet het eruit, zijn er gaten, is het juist gecodeerd?
- Data-analyse hebt je om:
o Data te organiseren (grafieken,…)
o Data te beschrijven (beschrijvende/deductieve statistiek, samenvatten)
o Interpreteren en uitspraken doen op basis van data (inferentiële/inductieve
statistiek, verklaren)
o Theorieën te verifiëren en aan te passen
▪ Theorieën testen, nieuwe theorieën ontwikkelen
Hoorcollege 1: Verkennen van data
- De meeste statistische technieken maken deel uit van het general lineair model
(anova, regressie)
o We gaan ervanuit dat er een lineaire relatie is tussen variabelen (er zijn dus
bepaalde assumpties)
▪ MAAR vaak is de data niet lineair, maar toch willen we deze via
lineaire technieken gaan analyseren
• Vaak gaan we dan onze data moeten transformeren
1) Grafisch verkennen van data
- Je hebt meerdere grafische voorstellingen
o Histogram
o Stam/blad diagram
o Box plot
→ deze geven een globaal zicht
- Een beeld zegt vaak meer dan woorden
Samenvatting
o SVDW
Vaak kan je adhv grafische voorstellingen al patronen in de data waarnemen 2
, - Een grafiek (Tufte, 2001):
o Onthult data: laat de gegevens zien zoals ze zijn.
Laat de lezer nadenken over de gepresenteerde data en schept (statistische)
verwachtingen
o Vat data samen en maakt grote datasets coherent.
Moedigt de lezer aan om verschillende gegevens te vergelijken.
o Voorbeeld: zie slide 21-22
- Een boxplot
o Geeft info over positie, spreiding, symmetrie
o Als perfect normaal verdeeld: dan valt het
gemiddelde samen met de mediaan
o Als gemiddelde boven of onder mediaan ligt
(zoals hier het geval is); dan is de verdeling
scheef verdeeld (skewness)
▪ Als scheef verdeeld: assumptie geschonden → vaak ga je je data
moeten transformeren
- Een histogram
o Geeft info over normaliteit van de verdeling
- Een scatterplot
o Hiermee kan je ook inzicht krijgen in de verdeling,
lineariteit, patronen en outliers in je data
o Voorbeeld: zie slide 30-31
- Kies een presentatiemethode die het begrip van de data optimaliseert
o Als je drie of minder getallen
presenteert, probeer dan een zin te
gebruiken
o Als je meer dan 20 getallen moet
presenteren, is een grafiek vaak nuttiger
dan een tabel, behalve wanneer het
nuttig is om “alle” info te kunnen
achterhalen (vb. ANOVA tabel)
- → hou rekening met het concept van
parsimonie = zo veel mogelijk data verklaren,
met zo min mogelijk parameters
Samenvatting SVDW 3
, 2) Analyse van ontbrekende data (missing data)
Missing data = ontbrekende waarden voor 1 of meerdere variabelen
- Oorzaak?
o Onafhankelijk van respondent
▪ Procedure (e.g., Indien “nee”, ga naar vraag xxx → “branching”)
▪ Codeerfouten
o Afhankelijk van de respondent
▪ Omvang? (veel of weinig)
▪ Analyse van het profiel van missing data (is er systematiek of
random?)
o → afhankelijk de van oorzaak, ga je hier ander mee om
▪ Het kan dus afhankelijk zijn van de persoon (respondent heeft weinig
ingevuld), maar het kan ook afhangen van uw variabele zelf (bv
sensitieve data)
- Impact missing data
o Praktische impact
▪ Reductie steekproefgrootte (listwise deletion; vb. Antarctica data)
• Als je alle cases met missing data verwijdert, hoe je minder
observaties over
▪ Indien te veel: N vergroten of remediëren (zie verder)
• Je kan eventueel data bij elkaar nemen; maar hierdoor verlies
je fijnmatigheid, de sampling frequency wordt kleiner
o Vaak ook reductie van spreiding
o Nonrandom missingness
▪ Bias!
• Er kan een systematische bias zitten in de missing data (bv.:
mensen gaan niet snel aangeven dat ze drugs doen, je zal dus
geen antwoord krijgen op deze vraag)
▪ Specifieke groepen uitgesloten uit analyse (vb. hoge inkomens)
▪ Merk je pas op als je missing data hebt bestudeerd
• Je moet de missing data actief analyseren
Samenvatting SVDW 4