Chapter 1
Individuelen/experimentele eenheden: objecten of eenheden bepaald door de data (mensen
zijn, dieren, planten of dingen)
Variabele: eigenschap van een individu. Een variabele kan voor verschillende individuen
verschillende waarden aannemen. (leeftijd, geslacht, bloedgroep, kleur)
Categorische/kwalitatieve variabele (uitspraak): plaatst een individu in één van meerdere
groepen of categorieën. Beperkt aantal waardes die het kan aannemen. Geven een
eigenschap of categorie weer. Kan geen berekening mee worden gemaakt (vb: geslacht bij
geboorte -> man of vrouw, bloedgroep -> A/B/AB of O, kleur van een bloem -> wit, blauw,
rood)
Geef je weer in staafdiagrammen/taartdiagram
Kwantitatieve variabele (cijfers): een eigenschap die je in getallen kunt uitdrukken, zodat je
er berekeningen zoals optellen of gemiddeldes mee kunt doen. Meestal noteer je deze
waardes met een maat, zoals seconde of kilogram. Ze geven een hoeveelheid of meting aan.
(vb: leeftijd in jaren, bloeddruk, lengte, aantal kinderen, inkomen in euro’s )
Geef je weer in Histogram, stipdiagram, stam/blad diagram, lijndiagram
- Discreet: kunnen alleen bepaalde (gehele) waardes aannemen, tussen twee waarde
zit geen betekenisvolle waarde (aantal kinderen, aantal telefoon gesprekken)
- continue: kunnen elke waarde binnen een interval meten, tussen twee waarde kan je
altijd nog een waarde vinden (lengte, gewicht, temperatuur)
Patiënt diagnose Leeftijd van overlijden
A hartfalen 87
B longkanker 79
Vb) hierboven in de tabel zie je dat het individu een mens is, diagnose is een categorische
variabelen en leeftijd een kwantitatieve variabelen.
Absolute frequenties: groepen waarnemingen hebt van groepen die even groot zijn of van
één groep.
Relatieve frequenties: groepen zijn niet even groot. Procentueel zie je makkelijker verschil
tussen groepen
,Kwalitatieve data -
- Taart diagram: één variabelen weergeven
- Staafdiagram: de hoogte van de staaf geeft de frequentie aan. De frequentie kan
absoluut zijn, gebruik je bij waarnemingen van groepen die even groot zij of wanneer
je maar 1 groep hebt waargenomen. Relatieve gebruik je bij groepen met
verschillende groten.
Kwantitatieve data:
- Dotplot Leafplot: ruwe data, geschikt voor kleinere data, anders onoverzichtelijk
(leafplot)
- Lijndiagram: data weergeven van meerdere individuen en 1 variabelen (bij een
betekenisvolle reeks, zoals tijd)
- Histogram: grotere data sets, manier om 1 variabelen weer te geven en te kijken hoe
de verdeling is (bijv de spreiding is en of er uitbijters zijn, iets minder nauwkeurig)
Verdelingen: symmetrische, rechtsscheve (staart naar rechts), linksscheve (staart naar links)
Uitbijters: ze liggen buiten het patroon, altijd kunnen uitleggen. Klopt het wel?
Interpretatie histogram
Je kan wat zeggen over:
- Vorm
- Centrum (gemiddelde)
- Spreiding
- Uitbijters (altijd kijken naar uitbijters en deze uitleggen)
,Chapter 2
Gemiddelde (centrum/locatie): alle kwantitatieve variabelen bij elkaar optellen en delen
voor het aantal individuen
Vb) 12 + 23 + 31 = 66 66 : 3 = 22
Mediaan (centrum/locatie): middelste waarneming je zet je waarnemingen in volgorde,
de middelste is de mediaan. Bij een even aantal waarnemingen kan je de middelste twee
getallen het gemiddelde van nemen. (n+1)/2)
Vb)
Mediaan en gemiddelde vergelijken:
- Symmetrische verdeling: mediaan en gemiddelde dezelfde waarde
- Rechts scheve verdeling: gemiddelde is hoger dan mediaan, want het wordt beïnvloed
door de andere waardes.
- Links scheve verdeling: gemiddelde is lager dan de mediaan, het gemiddelde wordt
naar beneden getrokken door die paar lage waardes. Een mediaan wordt er niet door
beïnvloed. (eerlijke weergave data)
Bij een scheve verdeling gebruik je altijd de mediaan omdat deze minder gevoelig is
voor de scheefheid.
Quartielen (spreiding)
Q1: 25% boven, 75% onder (mediaan berekenen van onderste variabelen)
Mediaan: 50% boven, 50% onder
Q3: 75% boven, 25% onder (mediaan berekenen van bovenste variabelen)
Quartielafstand: IQR = Q3 – Q1
Geeft aan waar tussen het grootst van je waarnemingen ligt
, Standaarddeviatie (spreidingsmaat): beschrijft hoeveel de waarden afwijken van de
mediaan of gemiddelde. Je kan positief en negatief afwijken.
Alle waarnemingen zijn Standaarddeviatie = 0 Geen afwijking van het
gelijk gemiddelde
Waarnemingen verschillen Standaarddeviatie > 0 Afwijkingen worden
gekwadrateerd variantie
positief
Definitie SD (standaarddeviatie) = Wortel uit altijd positieve
wortel van de variantie variantie
Formules SD:
Boxplot zegt wat over:
- Spreiding van je data
- Verdeling van je data
- Je kan er uitbijters mee signaleren
Uitbijters
Een uitbijter is een waarde die sterk afwijkt van de rest van de data. Statistisch is het een
waarde die ligt meer dan 1,5 x de IQR (of meer dan 3 standaarddeviaties van het
gemiddelde)
Kan invloed hebben op:
- Gemiddelde (kan sterk omhoog of juist omlaag worden getrokken
- Standaarddeviatie (wordt groter door een extreme waarde)
- Uitkomst van analyses (zoals regressie en correlatie)
Wat kan het betekenen:
- Meetfout
- Zeldzame gebeurtenis (het is echt, maar komt weinig voor)
- Belangrijke afwijking
- Vertekend datapunt (past niet binnen de populatie)