Leerdoelen KCO I
1. R toepassen bij het inlezen en analyseren van data;
2. Op een basisniveau programmeren/coderen in RStudio om univariate en bivariate analyses uit
te kunnen voeren;
3. Toetsbare hypothesen formuleren en uitvoeren (bij criminologische vraagstukken);
4. Aan de hand van een gegeven onderzoeksvraag de juiste statistische toets kiezen en de
voorwaarden (assumpties) kunnen benoemen waaraan voldaan moet zijn om die toets uit te
kunnen voeren;
5. Verschillende statistische technieken van sociaalwetenschappelijk onderzoek begrijpen en
toepassen op voorbeelden (uit de criminologische onderzoekspraktijk);
6. Univariate en bivariate analyseresultaten van R interpreteren en op basis daarvan een juiste
conclusie trekken over een hypothese;
7. Onderzoeksresultaten vertalen naar een visuele representatie.
Deze leerdoelen zijn geformuleerd op dezelfde volgorde als die aangehouden worden volgens de
stappen van NHST (wordt later uitgelegd) die gebruikt wordt om opdrachten te maken.
De basis van RStudio
RStudio maakt gebruik van packages, stukjes in een programma die verschillende functies hebben
en dus verschillende opdrachten kunnen uitvoeren. Deze packages moeten eerst geïnstaleerd
worden en vervolgens opgehaald worden uit de library om gebruikt te kunnen worden.
Package installeren
install.packages('naampackage')
Package inladen
library(naampackage)
Operators
Operators zijn tekens die in RStudio vaak staan voor wiskundige opdrachten
+ #optellen
- #aftrekken
* #vermenigvuldingen
/ #delen
^ #exponentieel
sqrt(x) #wortel
Volledige samenvatting KCO I 1
, < #minder dan
<= #minder dan of gelijk aan
> #groter dan
>= #grpter dan of gelijk aan
== #exact gelijk aan
!= #niet gelijk aan
!x #niet x
x|y #x of y
x & y #x en y
is.na(x) #toont TRUE als x een missende waarde NA betreft
!is.na(x) #toont TRUE als x geen missende waarde NA betref
Data inlezen
We gebruiken RStudio om datasets te interpreteren om tot conclusies te komen die onze
onderszoeksvraag kunnen beantwoorden. Hiervoor moet de data eerst ingelezen worden. Data die je
in wilt lezen moet in dezelfde map staan als het bestand waarin je werkt (voor de werkgroepen vaak
een RMarkdownbestand zoals gedownload vanuit Brightspace).
##Datasets worden — ook in het boek — soms tibbles genoemd. Ik gebruik hier de naam dataset
omdat het meer tot de verbeelding spreekt en omdat in de opdrachten vaak gevraagd zal worden
naar data, niet naar tibbles.
naam_dataset <- read.csv('naamcsv_bestand')
In één van de latere werkgroepen in dit vak werd ook gebruik gemaakt van een SPSS ofwel .sav
bestand. De code hiervoor ziet er ongeveer hetzelfde uit, maar hier zet je _df achter de naam die je
het databestand wilt geven.
naam_dataset_df <- read_sav('naamsav_bestand')
Extreme outliers
Soms bevat een dataset scores of antwoorden van respondenten die ver afwijken van de andere
antwoorden. Dit zijn outliers. Extreme outliers kunnen een grote invloed hebben op bijvoorbeeld
het gemiddelde van de resultaten en de uitkomsten van statistische toetsen.
Een mogelijkheid om deze invloedrijke outliers te verwerken is door de scores te verantwoorden in
‘NA’, oftwel ‘No Answer’.
naam_dataset <- naam_dataset |>
mutate(naamvariabele = replace_values(naamvariabele, outliernumber
~ NA))
Het is vaak statistisch onverantwoord om deze outliers op deze manier te verwijderen, omdat
hierdoor de statistische power minder wordt. Er worden namelijk minder observaties getoetst. Er
bestaan nog twee andere methoden die gebruikt kunnen worden om met invloedrijke outliers om te
gaan.
Volledige samenvatting KCO I 2
, 1. Winsoring: outliers worden vervangen door de meest dichtbijzijnde score, waardoor het aantal
observaties gelijk blijft en de outlier beter past bij de andere scores in de dataset.
2. Robuuste schatting van het model: bij een robuust lineair model wordt een alternatieve
schatting van een mogelijke regressielijn gegeven die minder afhankelijk is van parametrische
assumpties (zoals bijvoorbeeld de normaalverdeling van de scores). Deze lijn wordt ook minder
beïnvloedt door invloedrijke outliers.
Voor een tentamen moet je beide methoden kennen en weten wat ze inhouden, er staat niets
aangegeven over mogelijke RStudio codes voor deze twee methoden.
Data bewerking - codeblad
Er bestaan nog veel meer codes die de dataset of delen daarvan kunnen bewerken en verhelderen.
De codes hiervoor staan op het codeblad dat beschikbaar zal zijn op het tentamen.
Week 1 - Waarom statistiek?
Statistiek is bedoelt om uitspraken te doen over de werkelijkheid en deze te verklaren, maar: je kunt
nooit de hele werkelijkheid meten
Werkelijkheid = statistisch model + foutmarge
Een uitspraak over de hele populatie is niet mogelijk, dus —> steekproef
Kwaliteit en grootte van de steekproef beïnvloeden generaliseerbaarheid
Bij het bepalen van een steekproefgrootte kan de power berekend worden = de kans dat een effect in
de werkelijkheid wordt gevonden als deze in de steekproef gevonden wordt. Dit hangt af van:
Grootte van de effecten in de populatie: groter effect —> hogere power
Strengheid van de alfa (wordt later behandeld, is meestal 0,5): kleinere alfa —> lagere power
Steekproefgrootte (uitgedrukt in N), aantal respondenten: grotere steekproef —> hogere power
Populatieparameters = meetbare waardes van een populatie die we willen schatten op basis van
steekproef data
Stap 1 in analyse - data verkennen
Frequentieverdelingen
Frequentie = aantal keer dat een bepaalde waarde van een variabelen voorkomt in de verzamelde
data
Een vraag/item wordt in een model omgezet tot variabele in de dataset
Histogram = frequentieverdeling in een figuur
Het maken en interpreteren van een histogram kan handig zijn om:
Fouten te ontdekken in de data (bijv. typefouten bij invoer/vragenlijst)
Te checken of iedereen alle vragen heeft ingevuld (item-missings)
De onderzoeksgegevens samen te vatten (zonder diepere analyses of conclusies)
Volledige samenvatting KCO I 3
, Normaalverdeling
Wanneer een histogram normaal verdeeld is zal deze symmetrisch en klokvormig zijn. Een
histogram kan ook een afwijkende symmetrie of vorm hebben.
Afwijking symmetrie = skewness / scheefheid
- Links scheef / negative skew = langere staart (tail) links
- Rechts scheef / positive skew = langere staart (tail) rechts
Afwijking in puntigheid/klokvorm = kurtosis
- Platykurtic = kortere staart, vaak platter, kurtosis = <0
- Mesokurtic = standaard verdeling, kurtosis = 0
- Leptokurtic = langere staart, vaak spitser, kurtosis = >0
Meetniveau’s
Voor veel statistische toetsen en voor de interpretatie van data is van belang welk meetniveau een
bepaalde variabele is.
Nominaal = categorieën zonder logische volgorde of rangschikking (bijv. geslacht, woonplaats, etc.)
Ordinaal = categorieën én logishce volgorde, maar afstanden tussen waardes zijn niet gelijk of
hebben geen betekenis (ranglijst, beoordeling met sterren of cijfers, vaak subjectieve
waardetoekenning)
Interval = categorieën én logische volgorde én gelijke afstanden tussen waardes, maar geen
duidelijk of betekenisvol nulpunt (bijv. temperatuur in Celcius, kan altijd blijven dalen of stijgen)
Ratio = categorieën én logische volgorde én gelijke afstanden tussen waardes én duidelijk nulpunt,
waarbij nul een afwezigheid betekent (bijv. lengte, gewicht, inkomen, etc.)
Stap 2 in analyse - data beschrijven
Centrale tendentie
Centrummaten = maten om data samen te vatten of om het midden van de verdeling aan te geven
Bij een normaal verdeling liggen de modus, mediaan en het gemiddelde allemaal op dezelfde plek.
Modus = meest voorkomende waarde
Nadelen: Voordelen:
Mogelijk meer dan één modus (bimodaal = Makkelijk te bepalen/uit te rekenen
2, mutlimodaal = >2)
Kan ook voor elke variabele gebruikt
Bij lage kurtosis/puntigheid kunnen een worden (ook op nominaal meetniveau)
paar waarnemingen de waarde van de
modus al beïnvloeden
Zegt weinig over de hele scoreverdeling,
maar alleen over veelvoorkomende scores
Mediaan = middelste waarde in een frequentieverdeling
Nadelen: Voordelen:
Kleine steekproefstabiliteit
Volledige samenvatting KCO I 4