Overzicht R
Statistiek II
Dataverwerking en beschrijvende statistiek
Importeren van gegevens
# lokale installatie op MacOS in map Downloads
bus <- read.csv("~/Downloads/bus2016.csv", sep=";", stringsAsFactors=TRUE
# lokale installatie op Windows, data op C-schijf in map Temp
bus <- read.csv("C:/Temp/bus2016.csv", sep=";", stringsAsFactors=TRUE)
covid19 <- read.csv("C:/Temp/covid19.csv", sep=";")
unicef <- read.csv("C:/Temp/unicef.csv", sep=";")
Structuur opvragen
str(bus)
Samenvatting opvragen
summary(bus)
Waarde van specifieke cel opvragen/meerdere rijen of kolommen
bus[9,5]
bus[9,"kilometers"]
Om meerdere rijen/kolommen op te vragen. “De leeftijd en het kleur van
busjes 7 – 10”.
bus[7:10,c("leeftijd","kleur")]
bus[c(1,4,8,9),c("merk","kilometers","prijs")]
bus[c(1,4,8,9),]
bus[,c("merk","kilometers","prijs")]
Nieuwe variabele invoeren
bus$kmjaar <- bus$kilometers/bus$leeftijd
of
bus$brutoprijs <- bus$prijs
bus$brutoprijs[bus$btwincl=="nee"] <- bus$brutoprijs[bus$btwincl=="nee"] *
1.21
Kleur is een factorvariabel en kan het level “speciaal” dus niet aannemen,
daarom moet deze eerst terug worden omgezet naar een karakter variabele
bus$hoofdkleur <- as.character(bus$kleur)
bus$hoofdkleur[bus$kleur!="wit" & bus$kleur!="zwart"] <- "speciaal"
bus$hoofdkleur <- as.factor(bus$hoofdkleur)
Histogram
hist(bus$kmjaar,main="Kilometers per jaar")
Boxplot
Boxplot voor 1 variabele
Boxplot(bus$kmjaar,main="Kilometers per jaar")
Boxplot voor 2 variabelen
boxplot(brutoprijs~kleur,data=bus)
, boxplot(kilometers~verkoper,data=bus)
Titel invoeren
boxplot(brutoprijs~merk,data=bus)
title(main="Brutoprijs per merk")
Gemiddelde
mean(bus$kmjaar)
Indien de uitkomst NA zou geven kunnen we volgende functie toevoegen
mean(bus$stoelen,na.rm=TRUE)
Mediaan
median(bus$kmjaar)
Standaardafwijking
sd(bus$kilometers)
Percentiel (80%)
quantile(bus$kilometers,0.8)
Gelijkheid/Verschil nagaan
bus$merk=="Nissan"
bus$kmjaar[bus$merk=="Nissan"]
Percentage nagaan
mean(bus$locatie>=9000)
Voorwaarden toevoegen
sum(bus$merk=="Renault" & bus$kilometers<=100000)
mean(bus$kilometers[(bus$airco=="ja" | bus$kleur=="wit") &
bus$merk=="Opel"])
met logische operatoren: & (en), | (of), ! (niet) en xor (exclusieve of)
Frequentie bepalen met een tabel
table(bus$verkoper)
De frequentietabel kan je ook bewaren en later bijvoorbeeld bepalen bij
welk kleur de frequentie het grootst is en hoeveel die bedraagt.
x <- table(bus$kleur)
x[x==max(x)]
Staafdiagram
barplot(table(bus$kleur))
staafdiagram ordenen van groot naar klein:
barplot(sort(table(bus$kleur),decreasing=TRUE))
De functie tapply
Met tapply kan je functies (bv. Mean, median, …) ineens toepassen op
meerdere variabelen zonder telkens een nieuwe functie te moeten aanmaken.
Handig bij grote hoeveelheden data.
tapply(bus$kmjaar,bus$merk,mean)
tapply(bus$kilometers,bus$verkoper,sd)
De uitkomsten sorteren (van klein naar groot)
sort(tapply(bus$brutoprijs,bus$kleur,median))
Statistiek II
Dataverwerking en beschrijvende statistiek
Importeren van gegevens
# lokale installatie op MacOS in map Downloads
bus <- read.csv("~/Downloads/bus2016.csv", sep=";", stringsAsFactors=TRUE
# lokale installatie op Windows, data op C-schijf in map Temp
bus <- read.csv("C:/Temp/bus2016.csv", sep=";", stringsAsFactors=TRUE)
covid19 <- read.csv("C:/Temp/covid19.csv", sep=";")
unicef <- read.csv("C:/Temp/unicef.csv", sep=";")
Structuur opvragen
str(bus)
Samenvatting opvragen
summary(bus)
Waarde van specifieke cel opvragen/meerdere rijen of kolommen
bus[9,5]
bus[9,"kilometers"]
Om meerdere rijen/kolommen op te vragen. “De leeftijd en het kleur van
busjes 7 – 10”.
bus[7:10,c("leeftijd","kleur")]
bus[c(1,4,8,9),c("merk","kilometers","prijs")]
bus[c(1,4,8,9),]
bus[,c("merk","kilometers","prijs")]
Nieuwe variabele invoeren
bus$kmjaar <- bus$kilometers/bus$leeftijd
of
bus$brutoprijs <- bus$prijs
bus$brutoprijs[bus$btwincl=="nee"] <- bus$brutoprijs[bus$btwincl=="nee"] *
1.21
Kleur is een factorvariabel en kan het level “speciaal” dus niet aannemen,
daarom moet deze eerst terug worden omgezet naar een karakter variabele
bus$hoofdkleur <- as.character(bus$kleur)
bus$hoofdkleur[bus$kleur!="wit" & bus$kleur!="zwart"] <- "speciaal"
bus$hoofdkleur <- as.factor(bus$hoofdkleur)
Histogram
hist(bus$kmjaar,main="Kilometers per jaar")
Boxplot
Boxplot voor 1 variabele
Boxplot(bus$kmjaar,main="Kilometers per jaar")
Boxplot voor 2 variabelen
boxplot(brutoprijs~kleur,data=bus)
, boxplot(kilometers~verkoper,data=bus)
Titel invoeren
boxplot(brutoprijs~merk,data=bus)
title(main="Brutoprijs per merk")
Gemiddelde
mean(bus$kmjaar)
Indien de uitkomst NA zou geven kunnen we volgende functie toevoegen
mean(bus$stoelen,na.rm=TRUE)
Mediaan
median(bus$kmjaar)
Standaardafwijking
sd(bus$kilometers)
Percentiel (80%)
quantile(bus$kilometers,0.8)
Gelijkheid/Verschil nagaan
bus$merk=="Nissan"
bus$kmjaar[bus$merk=="Nissan"]
Percentage nagaan
mean(bus$locatie>=9000)
Voorwaarden toevoegen
sum(bus$merk=="Renault" & bus$kilometers<=100000)
mean(bus$kilometers[(bus$airco=="ja" | bus$kleur=="wit") &
bus$merk=="Opel"])
met logische operatoren: & (en), | (of), ! (niet) en xor (exclusieve of)
Frequentie bepalen met een tabel
table(bus$verkoper)
De frequentietabel kan je ook bewaren en later bijvoorbeeld bepalen bij
welk kleur de frequentie het grootst is en hoeveel die bedraagt.
x <- table(bus$kleur)
x[x==max(x)]
Staafdiagram
barplot(table(bus$kleur))
staafdiagram ordenen van groot naar klein:
barplot(sort(table(bus$kleur),decreasing=TRUE))
De functie tapply
Met tapply kan je functies (bv. Mean, median, …) ineens toepassen op
meerdere variabelen zonder telkens een nieuwe functie te moeten aanmaken.
Handig bij grote hoeveelheden data.
tapply(bus$kmjaar,bus$merk,mean)
tapply(bus$kilometers,bus$verkoper,sd)
De uitkomsten sorteren (van klein naar groot)
sort(tapply(bus$brutoprijs,bus$kleur,median))