Data analyse 2020
Casus 5: Leren en flexibiliteit
1
, Casus 5: Leren en flexibiliteit
Beschrijving onderzoek
Deze casus heet Leren en flexibiliteit, niet omdat het over leren en flexibiliteit gaat, maar
omdat het doel is je leervermogen en flexibiliteit te vergroten.
Hoe gemakkelijk het is om data te krijgen die je zelf nog niet kan analyseren, blijkt uit de
onderstaande mail die enkele tweedejaars psychologiestudenten me stuurden. Het gaat om
data die zijn verzameld in het kader van de cursus Onderzoekspracticum 2. De data zijn
aangepast t.b.v. deze cursus.
Bedankt voor je reactie op onze e-mail. Wij hebben net een gesprek gehad met onze
werkgroepbegeleider. Helaas kan hij ons niet precies verder helpen met de analyse van het
onderzoek. Verder vond hij het geen probleem als onze data werden gebruikt voor de cursus
data-analyse.
In ons onderzoek bekijken we de invloed van overredingstechnieken op het aantal keer dat
een advertentie op marktplaats.nl wordt bekeken. De onderzoeksvraag is: Wat is het
effect van het samenvoegen van twee overredingstechnieken op het aantal keer dat
een advertentie op marktplaats.nl bekeken wordt? Eerst hebben we een pilotstudie
gedaan om de twee overredingstechnieken naar voren te halen, die het beste werken. In ons
geval waren dat schaarste (OP=OP) en sociale bewijskracht (meest verkochte mediaplayer).
In de studie zelf kregen we dus 4 advertenties:
- OP=OP (schaarste): 112 keer bekeken
- meest verkochte mediaplayer (sociale bewijskracht): 90 keer bekeken
- combinatie van beiden: 150 keer bekeken
- controle (geen techniek): 85 keer bekeken
We hebben dus voor de analyse in totaal 4 getallen. Vandaag hebben we weer verschillende
manieren van analyse bekeken, maar zijn er helaas nog niet uit.
Antwoord
Dat is een vreemde situatie. Het uitgangspunt van OP2 is dat het onderzoek zo moet worden
opgezet dat studenten het zelf kunnen analyseren. Een goede onderzoeksopzet houdt in dat
je van te voren weet dat je de data die er uit komen ook kan analyseren. Nu zeg je dat zelfs
jullie begeleider het niet kan analyseren, dus er is iets goed mis gegaan. Hoe weet je dan dat
ik ze wél kan analyseren? Misschien moet je ze wel weggooien.
Enfin, ik zal je een tip geven: Dit kan niet met GLM en ook niet met loglineaire analyse. De
enige mogelijkheid is een Generalized Linear Model. Let op dat je de correcte verdeling en
link functie gebruikt.
Of deze data bruikbaar zijn voor Data-analyse is nog maar de vraag. Mochten ze worden
gebruikt, dan zou mijn opdracht zijn om de correcte verdeling en link functie te zoeken,
vandaar dat ik dat antwoord hier niet geef.
Data
De data staan in Viewed2020.sav.
2
, Casus 5: Leren en flexibiliteit
Opdracht 1
(Achteraf gezien denk ik dat een log-lineaire analyse ook goed was, en dat het een speciaal
geval van Generalized Linear Models is.) Analyseer de data met Generalized Linear Models.
Let op dat je de correcte verdeling en link functie gebruikt.
- Meestal is het handig om eerst te zorgen dat je er überhaupt iets uit krijgt, voor je je
om allerlei opties gaat bekommeren
- De tabs Estimation en Statistics hoef je in deze opdracht nog niet te gebruiken
- Het belangrijkste is dat je de correcte verdeling gebruikt. De link functie komt in een
latere opdracht nog aan de orde.
- Wat de correcte verdeling is, moet op theoretische gronden worden bepaald. Veel
verdelingen zijn typerend voor de uitkomsten van een bepaald soort proces.
Bijvoorbeeld, de wachttijd van een homogeen proces in continue tijd heeft een
exponentiele verdeling. Beperk je bij de verdelingen tot Binomial, Negative binomial,
Normal en Poisson.
Mogelijk te gebruiken:
SPSS Help, vanuit de dialoogbox
Controle:
Voor de Omnibus Test, chi square = 23.110.
Uitwerking opdracht 1
1. Onderzoeksvraag:
Wat is het effect van het samenvoegen van twee overredingstechnieken op het
aantal keer dat een advertentie op marktplaats.nl bekeken wordt?
2. Uitleg verdelingen:
a. Binomial: Verdeling van het aantal successen na N trials als bij elk trial de
kans op succes p is
i. Aantal items dat je goed hebt bij gokken op 20 items met 4 alternatieven: N =
20, p = 0.25
b. Negative binomial: Aantal trials voor het ‘r’de succes
i. Aantal fouten eer je 1 item goed hebt bij gokken op items met 4 alternatieven
(r = 1, p = 0.25)
c. Poisson: Verdeling van aantal gebeurtenissen in een interval als er gemiddeld
gebeurtenissen in een interval zijn
i. Aantal klanten dat in een uur binnenkomt, als er gemiddeld 4 klanten per uur
zijn ( = 4)
d. Normal: normaalverdeling zoals we dat kennen. Dat is de verdeling van een
GLM, heb je dus nu niet veel aan
3. Aantal keer dat een advertentie bekeken wordt (in een bepaalde tijd) dus: het
aantal successen in een continu interval
poisson-verdeling
3
, Casus 5: Leren en flexibiliteit
4. Design:
a. AV: aantal keer bekeken – viewed (kwantitatief)
OV: technique (kwalitatief: 1/2/3/4)
5. Analyze > Generalized Linear Models > Generalized Linear Models >
Types of Model: (counts) poisson loglinear
Response: dependent variable = viewed
Predictors: factors = technique
Model: main effect technique
EM Means: technique
6.
7.
8. Controle: Voor de Omnibus Test, chi square = 23.110. Klopt.
Opdracht 2
Als je eerder techniek als factor hebt gebruikt, gebruik dan nu schaars en sociaal en hun
interactie. Als je eerder schaars en sociaal hebt gebruikt, gebruik dan nu techniek. Bestudeer
van beide analyses de uitkomsten van de tabellen Omnibus Test en Tests of Model Effects,
en vergelijk de uitkomsten van de twee analyses. Trek een conclusie over wat de
nulhypothese van de Omnibus test is. Probeer dit ook te formuleren in termen die je eerder
bij statistiek hebt gehad.
Mogelijk te gebruiken:
Internet: Omnibus test
SPSS Help
Ellis, deel 4, sectie 4.4.4
Uitwerking opdracht 2
1. Design:
a. AV: aantal keer bekeken – viewed (kwantitatief)
OV1: sparse (kwalitatief: wel/niet)
OV2: social (kwaltatief: wel/niet)
4