HC 13: SPECIAL PREDICTORS PART 1
WAAROM “SPECIAL PREDICTORS”?
Kernidee In gewone regressie (= gemiddelde verandering v y): Y=β0+β1X
- Je hebt meestal:
o 1 continue predictor
o 1 rechte regressielijn
- Maar in echte data:
o Hebben we groepen
o Hebben we kromme verbanden
o Hebben we effecten die afhangen van elkaar
o GEVOLG:
Daarom voegen we speciale predictoren toe.
Doel vh hoofdstuk
- Verschillende speciale voorspellers in meervoudige regressie
uitleggen:
o 1) Categorische voorspellers (bv. type stimulus met dezelfde
en verschillende niveaus)
o 2) Kwadratische termen om niet-lineaire relaties te
modelleren (bv. hoek en het kwadraat van hoek)
o 3) Productvoorspellers om interacties te modelleren (bv.
het product van type stimulus en hoek).
Meerwaarde v deze specifieke voorspellers
- Door deze op te nemen maakt regressiemodel tot zeer veelzijdig
statistisch hulpmiddel.
CATEGORICAL PREDICTORS/ VOORSPELLERS (KWALITATIEVE PREDICTOREN)
Belangrijke termen
Engels Nederlands
categorical predictor categorische predictor
qualitative variable kwalitatieve variabele
dummy variable dummyvariabele
indicator variable indicatorvariabele
reference group referentiegroep
Synoniem
- Qualitative = categorical variables
Wat? Grafische weergave: Coded scatterdiagram
- Verdeelt SP in aantal verschillende groepen
- Classificatie is uitputtend en wederzijds exclusief
- Variables have only a limited number of values or classes
- Each observation belongs to 1 (and only 1) of those classes (exhaustive and mutually exclusive)
- kwaN voorspeller
o Vertegenwoordigt kwaL voorspeller vaak GEEN hoeveelheid
o Wanneer dat wel het geval is
Is het ONduidelijk welke getallen aan deze niveaus moeten worden gekoppeld
Categorische voorspeller/predictor coderen
, - Waarom
o Om categorische voorspeller op te nemen in regressieanalyse moeten we de info numeriek uitdrukken
Anders kunnen we geen berekeningen uitvoeren.
o Een regressiemodel kan niet rekenen met woorden zoals: same/different of male/female
Coderen
- Wat?
o Het omzetten van categorieën naar cijfers (bv. 0 en 1)
- Soorten
o Er bestaan verschillende manieren van codering (dummy-codering, effectcodering, cel betekent codering, enz.)
DUMMY CODING
- = information in categorical variable must be made numeric to be useful for regression analysis
- is done via collection of specially constructed indicator or dummy variables that take the values 0 or 1
o Info in categorische voorspeller w weergegeven door reeks binaire voorspellers
= indicator/dummy-variabelen genoemd.
Indicator- of dummyvariabelen = binair
nemen drm slechts waarde 0 of 1 aan
- To represent c categories you need c-1 indicator variables (=dummys)
2 groepen → 1 dummy
3 groepen → 2 dummy’s
5 groepen → 4 dummy’s
o Anders krijg je perfect collinearity = predictoren bevatten exact dezelfde info
o Bijvoorbeeld
Categorische voorspeller met K-waarden (bv.. biologisch geslacht).
Elke dummy-variabele codeert voor een specifieke categorie.
Voor geslacht kunnen we deze dummy-variabelen bv. S en D noemen:
o
{
Si = 1=if isa woman
0=if is a man
o D { 1=if is a man .
i =
0=if is a woman
Als je goed kijkt naar definitie van S en D + naar de bijhorende waarden
o Wordt duidelijk dat 1 vd 2 dummies overbodig is.
Als je weet dat voor observatie i de waarde = Si dan weet je automatisch ook de waarde Di = 1 -
Si
!!! Hetzelfde geldt andersom:
o Conclusie
info in categorische voorspeller met 2 categorieën kan w weergegeven mbv 1 dummy-variabele.
Daarom mag slechts 1 dummy worden opgenomen in het regressiemodel
!!! Het niveau dat wordt weergegeven door dummy dat NIET in het model is opgenomen
o = Wordt het referentieniveau genoemd
Welke dummy-variabele kiezen?
- = Volledig willekeurige keuze vanuit het perspectief van modelfit:
o Of je S of D in het model opneemt
Heeft geen invloed op R 2
Heeft geen invloed op grafische weergave vd aangepaste regressielijnen.
- Enige criterium dat de keuze kan sturen, is het gemak van interpretatie
,HOOFDEFFECTMODEL
Er is dus GEEN interactie aanwezig
POPULATION MODEL C = 2
We assume 2 predictors (p = 2) where
o X1 is a quantitative predictor
o X2 an indicator variable (c = 2) for a categorical variable:
• Xi2 = 0 for group 1 (reference group) = C1
• => Xi2 = 1 for group 2 = C2
i.i.d.
Y i=β 0 + β 1 X i 1+ β 2 X i 2+ ε i , ε i ∼ N (0 , σ 2 )
⇒ Y^ =E(Y ∨X 1 , X 2)=β 0 + β 1 X 1+ β2 X 2
Interpretation of the regression coefficients:
- Expected criterion score for observation from group 1
o
o regression of Y on X1 is linear with intercept 0 and regression weight 1 in group 1
- Expected criterion score for observation from group 2
o
o regression of Y on X1 is linear with intercept 0 +2 and regression weight 1 in group 2
ZEER BELANGRIJK = regressielijnen zijn parallel voor beide groepen
Samenvatting
- β0 = Intercept v groep 1 (= referentiegroep)
- β1 = Slope/regressiegewicht v X = Zelfde voor beide groepen
- β2 = Verschil in intercept tussen groep 1 VS 2
- Because regression weight 1 are the same in both groups:
o regression lines per group (=inside group regression lines) are parallel
o relationship between Y and X1 is the same in both groups so no interaction between categorical predictor and
X1
- Er is dus voor elk type stimulus (Facotr / IV) een afzonderlijke regressielijn
o = Regressielijn binnen de groep genoemd = binnengroepsregressielijnen
o Beide regressielijnen binnen de groep verschillen ALLEEN mbt hun intercept
o ZEER BELANGRIJK
Omdat beide groepen dezelfde slope hebben → regressielijnen zijn parallel
Dat betekent:
Effect van X is identiek in beide groepen
GEEN interactie
, POPULATION MODEL C > 2
General case with c categories:
We assume p = c where X1 is a numeric predictor and X2 ,..., Xc indicator variables (= c-1 indicator variables)
Xi2 =1 for group 2 AND 0 for the other groep
Xic = 1 for group c, AND 0 for the other groep
Dummy die NIET opgenomen w als voorspeller/predictor = referentie-niveau bv. Group 1 is reference group
Interpretation of the regression coefficients
- What is the expected criterion score for an observation from group 1?
o regression of Y on X1 is linear with intercept 0 and regression weight 1 in group 1
- What is the expected criterion score for an observation from group 2
o regression (= verandering) of Y on X1 is linear with intercept +02 and regression weight 1 in group 2
- What is the expected criterion score for an observation from group c
o regression of Y on X1 is linear with intercept 0 +c and regression weight 1 in group c
Example with c = 4
- !!!! Regression lines are parallel for ALL groups
- Sumary
o 0 = intercept of group 1 (reference group)
o 1 = regression weight for X1 in all groups (1 to c)
o 2 = difference between intercept of group 2 and group 1
...
o c = difference between intercept of group c and group 1
o Because regression weight 1 is the same in all groups:
regression lines per group (=inside
groupregression lines) are parallel
relationship between criterion and predictor X1 is
the same in all groups and so there is no interaction between the categorical predictor and X1
STATISTICAL INFERENCE : C = 2
H0 : 2 = 0
regression lines in both groups coincide = vallen samen
No difference between intercepts of both regression lines
- Interpretation
o after controlling for var(1) there is no evidence of a difference between var(2) of men and women
Why not just estimate a separate regression line per group?
- 1 is assumed to be the same in both groups