INLEIDING ............................................................................................................................................................... 4
1.1 CLASSIFICATIE MEETEIGENSCHAPPEN ....................................................................................................................... 4
2 DEFINITIE METEN EN VALIDITEIT EN BETROUWBAARHEID ................................................................................. 4
2.1 METEN ............................................................................................................................................................. 4
2.1.1 WAT BIJ ABSTRACTE CONCEPTEN? ............................................................................................................................... 4
2.1.2 VERBAND TUSSEN CONCEPTEN EN INDICATOREN ............................................................................................................ 4
2.1.3 2 SOORTEN RICHTINGEN VAN METINGEN ...................................................................................................................... 4
2.2 BELANGRIJKSTE KWALITEITEISEN BIJ EEN MEETINSTRUMENT .......................................................................................... 5
2.3 2 SOORTEN FOUTEN MOGELIJK BIJ MEETRESULTATEN METEN........................................................................................ 5
2.3.1 TOEVALLIGE MEETFOUTEN ......................................................................................................................................... 5
2.3.2 NIET-TOEVALLIGE FOUTEN= SYSTEMATISCHE MEETFOUTEN .............................................................................................. 5
2.4 TYPES VALIDITEIT è VERSCHILLENDE DOELEN DUS VERSCHILLENDE TYPES ....................................................................... 6
3 PSYCHOMETRISCHE ASPECTEN VAN TOELATINGSPROEVEN HOGER ONDERWIJS ............................................... 7
3.1 TOELATINGSPROEVEN VOLGENS DE LOGICA VAN PREDICTIE........................................................................................... 7
3.2 SELECTIE TOELATINGSPROEF OP GROND VAN EMPIRISCHE GEGEVENS .............................................................................. 7
3.3 VALIDERINGSONDERZOEK ..................................................................................................................................... 8
3.4 DE BELANGRIJK BEGRIPPEN ................................................................................................................................... 9
3.4.1 BEÏNVLOEDENDE FACTOREN VOOR SUCCESRATIO ........................................................................................................... 9
3.4.2 MAKEN VAN FOUTEN................................................................................................................................................. 9
3.4.3 TOELATINGSPROEVEN VOLGENS DE LOGICA VAN VASTSTELLING VAN MINIMUMVOORWAARDEN ........................................... 10
3.4.4 BINDEND OF NIET BINDENDE TOELATINGSPROEVEN ...................................................................................................... 10
4 KLASSIEKE TESTTHEORIE.................................................................................................................................. 11
4.1 BETROUWBAARHEID VAN METINGEN (WARE SCORES EN TOEVALSFOUTEN) .................................................................... 11
4.2 BEPALEN VAN BETROUWBAARHEID ....................................................................................................................... 12
4.2.1 HERTESTINGSMETHODE........................................................................................................................................... 12
4.2.2 PARALLELETESTMETHODE ........................................................................................................................................ 13
4.2.3 HALVERINGSMETHODE ............................................................................................................................................ 13
4.2.4 INTERNE CONSISTENTIE ........................................................................................................................................... 14
4.3 VRAGEN ......................................................................................................................................................... 14
4.4 VERBAND TUSSEN BETROUWBAARHEID EN VALIDITEIT ............................................................................................... 15
4.5 REGRESSIE NAAR HET GEMIDDELDE ....................................................................................................................... 15
4.5.1 CORRECTIE VOOR ATTENUATIE .................................................................................................................................. 15
4.5.2 PRATKIJK VOORBEELD 1: TWEE METINGEN OP VERSCHILLEND TIJDSTIP VAN DEZELFDE ‘WARE SCORE’ .................................... 15
4.5.3 PRATKIJK VOORBEELD 2: EFFECT OP VERSCHILSCORES ........................................................................................... 15
4.6 ITEMANALYSE .................................................................................................................................................. 15
4.6.1 KENMERKEN ITEM è ITEMNIVEAU ........................................................................................................................... 16
4.6.1.1 Univaritate kenmerken = vatten 1 variabele per keer samen ........................................................................ 16
Malika Desruelle 1
, Meten en evalueren
4.6.1.2 Betrouwbaarheid van de test ......................................................................................................................... 16
4.6.2 KENMERKEN TEST è TESTNIVEAU ............................................................................................................................ 17
4.6.2.1 Univariate testkenmerken = vatten 1 variabele per keer samen ................................................................... 17
4.6.2.2 Betrouwbaarheid van test .............................................................................................................................. 17
4.7 INTERPRETATIE SCORES ...................................................................................................................................... 18
4.7.1 HOE DE BEHAALDE SCORES MEER BETEKENISVOL MAKEN IN DE KTT................................................................................. 18
4.7.1.1 Discussie ......................................................................................................................................................... 19
4.8 PROBLEEM VAN EQUIVALEREN ............................................................................................................................. 19
4.8.1 TWEE SOORTEN DESIGNS ......................................................................................................................................... 19
4.8.1.1 Random groups designs ................................................................................................................................. 19
4.8.1.2 Common-item non-equivalent group design ................................................................................................. 19
4.8.1.3 Verschil met formule van random group design: .......................................................................................... 20
4.8.2 ITEMRESPONSTHEORIE: OPLOSSING VOOR EQUIVALEREN ........................................................................................ 20
4.9 EVALUATIE KLASSIEKE TEST THEORIE (KTT) .............................................................................................................. 21
5 ITEM RESPONS THEORIE MODELS (IRT) ........................................................................................................... 21
5.1 LLN VERSCHILLEN IN HUN VAARDIGHEIDSNIVEAU ...................................................................................................... 22
5.2 ITEMS VERSCHILLEN IN HUN MOEILIJKHEID ................................................................................................... 22
5.3 MODELFORMULERING ........................................................................................................................................ 22
5.3.1 BASISMODEL (1PL) ................................................................................................................................................ 22
5.3.1.1 Rach model ..................................................................................................................................................... 23
5.3.1.2 Vragen ............................................................................................................................................................ 23
5.3.2 2PL ..................................................................................................................................................................... 24
5.3.2.1 Vragen ............................................................................................................................................................ 24
5.3.3 3PL = KANS DAT IEMAND DOOR TE GOKKEN JUIST ANTWOORD HEEFT .............................................................................. 24
5.3.3.1 Vragen ............................................................................................................................................................ 25
5.4 VOORDELEN VAN IRT ALS MEETMODEL: ................................................................................................................ 25
5.5 ASSUMPTIE “LOKALE ONAFHANKELIJKHEID”............................................................................................................ 25
5.6 TEST CHARACTERISTIC CURVE (TCC) ...................................................................................................................... 25
5.7 COMPLEXERE MODELLEN: POLYTOME MODELLEN ..................................................................................................... 25
5.8 SCHATTING EN TOETSING: IRT ALS KANSMODEL........................................................................................................ 26
5.9 MEETKWALITEITEN KTT VS IRT è POSITIEVE PUNTEN ............................................................................................... 27
5.9.1 MEETNAUWKEURIGHEID: STANDAARDFOUT VAN METING EN TESTINFORMATIEFUNCTIE (TIF) ............................................... 27
5.9.2 TESTLENGTE EN AFNAMEVORM................................................................................................................................. 27
5.9.3 SCHATTING VAN ITEMKENMERKEN/ MOEILIJKHEIDSGRAAD ............................................................................................ 28
5.9.4 INTERPRETATIE MEETRESULTAAT ............................................................................................................................... 28
5.9.5 HET METEN VAN VERANDERING (LEERWINST) .......................................................................................................... 28
5.10 ITEM BIAS (DIF) ............................................................................................................................................. 29
5.10.1 CONCEPTEN ........................................................................................................................................................ 29
5.10.2 TEST FAIRNESS ..................................................................................................................................................... 29
5.10.3 AANTONEN VAN DIF ............................................................................................................................................. 29
5.10.4 DIF DETECTIE ....................................................................................................................................................... 29
5.10.5 DIFFERENTIAL TEST FUNCTIONING (DTF) ................................................................................................................... 29
5.10.6 HOE OMGAAN MET DIF? ...................................................................................................................................... 30
5.11 PEILINGEN EN PARALLELTOETSEN ........................................................................................................................ 30
Malika Desruelle 2
, Meten en evalueren
5.11.1 ONDERZOEKSLOGICA ACHTER PEILINGEN................................................................................................................... 30
5.12 INTERNATIONAL LARGE-SCALE ASSESSMENTS (ILSA) .............................................................................................. 31
5.13 CESUURBEPALING ........................................................................................................................................... 32
5.13.1 LEERLINGGERICHTE METHODES ............................................................................................................................... 32
5.13.1.1 Borderline methode (grensgevallen): KTT en IRT ......................................................................................... 32
5.13.1.2 Methode van contrasterende groepen (KTT en IRT) .................................................................................... 32
5.13.2 ITEMGERICHTE METHODE ...................................................................................................................................... 33
5.13.2.1 Angoff methode: KTT ................................................................................................................................... 33
5.13.2.2 Dichotome Angoff methode: KTT ................................................................................................................. 33
5.13.2.3 Nedelsky methode: KTT................................................................................................................................ 34
5.13.2.4 BOOKMARK METHOD: IRT............................................................................................................................ 34
5.13.3 EMPIRISCH ONDERZOEK ........................................................................................................................................ 34
5.14 BEOORDELAARSVERSCHILLEN ............................................................................................................................. 35
5.14.1 DATA: NOMINAAL NIVEAU (GESLAAGD/ NIET-GESLAAGD OF 0/3) ................................................................................ 35
5.14.2 DATA: INTERVALNIVEAU (SCORE OP 10) ................................................................................................................... 36
5.14.3 MOGELIJKE OORZAKEN VAN LAGE BEOORDELAARSVERSCHILLEN.................................................................................... 37
5.14.4 REMEDIS VOOR LAGE BEOORDELINGSBETROUWBAARHEID ........................................................................................... 37
5.15 PRAKTISCHE PROEVEN ...................................................................................................................................... 38
5.15.1 MULTIDIMENSIONELE MEETPROBLEMEN .................................................................................................................. 38
5.15.1.1 Van multidimensioneel naar multi-unidimensioneel ................................................................................... 38
5.15.2 PRAKTISCHE PROEVEN ........................................................................................................................................... 39
5.15.2.1 Waarde van praktische proeven .................................................................................................................. 39
5.15.2.2 Beperkingen van een praktische proef......................................................................................................... 39
Malika Desruelle 3
, Meten en evalueren
INLEIDING
1.1 CLASSIFICATIE MEETEIGENSCHAPPEN
CONTINU CATEGORISCHE
UNIDIMENSIONAAL= Meerderheid: Koala test, Toelatingsproeven
verschillende items meten 1 begrip Examens, LVS, Pisa-toetsen
MULTIDIMENSIONAAL= Stage beoordeling, TOEFL met een behaald beheersingsniveau voor de
verschillende aspecten beoordelen Praktijkproef, Portfolio verschillende taalvaardigheden Onderwijsinspectie
2 DEFINITIE METEN EN VALIDITEIT EN BETROUWBAARHEID
2.1 METEN
Meten= Stevens (1951): het toewijzen van getallen aan gebeurtenissen
• Vooral fysische metingen bv. lengte van object è eenheid in cm (Grootheid) kan je vergelijken mmet
andere waardes van eenzelfde grootheid.
• Concatentatie-operatie = Optellen eenheden die nodig zijn om welbepaalde gebeurtenis te overspannen
2.1.1 WAT BIJ ABSTRACTE CONCEPTEN?
• Proces van abstracte concepten (bv. eindtermen) linken aan empirische indicatoren Abstract niveau
Latent niveau
Empirisch niveau
Observaties
o Abstract/ Latente of niet geobserveerde niveau= theoretisch niveau
Onderzoeken of we evidentie kunnen bieden dat antwoord op die verschillende Onderliggend
concept
vragen wijzen op meten van de eindtermen (onderliggend concept)
o Empirische niveau = empirische indicatoren (observaties): kijken naar juistheid van het antwoord
• Let op: belang van hulptheorie om de relatie te verduidelijken tussen concepten en hun indicatoren
2.1.2 VERBAND TUSSEN CONCEPTEN EN INDICATOREN
• Bv. zelfobservatie van de lkr van de eigen les VS de feedback van lln.
• De assumptie is dat de observatie van de lkr een goede indicator is voor de evaluatie van de les.
2.1.3 2 SOORTEN RICHTINGEN VAN METINGEN
TOP-DOWN (è) BOTTOM-UP (ß)
Van concept naar operationalisatie (inhoudsvaliditeit) Van antwoorden op items naar een meetschaal
(betrouwbaarheid- empirische fit)
Altijd: Vertaling + deels verenging van het begrip Kwaliteitscriteria/meetmodel om de geldigheid van de
• Vertaling: het vak wordt vertaald naar 10 juist/fout conclusies te garanderen è hoe goed passen de items
vragen 2 kennis vragen en 1 inzicht-toepassingsvraag bij elkaar als meetschaal
• Verenging: van het examen (geen 1:1) er is altijd een
kloof tussen wat je bedoelt te meten en wat je feitelijk
meet (altijd aspecten die niet opgenomen zijn maar toch
zinvol blijken)
Malika Desruelle 4