Statistische inferentie is het proces waarbij je met behulp van steekproefdata
uitspraken doet over een populatie, terwijl je de onzekerheid van die uitspraken
expliciet meeneemt.
Doel van inferentie bij proporties: We willen uitspraken doen over een
populatieproportie p op basis van een steekproefproportie (p dakje)
Typische vragen:
- Is de proportie groter/kleiner dan een bepaalde waarde?
(significantietoets)
- Wat is een betrouwbaarheidsinterval voor p?
- Hoe groot moet mijn steekproef zijn?
Aannames:
- De gegevens gebruikt voor de schatting, zijn een willekeurige steekproef
uit de bestudeerde populatie
- Populatie is minstens 20x zo groot als de steekproef. Dit garandeert de
onafhaneklijkheid van opeenvolgende proeven bij de willekeurige
steekproefneming.
- Steekproefomvang n is groot genoeg zodat de vorm van de
steekproefverdeling bij benadering normaal is. Hoe groot deze moet zijn,
hangt af van het type inferentie dat wordt gevoerd.
Voorwaarden voor inferentie bij proporties
1. Aselecte steekproef (SRS)
De data moeten representatief zijn.
2. Populatie ≥ 20 × steekproefgrootte
Zorgt voor onafhankelijkheid van observaties.
3. Steekproef groot genoeg
Afhankelijk van de methode:
methode Voorwaarde
Significatie toets np_0≥10 én n(1-p_0)≥10
Large-sample BI successen ≥ 15 én mislukkingen ≥ 15
Plus-four BI n ≥ 10 en betrouwbaarheidsniveau ≥
90%
,Steekproefproportie
P^ = aantal successen/ n
Voorbeeld: 30 van 120 patiënten verbeteren →
p^ = 0,25
Categorische gegevens conclusie trekken over proportie, percentage of
populatie met specifieke eigenschappen
Als we bepaalde categorische eigenschappen succes noemen dan is de
steekproefproportie van successen:
steekproefverdeling van p^
steekproefverdeling van p dakje is nooit exact normaal, maar voor voldoende
grote steekproeven kan deze benaderd worden door een normale verdeling
Het gemiddelde en de standaardafwijking van de steekproefverdeling worden
beide volledig bepaald door p en n:
We hoeven dus maar één populatieparameter te schatten, namelijk p.
,significantietoets voor een proportie
Bij het toetsen:
Ho: p = po (gegeven waarde die we toetsen)
Als Ho waar is, is de steekproefverdeling bekend
De toetsing statistiek is de gestandaardiseerde waarde van p
(dit is geldig wanneer zowel het verwachte aantal mislukkingen (n(1-Po)) als het
verwachte aantal successen (npo) 10 of groter zijn)
P-waarde voor een eenzijdige of tweezijdige alternatieve hypothese
De p-waarde is de kans, als Ho waar zou zijn, om een toetsingsstatistiek te
verkrijgen die gelijk is aan de berekende waarde of extremer is in de richting van
Ho.
betrouwbaarheidsintervallen voor p
- Large-sample BI: Gebruik wanneer successen ≥ 15 en mislukkingen ≥ 15.
- Plus-four BI: Voeg 2 successen en 2 mislukkingen toe. Betere prestatie bij
kleinere steekproeven
, Betrouwbaarheidsinterval voor p bij grote steekproeven
Betrouwbaarheidsintervallen bevatten de populatieproportie p in C % van de
steekproeven. Voor een willekeurige steekproef van grootte n getrokken uit een
grote populatie en met een steekproefproportie pô berekend uit de gegevens, is
een benaderend betrouwbaarheidsinterval van niveau c voor p:
(gebruik deze methode wanneer zowel het aantal successen als het aantal
mislukkingen minstens 15 is)
Plus four – betrouwbaarheidsinterval voor p
De plus four methode levert redelijk nauwkeurige betrouwbaarheidsintervallen
op. We doen alsof we vier extra waarnemingen hebben, twee successen en twee
mislukkingen. De nieuwe steekproefomvang is dus n +4 4n X +2.
(Gebruik deze methode wanneer C minstens 90% is en de steekproefomvang
minstens 10 is)
Steekproefomvang voor een gewenste foutmarge
Mogelijk moet u een steekproefomvang kiezen die groot genoeg is om de
gespecificeerde foutmarge te bereiken. Omdat de steekproefverdeling van p^
een functie is van de onbekende populatieproportie p, vereist dit proces dat u
waarschijnlijke waarde voor p schat: p*