FARMACEUTISCHE DATA-ANALYSE
G. VERBEKE
,Part I: introduction, motivation and example
Chapter 1: Introductory material
Chapter 2: Homeopathy: the test
® Blindering & dubbele blindering (patiënt & arts weten niets)
® Controlegroep: er moet altijd een controlegroep zijn: ofwel placebo geven ofwel niets ofwel kijken of het oude
beter is dan het nieuwe (bv kanker)
® Statistiek helpt om de fouten te kwantificeren en te controleren
Een p-waarde is een statistische maat die aangeeft hoe waarschijnlijk het is om een waargenomen verschil of een
extremer verschil te vinden, onder de aanname dat de nulhypothese waar is.
® De p-waarde helpt bepalen of de resultaten van een studie statistisch significant zijn.
• Lage p-waarde (bijv. < 0.05): Wijst erop dat de waargenomen resultaten onwaarschijnlijk zijn onder de
nulhypothese
® Verwerping van de nulhypothese
• Hoge p-waarde: Geeft aan dat de waargenomen resultaten waarschijnlijk kunnen optreden onder de
nulhypothese,
® Onvoldoende bewijs om de nulhypothese te verwerpen
Part II: basic principles of statistical methology
Chapter 3: What is statistics
- Beschrijvende statistiek: Het samenvatten en beschrijven van waargenomen gegevens, zodat de relevante
aspecten expliciet worden gemaakt
o Beperkt zich tot de steekproef
o Tabellen, grafieken en berekeningen van gemiddelden
- Inferentiele statistiek: onderzoeken in hoeverre waargenomen trends/effecten kunnen worden
gegeneraliseerd naar een algemene (oneindige) populatie
o Vanuit steekproef uitspraken over populatie doen
o Correcte statistische methodologie
o Correcte interpretatie van resultaten
Chapter 4: Population versus sample
Populatie
- Inclusiecriteria: moeten voldaan zijn
- Exclusiecriteria: mogen niet voldaan zijn
- Objectieve criteria: zorgen voor vermijden van uitschieters
- Voortdurend anders ® oneindig groot
Kansberekening
® Vanuit populatie naar steekproef
= uitkomst van een experiment voorspellen, waarbij de populatie bekend is
Statistiek:
® Vanuit steekproef naar populatie
= gerichte conclusies trekken over populatie, gebaseerd op wat in het experiment is waargenomen
® interval schatten/berekenen
1
,Chapter 5: causality and randomization
Causaal effect: oorzaak verschil in respons ligt bij de behandeling
Randomisatie
= eens de steekproef bekend is ze opdelen in verschillende groepen
® geen systemisch verschil tussen groepen (de 2 groepen zouden ‘identiek’ moeten zijn)
Randomisatie is vereist wanneer causale verbanden moeten worden aangetoond: Oorzaak ⇒ Gevolg
® niet altijd mogelijk: bv kankertherapie
Een case-control studie
- Factoren identificeren die bijdragen aan een specifieke aandoening of uitkomst
- De onderzoekers kijken terug in de tijd om te zien hoe de blootstelling aan een risicofactor verschilt tussen
de twee groepen
- Onderzoeken van zeldzame ziekten of aandoeningen met een lange latentietijd.
® longkanker en roken
Part III: describing and summarizing data
Chapter 6: types of outcomes
Kwalitatieve (categorische) variabelen: variabelen die categorieën of groepen vertegenwoordigen
® Niet gekenmerkt door een numerieke waarde
- Dichotoom: slechts 2 mogelijke waarden: geslacht, overleving => binair
- Nominaal: geen volgorde: haarkleur, doodsoorzaak
- Ordinaal: geordende uitkomstwaarden: pijnscore, gemak van intubatie = er is een ordening
maar de afstanden tussen de categorieën zijn niet noodzakelijk gelijk, zoals opleidingsniveau (bijvoorbeeld
middelbare school, bachelor, master, doctoraat)
Kwantitatieve variabelen: numerieke waarden
- Discreet: kunnen alleen specifieke waarden aannemen (= ronde cijfers bv 7): hartslag
- Continu: elke waarde binnen een bepaald interval aannemen (bv 70,4): lengte, leeftijd, bloeddruk
Chapter 7: graphical presentation of data
Chapter 8: summary statistics
Modus = waarde die het meeste voorkomt
Gevoelig voor uitschieters: steekproefgemiddelde, variantie (dus ook gemiddelde kwadratische afwijking en
standaardafwijking) en de range
Niet gevoelig voor uitschieters: steekproefmediaan, interkwartielafstand
De interkwartielafstand is niet afhankelijk van de steekproefomvang, aangezien bij grotere steekproeven een groter
aantal waarnemingen wordt verwijderd.
Symmetrische data ⇒ gemiddelde en standaarddeviatie
Niet symmetrische data maar wel transformeerbaar ⇒ geometrisch gemiddelde en standaarddeviatie
Scheve data (niet transformeerbaar) ⇒ mediaan en IQR
2
, ® Transformaties
1. Staart naar grote kant: log of wortel
® negatieve kromming nodig: grote waarden naar de kleinere worden getransformeerd
2. Staart naar linker kant: kwadraat of e macht
® positieve kromming nodig, grote waarden weg van de kleinere worden getransformeerd
Als je met negatieve data of nul-waarden zit, kan je geen logaritme berekenen (computer gaat dat wel doen, op
missing zetten = verlies van informatie) à andere gepaste transformatie zoeken (bv log van 1+x)
Moment dat we een verdeling plakken op histogram ® overstap van steekproef naar populatie
Daarna dichtheidsfunctie gebruiken om uitspraken te doen
Part IV: basic concepts of statistical inference
Chapter 9: describing the population
Als het gaat over populatie ® griekse symbolen
Stochastische variabele = een veranderlijke waarvan het resultaat afhangt van toeval
1. Discrete stochastische variabelen: Deze kunnen slechts een eindig of aftelbaar oneindig aantal waarden
aannemen (bijvoorbeeld het gooien van een dobbelsteen).
2. Continue stochastische variabelen: Deze kunnen elke waarde aannemen binnen een bepaald interval
(bijvoorbeeld de lengte van personen).
® kansverdeling
Slide 136: voorbeelden
Discrete probabiliteit distributie ® kansverdeling met discrete verdeling
® Barplot
Continue probabiliteit distributie ® dichtheidsfunctie
® Histogram
Standaardiseren
= je kan elke normale verdeling overzetten in een standaard normale verdeling (en omgekeerd)
® Slide 156
!"#$%&'&"!$((")("
𝑠𝑡𝑎𝑛𝑑𝑎𝑎𝑟𝑑 𝑛𝑜𝑟𝑚𝑎𝑙𝑒 𝑣𝑒𝑟𝑑𝑒𝑙𝑖𝑛𝑔 = *#+%(++,( (".$+#$"
® eenheidsloos
Centrale limietstelling (158)
Een gemiddelde gedraagt zich altijd als een normale verdeling wanneer de steekproef voldoende groot is
Als de steekproef groter is dan 25 –> centrale limietstelling
Chapter 10: from the population tot he sample, and back tot he population
Kans dat je in 95% interval zit: dia 177
® multiple testing
3