• Verkeerd document? Gratis ruilen
  • Geschreven door studenten die geslaagd zijn
  • Direct beschikbaar na je betaling
  • Online lezen of als PDF
Verkopen
Kies je studieland
Kies je taal
Document preview thumbnail
Voorbeeld 4 van de 117 pagina's
Samenvatting

Samenvatting Business Intelligence | UGent | 2025/26

Document preview thumbnail
Voorbeeld 4 van de 117 pagina's

Samenvatting voor Business Intelligence in het Schakelprogramma Master of Science in de Handelswetenschappen aan de Universiteit Gent. De aantekeningen behandelen fundamentele concepten waarom data science belangrijk is voor bedrijven, big data, data warehouses en data lakes, en data-analytical thinking. Ideaal voor examenvoorbereiding en het begrijpen van de kernconcepten van data science in bedrijfscontext.

Voorbeeld van de inhoud

BUSINESS INTELLIGENCE
H0 INLEIDING ................................................................................................................................................. 1
WAAROM IS DATA SCIENCE BELANGRIJK VOOR BEDRIJVEN? ...................................................................................... 1
Wet van de massale digitale opslag ....................................................................................................................... 1
Big data................................................................................................................................................................ 1
Maslows hiërarchie van big data ............................................................................................................................ 1
Data warehouses & data marts ......................................................................................................................... 1
Data lakes ............................................................................................................................................................ 2
Data warehouse VS. data lakes ............................................................................................................................. 2
Data in bedrijven .................................................................................................................................................. 2
Data value trap ..................................................................................................................................................... 2
H1.1 DATA-ANALYTICAL THINKING .................................................................................................................... 3
INTRODUCTIE .......................................................................................................................................................... 3
WAAROM DATA-ANALYTICAL THINKING EN DATA SCIENCE? ....................................................................................... 3
Data opportunities ................................................................................................................................................ 3
Compliance to regulations − naleving van de voorschriften ..................................................................................... 4
Possible applications ........................................................................................................................................... 5
VOORBEELDEN ........................................................................................................................................................ 6
Hurricane Frances − WalMart ................................................................................................................................ 6
Pregnancy prediction − Target ............................................................................................................................... 6
Churn prediction − Megatrends ............................................................................................................................. 6
WAT IS DATA-ANALYTICAL THINKING? ....................................................................................................................... 6
Data science capability as strategic asset .......................................................................................................... 7
Signet Bank VS. Capital One .................................................................................................................................. 7
Amazon ............................................................................................................................................................... 8
Harrah’s Casinos .................................................................................................................................................. 8
Waardering van Facebook en Twitter ..................................................................................................................... 8
WAT IS DATA SCIENCE OF DATAWETENSCHAP? .......................................................................................................... 8
SAMENVATTING ..................................................................................................................................................... 11
H1.2 BUSINESS PROBLEMS & DATA SCIENCE SOLUTIONS ................................................................................ 12
VERSCHILLENDE DATAMINING TAKEN ..................................................................................................................... 12
Classification & class probability estimation ........................................................................................................ 12
Regression ......................................................................................................................................................... 12
Similarity matching ............................................................................................................................................. 12
Clustering .......................................................................................................................................................... 13
Co-occurrence grouping ..................................................................................................................................... 13
Profiling ............................................................................................................................................................. 13
Link prediction ................................................................................................................................................... 13
Data reduction ................................................................................................................................................... 13
Causal modeling ................................................................................................................................................ 13
Conclusion ........................................................................................................................................................ 14
Two high-level primary goals: prediction and description ............................................................................. 14

, SUPERVISED VS. UNSUPERVISED METHODS............................................................................................................ 14
Voorbeeld .......................................................................................................................................................... 14
HET DATAMINING PROCES ...................................................................................................................................... 15
Belangrijk onderscheid ..................................................................................................................................... 15
Knowledge discovery in databases ................................................................................................................... 15
ANDERE ANALYSETECHNIEKEN EN -TECHNOLOGIEËN............................................................................................. 17
Statistics ............................................................................................................................................................ 17
Database querying ............................................................................................................................................ 17
OLAP-tools......................................................................................................................................................... 17
Data warehousing .............................................................................................................................................. 18
Regression analysis .......................................................................................................................................... 18
Machine learning (AI) and datamining (KDD) ..................................................................................................... 18
H2.1 INTRODUCTION TO PREDICTIVE MODELING ............................................................................................. 19
TERMINOLOGIE ..................................................................................................................................................... 19
Model ................................................................................................................................................................ 19
In data science ................................................................................................................................................... 19
Two high-level primary goals: prediction & description ..................................................................................... 19
Instance............................................................................................................................................................. 19
Inductie & deductie .......................................................................................................................................... 19
SUPERVISED SEGMENTATIE .................................................................................................................................... 19
Complicaties ..................................................................................................................................................... 20
HET SELECTEREN VAN INFORMATIEVE ATTRIBUTEN ................................................................................................. 21
Entropie ............................................................................................................................................................. 21
Information gain ................................................................................................................................................ 22
Voorbeeld: IG berekenen .................................................................................................................................... 22
Numeric values ................................................................................................................................................. 23
Regressieproblemen .......................................................................................................................................... 23
SUPERVISED SEGMENTATIE MET BOOMSTRUCTUURMODELLEN ............................................................................... 23
Voorbeeld .......................................................................................................................................................... 24
Lichaamsvorm ................................................................................................................................................... 24
Samenvatting ..................................................................................................................................................... 25
ANDERE VOORSTELLINGEN .................................................................................................................................... 26
Visualisatie van segmenten .............................................................................................................................. 26
Decision lines & hyper planes (beslissingslijnen & hypervlakken) ................................................................ 26
Bomen als reeksen van regels ......................................................................................................................... 27
PROBABILITY ESTIMATION (WAARSCHIJNLIJKHEIDSSCHATTING) .............................................................................. 27
Voorbeeld .......................................................................................................................................................... 27
H2.2 FITTING A MODEL TO DATA....................................................................................................................... 28
CONTENTS ............................................................................................................................................................... 28
Decision Trees vS. parametric modeling ......................................................................................................... 28
Drie assumpties ................................................................................................................................................. 28
LINEAR DISCRIMINANT FUNCTIONS ........................................................................................................................ 28
Instance space ................................................................................................................................................... 28

, lineaire discriminerende functie .......................................................................................................................... 29
Optimaliseren v/d objective function ................................................................................................................... 30
Voorbeeld lineaire discriminatie ....................................................................................................................... 30
CLASSIFICATION: SCORING & RANKING .................................................................................................................. 30
LINEAR MODEL FOR CLASSIFICATION................................................................................................................................ 31
SUPPORT VECTOR MACHINES (SVM) ................................................................................................................... 31
Logistieke regressie ............................................................................................................................................ 32
Linear regression ................................................................................................................................................ 33
WHAT IF THE DATA IS NON-LINEAR? ......................................................................................................................... 34
H3.1 OVERFITTING & ITS AVOIDANCE ................................................................................................................ 35
OVERFITTING ......................................................................................................................................................... 35
Definitie ............................................................................................................................................................. 35
Wat nu? ............................................................................................................................................................. 35
Holdout data & fitting graphs ............................................................................................................................... 35
VOORSPELLINGSTECHNIEKEN & OVERFITTING ................................................................................................... 36
WAAROM IS OVERFITTEN SLECHT?...................................................................................................................... 39
AVOIDING OVERFITTING !!! ............................................................................................................................................ 40
CROSS VALIDATION ........................................................................................................................................... 40
LEARNING CURVES ............................................................................................................................................ 42
VERMIJDEN VAN OVERFITTING & COMPLEXITEITSCONTROLE .............................................................................. 42
H3.2 SIMILARITY, NEIGHBORS & CLUSTERS ....................................................................................................... 45
CALCULATE SIMILARITY ............................................................................................................................................. 45
gEBRUIK VAN SIMILARITY .................................................................................................................................... 45
AFSTAND ........................................................................................................................................................... 46
NEAREST-NEIGHBOUR REASONING (NN) ............................................................................................................ 47
Goniometrische interpretatie, overfitting & complexity control .............................................................................. 50
3 problemen met k-NN ....................................................................................................................................... 51
Technische details m.b.t. NN Heterogene attributen............................................................................................. 52
Technische details m.b.t. Andere afstandsfuncties ............................................................................................... 52
CLUSTERING AS SIMILARITY-BASED SEGMENTATION ............................................................................................... 54
Supervised vs. unsupervised ............................................................................................................................... 54
Clustering = unsupervised segmentation ............................................................................................................. 54
2 soorten clustering ............................................................................................................................................ 55
Hiërarchische clustering vs. centroid clustering (k-means) ................................................................................... 58
Clustering resultaten .......................................................................................................................................... 58
H4.1 DECISION ANALYTICAL THINKING 1 : WHAT IS A GOOD MODEL? ....................................................... 59
INTRODUCTIE ........................................................................................................................................................ 59
EVALUEREN VAN CLASSIFIERS ................................................................................................................................ 59
Plain accuracy ................................................................................................................................................... 59
Probleem met ongebalanceerde klassen ............................................................................................................. 60
Confusion matrix ................................................................................................................................................ 61
Problemen met ongelijke kosten en baten ............................................................................................................ 63
GENERALIZING BEYOND CLASSIFIERS ..................................................................................................................... 63

, Algemene principe .............................................................................................................................................. 63
EXPECTED VALUE FRAMEWORK .............................................................................................................................. 64
Using expected value to frame classifier use ........................................................................................................ 64
Gebruik v/d expected value voor de evaluatie v/d classifier ................................................................................... 65
Kosten & baten binnen expected value framework ................................................................................................ 66
BASELINE PERFORMANCE (& CONSEQUENCES) ........................................................................................................... 69
Baseline model .................................................................................................................................................. 69
Algemene principes ............................................................................................................................................ 69
Andere ............................................................................................................................................................... 70
H4.2 VISUALISING MODEL PERFORMANCE ....................................................................................................... 71
RANKING IN PLAATS VAN CLASSIFICEREN .......................................................................................................... 71
WINSTCURVES ................................................................................................................................................... 73
ROC curves & AUC (Area under curve) ................................................................................................................. 74
CUMULATIEVE RESPONS- & LIFTCURVES ............................................................................................................ 77
VOORBEELD CHURNPREDICTION ...................................................................................................................... 78
H5.1 EVIDENCE AND PROBABILITIES ................................................................................................................ 82
VOORBEELD ...................................................................................................................................................... 82
COMBINING EVICENCE PROBABILISTICALLY ...................................................................................................... 82
JOINT PROBABILITY & INDEPENDENCE ............................................................................................................... 83
BAYES' RULE ...................................................................................................................................................... 83
Het toepassen van de bayes’ rule op data science ................................................................................................ 84
Conditional independence & naive bayes............................................................................................................. 85
Voordelen & nadelen van naïve bayes .................................................................................................................. 86
EEN MODEL VAN BEWIJSVOERING "LIFT" ............................................................................................................ 86
Voorbeeld: bewijsliften van facebook likes ........................................................................................................... 86
SAMENVATTING ................................................................................................................................................. 87
H5.2 REPRESENTING AND MINING TEXT ............................................................................................................ 88
DATA PREPARATION ............................................................................................................................................... 88
WAAROM IS TEKST BELANGRIJK? ............................................................................................................................ 88
WAAROM IS TEKST MOEILIJK? ................................................................................................................................. 88
REPRESENTATION - WEERGAVE .............................................................................................................................. 89
Bag of words ...................................................................................................................................................... 89
Term frequency .................................................................................................................................................. 89
Normalisatie en stemming .................................................................................................................................. 90
meten van spaarzaamheid (sparseness): inverse document frequency .................................................................. 91
Combinatie van TF & IDF: TFIDF .......................................................................................................................... 92
VOORBEELD.............................................................................................................................................................. 92
THE RELATIONSHIP OF IDF TO ENTROPY ........................................................................................................................... 93
BEYOND BAG OF WORDS ....................................................................................................................................... 94
N-gram sequence ............................................................................................................................................... 94
Named Entity Extraction ...................................................................................................................................... 94
Topic models ..................................................................................................................................................... 95
VOORBEELD: DATAMINING OM DE KOERSBEWEGING TE VOORSPELLEN .................................................................. 96

Inhoudsopgave

  1. 01 SUPERVISED VS. UNSUPERVISED METHODS 14
  2. 02 Voorbeeld 14
  3. 03 HET DATAMINING PROCES 15
  4. 04 Belangrijk onderscheid 15
  5. 05 Knowledge discovery in databases 15
  6. 06 ANDERE ANALYSETECHNIEKEN EN -TECHNOLOGIEËN 17
  7. 07 Statistics 17
  8. 08 Database querying 17
  9. 09 OLAP-tools 17
  10. 10 Data warehousing 18
  11. 11 Regression analysis 18
  12. 12 Machine learning (AI) and datamining (KDD) 18
  13. 13 INTRODUCTION TO PREDICTIVE MODELING 19
  14. 14 TERMINOLOGIE 19
  15. 15 Model 19
  16. 16 In data science 19
  17. 17 Two high-level primary goals: prediction & description 19
  18. 18 Instance 19
  19. 19 Inductie & deductie 19
  20. 20 SUPERVISED SEGMENTATIE 19
  21. 21 Complicaties 20
  22. 22 HET SELECTEREN VAN INFORMATIEVE ATTRIBUTEN 21
  23. 23 Entropie 21
  24. 24 Information gain 22
  25. 25 Voorbeeld: IG berekenen 22
  26. 26 Numeric values 23
  27. 27 Regressieproblemen 23
  28. 28 SUPERVISED SEGMENTATIE MET BOOMSTRUCTUURMODELLEN 23
  29. 29 Voorbeeld 24
  30. 30 Lichaamsvorm 24
  31. 31 Samenvatting 25
  32. 32 ANDERE VOORSTELLINGEN 26
  33. 33 Visualisatie van segmenten 26
  34. 34 Decision lines & hyper planes (beslissingslijnen & hypervlakken) 26
  35. 35 Bomen als reeksen van regels 27
  36. 36 PROBABILITY ESTIMATION (WAARSCHIJNLIJKHEIDSSCHATTING) 27
  37. 37 Voorbeeld 27
  38. 38 FITTING A MODEL TO DATA 28
  39. 39 CONTENTS 28
  40. 40 Decision Trees vS. parametric modeling 28
  41. 41 Drie assumpties 28
  42. 42 LINEAR DISCRIMINANT FUNCTIONS 28
  43. 43 Instance space 28
  44. 44 lineaire discriminerende functie 29
  45. 45 Optimaliseren v/d objective function 30
  46. 46 Voorbeeld lineaire discriminatie 30
  47. 47 CLASSIFICATION: SCORING & RANKING 30
  48. 48 LINEAR MODEL FOR CLASSIFICATION 31
  49. 49 SUPPORT VECTOR MACHINES (SVM) 31
  50. 50 Logistieke regressie 32
  51. 51 Linear regression 33
  52. 52 WHAT IF THE DATA IS NON-LINEAR? 34
  53. 53 OVERFITTING & ITS AVOIDANCE 35
  54. 54 OVERFITTING 35
  55. 55 Definitie 35
  56. 56 Wat nu? 35
  57. 57 Holdout data & fitting graphs 35
  58. 58 VOORSPELLINGSTECHNIEKEN & OVERFITTING 36
  59. 59 WAAROM IS OVERFITTEN SLECHT? 39
  60. 60 AVOIDING OVERFITTING !!! 40
  61. 61 CROSS VALIDATION 40
  62. 62 LEARNING CURVES 42
  63. 63 VERMIJDEN VAN OVERFITTING & COMPLEXITEITSCONTROLE 42
  64. 64 SIMILARITY, NEIGHBORS & CLUSTERS 45
  65. 65 CALCULATE SIMILARITY 45
  66. 66 gEBRUIK VAN SIMILARITY 45
  67. 67 AFSTAND 46
  68. 68 NEAREST-NEIGHBOUR REASONING (NN) 47
  69. 69 Goniometrische interpretatie, overfitting & complexity control 50
  70. 70 problemen met k-NN 51
  71. 71 Technische details m.b.t. NN Heterogene attributen 52
  72. 72 Technische details m.b.t. Andere afstandsfuncties 52
  73. 73 CLUSTERING AS SIMILARITY-BASED SEGMENTATION 54
  74. 74 Supervised vs. unsupervised 54
  75. 75 Clustering = unsupervised segmentation 54
  76. 76 soorten clustering 55
  77. 77 Hiërarchische clustering vs. centroid clustering (k-means) 58
  78. 78 Clustering resultaten 58
  79. 79 DECISION ANALYTICAL THINKING 1 : WHAT IS A GOOD MODEL? 59
  80. 80 INTRODUCTIE 59
  81. 81 EVALUEREN VAN CLASSIFIERS 59
  82. 82 Plain accuracy 59
  83. 83 Probleem met ongebalanceerde klassen 60
  84. 84 Confusion matrix 61
  85. 85 Problemen met ongelijke kosten en baten 63
  86. 86 GENERALIZING BEYOND CLASSIFIERS 63
  87. 87 Algemene principe 63
  88. 88 EXPECTED VALUE FRAMEWORK 64
  89. 89 Using expected value to frame classifier use 64
  90. 90 Gebruik v/d expected value voor de evaluatie v/d classifier 65
  91. 91 Kosten & baten binnen expected value framework 66
  92. 92 BASELINE PERFORMANCE (& CONSEQUENCES) 69
  93. 93 Baseline model 69
  94. 94 Algemene principes 69
  95. 95 Andere 70
  96. 96 VISUALISING MODEL PERFORMANCE 71
  97. 97 RANKING IN PLAATS VAN CLASSIFICEREN 71
  98. 98 WINSTCURVES 73
  99. 99 ROC curves & AUC (Area under curve) 74
  100. 100 CUMULATIEVE RESPONS- & LIFTCURVES 77
  101. 101 VOORBEELD CHURNPREDICTION 78
  102. 102 EVIDENCE AND PROBABILITIES 82
  103. 103 VOORBEELD 82
  104. 104 COMBINING EVICENCE PROBABILISTICALLY 82
  105. 105 JOINT PROBABILITY & INDEPENDENCE 83
  106. 106 BAYES' RULE 83
  107. 107 Het toepassen van de bayes’ rule op data science 84
  108. 108 Conditional independence & naive bayes 85
  109. 109 Voordelen & nadelen van naïve bayes 86
  110. 110 EEN MODEL VAN BEWIJSVOERING "LIFT" 86
  111. 111 Voorbeeld: bewijsliften van facebook likes 86
  112. 112 SAMENVATTING 87
  113. 113 REPRESENTING AND MINING TEXT 88
  114. 114 DATA PREPARATION 88
  115. 115 WAAROM IS TEKST BELANGRIJK? 88
  116. 116 WAAROM IS TEKST MOEILIJK? 88
  117. 117 REPRESENTATION - WEERGAVE 89
  118. 118 Bag of words 89
  119. 119 Term frequency 89
  120. 120 Normalisatie en stemming 90
  121. 121 meten van spaarzaamheid (sparseness): inverse document frequency 91
  122. 122 Combinatie van TF & IDF: TFIDF 92
  123. 123 VOORBEELD 92
  124. 124 THE RELATIONSHIP OF IDF TO ENTROPY 93
  125. 125 BEYOND BAG OF WORDS 94
  126. 126 N-gram sequence 94
  127. 127 Named Entity Extraction 94
  128. 128 Topic models 95
  129. 129 VOORBEELD: DATAMINING OM DE KOERSBEWEGING TE VOORSPELLEN 96
  130. 130 The task 96
  131. 131 De data 96
  132. 132 Data preprocessing 96
  133. 133 Resultaten 96
  134. 134 SUMMARY 97
  135. 135 DECISION ANALYTICAL THINKING 2: TOWARD ANALYTICAL ENGINEERING 98
  136. 136 CHARITY MAILING 98
  137. 137 Wat is het exacte business probleem? 99
  138. 138 Hoe kunnen we het business probleem oplossen? 99
  139. 139 A brief digression on selection bias 99
  140. 140 CHURNPROBLEEM 100
  141. 141 Wat is het exacte business probleem? 100
  142. 142 Expected value framework: structuring a more complicated business problem 100
  143. 143 Assessing the influence of the incentive 100
  144. 144 From an expected value decomposition to a data science solution: 101
  145. 145 Hoe kunnen we het business probleem oplossen? 101
  146. 146 OTHER DATA SCIENCE TASKS & TECHNIQUES 102
  147. 147 CO-OCCURRENCE GROUPING (ASSOCIATIONS DISCOVERY) 102
  148. 148 Complexiteitcontrole 102
  149. 149 Het meten van surprise via lift & leverage 103
  150. 150 Voorbeeld: bier en loterijkaartjes 103
  151. 151 Associations via facebook likes 104
  152. 152 PROFILING 104
  153. 153 LINK PREDICTION 105
  154. 154 DATA REDUCTION 106
  155. 155 BIAS, VARIANCE & ENSEMBLE METHODS 106
  156. 156 CAUSAL MODELING 107
  157. 157 DATA SCIENCE & BUSINESS STRATEGY 108
  158. 158 THINKING DATA-ANALYTICALLY, REDUX 108
  159. 159 ACHIEVING COMPETITIVE ADVANTAGE WITH DATA SCIENCE 108
  160. 160 SUSTAINING COMPETITIVE ADVANTAGE WITH DATA SCIENCE 108
  161. 161 1ste reden ➔ fortuinlijk historisch voordeel 108
  162. 162 2de reden ➔ uniek intellectueel eigendom 108
  163. 163 3de reden ➔ uniek immateriële assets 109
  164. 164 4de reden ➔ superieure datawetenschappers 109
  165. 165 Superior data science management 109
  166. 166 BE READY TO EVALUATE PROPOSALS FOR DATA SCIENCE PROJECTS 110
  167. 167 CONCLUSION 111
  168. 168 THE FUNDAMENTAL CONCEPTS OF DATA SCIENCE 111
  169. 169 Applying our fundamental concepts to a new problem: mining mobile device data 111
  170. 170 Changing the way we think about solutions to business problems 112
  171. 171 WHAT DATA CAN’T DO: HUMANS IN THE LOOP, REVISITED 112
  172. 172 PRIVACY, ETHICS & MINING DATA ABOUT INDIVIDUALS 112
  173. 173 manipuleren 2
  174. 174 pas dan heb je de grootste waarde 3
  175. 175 toepassing van datawetenschappelijke principes en dataminingtechnieken 4
  176. 176 - Een voorschrift voor verzekeringsbedrijven 5

Documentinformatie

Studie
Geüpload op
3 juni 2026
Bestand laatst geupdate op
3 juni 2026
Aantal pagina's
117
Geschreven in
2025/2026
Type
Samenvatting
€12,06

Verkeerd document? Gratis ruilen Binnen 14 dagen na aankoop en voor het downloaden kun je een ander document kiezen. Je kunt het bedrag gewoon opnieuw besteden.
Geschreven door studenten die geslaagd zijn
Direct beschikbaar na je betaling
Online lezen of als PDF

Seller avatar
De reputatie van een verkoper is gebaseerd op het aantal documenten dat iemand tegen betaling verkocht heeft en de beoordelingen die voor die items ontvangen zijn. Er zijn drie niveau’s te onderscheiden: brons, zilver en goud. Hoe beter de reputatie, hoe meer de kwaliteit van zijn of haar werk te vertrouwen is.
Verkocht
16
Volgers
0
Items
26
Laatst verkocht
4 weken geleden

Echte notities, van echte studenten
Elk document op Stuvia is geschreven door een medestudent die hetzelfde vak deed. Zo leer je van iemand die het al heeft gehaald.



Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Kwaliteit die je kunt vertrouwen: geschreven door studenten die slaagden en beoordeeld door anderen die dit document gebruikten.

Niet tevreden? Kies een ander document

Geen zorgen! Je kunt voor hetzelfde geld direct een ander document kiezen dat beter past bij wat je zoekt.

Betaal zoals je wilt, start meteen met leren

Geen abonnement, geen verplichtingen. Betaal zoals je gewend bent via iDeal of creditcard en download je PDF-document meteen.

Student with book image

“Gekocht, gedownload en geslaagd. Zo makkelijk kan het dus zijn.”

Alisha Student

Bezig met je bronvermelding?

Maak nauwkeurige citaten in APA, MLA en Harvard met onze gratis bronnengenerator.

Bezig met je bronvermelding?

Veelgestelde vragen