Business intelligence termen
Hoofdstuk 1.2.: Business problemen en data science solutions
Classificatie (S) Bij classificatie ga je voorspellen tot welke klasse
iemand behoort. Voorspelt of er iets zal gebeuren
Class probability Bij class probability estimation ga je voorspellen wat de
estimation kans is dat iemand tot een klasse behoort.
Regressieanalyse Met regressieanalyse kun je voorspellen hoe de waarde
van de ene variabele (de afhankelijke variabele)
verandert als de waarde van de andere variabele (de
onafhankelijke variabele) verandert.
Regressie (S) Probeert voor elk individu de numerieke waarde van
(waardeschatting) een of andere variabele te schatten of te voorspellen.
Voorspelt hoeveel en in welke mate iets zal gebeuren.
Similarity Probeert gelijksoortige personen te identificeren op
matching basis van gegevens die over hen bekend zijn. Kan
gebruikt worden om soortelijke entiteiten te vinden
Clustering (U) Probeert individuen in een populatie te groeperen op
basis van hun gelijkenis, maar wordt niet gedreven
door een specifiek doel. Nuttig om te zien welke
natuurlijke groepen er bestaan, omdat deze groepen
op hun beurt andere datamining-taken of -
benaderingen kunnen suggereren. Hier wordt gekeken
naar overeenkomsten tussen objecten op basis van de
attributen van de objecten.
Co-occurence Tracht associaties te vinden tussen entiteiten op basis
grouping (U) van transacties waarbij deze personen betrokken zijn.
Bv welke items vaak samen ingekocht worden. Hier
wordt gekeken naar overeenkomsten tussen objecten
op basis van het feit dat ze samen in transacties
voorkomen.
Profilering (U) Probeert het typische gedrag van een individu, groep
(gedragsbeschrijv of populatie te karakteriseren. Wordt vaak gebruikt om
ing) gedragsnormen vast te stellen.
Link prediction Probeert verbanden tussen gegevens te voorspellen,
meestal dor te suggereren dat er een verband moet
bestaan en mogelijks ook door de sterkte van het
verband te schatten.
Data reduction Grote set gegevens vervangen door kleinere set
gegevens. Makkelijker te verwerken
Causal modeling Welke gebeurtenissen of acties zijn werkelijk van
(S) invloed op anderen. Technieken hiervoor houden vooral
investeringen in, die worden gezien als
counterfactual analyse: ze proberen te begrijpen
wat het verschil zou zijn tussen de situaties waar de
, gebeurtenis zou gebeuren en niet zou gebeuren.
Database Een query is een specifieke vraag naar een
querying deelverzameling van gegevens of naar statistieken
over gegevens, geformuleerd in een technische taal en
gesteld aan een databanksysteem.
OLAP Online analytical processing heeft als doel de
verkenning van gegevens te vergemakkelijken
Datamining (KDD) Heeft meer aandacht voor de analyse van gegevens
om nuttige of informatieve patronen te vinden. KDD
heeft ook de neiging om zich meer bezig te houden
met het hele proces van data-analyse: data
preparation, model learning en evaluatie.
Machine learning Subgebied van AI, dat zich bezighield met methoden
voor het verbeteren van de kennis of prestaties van
een intelligente agent over tijd, als reactie op de
ervaring van de agent in de wereld. Een dergelijke
verbetering betreft vaak het analyseren van gegevens
uit de omgeving en het maken van voorspellingen over
onbekende hoeveelheden.
Hoofdstuk 2.1.: Introduction to predictive modeling
Model Vereenvoudigde voorstelling van de werkelijkheid
gemaakt om een doel te dienen. Beschrijft een relatie
tussen een set van geselecteerde variabelen
(attributen of features) en een voorgedefinieerde
variabele (doelvariabele).
Prediction Voorspellen van een toekomstige gebeurtenis.
Description Primaire doel is om inzicht te krijgen in het
onderliggende fenomeen of proces. Je gebruikt enkele
variabelen om menselijk interpreteerbare patronen te
vinden die de gegevens beschrijven.
Instance of = Feature vecture. Wordt beschreven door set
example attributen
Inductie Veralgemenen van specifieke regels naar algemene
regels, modellen worden vanuit de data gecreëerd. (
deductie = model wordt gebruikt en toegepast)
Supervised Het segmenteren van populatie in subgroepen (die
segmentatie verschillende waarden hebben voor de doelvariabele),
rekening houdend met het vooropgestelde resultaat
(opdelen in subgroepen)
Information gain Hoe informatief een eigenschap is ten opzichte van ons
doel. De verandering in puurheid tussen ouder en kind.
IG komt voor als de entropie van de kinderen beter is
dan van de ouders.
Hoofdstuk 1.2.: Business problemen en data science solutions
Classificatie (S) Bij classificatie ga je voorspellen tot welke klasse
iemand behoort. Voorspelt of er iets zal gebeuren
Class probability Bij class probability estimation ga je voorspellen wat de
estimation kans is dat iemand tot een klasse behoort.
Regressieanalyse Met regressieanalyse kun je voorspellen hoe de waarde
van de ene variabele (de afhankelijke variabele)
verandert als de waarde van de andere variabele (de
onafhankelijke variabele) verandert.
Regressie (S) Probeert voor elk individu de numerieke waarde van
(waardeschatting) een of andere variabele te schatten of te voorspellen.
Voorspelt hoeveel en in welke mate iets zal gebeuren.
Similarity Probeert gelijksoortige personen te identificeren op
matching basis van gegevens die over hen bekend zijn. Kan
gebruikt worden om soortelijke entiteiten te vinden
Clustering (U) Probeert individuen in een populatie te groeperen op
basis van hun gelijkenis, maar wordt niet gedreven
door een specifiek doel. Nuttig om te zien welke
natuurlijke groepen er bestaan, omdat deze groepen
op hun beurt andere datamining-taken of -
benaderingen kunnen suggereren. Hier wordt gekeken
naar overeenkomsten tussen objecten op basis van de
attributen van de objecten.
Co-occurence Tracht associaties te vinden tussen entiteiten op basis
grouping (U) van transacties waarbij deze personen betrokken zijn.
Bv welke items vaak samen ingekocht worden. Hier
wordt gekeken naar overeenkomsten tussen objecten
op basis van het feit dat ze samen in transacties
voorkomen.
Profilering (U) Probeert het typische gedrag van een individu, groep
(gedragsbeschrijv of populatie te karakteriseren. Wordt vaak gebruikt om
ing) gedragsnormen vast te stellen.
Link prediction Probeert verbanden tussen gegevens te voorspellen,
meestal dor te suggereren dat er een verband moet
bestaan en mogelijks ook door de sterkte van het
verband te schatten.
Data reduction Grote set gegevens vervangen door kleinere set
gegevens. Makkelijker te verwerken
Causal modeling Welke gebeurtenissen of acties zijn werkelijk van
(S) invloed op anderen. Technieken hiervoor houden vooral
investeringen in, die worden gezien als
counterfactual analyse: ze proberen te begrijpen
wat het verschil zou zijn tussen de situaties waar de
, gebeurtenis zou gebeuren en niet zou gebeuren.
Database Een query is een specifieke vraag naar een
querying deelverzameling van gegevens of naar statistieken
over gegevens, geformuleerd in een technische taal en
gesteld aan een databanksysteem.
OLAP Online analytical processing heeft als doel de
verkenning van gegevens te vergemakkelijken
Datamining (KDD) Heeft meer aandacht voor de analyse van gegevens
om nuttige of informatieve patronen te vinden. KDD
heeft ook de neiging om zich meer bezig te houden
met het hele proces van data-analyse: data
preparation, model learning en evaluatie.
Machine learning Subgebied van AI, dat zich bezighield met methoden
voor het verbeteren van de kennis of prestaties van
een intelligente agent over tijd, als reactie op de
ervaring van de agent in de wereld. Een dergelijke
verbetering betreft vaak het analyseren van gegevens
uit de omgeving en het maken van voorspellingen over
onbekende hoeveelheden.
Hoofdstuk 2.1.: Introduction to predictive modeling
Model Vereenvoudigde voorstelling van de werkelijkheid
gemaakt om een doel te dienen. Beschrijft een relatie
tussen een set van geselecteerde variabelen
(attributen of features) en een voorgedefinieerde
variabele (doelvariabele).
Prediction Voorspellen van een toekomstige gebeurtenis.
Description Primaire doel is om inzicht te krijgen in het
onderliggende fenomeen of proces. Je gebruikt enkele
variabelen om menselijk interpreteerbare patronen te
vinden die de gegevens beschrijven.
Instance of = Feature vecture. Wordt beschreven door set
example attributen
Inductie Veralgemenen van specifieke regels naar algemene
regels, modellen worden vanuit de data gecreëerd. (
deductie = model wordt gebruikt en toegepast)
Supervised Het segmenteren van populatie in subgroepen (die
segmentatie verschillende waarden hebben voor de doelvariabele),
rekening houdend met het vooropgestelde resultaat
(opdelen in subgroepen)
Information gain Hoe informatief een eigenschap is ten opzichte van ons
doel. De verandering in puurheid tussen ouder en kind.
IG komt voor als de entropie van de kinderen beter is
dan van de ouders.