DATA ANALYTICS IN ACCOUNTING
HOOFDSTUK 1: INTRODUCTIE
Data analytics = het systematisch analyseren van data om specifieke businessvragen te
beantwoorden & beslissingen te verbeteren.
o vertrekt vanuit een duidelijke vraag
o data gebruiken om onderbouwde inschattingen te maken & patronen/relaties te
identificeren.
o doel = betere beslissingen nemen => menselijke vertekeningen te verminderen
Big Data verwijst naar datasets waarvan omvang, snelheid of complexiteit traditionele analysemethoden
overstijgen
o Volume – omvang van de data
o Velocity – de snelheid waarmee data worden gegenereerd & verwerkt
o Variety – de verschillende types data
o Veracity – de betrouwbaarheid en kwaliteit van de data
HOE VERANDERT DATA-ANALYSE HET WERK VAN ACCOUNTANTS EN FINANCIËLE PROFESSIONALS?
FINANCIAL ACCOUNTANTS
Data-analyse versterkt de kwaliteit en betrouwbaarheid van financiële verslaggeving.
o Nauwkeurigere schattingen:
betere inschatting van dubieuze debiteuren, afschrijvingen, waardeverminderingen &
voorzieningen obv historische patronen
o Consistente toepassing van verslaggevingsregels:
Systematische controle op correcte classificatie van transacties & snellere
detectie van afwijkingen (opsporen van ongebruikelijke boekingen/ transacties)
AUDITORS
Data-analyse verhoogt de auditkwaliteit
o Data-analyse versterkt de kwaliteit & diepgang van de controle
bv door grondigere audits (bv. analyse van de volledige populatie ipv steekproef van transacties)
o De auditor ontwikkelt een beter begrip van het bedrijfsmodel & de risico’s
duurzame klantrelaties uitbouwen & aanvullende diensten aanbieden (vb. Due diligence van M&A
targets, ESG of sustainability assurance…)
MANAGEMENT ACCOUNTANTS
o Data-analyse verbetert kostenbeheersing en rendabiliteitsanalyse en verhoogt de
nauwkeurigheid van forecasts, budgetten, productie- en verkoopplanningen
o Data-analyse leidt tot beter onderbouwde strategische en operationele beslissingen
1
,WAT IS HET IMPACT MODEL?
= een methode om data-analyse uit te voeren, die het volledige proces omvat: van het identificeren
van de vraag, over het beheersen en begrijpen van de data, tot het uitvoeren van analyses en het
communiceren en opvolgen van de resultaten.
Het model is recursief van aard => wnr vragen worden beantwoord => ontstaan vaak nieuwe & meer
verfijnde vragen die op een gelijkaardige manier kunnen worden onderzocht.
Deze cyclus zal vaak herhaald worden, omdat 1 vraag vaak snelle vervolgvragen oproept.
1. Identify the questions.
2. Master the data.
3. Perform the test plan.
4. Address and refine results.
5. Communicate insights.
6. Track outcomes.
STEP 1: IDENTITFY THE QUESTIONS
Begrijp het businessprobleem dat moet aangepakt worden → begin met een duidelijke en concrete
vraag die mogelijk met data kan worden beantwoord (empirische vraagstelling)
AANDACHTSPUNTEN:
- Vraag empirisch te beantwoorden? Welke relevante databronnen zijn nodig om de vraag te
beantwoorden?
- Is de probleemstelling voldoende scherp afgebakend?
- Voor wie worden de resultaten geanalyseerd & gerapporteerd?
VOORBEELDEN VAN VRAGEN DIE MET DATA KUNNEN WORDEN BEANTWOORD:
- Omzeilen werknemers de interne controles rond betalingen?
- Betalen onze klanten tijdig?
- Hoe kunnen we de voorziening voor kredietverliezen op bankleningen voorspellen?
- Hoe kunnen we transacties identificeren met een verhoogd risico op boekhoudkundige fouten of
onregelmatigheden?
- Wie autoriseert betalingen boven 100.000 euro?
- Hoe kunnen fouten systematisch worden opgespoord?
STEP 2: MASTER THE DATA
We hebben een grondig begrip van de data nodig en moeten nagaan welke data beschikbaar is, hoe we
er toegang toe krijgen en of ze betrouwbaar en relevant is voor het bedrijfsprobleem.
! This step is very crucial but time-consuming (can take around 80% of your time)
2
,7 ELEMENTEN
1. Data beschikbaar in interne systemen (ERP, Boekhoudsysteem, enz.)
2. Data beschikbaar in externe netwerken en datawarehouses.
3. Bekijk Data Dictionaries (beschrijving van variabelen en definities).
4. Evalueer en voer het ETL-proces uit: extractie, transformatie en laden van data.
5. Valideer en controleer de volledigheid van de data.
6. Normalisatie & standaardisatie van data.
7. Datapreparatie & data cleaning => leave out redundancies, inconsistencies & irrelevant info
STEP 3: PERFORM THE TEST PLAN
Identificeer een relatie tussen de respons- (of afhankelijke) variabele & de factoren die de respons
beïnvloeden (=predictor-, verklarende of onafhankelijke variabelen)
- gebruik een geschikte methode om de data te onderzoeken en inzichten te verkrijgen.
- hiervoor: model of een vereenvoudigde voorstelling van de werkelijkheid gebruiken
vb: Predict the performance on the next accounting exam:
The response/dependent variable: score on the exam
The independent variables: study time, IQ, score on last exam…
BELANGRIJKE BENADERINGEN, AFHANKELIJK VAN DE VRAAG (PROVOST & FAWCETT)
1. CLASSIFICATIE
- wijs elke eenheid in een populatie toe aan een (vooraf gedefinieerde) categorie of klasse.
bv voorspellen welke bedrijven failliet zullen gaan en welke niet
2. REGRESSIE
- voorspel de waarde van een continue afhankelijke variabele obv onafhankelijke variabelen mbv
een statistisch model.
- relaties tussen variabelen beoordelen (vb correlaties)
bv de relatie voorspellen tussen een investering in advertentie-uitgaven & het daaropvolgende
operationele inkomen
3. SIMILARITY MATCHING (gelijkenisvergelijking)
- identificeer vergelijkbare individuen/items obv bekende data (bv adresgegevens: “123 Main St.” vs. “123
Main Street”)
- beoordelen of verschillende accounts van dezelfde persoon zijn
4. CLUSTERING
- verdeel individuen/items in betekenisvolle of bruikbare groepen (zonder vooraf gedefinieerde
categorieën)
- kan inzicht geven in consumentengedrag & helpen bij marketingtechnieken
3
, 5. CO-OCCURANCE GROUPING (samenvoorkomende groepering)
- ontdek associaties of relaties tussen individuen/items obv gedeelde transacties
bv Amazon gebruikt dit met “vaak samen gekocht met …” om je te overtuigen om producten te kopen
6. LINK PREDICTION
- voorspel connecties of relaties tussen twee data-items
bv zoeken naar relaties tussen verbonden partijen die anders niet bekendgemaakt zijn
7. PROFILING
- karakteriseer het typische gedrag van een individu, groep of populatie door samenvattende
statistieken over de data te genereren
- helpt om (ab)normaal gedrag in een groep te identificeren
bv maximum, minimum, … om het gedrag van een groep te beschrijven
bv normaal gedrag begrijpen om vervolgens abnormaal gedrag (zoals fraude) te herkennen
8. DATA REDUCTION
- focus op de meest kritische elementen om grote dataset te verkleinen tot een kleinere subset
samenvatting
Approach Definition Similarity with Other ApproachesKey Difference
Assigns each unit in a Classification uses predefined
population to a Similar to Clustering in grouping datalabeled data (supervised learning),
Classification
predefined category or & Regression in predicting outcomes.while clustering finds patterns in
class. unlabeled data.
Shares a goal with Classification Focuses on continuous outputs
Predicts a continuous
(predicting an outcome) and can (e.g., predicting sales), unlike
Regression dependent var based
complement Data Reduction in classification, which predicts
on independent var
simplifying inputs. categorical outputs.
Identifies individuals or Focuses on pairwise comparisons
Overlaps with Clustering in identifying
Similarity items that are similar (finding matches), while clustering
patterns or groups and with
Matching based on known creates broader groups or
Profiling in analyzing behaviors.
characteristics. patterns.
Divides individuals or Related to Similarity Matching and Clustering is unsupervised
Clustering items into meaningful, Classification in organizing data into learning, meaning it doesn't rely
unlabeled groups. patterns. on pre-existing labels.
Focuses on current/observed
Discovers associations Similar to Link Prediction in
Co-occurrence associations (e.g., market basket
between items based uncovering relationships between
Grouping analysis), while link prediction
on shared transactions. items.
forecasts future links.
Characterizes the
Profiling Related to Similarity Matching, as Aims to describe or summarize
"typical" behavior of
both analyze patterns, and Data data rather than predict or
individuals, groups, or
4
HOOFDSTUK 1: INTRODUCTIE
Data analytics = het systematisch analyseren van data om specifieke businessvragen te
beantwoorden & beslissingen te verbeteren.
o vertrekt vanuit een duidelijke vraag
o data gebruiken om onderbouwde inschattingen te maken & patronen/relaties te
identificeren.
o doel = betere beslissingen nemen => menselijke vertekeningen te verminderen
Big Data verwijst naar datasets waarvan omvang, snelheid of complexiteit traditionele analysemethoden
overstijgen
o Volume – omvang van de data
o Velocity – de snelheid waarmee data worden gegenereerd & verwerkt
o Variety – de verschillende types data
o Veracity – de betrouwbaarheid en kwaliteit van de data
HOE VERANDERT DATA-ANALYSE HET WERK VAN ACCOUNTANTS EN FINANCIËLE PROFESSIONALS?
FINANCIAL ACCOUNTANTS
Data-analyse versterkt de kwaliteit en betrouwbaarheid van financiële verslaggeving.
o Nauwkeurigere schattingen:
betere inschatting van dubieuze debiteuren, afschrijvingen, waardeverminderingen &
voorzieningen obv historische patronen
o Consistente toepassing van verslaggevingsregels:
Systematische controle op correcte classificatie van transacties & snellere
detectie van afwijkingen (opsporen van ongebruikelijke boekingen/ transacties)
AUDITORS
Data-analyse verhoogt de auditkwaliteit
o Data-analyse versterkt de kwaliteit & diepgang van de controle
bv door grondigere audits (bv. analyse van de volledige populatie ipv steekproef van transacties)
o De auditor ontwikkelt een beter begrip van het bedrijfsmodel & de risico’s
duurzame klantrelaties uitbouwen & aanvullende diensten aanbieden (vb. Due diligence van M&A
targets, ESG of sustainability assurance…)
MANAGEMENT ACCOUNTANTS
o Data-analyse verbetert kostenbeheersing en rendabiliteitsanalyse en verhoogt de
nauwkeurigheid van forecasts, budgetten, productie- en verkoopplanningen
o Data-analyse leidt tot beter onderbouwde strategische en operationele beslissingen
1
,WAT IS HET IMPACT MODEL?
= een methode om data-analyse uit te voeren, die het volledige proces omvat: van het identificeren
van de vraag, over het beheersen en begrijpen van de data, tot het uitvoeren van analyses en het
communiceren en opvolgen van de resultaten.
Het model is recursief van aard => wnr vragen worden beantwoord => ontstaan vaak nieuwe & meer
verfijnde vragen die op een gelijkaardige manier kunnen worden onderzocht.
Deze cyclus zal vaak herhaald worden, omdat 1 vraag vaak snelle vervolgvragen oproept.
1. Identify the questions.
2. Master the data.
3. Perform the test plan.
4. Address and refine results.
5. Communicate insights.
6. Track outcomes.
STEP 1: IDENTITFY THE QUESTIONS
Begrijp het businessprobleem dat moet aangepakt worden → begin met een duidelijke en concrete
vraag die mogelijk met data kan worden beantwoord (empirische vraagstelling)
AANDACHTSPUNTEN:
- Vraag empirisch te beantwoorden? Welke relevante databronnen zijn nodig om de vraag te
beantwoorden?
- Is de probleemstelling voldoende scherp afgebakend?
- Voor wie worden de resultaten geanalyseerd & gerapporteerd?
VOORBEELDEN VAN VRAGEN DIE MET DATA KUNNEN WORDEN BEANTWOORD:
- Omzeilen werknemers de interne controles rond betalingen?
- Betalen onze klanten tijdig?
- Hoe kunnen we de voorziening voor kredietverliezen op bankleningen voorspellen?
- Hoe kunnen we transacties identificeren met een verhoogd risico op boekhoudkundige fouten of
onregelmatigheden?
- Wie autoriseert betalingen boven 100.000 euro?
- Hoe kunnen fouten systematisch worden opgespoord?
STEP 2: MASTER THE DATA
We hebben een grondig begrip van de data nodig en moeten nagaan welke data beschikbaar is, hoe we
er toegang toe krijgen en of ze betrouwbaar en relevant is voor het bedrijfsprobleem.
! This step is very crucial but time-consuming (can take around 80% of your time)
2
,7 ELEMENTEN
1. Data beschikbaar in interne systemen (ERP, Boekhoudsysteem, enz.)
2. Data beschikbaar in externe netwerken en datawarehouses.
3. Bekijk Data Dictionaries (beschrijving van variabelen en definities).
4. Evalueer en voer het ETL-proces uit: extractie, transformatie en laden van data.
5. Valideer en controleer de volledigheid van de data.
6. Normalisatie & standaardisatie van data.
7. Datapreparatie & data cleaning => leave out redundancies, inconsistencies & irrelevant info
STEP 3: PERFORM THE TEST PLAN
Identificeer een relatie tussen de respons- (of afhankelijke) variabele & de factoren die de respons
beïnvloeden (=predictor-, verklarende of onafhankelijke variabelen)
- gebruik een geschikte methode om de data te onderzoeken en inzichten te verkrijgen.
- hiervoor: model of een vereenvoudigde voorstelling van de werkelijkheid gebruiken
vb: Predict the performance on the next accounting exam:
The response/dependent variable: score on the exam
The independent variables: study time, IQ, score on last exam…
BELANGRIJKE BENADERINGEN, AFHANKELIJK VAN DE VRAAG (PROVOST & FAWCETT)
1. CLASSIFICATIE
- wijs elke eenheid in een populatie toe aan een (vooraf gedefinieerde) categorie of klasse.
bv voorspellen welke bedrijven failliet zullen gaan en welke niet
2. REGRESSIE
- voorspel de waarde van een continue afhankelijke variabele obv onafhankelijke variabelen mbv
een statistisch model.
- relaties tussen variabelen beoordelen (vb correlaties)
bv de relatie voorspellen tussen een investering in advertentie-uitgaven & het daaropvolgende
operationele inkomen
3. SIMILARITY MATCHING (gelijkenisvergelijking)
- identificeer vergelijkbare individuen/items obv bekende data (bv adresgegevens: “123 Main St.” vs. “123
Main Street”)
- beoordelen of verschillende accounts van dezelfde persoon zijn
4. CLUSTERING
- verdeel individuen/items in betekenisvolle of bruikbare groepen (zonder vooraf gedefinieerde
categorieën)
- kan inzicht geven in consumentengedrag & helpen bij marketingtechnieken
3
, 5. CO-OCCURANCE GROUPING (samenvoorkomende groepering)
- ontdek associaties of relaties tussen individuen/items obv gedeelde transacties
bv Amazon gebruikt dit met “vaak samen gekocht met …” om je te overtuigen om producten te kopen
6. LINK PREDICTION
- voorspel connecties of relaties tussen twee data-items
bv zoeken naar relaties tussen verbonden partijen die anders niet bekendgemaakt zijn
7. PROFILING
- karakteriseer het typische gedrag van een individu, groep of populatie door samenvattende
statistieken over de data te genereren
- helpt om (ab)normaal gedrag in een groep te identificeren
bv maximum, minimum, … om het gedrag van een groep te beschrijven
bv normaal gedrag begrijpen om vervolgens abnormaal gedrag (zoals fraude) te herkennen
8. DATA REDUCTION
- focus op de meest kritische elementen om grote dataset te verkleinen tot een kleinere subset
samenvatting
Approach Definition Similarity with Other ApproachesKey Difference
Assigns each unit in a Classification uses predefined
population to a Similar to Clustering in grouping datalabeled data (supervised learning),
Classification
predefined category or & Regression in predicting outcomes.while clustering finds patterns in
class. unlabeled data.
Shares a goal with Classification Focuses on continuous outputs
Predicts a continuous
(predicting an outcome) and can (e.g., predicting sales), unlike
Regression dependent var based
complement Data Reduction in classification, which predicts
on independent var
simplifying inputs. categorical outputs.
Identifies individuals or Focuses on pairwise comparisons
Overlaps with Clustering in identifying
Similarity items that are similar (finding matches), while clustering
patterns or groups and with
Matching based on known creates broader groups or
Profiling in analyzing behaviors.
characteristics. patterns.
Divides individuals or Related to Similarity Matching and Clustering is unsupervised
Clustering items into meaningful, Classification in organizing data into learning, meaning it doesn't rely
unlabeled groups. patterns. on pre-existing labels.
Focuses on current/observed
Discovers associations Similar to Link Prediction in
Co-occurrence associations (e.g., market basket
between items based uncovering relationships between
Grouping analysis), while link prediction
on shared transactions. items.
forecasts future links.
Characterizes the
Profiling Related to Similarity Matching, as Aims to describe or summarize
"typical" behavior of
both analyze patterns, and Data data rather than predict or
individuals, groups, or
4