Geschreven door studenten die geslaagd zijn Direct beschikbaar na je betaling Online lezen of als PDF Verkeerd document? Gratis ruilen 4,6 TrustPilot
logo-home
Document preview thumbnail
Voorbeeld 4 van de 106 pagina's
Samenvatting

Volledige samenvatting van het vak methodologie 2 (VU). Behaald tentamencijfer met deze samenvatting: 9.7

Document preview thumbnail
Voorbeeld 4 van de 106 pagina's

Volledige samenvatting van alle hoorcolleges/powerpoints, aangevuld met alles wat erin word vermeld. Ook de nieuwe AI powerpoints zijn hierin volledig verwerkt. Door het leren van deze samenvatting bevat je alle kennis van het vak, zelf heb ik er een 9.7 mee behaald.

Voorbeeld van de inhoud

Methodologie 2

Hoorcollege 0. AI.
‘.. als student geen generatieve AI mag gebruiken, tenzij de docent of examinator van je vak
aangeeft of en hoe dat mag’ → niet copy pasten en niet parafraseren.

Waarom dit college?:
●​ Er is een enorme verzameling tools beschikbaar gekomen om onderzoek uit te
voeren, maar ook om werkopdrachten te "doen" (offload)
●​ Uitleggen hoe onderzoek ethisch uit te voeren
●​ Helpen om je leerproces vorm te geven
●​ LLM's worden steeds krachtiger: informatie opzoeken, redeneren, schrijven, zelfs
complete producten maken, software herontwikkelen en zelfs herschrijven.
●​ Dit zijn kernvaardigheden die nodig zijn om onderzoek uit te voeren en die je opdoet
tijdens cursussen zoals deze
●​ Is het OK om LLM's te gebruiken tijdens het leren en/of onderzoek? En op welke
manier dan? Hiervoor eerst AI begrijpen.

Gen AI begrijpen (in dit college genAI = LLM’s):
-​ Wat kunnen LLM’s doen?
-​ Hoe werken LLM’s?
-​ Chat GPT: wat betekent GPT eigenlijk??
-​ Generative Pre-trained Transformer
-​ Wat betekent "generatief"...
-​ en wat is een “transformer”???

Hoe werken LLM’s?
Verschillende componenten en processen:
-​ Tokenizer
-​ Enorm trainingsproces (backpropagation)
-​ Embedding matrix [inbedding matrix]
-​ Transformer architectuur
-​ Chain of Thought (RLHF) [gedachtegang]: hoe een LLM voor zichzelf een
denkproces opbreekt en verwoord → getraind met behulp van RLHF.

Tokenizer:
●​ Large Language Models verwerken getallen, geen taal.
●​ Data (bv een tekst) wordt geëncodeerd als “tokens”
●​ Iedere token is een getal, het token ID
●​ Token IDs zijn de eenheden van informatie waar LLM’s mee werken

Hoe werkt dat?
●​ Iedere LLM heeft zijn eigen tokenizer en kan alleen tokens van zijn eigen tokenizer
verwerken
●​ Afhankelijk van de tokenizer kunnen tokens letters, deelwoorden, hele woorden of
een combinatie hiervan representeren
●​ Alle tokens die een LLM kan representeren worden tezamen de vocabulary
[woordenschat] van de LLM genoemd

,Letter tokenizer:
Geeft aan iedere letter een getal. Waarbij iedere letter 1 keer
gerepresenteerd wordt. Het zet de tekst om in getallen, de token
ID’s.

Een LLM die een letter tokenizer gebruikt, zou waarschijnlijk een
woordenschat hebben van slechts 70 of 80 tokens:
-​ Eén token voor elke kleine letter van het alfabet
-​ Eén token voor elke HOOFDLETTER van het alfabet
-​ Speciale tekens zoals spatie, !?#@$%^&*()":;<>, enz
Is dit wel handig??

Woord tokenizer
Ieder woord krijgt een aparte token.
-​ Een LLM die een woord tokenizer gebruikt, zou waarschijnlijk
een woordenschat hebben van tientallen miljoenen tokens.
-​ Als je alle unieke Nederlandse woorden op het internet neemt
(inclusief verschillende spellingen, zeer zeldzame woorden,
typefouten enz.) zou je zelfs honderden miljoenen tokens
kunnen krijgen.
Ook niet handig! Wat doen ze dan wel?

Eenvoudige deelwoord tokenizer
-​ Probeert een balans te vinden tussen representatie op
karakter niveau en representatie op woordniveau. De
meeste LLM's doen iets dergelijks en hebben een
woordenschat van tussen de 50.000 en 100.000 tokens,
die altijd vooraf is gedefinieerd.
-​ Dit houdt de woordenschat klein genoeg om efficiënt te zijn,
en flexibel genoeg om willekeurige nieuwe woorden te
kunnen representeren, waarbij men poogt een balans te
vinden tussen de generaliseerbaarheid van het model
enerzijds en de modelgrootte / trainingstijd anderzijds.

Voorbeeld 1.​ ​ ​ ​ ​ Voorbeeld 2.
In Chat Gpt-4 kon je vragen hoeveel a’s
zitten er in het woord strawberry. Zegt
hij eerst 1, maar al vraag je na of hij dat
wel zeker weet, zegt hij opeens dat het
er 2 zijn. Deze simpele taak lukt niet
door het tokenizeren. Het zou kunnen
zijn dat straw = 17 en berry=89,
hierdoor zou hij de opdracht niet kunnen
uitvoeren, hij ziet niet de a.
→ Als een LLM iets niet zeker weet
geeft hij je vaak gelijk!

,Hoe kan je hem dit wel laten oplossen?:
Schrijf een klein computerprogrammaatje dat twee NFL team geeft met….
→ Latere taalmodellen lossen het probleem op deze manier op, d.w.z. door woorden
expliciet te ont-tokeniseren en het met behulp van deelstapjes te formaliseren

Hij zou niet van nature doen wat wij zouden doen, het werkt op een andere manier, het moet
echt in deelstappen en op een andere manier.

Hoe wordt informatie over de woordenschat opgeslagen?
●​ Een token woordenschat bevat van zichzelf zeer weinig informatie
●​ De LLM heeft informatie nodig over de relatie die tokens in de woordenschat tot
elkaar hebben (denk aan appel, welke kenmerken, welke relaties?)
●​ Deze informatie is opgeslagen in de embedding matrix [inbedding matrix]

Embedding Matrix
Bestaat uit dimensies op basis waarvan je woorden zou kunnen scoren.
Je kunt de woorden plaatsen aan de hand van deze dimensies in het figuur.




De getallen heten de gewichten: hoe sterk scoort het op ieder van de dimensies. +0.95
De rij van alle getallen achter elkaar heten vectoren (horizontale rij) +0.95, -0.10, +0.43…

De gewichten (ook wel parameters genaamd) van een model zijn uitgebreid vooraf getraind
door backpropagation.

Iedere token heeft een vector van gewichten, die je kan visualiseren als een pijl in een
multidimensionale ruimte.

In een LLM zijn de dimensies helemaal geen menselijk interpreteerbare waarden. Het zijn
abstracte dimensies die de computer gebruikt om de woordenschat in te kunnen delen.

, Correlatie tussen deze vectoren

Tokens waarvan de betekenis
vergelijkbaar is zullen vaak vectoren
hebben die hoog met elkaar
correleren, terwijl tokens met
uiteenlopende betekenissen vaak
ongecorreleerd of negatief
gecorreleerd zullen zijn.

De correlatie tussen "kat" en "hond"
in deze matrix is bijvoorbeeld 0,81,
terwijl de correlatie tussen "kat" en
"auto" -0,44 is

Ze hebben meer met elkaar gemeen
in semantische zin!

Werkelijkheid
●​ In werkelijkheid zijn de tokens (tot wel 100.000) meestal subwoorden, geen volledige
woorden
●​ In werkelijkheid zijn de dimensies in de kolommen zelden interpreteerbaar als
menselijke concepten en zeer groot in aantal (duizenden dimensies)
●​ De embedding matrix kan worden gezien als een extreem hoog dimensionale ruimte
waarin LLM's de semantische relaties tussen tokens representeren

Voorbeeld
Vector Verschil voor het woord neefje en nichtje. Het
verschil tussen deze vectoren is vergelijkbaar met een
verschilvector voor man en vrouw.

De matrix is echt veeel groter in de LLM’ s. Vaak willen
ze het niet delen, maar van chatgpt 3 had het 12288
dimensies en 50257 tokens → 617558016 gewichten.

Na uitgebreide training
●​ De embedding matrix en andere model
gewichten (parameters) veranderen niet meer
na de uitgebreide voor training
●​ Commerciële LLM-bedrijven maken niet bekend op welke teksten hun modellen zijn
getraind (o.a. een groot deel van het internet en meer), je kunt het wel raden maar je
weet het niet.
●​ Dit kan © auteursrechtelijk beschermd, beledigend, privé/gevoelig, gebiased en
feitelijk onjuist materiaal omvatten
●​ Pas op waar je informatie naar toe stuurt, het bedrijf mag alles wat je deelt gebruiken
in training van toekomstige modellen. Denk hierbij ook over privacy gevoelige info na.

Documentinformatie

Geüpload op
26 augustus 2026
Aantal pagina's
106
Geschreven in
2025/2026
Type
Samenvatting
€9,66

Verkeerd document? Gratis ruilen Binnen 14 dagen na aankoop en voor het downloaden kun je een ander document kiezen. Je kunt het bedrag gewoon opnieuw besteden.
Geschreven door studenten die geslaagd zijn
Direct beschikbaar na je betaling
Online lezen of als PDF

Verkocht
10
Volgers
0
Items
6
Laatst verkocht
5 maanden geleden

Echte notities, van echte studenten
Elk document op Stuvia is geschreven door een medestudent die hetzelfde vak deed. Zo leer je van iemand die het al heeft gehaald.



Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Kwaliteit die je kunt vertrouwen: geschreven door studenten die slaagden en beoordeeld door anderen die dit document gebruikten.

Niet tevreden? Kies een ander document

Geen zorgen! Je kunt voor hetzelfde geld direct een ander document kiezen dat beter past bij wat je zoekt.

Betaal zoals je wilt, start meteen met leren

Geen abonnement, geen verplichtingen. Betaal zoals je gewend bent via iDeal of creditcard en download je PDF-document meteen.

Student with book image

“Gekocht, gedownload en geslaagd. Zo makkelijk kan het dus zijn.”

Alisha Student

Bezig met je bronvermelding?

Maak nauwkeurige citaten in APA, MLA en Harvard met onze gratis bronnengenerator.

Bezig met je bronvermelding?

Veelgestelde vragen