PROBLEEM A
INLEIDING
Taal staat centraal in alle aspecten van de psychologische wetenschap. Technologische ontwikkelingen
hebben het makkelijker gemaakt om taalanalyses uit te voeren. Grote taalmodellen (LLMs) zijn grote
statistische modellen die woorden binnen een specifieke context kunnen begrijpen en getraind zijn op
enorme hoeveelheden diverse tekstbronnen. Ze kunnen mensachtige taal genereren. Deze taalmodellen
kunnen zo aangepast worden dat ze gebruikt kunnen worden voor psychologische doeleinden.
Onderzoeksvraag: wanneer en hoe zal de psychologie LLM-technologie begrijpen en toepassen om
nieuwe tools te ontwikkelen en te verspreiden, zodat psychologen de voordelen ervan voor hun
onderzoek kunnen gebruiken, terwijl ze ook het risico van vroegtijdig gebruik vermijden?
WAT ZIJN LLMS?
LLMs herkennen en reproduceren patronen in taal. Dit doen ze door zinnen te voorspellen en hun
prestaties te verbeteren op basis van fouten corrigeren (pre-training). LLMs kunnen advies genereren,
maar hierbij houden ze geen rekening met gezondheid en wetenschappelijke literatuur. Daarom is een
nieuwe aanpak nodig.
LLMs zijn te gebruiken zonder dat je expertise nodig hebt, denk aan openai en ChatGPT. Extra
training en evaluatie zijn nodig als je LLMs optimaal wil laten presteren in specifieke domeinen.
Fasen
1. Pre-training
Groot taalmodel wordt getraind op enorme dataset met algemene teksten.
Basisstructuren van taal worden geleerd (woordenschat, grammatica, context).
2. Fine-tuning
Voorgetraind model wordt verder getraind op kleinere, taak-specifieke dataset
(bijvoorbeeld teksten die geannoteerd zijn door experts).
Parameters worden aangepast op basis van specifieke kenmerken van data
(bijvoorbeeld vraagbeantwoording).
Contextuele en relevante output genereren.
Studie: studenten die een essay schreven die meer thema’s van erbij horen interventie
reflecteerde, het beter deden op school gedurende het jaar.
3. Prompt-tuning
Gebruiker geeft specifieke instructies of voorbeelden (prompts) om de output te
beïnvloeden zonder parameters te wijzigen.
Framing helpt het model om gewenste antwoorden/teksten te genereren, zonder
verdere training.
Nuttig voor het creëren van gerichte en contextuele reacties op vragen of opdrachten.
Publieke gebruikers kunnen het model niet aanpassen.
Studie: de beoordelingen van jongeren van de prompt-tuned voorbeelden, verschilden
niet significant met de menselijke expert voorbeelden, dus LLMs kunnen nieuwe tekst
(ging over speech beoordelen en groei-mindset taal).
, Nadelen fine-tuning: duur, moeilijk om aan geannoteerde data te komen (van experts) en vatbaar voor
biases.
Nadelen prompt-tuning: moeilijk om aan geannoteerde data te komen, mogelijk niet effectief bij
complexe psychologische constructen, kleinere kans om bias tegen te gaan en output is gevoelig voor
framing.
ZORGEN OVER HET TOEPASSEN VAN LLMS IN PSYCHOLOGIE EN TOEKOMST
LLMs voorspellen gewoon tekst op basis van trainingsdata, en bootsen dus geen menselijke
intelligentie na. Daarnaast geven ze een gemiddelde van hun trainingsdata, en bevatten ze geen niet-
taal-specifieke cognitieve vaardigheden om gedachten te modelleren.
EVALUATIE VAN LLMS
Expert evaluatie houdt in dat de output van het model vergeleken wordt met de beoordelingen van
menselijke expert. Hierbij komen er een paar uitdagingen kijken, bijvoorbeeld dat coders de gevoelens
van anderen bij LLM-gegenereerde tekst verkeerd inschatten, omdat ze de context niet begrijpen. Ook
kunnen beoordelaars uit verschillende groepen onnauwkeurig zijn in hun schattingen. Daarnaast is er
soms geen juist antwoord, denk aan compliment voorbeeld.
Impact evaluatie houdt in dat er een meting gedaan wordt vóór en ná het lezen van een tekst, waardoor
de impact van de tekst gemeten kan worden. Echter laat dit niet altijd zien waarom een tekst geen
effect heeft.
Het beste is om beide evaluaties te gebruiken, omdat ze elkaar aanvullen.