Geschreven door studenten die geslaagd zijn Direct beschikbaar na je betaling Online lezen of als PDF Verkeerd document? Gratis ruilen 4,6 TrustPilot
logo-home
Document preview thumbnail
Voorbeeld 1 van de 4 pagina's
Samenvatting

samenvatting - taaltechnologie hoofdstuk 4

Document preview thumbnail
Voorbeeld 1 van de 4 pagina's

Dit document is een combinatie van notities tijdens colleges en een samenvatting van de syllabus gemaakt door de prof zelf. (Walter Daelemans)

Voorbeeld van de inhoud

TAALTECH 4

4. VOORGETRAINDE MODELLEN

A. INLEIDING

 WAT? diepe neurale netwerken zorgen voor de beste resultaten in de taaltechnologie
 Ze werken end-to-end
 Geen modulariteit maar alles in één  geen feature engineering
 Een statistische methode om representaties en patronen te leren uit heel veel data
 Problemen?
 Voor het oplossen van ambiguiteit is context en achtergrondkennis nodig
 Vb: “balletje” splitsen MAAR is het een kleine bal of een dansvoorstellinkje?
 Neurale netwerken willen getallen of data als invoer <-> GEEN symbolen

B. WOORDINBEDDING; WORD EMBEDDINGS

!! bij een kennisgebaseerde aanpak kunnen we werken met symbolische representaties vd betekenis van woorden
vb: we kunnen aangeven dat “bank” 4 toepassingen heeft maar de dekkingsgraad is zo relatief klein

Oplossing: distributionele hypothese
 Er is een verband tss woorden die voorkomen in tekst (hun distributie) en hun betekenis
 Woorden die in gelijkaardige contexten voorkomen hebben gelijkaardige betekenissen
 Firth: “you should know a word by the company it keeps”

 o.b.v. die hypothese kunnen we matrix opstellen van tellingen hoe vaak een woord voorkomt in de context van
een ander woord
 De verschillende rijtjes kunnen we nu beschouwen als numerieke
representatie vd betekenis vh woord
 Numerieke representatie = een vectorisatie
 Distributionele semantiek (structuralisme)
 De betekenis v/e woord is afleidbaar (uit context)
 Gelijkenis tussen vectoren berekenen?
 Intern product v paren v woorden berekenen en kijken
welke semantisch het meest op elkaar lijken
 Vb: kat (< 6,0,1,2,1,1,1>) en hond (<4,2,1,0,0,0,1>) = 26
 De gelijkenis tss kat en hond is veel groter dan tussen kat en man
 = DOT PRODUCT
 De resulterende vectoren per woord zijn een voorgetraind lexicon
 Hoe groter het corpus, hoe groter de vectoren, hoe fijnmaziger de betekenissen
 “sparse vectors” = vectoren met veel nullen omdat veel woorden niet in elkaars context voorkomen
 = een probleem want zo krijg je heel grote getallen

EEN NOG BETERE OPLOSSING: WORD EMBEDDINGS
 Verzamel een reusachtig corpus
 “Dense vectors” methodes gingen ervoor zorgen dat de vectoren ‘dicht werden’ (van 50-500 componenten)
 Train een neuraal netwerk – HOE?
 Geef een stukje tekst waarin het middelste woord is weggelaten
 Het netwerk moet dat ontbrekende woord leren voorspellen op basis vd context
 De output is dan het weggelaten woord

Documentinformatie

Geüpload op
10 februari 2025
Aantal pagina's
4
Geschreven in
2024/2025
Type
Samenvatting
€5,06

Verkeerd document? Gratis ruilen Binnen 14 dagen na aankoop en voor het downloaden kan je een ander document kiezen. Je kan het bedrag gewoon opnieuw besteden.
Geschreven door studenten die geslaagd zijn
Direct beschikbaar na je betaling
Online lezen of als PDF

Seller avatar
De reputatie van een verkoper is gebaseerd op het aantal documenten dat iemand tegen betaling verkocht heeft en de beoordelingen die voor die items ontvangen zijn. Er zijn drie niveau’s te onderscheiden: brons, zilver en goud. Hoe beter de reputatie, hoe meer de kwaliteit van zijn of haar werk te vertrouwen is.
Verkocht
37
Volgers
0
Items
38
Laatst verkocht
6 dagen geleden



Waarom studenten kiezen voor Stuvia

Gemaakt door medestudenten, geverifieerd door reviews

Kwaliteit die je kunt vertrouwen: geschreven door studenten die slaagden en beoordeeld door anderen die dit document gebruikten.

Niet tevreden? Kies een ander document

Geen zorgen! Je kunt voor hetzelfde geld direct een ander document kiezen dat beter past bij wat je zoekt.

Betaal zoals je wilt, start meteen met leren

Geen abonnement, geen verplichtingen. Betaal zoals je gewend bent via Bancontact, iDeal of creditcard en download je PDF-document meteen.

Student with book image

“Gekocht, gedownload en geslaagd. Zo eenvoudig kan het zijn.”

Alisha Student

Bezig met je bronvermelding?

Maak nauwkeurige citaten in APA, MLA en Harvard met onze gratis bronnengenerator.

Bezig met je bronvermelding?

Veelgestelde vragen