Dataset: Wikipedia
term_id: datasetwikipedia
Category: basic_concepts
Definition
Wikipedia is een van de grootste en meest uitgebreide verzamelingen van menselijke kennis die beschikbaar is in tekstformaat. In de kunstmatige intelligentie fungeert het als primaire bron voor het pre-trainen van grote taalmodellen, waardoor modellen brede algemene kennis en linguïstische diversiteit kunnen verwerven.
Summary
De enorme verzameling tekst van Wikipedia, die dient als fundamentele corpus voor het pre-trainen van taalmodellen en kennisintensieve NLP-taken.
Key Concepts
- Pre-trainingscorpus
- Kennisbasis
- Linguïstische diversiteit
Use Cases
- Pre-trainen van foundation language models
- Entiteitkoppeling en -ontambiguïtering
- Feitencheck en kennisopzoeking