Dataset: Wikipedia

term_id: datasetwikipedia

Category: basic_concepts

Definition

Wikipedia is een van de grootste en meest uitgebreide verzamelingen van menselijke kennis die beschikbaar is in tekstformaat. In de kunstmatige intelligentie fungeert het als primaire bron voor het pre-trainen van grote taalmodellen, waardoor modellen brede algemene kennis en linguïstische diversiteit kunnen verwerven.

Summary

De enorme verzameling tekst van Wikipedia, die dient als fundamentele corpus voor het pre-trainen van taalmodellen en kennisintensieve NLP-taken.

Key Concepts

  • Pre-trainingscorpus
  • Kennisbasis
  • Linguïstische diversiteit

Use Cases

  • Pre-trainen van foundation language models
  • Entiteitkoppeling en -ontambiguïtering
  • Feitencheck en kennisopzoeking