Dataset:Embedding Data/Simple Wiki

term_id: datasetembedding_datasimple_wiki

Category: training_techniques

Definition

Deze dataset bestaat uit zinnen en alinea’s die zijn geëxtraheerd uit Simple English Wikipedia, een versie van Wikipedia geschreven voor niet-moedertaalsprekers met vereenvoudigde grammatica en woordenschat. Het dient als een

Summary

Een samengestelde dataset afgeleid van Simple English Wikipedia, gebruikt voor het trainen en evalueren van tekst-embeddingsmodellen.

Key Concepts

  • Semantische Embeddings
  • Tekstvereenvoudiging
  • Wikipedia-corpus
  • Modelbenchmarking

Use Cases

  • Het trainen van lichtgewicht embeddingsmodellen
  • Het evalueren van semantische gelijkenis in eenvoudige contexten
  • Het verbeteren van toegankelijkheidstools voor NLP