Dataset:Embedding Data/Simple Wiki
term_id: datasetembedding_datasimple_wiki
Category: training_techniques
Definition
Deze dataset bestaat uit zinnen en alinea’s die zijn geëxtraheerd uit Simple English Wikipedia, een versie van Wikipedia geschreven voor niet-moedertaalsprekers met vereenvoudigde grammatica en woordenschat. Het dient als een
Summary
Een samengestelde dataset afgeleid van Simple English Wikipedia, gebruikt voor het trainen en evalueren van tekst-embeddingsmodellen.
Key Concepts
- Semantische Embeddings
- Tekstvereenvoudiging
- Wikipedia-corpus
- Modelbenchmarking
Use Cases
- Het trainen van lichtgewicht embeddingsmodellen
- Het evalueren van semantische gelijkenis in eenvoudige contexten
- Het verbeteren van toegankelijkheidstools voor NLP