Dataset: Inbeddingsdata/Altlex
term_id: datasetembedding_dataaltlex
Category: training_techniques
Definition
De Altlex-dataset bestaat uit paren van zinnen die dezelfde onderliggende betekenis delen, maar verschillende vocabulaire of syntactische structuren gebruiken. Het wordt voornamelijk ingezet bij het trainen van inbeddingsmodellen.
Summary
Een dataset met alternatieve lexicaal vormen die wordt gebruikt om modellen te trainen op semantische equivalentie en parafrasedetectie.
Key Concepts
- Semantische equivalentie
- Parafrasedetectie
- Lexicale variatie
- Vectorgebondenheid
Use Cases
- Het trainen van semantische zoekmachines
- Het verbeteren van vraag-en-antwoordsystemen
- Het verfijnen van tekstgelijkheidsmetrieken