Dataset: Embedding Data/Altlex
term_id: datasetembedding_dataaltlex
Category: training_techniques
Definition
Altlex-datasetet består av meningar som delar samma underliggande betydelse men använder olika ordval eller syntaktiska strukturer. Det används främst för att träna embedding-modeller.
Summary
Ett dataset som innehåller alternativa lexikaliska former som används för att träna modeller på semantisk ekvivalens och parafrasdetektering.
Key Concepts
- Semantisk ekvivalens
- Parafrasdetektering
- Lexikal variation
- Vektorsimilaritet
Use Cases
- Träning av semantiska sökmotorer
- Förbättring av frågesvars-system
- Förbättring av textlikhetsmått