Dataset: Embedding Data/Altlex
term_id: datasetembedding_dataaltlex
Category: training_techniques
Definition
Altlex-datasettet består av setningspar som deler samme underliggende betydning, men bruker forskjellig ordforråd eller syntaktiske strukturer. Det brukes hovedsakelig til å trene innbæringmodeller (embedding models).
Summary
Et datasett som inneholder alternative leksikalske former brukt til å trene modeller på semantisk ekvivalens og gjenkjennelse av parafrazer.
Key Concepts
- Semantisk ekvivalens
- Gjenkjennelse av parafrazer
- Leksikal variasjon
- Vektorligning
Use Cases
- Trening av semantiske søkemotorer
- Forbedring av spørsmåls-svar-systemer
- Forbedring av tekstligningsmetrikker