Datasæt: Indlejringsdata/Altlex
term_id: datasetembedding_dataaltlex
Category: training_techniques
Definition
Altlex-datasættet består af sætningspar, der deler den samme underliggende betydning, men bruger forskelligt ordforråd eller syntaktiske strukturer. Det primært anvendes til at træne indlejringsmodeller
Summary
Et datasæt, der indeholder alternative leksikale former, der bruges til at træne modeller i semantisk ækvivalens og genkendelse af parafraser.
Key Concepts
- Semantisk ækvivalens
- Genkendelse af parafraser
- Leksikal variation
- Vektorlignhed
Use Cases
- Træning af semantiske søgemaskiner
- Forbedring af spørgsmål-svar-systemer
- Forbedring af tekstlignhedsmetrics