Dataset: Embedding Data/Altlex

term_id: datasetembedding_dataaltlex

Category: training_techniques

Definition

Altlex-datasettet består av setningspar som deler samme underliggende betydning, men bruker forskjellig ordforråd eller syntaktiske strukturer. Det brukes hovedsakelig til å trene innbæringmodeller (embedding models).

Summary

Et datasett som inneholder alternative leksikalske former brukt til å trene modeller på semantisk ekvivalens og gjenkjennelse av parafrazer.

Key Concepts

  • Semantisk ekvivalens
  • Gjenkjennelse av parafrazer
  • Leksikal variasjon
  • Vektorligning

Use Cases

  • Trening av semantiske søkemotorer
  • Forbedring av spørsmåls-svar-systemer
  • Forbedring av tekstligningsmetrikker