Datasæt: Indlejringsdata/Altlex

term_id: datasetembedding_dataaltlex

Category: training_techniques

Definition

Altlex-datasættet består af sætningspar, der deler den samme underliggende betydning, men bruger forskelligt ordforråd eller syntaktiske strukturer. Det primært anvendes til at træne indlejringsmodeller

Summary

Et datasæt, der indeholder alternative leksikale former, der bruges til at træne modeller i semantisk ækvivalens og genkendelse af parafraser.

Key Concepts

  • Semantisk ækvivalens
  • Genkendelse af parafraser
  • Leksikal variation
  • Vektorlignhed

Use Cases

  • Træning af semantiske søgemaskiner
  • Forbedring af spørgsmål-svar-systemer
  • Forbedring af tekstlignhedsmetrics