Dataset: Embedding Data/Altlex

term_id: datasetembedding_dataaltlex

Category: training_techniques

Definition

Altlex-datasetet består av meningar som delar samma underliggande betydelse men använder olika ordval eller syntaktiska strukturer. Det används främst för att träna embedding-modeller.

Summary

Ett dataset som innehåller alternativa lexikaliska former som används för att träna modeller på semantisk ekvivalens och parafrasdetektering.

Key Concepts

  • Semantisk ekvivalens
  • Parafrasdetektering
  • Lexikal variation
  • Vektorsimilaritet

Use Cases

  • Träning av semantiska sökmotorer
  • Förbättring av frågesvars-system
  • Förbättring av textlikhetsmått