Dataset: Inbeddingsdata/Altlex

term_id: datasetembedding_dataaltlex

Category: training_techniques

Definition

De Altlex-dataset bestaat uit paren van zinnen die dezelfde onderliggende betekenis delen, maar verschillende vocabulaire of syntactische structuren gebruiken. Het wordt voornamelijk ingezet bij het trainen van inbeddingsmodellen.

Summary

Een dataset met alternatieve lexicaal vormen die wordt gebruikt om modellen te trainen op semantische equivalentie en parafrasedetectie.

Key Concepts

  • Semantische equivalentie
  • Parafrasedetectie
  • Lexicale variatie
  • Vectorgebondenheid

Use Cases

  • Het trainen van semantische zoekmachines
  • Het verbeteren van vraag-en-antwoordsystemen
  • Het verfijnen van tekstgelijkheidsmetrieken