Zbiór danych: Dane osadzające/Altlex
term_id: datasetembedding_dataaltlex
Category: training_techniques
Definition
Zbiór danych Altlex składa się z par zdań, które dzielą to samo podstawowe znaczenie, ale wykorzystują inny słownictwo lub struktury składniowe. Jest on głównie wykorzystywany w treningu modeli osadzających (embedding models).
Summary
Zbiór danych zawierający alternatywne formy leksykalne używane do trenowania modeli w zakresie równoważności semantycznej i wykrywania parafraz.
Key Concepts
- Równoważność semantyczna
- Wykrywanie parafraz
- Wariacja leksykalna
- Podobieństwo wektorowe
Use Cases
- Trenowanie silników wyszukiwania semantycznego
- Ulepszanie systemów odpowiadania na pytania
- Poprawa metryk podobieństwa tekstu