Zbiór danych: Dane osadzające/Paq Pairs
term_id: datasetembedding_datapaq_pairs
Category: training_techniques
Definition
Zbiór danych PAQ (Pseudo-Answer Quality) zawiera miliony automatycznie generowanych par pytanie-odpowiedź wyodrębnionych z Wikipedii. Został specjalnie zaprojektowany do trenowania gęstych retrieverów, dostarczając (providing)…
Summary
Duży zbiór danych par pytanie-odpowiedź wywodzących się z Wikipedii, zaprojektowany do treningu gęstego pobierania fragmentów tekstu (dense passage retrieval).
Key Concepts
- Gęste pobieranie fragmentów tekstu (Dense Passage Retrieval)
- Próbkowanie negatywne (Negative Sampling)
- Odpowiadanie na pytania w domenie otwartej (Open-Domain QA)
- Wyodrębnianie z Wikipedii (Wikipedia Extraction)
Use Cases
- Trenowanie gęstych retrieverów
- Odpowiadanie na pytania w domenie otwartej
- Benchmarkowanie wydajności pobierania