Tập dữ liệu: Dữ liệu Nhúng/Paq Pairs
term_id: datasetembedding_datapaq_pairs
Category: training_techniques
Definition
Tập dữ liệu PAQ (Pseudo-Answer Quality - Chất lượng Câu trả lời Giả) chứa hàng triệu cặp câu hỏi-câu trả lời được tạo tự động từ Wikipedia. Nó được thiết kế đặc biệt để huấn luyện các bộ truy xuất mật độ cao bằng cách cung cấp…
Summary
Một tập dữ liệu quy mô lớn gồm các cặp câu hỏi-câu trả lời được trích xuất từ Wikipedia, thiết kế cho việc huấn luyện truy xuất đoạn văn mật độ cao.
Key Concepts
- Truy xuất đoạn văn mật độ cao
- Mẫu âm (Negative Sampling)
- Hỏi đáp miền mở
- Trích xuất từ Wikipedia
Use Cases
- Huấn luyện các bộ truy xuất mật độ cao
- Hỏi đáp miền mở
- Đánh giá hiệu suất truy xuất