Dataset:Ms Marco
term_id: datasetms_marco
Category: basic_concepts
Definition
MS MARCO (Microsoft Machine Reading Comprehension) este un set de date foarte utilizat în procesarea limbajului natural, în special pentru recuperarea informațiilor și răspunsul la întrebări. Acesta constă în interogări de căutare anonimizate provenite de la utilizatorii Google, împreună cu pasaje din documente considerate relevante sau răspunsuri corecte, servind ca etalon pentru evaluarea modelelor de clasificare a documentelor.
Summary
Setul de date Microsoft pentru Înțelegerea Mașinii a Textului, o colecție la scară largă de interogări reale de căutare și pasaje din documente relevante, utilizată pentru antrenarea sistemelor de recuperare a informațiilor.
Key Concepts
- Recuperarea informațiilor
- Clasarea pasajelor
- Interogări de căutare
- Înțelegerea mașinii a textului
Use Cases
- Antrenarea motoarelor de căutare
- Dezvoltarea sistemelor de răspuns la întrebări
- Evaluarea benchmark a modelelor de recuperare