Dataset:Ms Marco

term_id: datasetms_marco

Category: basic_concepts

Definition

MS MARCO (Microsoft Machine Reading Comprehension) este un set de date foarte utilizat în procesarea limbajului natural, în special pentru recuperarea informațiilor și răspunsul la întrebări. Acesta constă în interogări de căutare anonimizate provenite de la utilizatorii Google, împreună cu pasaje din documente considerate relevante sau răspunsuri corecte, servind ca etalon pentru evaluarea modelelor de clasificare a documentelor.

Summary

Setul de date Microsoft pentru Înțelegerea Mașinii a Textului, o colecție la scară largă de interogări reale de căutare și pasaje din documente relevante, utilizată pentru antrenarea sistemelor de recuperare a informațiilor.

Key Concepts

  • Recuperarea informațiilor
  • Clasarea pasajelor
  • Interogări de căutare
  • Înțelegerea mașinii a textului

Use Cases

  • Antrenarea motoarelor de căutare
  • Dezvoltarea sistemelor de răspuns la întrebări
  • Evaluarea benchmark a modelelor de recuperare