Šum ve štítcích

term_id: label_noise

Category: basic_concepts

Definition

Šum ve štítcích označuje nesoulad mezi skutečnými třídami datových instancí a štítky poskytnutými v trénovací sadě. Může vzniknout kvůli chybám lidských anotátorů, nejednoznačnosti dat nebo chybám v automatickém sběru dat. Tento šum může negativně ovlivnit přesnost a generalizační schopnosti modelů strojového učení, což vyžaduje použití robustních algoritmů nebo technik čištění dat.

Summary

Chyby nebo nekonzistence v cílových štítcích datové sady používané pro trénování supervizovaného strojového učení.

Key Concepts

  • Kvalita dat
  • Robustní učení
  • Chyby anotace
  • Symetrický/asymetrický šum

Use Cases

  • Trénování modelů na datech z crowdsourceingu
  • Zpracování neúplných reálných datových sad
  • Zvyšování robustnosti modelů