Šum ve štítcích
term_id: label_noise
Category: basic_concepts
Definition
Šum ve štítcích označuje nesoulad mezi skutečnými třídami datových instancí a štítky poskytnutými v trénovací sadě. Může vzniknout kvůli chybám lidských anotátorů, nejednoznačnosti dat nebo chybám v automatickém sběru dat. Tento šum může negativně ovlivnit přesnost a generalizační schopnosti modelů strojového učení, což vyžaduje použití robustních algoritmů nebo technik čištění dat.
Summary
Chyby nebo nekonzistence v cílových štítcích datové sady používané pro trénování supervizovaného strojového učení.
Key Concepts
- Kvalita dat
- Robustní učení
- Chyby anotace
- Symetrický/asymetrický šum
Use Cases
- Trénování modelů na datech z crowdsourceingu
- Zpracování neúplných reálných datových sad
- Zvyšování robustnosti modelů