Datensatz: Einbettungsdaten / Flickr30K-Beschreibungen
term_id: datasetembedding_dataflickr30k_captions
Category: training_techniques
Definition
Flickr30K Captions ist ein weit verbreiteter Benchmark-Datensatz, der 31.783 Bilder umfasst, wobei jedes Bild mit fünf verschiedenen englischen Sätzen annotiert ist, die den visuellen Inhalt beschreiben. Es dient als grundlegende Ressource.
Summary
Ein multimodaler Datensatz, der 31.000 Bilder mit menschengenerierten Beschreibungen verknüpft, um cross-modale Einbettungsmodelle zu trainieren.
Key Concepts
- Multimodales Lernen
- Bild-Text-Zuordnung
- Cross-modale Suche
- Visuelle Verankerung
Use Cases
- Entwicklung von Bildsuchmaschinen
- Generierung von Bildbeschreibungen
- Training von Vision-Language-Modellen