Image Text To Text
term_id: image_text_to_text
Category: application_paradigms
Definition
Image Text To Text는 시각적 입력과 텍스트 쿼리를 함께 처리하여 일관된 자연어 출력을 생성하는 모델을 지칭합니다. 이러한 시스템은 종종 비전-언어 모델(Vision-Language Models, VLMs)이라고 불리며, 이미지 이해와 언어 생성을 결합합니다.
Summary
입력 이미지와 선택적 텍스트 프롬프트를 기반으로 텍스트 설명이나 답변을 생성하는 다중 모달 AI 기능입니다.
Key Concepts
- 다중 모달 학습(Multimodal Learning)
- 시각 질문 답변(Visual Question Answering)
- 캡셔닝(Captioning: 이미지에 대한 설명 생성)
- 크로스모달 어텐션(Cross-modal Attention)
Use Cases
- 접근성을 위한 자동 이미지 캡셔닝
- 시각 질문 답변 시스템
- 콘텐츠 검열 분석