Image Text To Text

term_id: image_text_to_text

Category: application_paradigms

Definition

Image Text To Text는 시각적 입력과 텍스트 쿼리를 함께 처리하여 일관된 자연어 출력을 생성하는 모델을 지칭합니다. 이러한 시스템은 종종 비전-언어 모델(Vision-Language Models, VLMs)이라고 불리며, 이미지 이해와 언어 생성을 결합합니다.

Summary

입력 이미지와 선택적 텍스트 프롬프트를 기반으로 텍스트 설명이나 답변을 생성하는 다중 모달 AI 기능입니다.

Key Concepts

  • 다중 모달 학습(Multimodal Learning)
  • 시각 질문 답변(Visual Question Answering)
  • 캡셔닝(Captioning: 이미지에 대한 설명 생성)
  • 크로스모달 어텐션(Cross-modal Attention)

Use Cases

  • 접근성을 위한 자동 이미지 캡셔닝
  • 시각 질문 답변 시스템
  • 콘텐츠 검열 분석