비전-랭귀지 (시각-언어)

term_id: vision_language

Category: application_paradigms

Definition

비전-랭귀지 모델은 종종 다중 모달 대규모 언어 모델(MLLMs)이라고 불리며, 컴퓨터 비전과 자연어 처리를 통합합니다. 이를 통해 AI는 이미지를 이해하고 텍스트를 생성할 수 있습니다.

Summary

비전-랭귀지 모델은 다중 모달 맥락을 이해하기 위해 시각 데이터와 텍스트 정보를 처리하고 상관관계 분석하는 AI 시스템입니다.

Key Concepts

  • 다중 모달성
  • 크로스-모달 정렬
  • 이미지 캡셔닝
  • 시각적 질문 답변

Use Cases

  • 자동 이미지 캡셔닝
  • 시각적 질문 답변 시스템
  • 맥락 기반 콘텐츠 검열