비전-랭귀지 (시각-언어)
term_id: vision_language
Category: application_paradigms
Definition
비전-랭귀지 모델은 종종 다중 모달 대규모 언어 모델(MLLMs)이라고 불리며, 컴퓨터 비전과 자연어 처리를 통합합니다. 이를 통해 AI는 이미지를 이해하고 텍스트를 생성할 수 있습니다.
Summary
비전-랭귀지 모델은 다중 모달 맥락을 이해하기 위해 시각 데이터와 텍스트 정보를 처리하고 상관관계 분석하는 AI 시스템입니다.
Key Concepts
- 다중 모달성
- 크로스-모달 정렬
- 이미지 캡셔닝
- 시각적 질문 답변
Use Cases
- 자동 이미지 캡셔닝
- 시각적 질문 답변 시스템
- 맥락 기반 콘텐츠 검열