Vision Language (Ngôn ngữ thị giác)

term_id: vision_language

Category: application_paradigms

Definition

Các mô hình Vision-Language, thường được gọi là Mô hình Ngôn ngữ Lớn Đa phương thức (MLLMs), tích hợp thị giác máy tính và xử lý ngôn ngữ tự nhiên. Chúng cho phép AI hiểu hình ảnh và tạo ra văn bản…

Summary

Các mô hình Vision-Language là hệ thống AI xử lý và kết hợp dữ liệu trực quan với thông tin văn bản để hiểu các ngữ cảnh đa phương thức.

Key Concepts

  • Tính đa phương thức (Multimodality)
  • Căn chỉnh chéo phương thức (Cross-modal Alignment)
  • Tạo chú thích ảnh (Image Captioning)
  • Hỏi đáp trực quan (Visual Question Answering)

Use Cases

  • Tạo chú thích ảnh tự động
  • Hệ thống hỏi đáp dựa trên hình ảnh
  • Kiểm duyệt nội dung có ngữ cảnh