Chú ý Đa đầu

term_id: multi_head_attention

Category: basic_concepts

Definition

Chú ý Đa đầu mở rộng cơ chế chú ý tiêu chuẩn bằng cách chạy nó nhiều lần song song với các phép chiếu tuyến tính khác nhau đã được học. Điều này cho phép mô hình cùng lúc chú ý đến thông…

Summary

Một cơ chế trong các mô hình Transformer cho phép mô hình chú ý đến thông tin từ các không gian biểu diễn con khác nhau đồng thời.

Key Concepts

  • Chú ý tự thân
  • Phép chiếu tuyến tính
  • Nối chuỗi

Use Cases

  • Xử lý Ngôn ngữ Tự nhiên (NLP)
  • Dịch máy
  • Phân loại ảnh với Vision Transformers

Code Example

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
import torch.nn as nn

class MultiHeadAttention(nn.Module):
    def __init__(self, d_model, num_heads):
        super().__init__()
        self.num_heads = num_heads
        self.d_k = d_model // num_heads
        self.W_q = nn.Linear(d_model, d_model)
        self.W_k = nn.Linear(d_model, d_model)
        self.W_v = nn.Linear(d_model, d_model)
        self.W_o = nn.Linear(d_model, d_model)

    def forward(self, x):
        # Simplified forward pass logic
        pass