LLM-as-a-Judge (Mô hình ngôn ngữ lớn làm trọng tài)

term_id: llm_as_a_judge

Category: application_paradigms

Definition

LLM-as-a-Judge là một mô hình đánh giá trong đó một Mô hình ngôn ngữ lớn đóng vai trò là bộ đánh giá tự động cho chất lượng đầu ra từ các mô hình khác. Thay vì chỉ dựa vào người gán nhãn con người hoặc các chỉ số…

Summary

Một phương pháp đánh giá kết quả đầu ra của Mô hình ngôn ngữ lớn (LLM) bằng cách sử dụng một LLM khác để chấm điểm hoặc xếp hạng các phản hồi dựa trên các tiêu chí nhất định.

Key Concepts

  • Đánh giá tự động
  • Kỹ thuật prompt (Prompt Engineering)
  • Căn chỉnh mô hình
  • Chỉ số chất lượng

Use Cases

  • Chuẩn hóa các mô hình RLHF
  • Đánh giá văn học sáng tạo
  • Phát hiện an toàn và thiên kiến