Bộ dữ liệu: Snli

term_id: datasetsnli

Category: basic_concepts

Definition

SNLI là một bộ dữ liệu chuẩn mực chứa hơn 500.000 cặp câu được gắn nhãn, với ba lớp: suy diễn (entailment), mâu thuẫn (contradiction) và trung lập (neutral). Nó được tạo ra để thúc đẩy nghiên cứu trong lĩnh vực xử lý ngôn ngữ tự nhiên…

Summary

Stanford Natural Language Inference Corpus, một bộ dữ liệu lớn về các câu tiếng Anh được ghép cặp với nhãn suy diễn văn bản do con người viết.

Key Concepts

  • Suy diễn ngôn ngữ tự nhiên
  • Suy diễn văn bản
  • Cặp câu
  • Chuẩn đánh giá (Benchmark)

Use Cases

  • Đánh giá các mô hình tương đồng ngữ nghĩa
  • Huấn luyện bộ phân loại NLI
  • Nghiên cứu lý luận logic trong xử lý ngôn ngữ tự nhiên