Tập dữ liệu: Bigcode/The Stack Dedup

term_id: datasetbigcodethe_stack_dedup

Category: basic_concepts

Definition

The Stack Dedup là một tập con chuyên biệt của The Stack, một kho lưu trữ mã nguồn mở khổng lồ. Nó áp dụng các kỹ thuật loại bỏ trùng lặp nghiêm ngặt để xóa bỏ các đoạn mã dư thừa có thể gây thiên vị cho các mô hình ngôn ngữ lớn.

Summary

Phiên bản đã loại bỏ trùng lặp của tập dữ liệu The Stack, được BigCode tuyển chọn để loại bỏ các đoạn mã gần giống nhau nhằm tạo dữ liệu huấn luyện sạch hơn.

Key Concepts

  • Loại bỏ trùng lặp
  • LLM về mã nguồn
  • Chất lượng dữ liệu
  • The Stack

Use Cases

  • Huấn luyện các mô hình sinh mã
  • Đánh giá khả năng lập trình
  • Giảm thiểu sự dư thừa trong huấn luyện