データセット:Bigcode/The Stack Dedup

term_id: datasetbigcodethe_stack_dedup

Category: basic_concepts

Definition

The Stack Dedupは、大規模なオープンソースコードリポジトリであるThe Stackの専門的なサブセットです。大規模言語モデルの学習バイアスを防ぐため、冗長なコードスニペットを排除するために厳格な重複除去技術が適用されています。

Summary

BigCodeによってキュレーションされたThe Stackデータセットの重複除去版であり、クリーンな学習データのためにほぼ重複するコードスニペットを削除しています。

Key Concepts

  • 重複除去
  • コードLLM
  • データ品質
  • The Stack

Use Cases

  • コード生成モデルの学習
  • コーディング能力のベンチマーク
  • 学習の冗長性削減