データ拡張

term_id: data_augmentation

Category: training_techniques

Definition

この手法は、画像の回転、音声へのノイズ付加、テキストにおける同義語置換など、既存のサンプルを変形させたバージョンを作成することで、トレーニングデータを人為的に拡張します。これにより、モデルの過学習を防ぎ、汎化性能を向上させるのに役立ちます。

Summary

データ拡張とは、既存のデータポイントに変換を適用することで、トレーニングデータの多様性と規模を増加させる手法です。

Key Concepts

  • 過学習の防止
  • データセットの拡張
  • 汎化性能
  • 変換

Use Cases

  • コンピュータビジョンモデルの堅牢性の向上
  • 限られたテキストデータでのNLPモデル性能の強化
  • 不均衡なデータセットのバランス調整

Code Example

1
2
from tensorflow.keras.preprocessing.image import ImageDataGenerator
gen = ImageDataGenerator(rotation_range=20)