Whisper

term_id: whisper

Category: basic_concepts

Definition

Whisperは、さまざまな言語、方言、アクセントに対応するために設計された汎用音声認識モデルです。多言語かつマルチタスクの教師ありデータから、数十万時間分のオーディオを用いて学習しています。

Summary

多様なオーディオデータセットで学習した、OpenAIが開発した自動音声認識(ASR)システム。

Key Concepts

  • 自動音声認識
  • 多言語サポート
  • ノイズへの頑健性
  • トランスフォーマーアーキテクチャ

Use Cases

  • 動画の字幕生成
  • 会議や講義の文字起こし
  • 音声コマンドの処理

Code Example

1
2
3
4
import whisper
model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])