Whisper
term_id: whisper
Category: basic_concepts
Definition
Whisperは、さまざまな言語、方言、アクセントに対応するために設計された汎用音声認識モデルです。多言語かつマルチタスクの教師ありデータから、数十万時間分のオーディオを用いて学習しています。
Summary
多様なオーディオデータセットで学習した、OpenAIが開発した自動音声認識(ASR)システム。
Key Concepts
- 自動音声認識
- 多言語サポート
- ノイズへの頑健性
- トランスフォーマーアーキテクチャ
Use Cases
- 動画の字幕生成
- 会議や講義の文字起こし
- 音声コマンドの処理
Code Example
import whisper
model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])