Whisper

term_id: whisper

Category: basic_concepts

Definition

Whisper adalah model pengenalan ucapan serbaguna yang dirancang untuk menangani berbagai bahasa, dialek, dan aksen. Model ini dilatih pada ratusan ribu jam data multilingual dan multitask yang disupervisi, membuatnya sangat robust terhadap kebisingan latar belakang dan variasi pengucapan, sehingga mampu mentranskripsi ucapan menjadi teks dengan akurasi tinggi dalam banyak konteks.

Summary

Sistem pengenalan ucapan otomatis (ASR) yang dikembangkan oleh OpenAI dan dilatih pada dataset audio beragam yang besar.

Key Concepts

  • Pengenalan Ucapan Otomatis
  • Dukungan multibahasa
  • Ketahanan terhadap kebisingan
  • Arsitektur Transformer

Use Cases

  • Pembuatan caption dan subtitle video
  • Transkripsi rapat atau kuliah
  • Pemrosesan perintah suara

Code Example

1
2
3
4
import whisper
model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])