Whisper

term_id: whisper

Category: basic_concepts

Definition

Whisper es un modelo de reconocimiento de voz de propósito general diseñado para manejar varios idiomas, dialectos y acentos. Está entrenado con cientos de miles de horas de supervisión multilingüe y multitarea, lo que le permite transcribir audio con alta precisión incluso en entornos ruidosos.

Summary

Un sistema de reconocimiento automático de voz (ASR) desarrollado por OpenAI, entrenado con un gran conjunto de datos de audio diverso.

Key Concepts

  • Reconocimiento automático de voz
  • Soporte multilingüe
  • Robustez ante el ruido
  • Arquitectura Transformer

Use Cases

  • Generación de subtítulos y leyendas para videos
  • Transcripción de reuniones o conferencias
  • Procesamiento de comandos de voz

Code Example

1
2
3
4
import whisper
model = whisper.load_model("base")
result = model.transcribe("audio.mp3")
print(result["text"])