Todo el código abierto
Código abiertoVoz y medios78k

Whisper

El robusto modelo de voz a texto de OpenAI para transcripción y traducción.

Whisper es el modelo de reconocimiento automático de voz open source de OpenAI y su implementación de referencia, entrenado sobre un gran conjunto de datos multilingüe y multitarea. Realiza transcripción y traducción en múltiples idiomas y se distribuye en varios tamaños de modelo que permiten equilibrar precisión, velocidad y uso de memoria.

Repositorio

openai/whisper

Lenguaje

Python

Lo que construirías con esto

  • Transcribir audio o vídeo a texto para subtitulado, búsqueda o procesamiento posterior con un LLM
  • Traducir directamente voz en idiomas distintos del inglés a texto en inglés
  • Generar transcripciones como entrada para aplicaciones de IA basadas en voz y resúmenes de reuniones o podcasts

Etiquetas

stttranscriptionopenai