Código abiertoVoz y medios78k
Whisper
El robusto modelo de voz a texto de OpenAI para transcripción y traducción.
Whisper es el modelo de reconocimiento automático de voz open source de OpenAI y su implementación de referencia, entrenado sobre un gran conjunto de datos multilingüe y multitarea. Realiza transcripción y traducción en múltiples idiomas y se distribuye en varios tamaños de modelo que permiten equilibrar precisión, velocidad y uso de memoria.
Repositorio
openai/whisperLenguaje
PythonLo que construirías con esto
- Transcribir audio o vídeo a texto para subtitulado, búsqueda o procesamiento posterior con un LLM
- Traducir directamente voz en idiomas distintos del inglés a texto en inglés
- Generar transcripciones como entrada para aplicaciones de IA basadas en voz y resúmenes de reuniones o podcasts
Etiquetas
stttranscriptionopenai