Open SourceVoix et médias78k
Whisper
Le modèle de reconnaissance vocale robuste d'OpenAI pour la transcription et la traduction.
Whisper est le modèle open-source de reconnaissance automatique de la parole d'OpenAI et son implémentation de référence, entraîné sur un large jeu de données multilingue et multi-tâches. Il effectue la transcription et la traduction dans de nombreuses langues et est distribué en plusieurs tailles de modèles offrant un compromis entre précision, vitesse et mémoire.
Dépôt
openai/whisperLangage
PythonCe que vous pourriez construire avec
- Transcrire de l'audio ou de la vidéo en texte pour le sous-titrage, la recherche ou le traitement LLM en aval
- Traduire directement la parole non anglophone en texte anglais
- Générer des transcripts comme entrée pour des applications IA pilotées par la voix et la synthèse de réunions ou de podcasts
Tags
stttranscriptionopenai