Tout l'open source
Open SourceVoix et médias78k

Whisper

Le modèle de reconnaissance vocale robuste d'OpenAI pour la transcription et la traduction.

Whisper est le modèle open-source de reconnaissance automatique de la parole d'OpenAI et son implémentation de référence, entraîné sur un large jeu de données multilingue et multi-tâches. Il effectue la transcription et la traduction dans de nombreuses langues et est distribué en plusieurs tailles de modèles offrant un compromis entre précision, vitesse et mémoire.

Dépôt

openai/whisper

Langage

Python

Ce que vous pourriez construire avec

  • Transcrire de l'audio ou de la vidéo en texte pour le sous-titrage, la recherche ou le traitement LLM en aval
  • Traduire directement la parole non anglophone en texte anglais
  • Générer des transcripts comme entrée pour des applications IA pilotées par la voix et la synthèse de réunions ou de podcasts

Tags

stttranscriptionopenai