Open SourceVoce e media78k
Whisper
Il modello di speech-to-text robusto di OpenAI per trascrizione e traduzione.
Whisper è il modello open-source di riconoscimento automatico del parlato di OpenAI e la sua implementazione di riferimento, addestrato su un ampio dataset multilingue e multi-task. Esegue trascrizione e traduzione in molte lingue ed è distribuito in diverse dimensioni di modello che bilanciano accuratezza, velocità e utilizzo di memoria.
Repository
openai/whisperLinguaggio
PythonCosa ci costruiresti
- Trascrivere audio o video in testo per sottotitolazione, ricerca o elaborazione downstream con un LLM
- Tradurre il parlato in lingue diverse dall'inglese direttamente in testo inglese
- Generare trascritti come input per applicazioni AI vocali e per la sintesi di riunioni/podcast
Tag
stttranscriptionopenai