Tutto l'open source
Open SourceVoce e media78k

Whisper

Il modello di speech-to-text robusto di OpenAI per trascrizione e traduzione.

Whisper è il modello open-source di riconoscimento automatico del parlato di OpenAI e la sua implementazione di riferimento, addestrato su un ampio dataset multilingue e multi-task. Esegue trascrizione e traduzione in molte lingue ed è distribuito in diverse dimensioni di modello che bilanciano accuratezza, velocità e utilizzo di memoria.

Repository

openai/whisper

Linguaggio

Python

Cosa ci costruiresti

  • Trascrivere audio o video in testo per sottotitolazione, ricerca o elaborazione downstream con un LLM
  • Tradurre il parlato in lingue diverse dall'inglese direttamente in testo inglese
  • Generare trascritti come input per applicazioni AI vocali e per la sintesi di riunioni/podcast

Tag

stttranscriptionopenai