OpenAI ha annunciato il lancio di una serie di nuove funzionalità vocali nella sua API, pensate per supportare gli sviluppatori nella creazione di applicazioni capaci di parlare, trascrivere e tradurre conversazioni in tempo reale.
GPT-Realtime-2 è un modello vocale di nuova generazione, dotato di capacità di ragionamento di livello GPT-5, progettato per gestire richieste complesse. GPT-Realtime-Translate offre traduzione simultanea in tempo reale, supportando 70 lingue in input e 13 in output. GPT-Realtime-Whisper fornisce invece trascrizione live da parlato a testo nel corso della conversazione.
Le applicazioni previste spaziano dal customer service all’istruzione, dai media alle piattaforme creative. OpenAI sottolinea inoltre di aver integrato meccanismi di sicurezza per limitare abusi, spam e frodi, con sistemi automatici capaci di interrompere conversazioni che violano le policy aziendali. I modelli sono disponibili tramite la Realtime API con diversi schemi di tariffazione.
Leggi l’articolo completo: OpenAI launches new voice intelligence features in its API su TechCrunch
Immagine generata tramite DALL-E. Tutti i diritti sono riservati. Università di Torino (24/03/2025).

