Microsoft ha presentato tre modelli fondazionali sviluppati dal team MAI Superintelligence, creato nel 2025 e guidato dal CEO Mustafa Suleyman: MAI-Transcribe-1 per la trascrizione vocale, MAI-Voice-1 per la sintesi di voci e MAI-Image-2 per la generazione di contenuti visivi. I modelli sono disponibili su Microsoft Foundry e MAI Playground.
MAI-Transcribe-1 converte il parlato in testo in 25 lingue diverse, con una velocità 2,5 volte superiore rispetto ad Azure Fast, l’offerta precedente di Microsoft. MAI-Voice-1 genera audio a una velocità notevole (60 secondi di audio prodotti in un solo secondo) e consente di creare voci personalizzate, aprendo scenari di uso sia professionale che creativo.
In termini di prezzi, Microsoft punta a offrire un’alternativa più economica rispetto a Google e OpenAI. MAI-Transcribe-1 parte da 0,36 dollari l’ora, MAI-Voice-1 da 22 dollari per milione di caratteri, MAI-Image-2 da 5 dollari per milione di token in input testuale e 33 dollari per milione di token in input immagine.
Leggi l’articolo completo: Microsoft takes on AI rivals with three new foundational models su TechCrunch
Immagine generata tramite DALL-E. Tutti i diritti sono riservati. Università di Torino (16/01/2025).

