2 min di lettura
Google ti lascia disegnare una voce AI scrivendo solo una descrizione
Hai mai pensato a come dovrebbe suonare la voce perfetta per il tuo audiolibro, il tuo assistente vocale o il doppiaggio di un video? Fino a ieri dovevi scegliere tra un catalogo di voci preimpostate. Ora puoi semplicemente descriverla a parole, e l’AI la crea da zero.
Il 23 settembre Google ha presentato Gemini 3.8 Flash TTS e Flash-Lite TTS, due modelli text-to-speech che trasformano una descrizione testuale in una voce sintetica su misura: accento, timbro, età percepita, persino il ruolo che quella voce deve interpretare (narratore, assistente, personaggio). Non scegli più da un menu, la disegni con le parole.
I nuovi modelli supportano indicazioni di scena dirette nel testo, come sospiri o risate, rendendo il parlato sintetico molto più naturale e commercialmente versatile.
Perché questo cambia le regole del gioco per chi crea contenuti
Pensa a come lavori con un fotografo modello quando dai indicazioni di posa o espressione: “guarda in camera, sorriso appena accennato, un po’ di luce laterale”. Con questi modelli TTS fai la stessa cosa con la voce: scrivi “voce femminile, accento del nord, tono caldo e rassicurante, con un leggero sospiro a metà frase” e ottieni esattamente quello.
- Voci create da zero: niente più cataloghi chiusi, la voce nasce dal prompt.
- Indicazioni di scena: sospiri, risate, pause, tutto controllabile via testo.
- Due tagli di modello: Flash per qualità superiore, Flash-Lite per costi ancora più bassi e velocità.
Tre numeri per inquadrare la notizia:
- 2 i nuovi modelli lanciati (Flash e Flash-Lite).
- 23 settembre 2026: data di rilascio.
- 1 solo prompt testuale: tutto quello che serve per generare la voce.
Un caso concreto per te che lavori con contenuti multimediali: se produci reel, video immobiliari o materiale didattico, potresti presto generare voci narranti diverse per ogni progetto, coerenti col tono che vuoi comunicare, senza pagare uno speaker professionista per ogni variante o lingua.
Il basso costo di questi modelli apre possibilità commerciali che vanno dagli assistenti vocali personalizzati al doppiaggio automatico su scala.
Tre cose che mi porto via
- La personalizzazione vocale sta seguendo la stessa traiettoria delle immagini generate: da template fissi a descrizione testuale libera.
- Le “indicazioni di scena” (sospiri, risate) sono il dettaglio che rende una voce sintetica credibile, non solo comprensibile.
- Il costo basso di questi modelli Flash è il vero acceleratore: la qualità da sola non basta, deve essere anche accessibile per diffondersi.
È come passare dal comprare un vestito già confezionato al farselo cucire su misura descrivendolo al sarto, con la differenza che qui il sarto lavora in pochi secondi e costa una frazione del prezzo.
Fonte: the-decoder.com
✍️ Articolo firmato da “La Redazione”: sistema editoriale multi-agente (AI) orchestrato con Claude Code e supervisionato da Luca Cazzaniga · lucacazzaniga.it
Creatività Aumentata
Analisi di approfondimento direttamente nella tua casella di posta.