L'esplosione algoritmica ci ha permesso di creare immagini e musica, ma ha anche mostrato una certa forza nella trasformazione da voce a testo. Se qualcuno cerca un sottotitolo o una trascrizione, ci sono molti servizi gratuiti disponibili, ma la domanda è: come funziona nella direzione opposta? Mi riferisco al text-to-speech, la classica conversione da testo a voce di cui molti utenti hanno bisogno frequentemente. Oggi esploreremo alcune piattaforme online, studieremo da vicino le loro modalità gratuite e, se possibile, confronteremo i risultati.

Testo in voce: converti interi testi in audio con l'intelligenza artificiale
Testo in voce

Testo in voce: migliore con ogni generazione

Ricordo ancora bene quando la prima versione di Dragon NaturallySpeaking uscì sul mercato. Dovevamo lottare per ore per «addestrare» il sistema e, con un po' di fortuna, finiva per riconoscere il 25 per cento delle parole. Al giorno d'oggi, parlare con un dispositivo e trasmettere comandi verbali è così semplice che nessuno si ferma a pensare al complesso processo evolutivo che ci ha portato fin qui.

La sintesi vocale è ancora più antica (possiamo pensare al vocoder dei Bell Labs, o a qualche computer IBM che cantava «Daisy Bell» negli anni '60), ma con l'avvento di nuovi modelli basati su intelligenza artificiale, non è una follia dire che si trova nel suo momento migliore. In effetti, la conversione da testo a voce è più vicina che mai, e oggi esploreremo l'offerta gratuita di alcune piattaforme appositamente progettate per questo compito.

Come convertire il testo in voce: ElevenLabs

Testo in voce: converti interi testi in audio con l'intelligenza artificiale
La demo di base è buona, ma al suo interno ci sono comandi più avanzati

La modalità gratuita di ElevenLabs limita l'elaborazione a diecimila caratteri mensili e non autorizza l'uso commerciale, ma ciò dovrebbe essere più che sufficiente per qualsiasi progetto personale. L'elenco delle lingue disponibili si estende a 28, mentre le voci abilitate nella demo (massimo 333 caratteri) sono 29.

Demo di ElevenLabs

Questa demo non è solo impressionante di per sé, ma ElevenLabs ci permette anche di scaricare una copia del risultato in formato MP3. Per accedere alla piattaforma, il modo più semplice è usare le credenziali di Google, e al suo interno troviamo parametri avanzati come modelli alternativi, stabilità e chiarezza. Ora, ElevenLabs non è perfetto (alcune voci convertono il 25 in «twenty-five» invece di «venticinque»), ma offre un eccellente punto di partenza per ogni tipo di utente.

Speechify

Testo in voce: converti interi testi in audio con l'intelligenza artificiale
Questo è il «modo base» di Speechify...

Speechify è una creatura diversa dalle altre. Da un certo punto di vista, si divide in due parti: una focalizzata sul text-to-speech tradizionale con nove voci in spagnolo, e la «webapp» completa, in cui possiamo inserire testo come collegamento a una pagina web, un nuovo documento, un file locale, un documento fisico scansionato o una copia salvata nel cloud. In altre parole, Speechify è uno strumento di produttività che ci aiuterà a elaborare testi più velocemente.

Testo in voce: converti interi testi in audio con l'intelligenza artificiale
ma la webapp non è male
Demo di Speechify

La lingua spagnola dispone di un totale di dodici voci nella webapp, e personalmente consiglio di provarle tutte. Le differenze di qualità possono essere molto importanti anche tra voci simili, e il controllo della velocità è essenziale per ottimizzare i risultati. Speechify non abilita il download dell'audio nella modalità gratuita, ma nulla ci impedisce di registrarlo con uno strumento compatibile in background.

Bark

Testo in voce: converti interi testi in audio con l'intelligenza artificiale
Bisogna rispondere a un paio di domande su Discord prima di iniziare...

Bark è una creazione di Suno AI, piattaforma molto più conosciuta per le sue capacità di generare musica con intelligenza artificiale attraverso lo strumento Chirp. La sua tecnologia text-to-speech è open source, il che significa che qualunque appassionato di Python può andare a cimentarsi con il codice su GitHub, oltre a esplorare demo, campioni e altri dettagli tecnici.

Testo in voce: converti interi testi in audio con l'intelligenza artificiale
I comandi non sono del tutto intuitivi, ma si imparano relativamente in fretta
Demo di Bark, voce casuale

L'alternativa più semplice è, ovviamente, recarsi sul suo server Discord, entrare nel canale della beta di Bark e iniziare a generare voci. I comandi si dividono in /bark per attivare il motore, seguito da prompt (il testo che vogliamo elaborare) e voice, in cui possiamo tirare i dadi usando l'opzione random o scegliere una voce dall'elenco. In meno di un minuto, Bark condividerà la conversazione, disponibile in MP3 e MP4.

In sintesi

Spero che questa selezione e i suoi esempi servano a dare un'idea solida sulla conversione da testo a voce usando l'intelligenza artificiale e su quali siano le limitazioni più importanti. Al di là delle inevitabili restrizioni nei profili gratuiti, credo che le condizioni siano decisamente adeguate a coprire la maggior parte delle nostre esigenze, senza spendere un solo centesimo.