L'explosion algorithmique nous a permis de créer des images et de la musique, mais elle a aussi montré une certaine force dans la transformation de la voix en texte. Si l'on cherche un sous-titre ou une transcription, il existe bien de nombreux services gratuits, mais la question est : comment cela fonctionne-t-il dans l'autre sens ? Je parle du text-to-speech, la classique conversion de texte en voix dont de nombreux utilisateurs ont régulièrement besoin. Aujourd'hui, nous allons explorer quelques plateformes en ligne, étudier de près leurs modes gratuits et, si possible, comparer les résultats.
Texte à voix : meilleur à chaque génération
Je me souviens encore très bien de la première version de Dragon NaturallySpeaking qui est sortie sur le marché. Nous devions lutter pendant des heures pour «entraîner» le système, et avec un peu de chance, il finissait par reconnaître 25 % des mots. De nos jours, parler à un appareil et transmettre des commandes vocales est si simple que personne ne s'arrête pour réfléchir au processus évolutif complexe qui nous a menés ici.
La synthèse vocale est encore plus ancienne (on peut penser au vocodeur des Bell Labs, ou à un certain ordinateur IBM chantant «Daisy Bell» dans les années 60), mais avec l'apparition de nouveaux modèles basés sur l'intelligence artificielle, il n'est pas insensé de dire qu'elle est à son meilleur. En fait, la conversion de texte en voix est plus proche que jamais, et aujourd'hui nous allons explorer l'offre gratuite de quelques plateformes spécialement conçues pour cette tâche.
Comment convertir du texte en voix : ElevenLabs
Le mode gratuit de ElevenLabs limite son traitement à dix mille caractères par mois et n'autorise pas l'utilisation commerciale, mais cela devrait être largement suffisant pour tout projet personnel. La liste des langues disponibles s'étend à 28, tandis que les voix activées dans la démo (maximum de 333 caractères) sont au nombre de 29.
Cette démo n'est pas seulement impressionnante en elle-même, mais en plus, ElevenLabs nous permet de télécharger une copie du résultat au format MP3. Pour entrer sur la plateforme, le plus simple est d'utiliser les identifiants Google, et à l'intérieur, nous trouvons des paramètres avancés comme des modèles alternatifs, la stabilité et la clarté. Cependant, ElevenLabs n'est pas parfait (certaines voix convertissent le 25 en «twenty-five» au lieu de «vingt-cinq»), mais il offre un excellent point de départ pour toutes sortes d'utilisateurs.
Speechify
Speechify est une créature différente des autres. D'un certain point de vue, elle se divise en deux parties : une axée sur le text-to-speech traditionnel avec neuf voix en espagnol, et la «webapp» complète, dans laquelle nous devons saisir le texte comme un lien vers une page web, un nouveau document, un fichier local, un document physique scanné, ou une copie enregistrée dans le cloud. Autrement dit, Speechify est un outil de productivité qui nous aidera à traiter des textes plus rapidement.
La langue espagnole dispose d'un total de douze voix dans la webapp, et je recommande personnellement de toutes les essayer. Les différences de qualité peuvent être très importantes, même entre des voix similaires, et le contrôle de la vitesse est essentiel pour optimiser les résultats. Speechify ne permet pas de télécharger l'audio en mode gratuit, mais rien ne nous empêche de l'enregistrer avec un outil compatible en arrière-plan.
Bark
Bark est une création de Suno AI, plateforme beaucoup mieux connue pour ses talents à générer de la musique avec l'intelligence artificielle via l'outil Chirp. Sa technologie de text-to-speech est open source, ce qui signifie que tout cavalier de Python peut aller croiser le fer avec le code sur GitHub, et explorer des démos, des échantillons et d'autres détails techniques.
L'alternative la plus simple est, évidemment, de se rendre sur son serveur Discord, d'entrer dans le canal de la bêta de Bark, et de commencer à générer des voix. Les commandes se divisent en /bark pour activer le moteur, suivi du prompt (le texte que nous voulons traiter), et voice, dans lequel nous pouvons lancer les dés en utilisant l'option random, ou choisir une voix de la liste. En moins d'une minute, Bark partagera la conversation, disponible en MP3 et MP4.
En résumé
J'espère que cette sélection et ses échantillons vous donneront une idée solide de la conversion de texte en voix avec l'intelligence artificielle et de ses principales limites. Au-delà des inévitables restrictions des profils gratuits, je pense que les conditions sont définitivement appropriées pour couvrir la plupart de nos besoins, sans dépenser un seul centime.