SMF·WELLSAID-LABS
Un prompt peut-il remplacer WellSaid Labs ?
Audio et vidéo IA — synthetic voice, dubbing and AI avatars
Bordereau de suivi des pièces
Verdict
WellSaid vend deux choses qu’un projet local sépare proprement. Les voix sont des performances sous licence enregistrées avec des comédiens sous contrat, et rien d’ouvert ne les égale pour la narration d’entreprise. La surface de contrôle — ajuster l’emphase, la prononciation et le rythme sur des mots individuels jusqu’à ce qu’une prise soit utilisable — est reproductible, et c’est ce qui transforme une voix synthétique passable en une voix que tu peux livrer. Construire cet éditeur est un vrai travail d’une session et c’est là où la plupart des installations TTS locales échouent.
Pièce A — Le prompt
Reçu le31.07.2026Construis un studio de narration local dont la fonctionnalité distinctive est le contrôle mot par mot sur le débit.
Modèle : un moteur TTS local — Piper ou Kokoro — téléchargé au premier usage. N’accepte que des modèles avec une licence documentée et enregistre quelle licence porte chaque voix, puisque ce champ décide si la sortie peut être utilisée commercialement.
Script : des paragraphes de texte découpés en phrases, chaque phrase rendue comme un segment audio indépendant. Le rendu au niveau du segment est ce qui rend l’itération supportable : corriger un mot re-rend une phrase, pas tout le script.
Contrôles mot par mot, qui sont l’intérêt de ce projet. Cliquer sur un mot dans le script ouvre des contrôles pour ce mot seulement :
- Surcharge de prononciation, saisie comme des phonèmes dans la propre notation du modèle, avec un bouton d’aperçu qui prononce juste ce mot. Fournis une référence de phonèmes et une recherche qui propose une orthographe pour un mot inconnu en utilisant les règles d’espeak-ng comme point de départ.
- Emphase : trois niveaux, appliqués en ajustant la durée et le contour de hauteur du mot par rapport à ses voisins plutôt qu’en le criant.
- Pause après, en millisecondes.
- Multiplicateur de vitesse pour le mot, pour ralentir un nombre ou un acronyme.
Stocke tout ça comme une couche d’annotation par mot au-dessus du texte brut, pour que le script reste lisible et copiable et que les annotations puissent être exportées séparément.
Glossaire de projet : un dictionnaire de prononciation au niveau du projet, appliqué à chaque occurrence. Ajouter un mot depuis l’éditeur mot par mot au glossaire se fait en un clic, puisque le même nom de produit serait faux dans chaque script sinon.
La boucle de relecture, qui compte autant que les contrôles : forme d’onde de la narration complète avec les frontières de phrase marquées, clique sur une phrase pour la jouer, et un bascule A/B entre le rendu actuel et précédent de la même phrase à volume sonore égalisé. Le volume égalisé est essentiel — sinon chaque changement sonne comme une amélioration.
Rendu : assemble les segments de phrase avec les pauses déclarées, normalise chacun vers un volume sonore cohérent avant l’assemblage, et normalise toute la piste vers une cible broadcast. Exporte WAV et MP3 plus un fichier de sous-titres WebVTT généré depuis le script avec les vrais timings de segment.
Provenance : intègre des métadonnées enregistrant le modèle, la voix, la licence et la date de rendu, et note dans le README qu’une narration synthétique utilisée publiquement devrait être divulguée.
Refus : ne livre aucune voix de célébrité, de personnage public ou récupérée par scraping, et n’implémente pas de clonage à partir d’un échantillon.
Hors périmètre : le clonage de voix, toute API hébergée, le dialogue multi-locuteurs, la vidéo, et la traduction.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 le catalogue de voix et les contrats d’acteurs derrière
- B.2 les droits commerciaux qui permettent à la sortie d’aller dans une publicité client
- B.3 la qualité vocale qui rend une longue narration confortable à écouter
- B.4 les flux de travail d’équipe et les bibliothèques de prononciation partagées
Pièce C — Pourquoi certains continuent de payer : models, compute, rights, and safety operations
Parce qu’une voix de narration est une performance sous licence. Cinquante dollars achète le droit de mettre la voix d’un acteur précis dans un travail commercial, et aucun modèle ouvert ne vient avec ça.
Questions
Est-ce que je peux récupérer mes scripts WellSaid ?
Les scripts sont du texte et se transfèrent sans problème. Les bibliothèques de prononciation et tout ajustement mot par mot sont tenus dans le propre format de WellSaid et ne s’exportent pas, ce qui est la partie qui mérite qu’on y consacre du temps pour reconstruire la terminologie récurrente.
À quel point l’écart de qualité vocale est-il vraiment grand ?
Grand pour la narration longue et plus petit pour les lignes courtes. Les modèles ouverts sont intelligibles et plats ; les voix de WellSaid portent la prosodie à travers un paragraphe d’une façon qui rend une vidéo de cinq minutes confortable à écouter. L’ajustement mot par mot réduit l’écart sur des mots problématiques spécifiques et ne le ferme pas.
Combien ça coûte à faire tourner ?
Rien par minute après le téléchargement du modèle. Le rendu est plus rapide que le temps réel sur une machine moderne, donc des prises illimitées ne coûtent que de l’électricité — ce qui est l’argument le plus fort pour construire ça, puisque l’itération est là où le tarif au caractère fait mal.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
La licence. Les voix de WellSaid viennent avec le droit de les utiliser commercialement, soutenu par des contrats avec les acteurs. Un modèle ouvert te donne un son et, selon sa licence, peut-être aucun droit de le mettre dans une publicité client du tout.
Outils proches
Récépissé