SMF·LOVO
Un prompt peut-il remplacer LOVO ?
Audio et vidéo IA — synthetic voice, dubbing and AI avatars
Bordereau de suivi des pièces
Verdict
Le studio autour du modèle est faisable : un script où chaque ligne a un intervenant, un marqueur d’emphase et une pause, rendu ligne par ligne et mixé en une timeline. Les modèles TTS ouverts gèrent le rendu. Ce que vend Lovo, c’est le catalogue — des centaines de voix, dans des dizaines de langues, sous licence pour usage commercial, avec des variantes d’émotion enregistrées ou entraînées par voix. Les poids ouverts te donnent une poignée de voix avec un seul registre chacune, et aucun papier de droits derrière.
Pièce A — Le prompt
Reçu le31.07.2026Construis un studio local de voix off multi-intervenant. Un script entre, un fichier audio mixé sort.
Format de script : texte brut où une ligne commence par un nom d’intervenant et deux-points. Les lignes vides sont des pauses. Des marqueurs en ligne contrôlent la délivrance : un nombre entre crochets pour une pause explicite en millisecondes, et un marqueur pour l’emphase sur un mot ou une phrase. Les erreurs d’analyse sont rapportées avec un numéro de ligne, jamais devinées.
Intervenants : chacun correspond à une voix d’un modèle TTS installé localement, avec débit, décalage de hauteur et volume par intervenant. N’accepte que des modèles avec une licence documentée, et enregistre quelle licence porte la voix de chaque intervenant dans le fichier de projet — c’est le champ qui décide si la sortie peut être utilisée commercialement, et il devrait être visible plutôt qu’enfoui.
Rendu : synthétise chaque ligne séparément, pas tout le script à la fois. Le rendu ligne par ligne veut dire qu’une mauvaise ligne peut être re-rendue sans refaire toute la prise, et c’est ce qui rend l’itération supportable. Mets en cache chaque ligne par un hash de son texte plus voix plus réglages, pour que re-rendre après avoir édité une ligne ne coûte qu’une ligne.
Mixage : assemble les lignes rendues sur une timeline avec les pauses déclarées entre elles, plus un petit écart par défaut configurable. Normalise chaque ligne à un volume cohérent avant mixage pour qu’une voix calme ne disparaisse pas à côté d’une forte, puis normalise toute la piste à un LUFS cible. Bande sonore de fond optionnelle à un niveau d’atténuation fixe sous la parole, depuis un fichier que fournit l’utilisateur — ne livre aucune musique.
Prononciation : un dictionnaire au niveau du projet associant des formes écrites à des orthographes phonétiques, appliqué avant synthèse. C’est la différence entre utilisable et gênant pour les noms de produits, et ça devrait être une partie de premier ordre de l’interface, pas une page de réglages.
Revue : une forme d’onde de la piste mixée avec les limites de ligne marquées et le script à côté, pour que cliquer sur une ligne la joue et cliquer sur re-rendre remplace juste cette ligne dans le mix.
Provenance et étiquetage : intègre des métadonnées enregistrant les modèles et voix utilisés, leurs licences, et la date de rendu. Écris un fichier annexe avec la même chose. Note dans le README que la parole synthétique utilisée publiquement devrait être divulguée.
Refus : ne livre aucune voix de célébrité, de personnalité publique ou récupérée, et n’implémente pas le clonage de voix depuis un échantillon.
Hors périmètre : le clonage de voix, toute API hébergée ou compte, la vidéo, et la traduction automatique du script.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 le catalogue de voix et sa licence commerciale
- B.2 les variantes d’émotion et de délivrance par voix
- B.3 la couverture linguistique qui rend un workflow de doublage possible
- B.4 cloner une voix avec le workflow de consentement qui la rend utilisable
Alternatives existantes
Pièce C — Pourquoi certains continuent de payer : models, compute, rights, and safety operations
Parce qu’une voix off est un actif commercial et que sa voix a besoin d’une licence attachée. Les poids ouverts te donnent un son ; ils ne te donnent pas le droit de le mettre dans la publicité d’un client.
Questions
Puis-je récupérer mes projets Lovo ?
Les scripts peuvent être copiés en texte et remarqués, ce qui est rapide. Les voix ne peuvent pas : ce sont des actifs sous licence propres à Lovo, donc chaque intervenant est recasté depuis les modèles locaux que tu as, et le résultat sonnera différemment.
Puis-je utiliser la sortie commercialement ?
Seulement si la licence du modèle de voix le permet, c’est pourquoi le prompt enregistre la licence par intervenant dans le fichier de projet. Certains poids TTS ouverts sont sous licence permissive et d’autres sont réservés à la recherche, et la distinction est facile à perdre de vue une fois qu’un projet a cinq intervenants.
Combien ça coûte à faire tourner ?
Rien à la minute après le téléchargement des modèles. Le rendu se fait en local plus vite que le temps réel sur une machine moderne, donc un script de dix minutes prend quelques minutes et ne coûte que de l’électricité — face à une tarification à la minute ou par crédit sur le produit payant.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
Le casting. La valeur de Lovo, c’est parcourir des centaines de voix jusqu’à en trouver une qui convient à la pièce, dans la langue dont tu as besoin, avec le registre émotionnel que tu veux. Une poignée de voix locales veut dire que tu écris le script pour convenir aux voix que tu as.
Outils proches
Récépissé