SMF·COLOSSYAN
Un prompt peut-il remplacer Colossyan ?
Audio et vidéo IA — synthetic voice, dubbing and AI avatars
Bordereau de suivi des pièces
Verdict
La moitié assemblage est vraiment atteignable : un script devient une narration, la narration devient des diapositives cadencées, les diapositives deviennent un MP4 avec sous-titres et une carte de quiz. C’est un pipeline local avec ffmpeg et un modèle TTS ouvert. Le présentateur n’est pas atteignable. Les avatars de Colossyan sont des performances licenciées de vrais acteurs, filmées et validées pour un usage commercial, pilotées par un modèle entraîné sur ces images. Tu peux construire la vidéo de formation ; tu ne peux pas construire la personne qui la présente.
Pièce A — Le prompt
Reçu le31.07.2026Construis un générateur local de vidéos de formation : un script entre, un MP4 sous-titré avec diapositives et narration sort. Pas d’avatar, pas de visage.
Format d’entrée : un script Markdown où chaque titre de niveau deux est une scène. Sous un titre, la prose devient la narration et un bloc encadré déclare le visuel de cette scène : une liste à puces, un chemin d’image, un exemple de code, ou une carte de titre. Une scène peut aussi déclarer une question de contrôle des connaissances avec des options et la bonne réponse.
Narration : rends la prose de chaque scène avec un modèle TTS local (Piper ou Kokoro), téléchargé à la première utilisation. Expose la voix, le débit et un dictionnaire de prononciation que l’utilisateur maintient pour les noms de produits et acronymes, ce qui fait la différence entre utilisable et gênant dans un contexte d’entreprise. Ne livre aucune voix clonée ni voix de célébrité ou personnalité publique, et n’accepte que des modèles avec une licence documentée.
Cadencement : mesure chaque segment de narration rendu et construis la timeline à partir de ça, plutôt que de demander à l’utilisateur de deviner les durées. Une liste à puces révèle une puce à la fois, synchronisée sur les limites de phrase dans la narration. Insère une courte pause entre les scènes.
Rendu : compose les diapositives comme du SVG à partir d’un fichier de thème (polices, couleurs, espacement) et rastérise-les ; assemble vidéo et audio avec ffmpeg. Produis un MP4 en 1080p plus un fichier de sous-titres WebVTT généré depuis le texte de narration avec les vrais timings — les sous-titres sont une exigence légale pour la formation en entreprise dans beaucoup d’endroits, et les générer depuis le texte source plutôt qu’en re-transcrivant est à la fois moins cher et exact.
Contrôles de connaissances : rends une question déclarée comme une carte à la fin de sa section avec les options visibles et une pause, puis une carte révélant la réponse. Produis aussi l’ensemble complet des questions comme un fichier JSON pour que le même script puisse alimenter un quiz dans un système d’apprentissage.
Provenance : écris un fichier JSON annexe par rendu enregistrant le hash du script, le modèle et la voix TTS, le thème, et le hash de sortie. Intègre un avis visible de média synthétique dans la dernière image indiquant que la narration est générée par machine.
Hors périmètre : toute génération de tête parlante ou d’avatar, cloner une voix, la traduction automatique dans d’autres langues, le packaging SCORM ou xAPI, et tout service hébergé.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 les avatars licenciés et l’autorisation de droits derrière eux
- B.2 des versions multilingues générées à partir d’un seul script
- B.3 l’embranchement interactif qu’attend une plateforme d’apprentissage
- B.4 une qualité vocale proche d’un narrateur professionnel
Alternatives existantes
Pièce C — Pourquoi certains continuent de payer : models, compute, rights, and safety operations
Parce qu’une vidéo de formation d’entreprise a besoin d’une personne à l’écran et d’une licence commerciale pour son image, et c’est un contrat avec un acteur plutôt qu’un modèle que tu peux télécharger.
Questions
Puis-je importer mes projets Colossyan ?
Les scripts peuvent être copiés en texte et remarqués en Markdown, ce qui prend une heure par cours. Les vidéos rendues sont téléchargeables et restent utilisables. Rien d’autre ne se transfère, puisque les performances d’avatar sont des actifs propres à la plateforme.
Comment la narration se compare-t-elle aux voix de Colossyan ?
Notablement plus synthétique. Les modèles TTS ouverts se sont beaucoup améliorés, mais ils aplatissent encore l’emphase sur les longues phrases et prononcent mal les mots spécifiques à un domaine à moins que tu construises le dictionnaire de prononciation. Pour de la formation interne, c’est souvent acceptable ; pour du contenu client, généralement pas.
Combien ça coûte à faire tourner ?
Rien après les téléchargements de modèles. Le rendu se fait sur ta propre machine à peu près en temps réel ou plus vite, donc une vidéo de formation de dix minutes prend quelques minutes à produire et ne coûte que de l’électricité.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
Le présentateur. Une vidéo de formation avec une personne à l’écran retient l’attention différemment de diapositives avec une voix par-dessus, et les avatars de Colossyan viennent avec les droits du modèle et le consentement de l’acteur déjà réglés. C’est un arrangement de licence, pas un poids de modèle.
Outils proches
Récépissé