SMF·CAPTIONS-AI
Un prompt peut-il remplacer Captions ?
Audio et vidéo IA — synthetic voice, dubbing and AI avatars
Bordereau de suivi des pièces
Verdict
Transcrire une vidéo en local avec Whisper, incruster des sous-titres stylés avec ffmpeg, et recadrer en cadre vertical 9:16 en utilisant une détection de visage basique pour garder l’intervenant centré, c’est une vraie construction de repli — un vrai projet d’une session qui produit un clip sous-titré utilisable. Ça approxime le recadrage de Captions avec une heuristique de suivi de visage bien plus simple, pas le modèle entraîné qui garde un plan cadré à travers des mouvements rapides et plusieurs intervenants.
Pièce A — Le prompt
Reçu le31.07.2026Construis un outil local de sous-titrage vidéo : transcris, incruste des sous-titres stylés, et recadre en vertical avec un suivi de visage basique. Stack : Python, ffmpeg pour tout le traitement vidéo, whisper.cpp pour la transcription locale, OpenCV pour la détection de visage. Aucune API cloud requise.
Boucle centrale : l’utilisateur dépose un fichier vidéo local. Transcris-le avec whisper.cpp pour obtenir des horodatages au mot près, puis génère une piste de sous-titres ASS avec des sous-titres stylés, surlignés mot par mot, et incruste-la dans la vidéo avec ffmpeg. Séparément, lance le détecteur de visage d’OpenCV sur des images échantillonnées, lisse la position du visage détectée dans le temps, et calcule une fenêtre de recadrage vertical 9:16 qui la suit — en retombant sur un recadrage centré fixe pour les passages sans visage détecté. Exporte la vidéo finale sous-titrée et recadrée comme un seul fichier.
Ça ne nécessite aucune clé API — whisper.cpp et OpenCV tournent tous deux entièrement hors ligne. Un GPU accélère la transcription mais n’est pas requis pour des longueurs de clip court typiques.
Ne construis pas : un modèle entraîné de suivi de visage/sujet (ceci utilise une détection OpenCV prête à l’emploi, explicitement plus faible sous mouvement rapide ou plusieurs intervenants — dis-le dans l’interface quand la confiance est basse), des présentateurs avatars IA, ni une application mobile. Si OpenCV perd le visage pendant plus de quelques secondes, retombe sur un recadrage centré plutôt que de deviner.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 un modèle de recadrage entraîné qui suit les intervenants de façon fiable à travers des coupes rapides et plusieurs personnes dans le cadre
- B.2 une application mobile native pour enregistrer et sous-titrer en déplacement
- B.3 un catalogue sous licence de présentateurs avatars IA
- B.4 le rendu cloud, pour que les exports ne fassent pas la queue derrière ta propre machine
- B.5 des préréglages de style de sous-titres affinés et testés sur des milliers de vidéos
Alternatives existantes
Pièce C — Pourquoi certains continuent de payer : models, compute, rights, and safety operations
Les gens paient Captions parce qu’une simple heuristique de détection de visage perd le sujet dès qu’il y a un mouvement rapide, un geste de la main qui bloque le visage, ou plus d’une personne qui parle — le modèle de Captions a été entraîné spécifiquement pour garder le suivi à travers exactement ces cas. L’abonnement achète cette fiabilité dans de vraies conditions d’enregistrement, pas juste des sous-titres et un recadrage.
Questions
Puis-je importer mes projets Captions existants ?
Non — les fichiers de projet et styles de sous-titres de Captions sont internes à leur application. Tu partirais de tes fichiers vidéo bruts et réappliquerais ton style de sous-titres préféré une fois, comme un modèle réutilisable.
Ça marche sur mon téléphone ?
Non — le traitement ffmpeg et la détection de visage demandent plus de puissance de calcul qu’un navigateur mobile typique n’en fournit. Tu enregistrerais sur ton téléphone, puis lancerais ça sur un ordinateur pour traiter.
Combien ça coûte à faire tourner ?
Rien par vidéo — whisper.cpp et OpenCV tournent tous deux en local sans frais à la minute. Le seul coût, c’est le temps de calcul lui-même, gratuit si c’est ta propre machine.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
Un suivi fiable à travers le mouvement. Le modèle de Captions garde le recadrage centré sur un intervenant qui bouge et gesticule, ou bascule correctement entre plusieurs personnes qui parlent ; l’heuristique basée sur OpenCV ici perd le visage régulièrement dans exactement ces conditions et se contente d’un recadrage statique jusqu’à ce qu’elle le retrouve.
Outils proches
Récépissé