SMF·SWELL-AI
Un prompt peut-il remplacer Swell AI ?
Montage audio et vidéo — podcast recording, cleanup and publishing
Bordereau de suivi des pièces
Verdict
L’audio est invisible pour la recherche. Le vrai travail de Swell, c’est de convertir un épisode en texte sur page avec la structure qui le rend trouvable : un transcript complet avec étiquettes de locuteur et ancres, des titres de chapitre, et les données structurées qui disent à un moteur de recherche ce qu’est la page. C’est une passe de transcription plus une génération HTML soignée, ce qui représente quelques bons jours. Ce que tu continues à payer, c’est que Swell publie ça directement dans ton hébergeur ou ton CMS, l’étape que personne n’aime faire à la main chaque semaine.
Pièce A — Le prompt
Reçu le31.07.2026Construis un outil qui transforme un épisode de podcast en une page de transcript publiable. La sortie est du HTML structuré, pas un article de blog.
Transcription : whisper.cpp en local avec horodatages au niveau du mot. Séparation des locuteurs par une heuristique d’énergie et de pause, l’utilisateur renommant les locuteurs une fois et le changement se propageant. Ne prétends pas à une identification automatique de locuteur.
Structuration, ce qui rend la page utile plutôt qu’un mur de texte :
- Fusionne la sortie au niveau du mot en tours de parole, puis en paragraphes aux pauses naturelles, pour que le transcript se lise comme un dialogue plutôt qu’un flux.
- Détecte les frontières de chapitre en encodant des fenêtres consécutives du transcript et en trouvant les changements de sujet, puis aligne chaque frontière sur un début de tour de parole. Titre chaque chapitre à partir de son propre texte.
- Donne à chaque chapitre un identifiant d’ancre et à chaque paragraphe un attribut d’horodatage, pour qu’un lien puisse pointer vers un moment précis.
- Produis un résumé d’épisode et une courte liste de points clés à partir du transcript.
La sortie de page, qui est le livrable :
- HTML sémantique : un élément article, des titres de chapitre en h2 avec ancres, des tours de parole balisés de façon cohérente, des horodatages rendus comme des liens portant aussi un attribut de temps lisible par machine.
- Des données structurées JSON-LD utilisant le type PodcastEpisode, avec le nom de l’épisode, la description, la durée, la date de publication, la série associée, et l’URL du fichier audio. C’est la partie la plus précieuse de la sortie et elle doit être valide — valide-la dans la suite de tests plutôt que de le supposer.
- Une table des matières construite à partir des ancres de chapitre.
- Titre et description meta, avec des longueurs vérifiées par rapport aux points de troncature habituels.
- Un élément lecteur audio pointant vers le fichier de l’épisode, avec le transcript en dessous.
Édition avant export : le transcript est modifiable dans l’outil, parce que Whisper va se tromper sur les noms, le jargon et les nombres, et publier ces erreurs est pire que ne pas publier. Un glossaire par épisode des orthographes correctes, appliqué comme une passe rechercher-remplacer sur chaque futur épisode de la même émission, pour que les mêmes noms cessent d’être faux chaque semaine.
Exports : la page HTML autonome, une version Markdown pour un générateur de site statique, des sous-titres WebVTT simples pour le lecteur audio, et le bloc JSON-LD seul pour le coller dans un CMS.
Honnêteté sur ce que ça ne fait pas : ça produit une page, ça n’en publie pas une, et ça ne fait aucune promesse sur le classement. Dis les deux dans le README.
Utilise Anthropic ou OpenAI pour les titres de chapitre et le résumé. Sans clé, la transcription, la structuration, les ancres et l’export HTML doivent quand même tous fonctionner — seuls les titres et le résumé sont indisponibles.
Hors périmètre : la publication vers un quelconque hébergeur ou CMS, l’édition audio, la génération de clips vidéo, et la génération de posts sociaux.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 la publication directe dans ton hébergeur de podcast ou ton CMS
- B.2 le traitement hébergé, donc les longs épisodes occupent ta propre machine
- B.3 la bibliothèque de modèles pour différents formats d’émission
- B.4 la génération de clips sociaux
Alternatives existantes
Pièce C — Pourquoi certains continuent de payer : audio infrastructure, distribution, and production polish
Parce que la valeur n’arrive qu’une fois la page en ligne, et la dernière étape — la mettre dans le CMS chaque semaine sans effort — est celle qu’un outil local te laisse faire.
Questions
Est-ce que je peux importer mon contenu Swell ?
Les transcripts et le texte généré s’exportent et peuvent être gardés comme archives. Il n’y a rien de structuré à importer, et retraiter un épisode ne coûte que du temps local, donc un catalogue d’archives peut simplement être relancé.
Est-ce qu’une page de transcript aide vraiment la découvrabilité ?
Ça donne aux moteurs de recherche du texte là où il n’y en avait pas, ce qui est une condition préalable plutôt qu’une garantie. Les données structurées aident un moteur de recherche à comprendre ce qu’est la page. Ni l’une ni l’autre ne fait classer un épisode toute seule, et tout outil qui prétend le contraire en fait trop.
Combien ça coûte à faire tourner ?
La transcription est gratuite et locale. Les titres de chapitre et le résumé coûtent quelques centimes par épisode. Une émission hebdomadaire coûte quelques dollars par an, contre dix-sept dollars par mois.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
L’étape de publication. Swell écrit la page dans ton CMS ; ici tu exportes du HTML et tu le colles chaque semaine. Petit, répétitif, et exactement le frottement qui finit par faire arrêter les gens complètement.
Outils proches
Récépissé