SMF·PODSQUEEZE
Un prompt peut-il remplacer Podsqueeze ?
Montage audio et vidéo — podcast recording, cleanup and publishing
Bordereau de suivi des pièces
Verdict
Résumer une transcription est facile et ce catalogue le couvre déjà. Ce qui rend les chapitres différents, c’est qu’ils ont besoin de limites, pas de prose : l’outil doit trouver où la conversation a réellement changé de sujet et produire un horodatage assez précis pour qu’un auditeur qui tape dessus atterrisse au bon endroit. C’est un problème de segmentation — calculer des embeddings de fenêtres de la transcription et détecter où le sujet dérive — et bien le faire prend plus de temps qu’un résumé.
Pièce A — Le prompt
Reçu le31.07.2026Construis un outil local d’épisode-vers-chapitres. Le livrable, ce sont des horodatages, pas de la prose.
Transcription : fais tourner whisper.cpp en local sur l’épisode avec des horodatages au niveau du mot. Diarise les locuteurs avec une heuristique simple d’énergie et de pause et laisse l’utilisateur les renommer, en propageant à travers la transcription. Ne prétends pas à une identification de locuteur automatique fiable.
Segmentation, qui est le cœur de ce projet. Les chapitres viennent de la détection de changement de sujet, pas du fait de demander à un modèle de les inventer :
1. Découpe la transcription en fenêtres chevauchantes d’environ une minute.
2. Calcule un embedding de chaque fenêtre avec un modèle d’embeddings de phrases local.
3. Calcule la similarité entre fenêtres consécutives et trouve les minima locaux — les points où la conversation ressemble le moins à ce qui précédait.
4. Filtre les candidats par une longueur de chapitre minimale, configurable et par défaut de deux minutes, pour qu’une brève digression ne devienne pas un chapitre.
5. Aligne chaque limite acceptée sur le début de phrase le plus proche dans la transcription, pour qu’un chapitre ne commence jamais en plein milieu d’une phrase.
6. Seulement alors, demande à un modèle de titrer chaque segment résultant à partir de son propre texte.
Cet ordre compte. Demander à un modèle de produire des chapitres directement à partir d’une longue transcription donne des horodatages confiants mais faux, parce qu’il n’a aucun sens fiable de la position dans un texte de deux heures. Dériver les limites mécaniquement et les titrer après coup produit des horodatages auxquels un auditeur peut vraiment faire confiance.
Relecture : la transcription avec les limites détectées marquées, chacune déplaçable pour ajustement, avec l’audio lisible depuis n’importe quelle limite pour que l’utilisateur puisse entendre si elle tombe bien. Ajoute ou retire une limite à la main et les titres se régénèrent seulement pour les segments affectés.
Sorties, toutes copiables-collables :
- Chapitres au format qu’acceptent les hébergeurs de podcast : HH:MM:SS suivi du titre, un par ligne.
- Un fichier JSON de chapitres au format Podcasting 2.0.
- Notes d’épisode : un paragraphe par chapitre avec son horodatage lié.
- Citations à mettre en avant : des passages que le modèle marque comme autonomes et citables, chacun avec son horodatage et son locuteur pour pouvoir être vérifié par rapport à l’audio avant publication.
- Une transcription complète en Markdown et WebVTT.
Utilise Anthropic ou OpenAI pour le titrage et les notes, selon la clé configurée. Sans clé, la transcription, la segmentation et l’export d’horodatages doivent continuer à fonctionner — les limites sont la partie précieuse et elles sont calculées en local.
Hors périmètre : le montage audio, la génération de clips vidéo, la publication vers tout hébergeur ou CMS, et le traitement hébergé.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 la publication directe dans ton hébergeur de podcast ou ton CMS
- B.2 la génération de clips vidéo pour le social
- B.3 la bibliothèque de modèles pour différents formats d’émission
- B.4 le traitement hébergé, donc un long épisode occupe ta propre machine
Alternatives existantes
Pièce C — Pourquoi certains continuent de payer : audio infrastructure, distribution, and production polish
Parce que la sortie doit atterrir quelque part, et un outil qui écrit les chapitres directement dans le formulaire d’épisode de ton hébergeur t’épargne la partie du travail qui est vraiment fastidieuse.
Questions
Est-ce que je peux importer mes sorties Podsqueeze ?
Les notes d’épisode et les chapitres s’exportent en texte, ce qui convient pour les garder comme archives. Il n’y a rien de structuré à importer, et relancer un épisode dans ce projet ne coûte que du temps de traitement local.
Pourquoi ne pas simplement demander les chapitres directement à un modèle ?
Parce que ça produit des titres plausibles attachés à de mauvaises heures. Les modèles de langage n’ont aucun sens fiable de la position dans une longue transcription, donc les horodatages dérivent de plusieurs minutes. Détecter les limites par similarité d’embeddings te donne des positions auxquelles tu peux faire confiance, et le modèle ne fait que nommer ce qu’on lui donne.
Combien ça coûte à faire tourner ?
La transcription et la segmentation sont gratuites et locales. Seuls le titrage et les notes coûtent quelque chose, et un épisode de deux heures résumé chapitre par chapitre coûte quelques centimes. Une émission hebdomadaire, c’est moins d’un dollar par an.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
La dernière étape. Podsqueeze écrit les chapitres directement dans ton hébergeur de podcast ; ici, tu copies un bloc de texte dans un formulaire chaque semaine. Petit, ennuyeux, et exactement le genre de friction qui pousse les gens à continuer de payer.
Outils proches
Récépissé