SMF·NATURALREADER
Un prompt peut-il remplacer NaturalReader ?
Audio et vidéo IA — synthetic voice, dubbing and AI avatars
Bordereau de suivi des pièces
Verdict
Le texte-vers-parole basique est un problème local déjà résolu. Ce qui distingue NaturalReader d’un simple outil de lecture à voix haute, c’est qu’il gère les documents que les gens ont réellement : des PDF scannés, des pages photographiées, des captures d’écran — aucun ne contient de texte tant que quelque chose ne l’a pas reconnu. Tesseract fait bien ça, et en local, donc le pipeline OCR-puis-lecture est vraiment le travail d’une session. Les voix sont l’endroit où l’écart reste visible, et sur un long document, cet écart devient fatigant.
Pièce A — Le prompt
Reçu le31.07.2026Construis un outil de lecture à voix haute local qui gère les documents scannés, pas seulement le texte.
Entrée : PDF, EPUB, DOCX, texte brut, et images (PNG, JPEG, HEIC).
L’extraction de texte, qui est le cœur de ce projet. Pour un PDF, essaie d’abord la couche de texte intégrée. Détecte explicitement le cas scanné — une page dont le texte extrait est vide ou ne contient que quelques caractères égarés — et bascule sur l’OCR avec Tesseract sur un rendu de cette page à 300 DPI. Gère un document mixte, où certaines pages ont une couche de texte et d’autres non, page par page plutôt qu’en choisissant une seule stratégie pour tout le fichier. Pour les images, fais toujours de l’OCR.
Les étapes de qualité OCR qui font la différence entre utilisable et inutilisable : redresse la page, convertis en niveaux de gris et applique un seuillage avant la reconnaissance, et détecte la langue de la page à partir d’une sélection de l’utilisateur plutôt qu’en devinant. Les mises en page à deux colonnes doivent être gérées par une détection de colonnes, parce que lire une page à deux colonnes de gauche à droite produit du charabia — c’est l’échec le plus courant d’une lecture OCR naïve et ça doit être testé explicitement.
Nettoyage avant la synthèse vocale : rejoins les mots coupés par un trait d’union en fin de ligne, retire les en-têtes et pieds de page répétés détectés à travers les pages, supprime les numéros de page, et fusionne les sauts de ligne que l’OCR insère en plein milieu d’une phrase. Un texte OCR brut lu à voix haute sonne cassé même quand la reconnaissance était parfaite.
Synthèse vocale : un modèle TTS local (Piper pour la vitesse, Kokoro pour la qualité), avec un contrôle de vitesse de 0,5 à 3 fois, et un dictionnaire de prononciation que l’utilisateur maintient. Synthétise une phrase à l’avance pour que la lecture ne bafouille pas aux limites.
Interface de lecture : le texte du document affiché avec la phrase en cours de lecture en surbrillance et défilement automatique, cliquer sur n’importe quelle phrase pour y sauter, et la position de lecture mémorisée par document. Affiche la confiance OCR par page et laisse l’utilisateur corriger le texte reconnu avant ou pendant la lecture, avec la correction qui persiste.
Export : le texte extrait en Markdown, et l’audio parlé en MP3 avec des marqueurs de chapitre par section du document, pour écouter ailleurs.
Hors périmètre : les applications mobiles, toute voix cloud, la synchro entre appareils, et la traduction.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 la qualité de voix — les modèles ouverts fatiguent l’oreille sur un long document
- B.2 l’application mobile, qui est l’endroit où l’écoute a réellement lieu
- B.3 la position de lecture synchronisée entre appareils
- B.4 la licence commerciale pour l’audio généré
Pièce C — Pourquoi certains continuent de payer : models, compute, rights, and safety operations
Parce qu’écouter un document de deux heures n’est tolérable qu’avec une voix qui ne grince pas, et la qualité de voix est exactement l’endroit où les modèles hébergés gardent une vraie avance.
Questions
Y a-t-il quelque chose à migrer depuis NaturalReader ?
Tes documents sont tes propres fichiers, donc rien n’est piégé. Les positions de lecture et les entrées de prononciation personnalisées ne s’exportent pas, et reconstruire le dictionnaire de prononciation est le seul vrai coût de mise en place.
L’OCR est-il vraiment bon ?
Sur un scan propre à 300 DPI de texte imprimé, Tesseract est excellent. Sur une photo de téléphone prise de travers, ou une page avec des colonnes, des tableaux et des notes de bas de page, ça se dégrade fortement — c’est pour ça que le redressement, le seuillage et la détection de colonnes sont dans le prompt plutôt que laissés comme des améliorations futures. L’écriture manuscrite est totalement hors de portée.
Combien ça coûte à faire tourner ?
Rien après le téléchargement des modèles. L’OCR et la synthèse vocale tournent tous deux en local, donc un nombre illimité de documents ne coûte que du temps de traitement — un livre scanné de 300 pages, c’est quelques minutes d’OCR sur une machine moderne.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
Écouter pendant une heure sans se fatiguer de la voix. Les modèles locaux sont intelligibles et plats ; les voix payantes ont une prosodie qui rend l’écoute longue confortable, et c’est précisément le cas d’usage pour lequel cette catégorie existe.
Outils proches
Récépissé