SMF·SITEBULB
Un prompt peut-il remplacer Sitebulb ?
SEO et marketing — technical audits and on-page optimization
Bordereau de suivi des pièces
Verdict
Un crawler qui récupère, analyse et stocke un site est une forme résolue, et le catalogue a déjà une fiche pour la catégorie crawler de bureau. Le vrai produit de Sitebulb, c’est la couche au-dessus : plusieurs centaines de règles, chacune avec une explication écrite de pourquoi elle compte, un échantillon de preuve, et un ordre de priorité qui empêche un audit de se transformer en tableur de 40 000 lignes. Tu peux écrire cinquante bonnes règles en un week-end. Tu ne peux pas écrire les quelques centaines d’autres, et les explications sont la partie que les clients lisent réellement.
Pièce A — Le prompt
Reçu le31.07.2026Construis un auditeur de site dont la sortie est un rapport priorisé et expliqué plutôt qu’un déversement d’URL.
Garde-fou d’abord : avant qu’un crawl ne démarre, exige que l’utilisateur confirme qu’il possède ou a la permission de crawler le domaine cible, et enregistre cette confirmation avec le crawl.
Crawler : récupère avec un user-agent descriptif, obéis au robots.txt, respecte une concurrence et un délai configurables, et plafonne le total d’URL. Suis seulement les liens internes, enregistre les chaînes de redirection en entier plutôt que seulement la destination finale, et stocke le statut, les en-têtes, le timing et le corps de chaque réponse. Persiste les crawls dans SQLite pour qu’une exécution puisse être rouverte, comparée et exportée plus tard.
Extraction par page : titre, meta description, canonique, meta robots, H1 à H3, nombre de mots, liens internes et externes avec texte d’ancre, images avec texte alt et taille en octets, hreflang, blocs de données structurées, et les en-têtes de cache et de compression de la réponse.
Moteur de règles, qui est le cœur du projet. Les règles vivent dans un fichier lisible, pas dans du code. Chaque règle déclare un id, une sévérité, une explication d’un paragraphe de pourquoi elle compte, une note de correction, et un prédicat sur les champs de page extraits. Livre au moins celles-ci, groupées :
- Indexabilité : noindex sur une page qui reçoit des liens internes, canonique pointant vers une redirection, canonique pointant hors site, robots.txt bloquant une page dans le sitemap, chaînes de redirection de plus de deux sauts, boucles de redirection.
- Contenu : titres dupliqués ou manquants, titres au-delà du budget de pixels, meta descriptions manquantes ou dupliquées, H1 manquant, H1 multiples, pages fines sous un seuil de mots, contenu de corps quasi dupliqué par similarité de shingles.
- Liens : liens internes cassés, pages orphelines présentes dans le sitemap mais non liées, pages à plus de quatre clics de la page d’accueil, liens vers des versions non canoniques, texte d’ancre vide ou générique.
- Performance et hygiène : réponses non compressées, images au-delà d’un seuil en octets, texte alt manquant, contenu mixte, liens de retour hreflang manquants.
Rapport : constats groupés par sévérité, chacun montrant le compte, jusqu’à vingt URL d’exemple, l’explication, et la note de correction. Exporte un fichier HTML autonome avec tout intégré, plus un CSV par règle. Le rapport HTML est le livrable, donc il doit s’ouvrir sans serveur et sans réseau.
Comparaison de crawls : étant donné deux crawls du même site, montre quels constats sont apparus, ont disparu ou ont changé de compte. Ce diff est ce qui rend un outil d’audit digne d’être lancé deux fois.
Hors périmètre : le rendu JavaScript, crawler des sites dont l’utilisateur n’a pas confirmé la propriété, les données de backlinks ou de mots-clés, et tout changement automatique sur un site en production.
L’ouverture pré-remplit le prompt — il ne reste qu’à appuyer sur entrée.
Pièce B — Ce que tu perds
- B.1 la bibliothèque de règles — des centaines de vérifications affinées sur de vrais sites clients
- B.2 le rendu JavaScript, dont beaucoup de sites ont maintenant besoin pour être crawlables du tout
- B.3 les visualisations de crawl qui rendent la structure du site lisible
- B.4 les re-crawls planifiés avec détection de changement entre exécutions
Alternatives existantes
Pièce C — Pourquoi certains continuent de payer : crawl scale, rule depth, and operational polish
Parce qu’un audit est un document que tu remets à quelqu’un d’autre, et la valeur est dans l’explication et l’ordonnancement, pas dans le crawl. Cette bibliothèque, ce sont des années de jugement accumulé sur quels problèmes coûtent réellement du trafic.
Questions
Est-ce que je peux importer un crawl Sitebulb ?
Sitebulb exporte ses données en CSV par rapport, ce qui s’importe comme des constats mais pas comme un crawl réutilisable — le détail au niveau de la page contre lequel tournent les règles de ce projet n’est pas dans ces exports. En pratique, tu recrawles, ce qui pour un site de moins de quelques milliers de pages prend quelques minutes.
Est-ce que ça gère les sites rendus en JavaScript ?
Non, et c’est la plus grosse limitation pratique. Piloter un navigateur headless par URL transforme un crawl de cinq minutes en une heure et apporte une lourde charge de maintenance. Si ton site n’expose son contenu qu’après l’exécution de JavaScript, ce projet le rapportera comme vide, ce qui est au moins un échec honnête.
Combien ça coûte à faire tourner ?
Rien. Ça tourne en local contre un fichier SQLite, et la seule vraie limite, c’est combien de temps tu es prêt à attendre. Le plan Lite de Sitebulb est mensuel ; un crawler auto-construit que tu utilises deux fois par an est gratuit.
Quelle est la seule chose qui ne survit pas à la reconstruction ?
Les explications. Cinquante règles que tu as écrites toi-même trouveront la plupart des problèmes importants, mais Sitebulb remet à un client un paragraphe sur pourquoi chacun lui coûte du trafic, écrit par des gens qui ont argumenté ce point avec des développeurs mille fois. C’est le livrable, et ce n’est pas quelque chose que tu écris en un week-end.
Outils proches
Récépissé