HTML vers Markdown pour LLM
Transformez le HTML d’une page web en Markdown propre, en conservant les tableaux et en supprimant navigation, scripts et pieds de page.
Entrée
Résultat
Le résultat apparaîtra ici.Coller du HTML brut dans un modèle gaspille l’essentiel du contexte en balises, noms de classes, scripts et menus, et le modèle doit encore deviner quelle partie constitue l’article. Le Markdown conserve l’essentiel — titres, listes, liens, blocs de code et tableaux — pour une fraction des tokens. Collez le code source de la page : le convertisseur garde l’élément main ou article s’il existe, supprime tout ce qui l’entoure et convertit le reste avec mixmark-io/turndown. Pour des sites entiers ou des fichiers PDF et Office, jina-ai/reader et microsoft/markitdown font le même travail, respectivement comme service et comme outil Python.
Comment ça marche
- Le HTML est analysé par le DOMParser de votre navigateur : un balisage mal formé est donc réparé comme le ferait un navigateur, avant la conversion.
- Les tableaux deviennent des tableaux à barres verticales de style GitHub grâce à une règle écrite pour cet outil, car Turndown seul les laisse en HTML.
- Scripts, styles, formulaires, nav, aside ainsi que le header et le footer de la page sont supprimés ; le header propre à un article, avec son titre, est conservé.
Où vont vos données
Nulle part. Cet outil s’exécute entièrement dans votre navigateur : le texte collé est traité par la page, jamais transmis à un serveur ni consigné dans un journal.
Cet outil est gratuit et ne demande aucun compte. Ses résultats n’existent que dans la page ouverte et ne sont enregistrés nulle part.
Ce que ça coûte
Cet outil est gratuit, sans connexion ni points.
Questions fréquentes
- Puis-je donner une URL au lieu du HTML ?
- Pas ici : une page dans votre navigateur ne peut pas lire le HTML d’un autre site, car les règles CORS de ce site le bloquent. Ouvrez la page, affichez son code source ou copiez l’élément depuis les outils de développement, puis collez-le. Pour récupérer des URL en masse, un lecteur côté serveur comme jina-ai/reader est l’outil adapté.
- Comment les cellules fusionnées sont-elles traitées ?
- Une cellule avec colspan est suivie de cellules vides afin que chaque ligne garde le même nombre de colonnes. Rowspan n’a pas d’équivalent en Markdown et n’est pas reproduit. Un tableau d’une seule ligne ou d’une seule colonne est considéré comme un tableau de mise en page et converti en paragraphes, ce que ces tableaux sont presque toujours.
- Pourquoi y a-t-il moins de barres obliques inverses qu’avec d’autres convertisseurs ?
- Turndown échappe normalement chaque tiret bas et chaque astérisque du texte, ce qui transforme Q4_K_M en Q4\_K\_M. Cela évite de rares collisions avec l’emphase au prix de bruit sur chaque page ; cet outil n’échappe donc que les caractères qui feraient d’une ligne un titre, une citation ou une liste.
L’open source derrière
Cet outil fonctionne grâce à mixmark-io/turndown, publié sous licence MIT. Si vous avez besoin du même comportement dans votre propre programme, c’est cette bibliothèque qu’il faut utiliser.
mixmark-io/turndownAussi appelé
- html vers markdown
- convertir html en markdown
- page web en markdown pour llm
- html en md en ligne
- turndown en ligne