Dokument-till-Markdown konverterare med MCP-server och tvåvägs-export
all2md, utvecklad av Thomas Villani, konverterar komplexa dokumentformat till strukturerad Markdown för LLM-inmatning och automatiserade dokumentarbetsflöden. Verktyget utför tvåvägskonvertering över 40+ format, kör en inbyggd Model Context Protocol-server och erbjuder RAG-infödd chunking samt AST-baserade transformationer för högfidelitetsparsing. Det inkluderar avancerad PDF-tabellåterställning, valfri OCR-stöd och CLI-batchverktyg. Målgruppen är LLM- och RAG-byggare, Python-utvecklare och kraftanvändare som hanterar programmatisk dokumentförberedelse.
Transformera komplexa filer till LLM-redo Markdown för RAG-inmatning
Verktyget konverterar över 40 filtyper, inklusive PDF, DOCX, PPTX, HTML, e-post och kalkylblad, till ren, GitHub Flavored Markdown designad för modellkontextinmatning. Pipen använder ett abstrakt syntaxträd för att bevara dokumentstrukturen och möjliggöra programmatisk transformation, och den kan skriva Markdown tillbaka till rika format som DOCX och PDF, vilket möjliggör redigering av modellgenererat innehåll.
Producerar strukturerade utdata med mätbar trohet för komplexa layouter
PDF-hantering fokuserar på tabellåterställning, analys av flerkolumnslayouter och borttagning av rubriker/fotnoter, vilket minskar mängden spurious eller 'uppfunnet' text jämfört med enklare parser. Projektet rapporterar benchmarking mot Docling och pymupdf4llm och betonar låga uppfunna textnivåer. RAG-inbyggd chunking erbjuder elva strategier, inklusive semantiska, rubrik- och tokenuppdelningar, samtidigt som sektion och sidursprung bevaras för återvinningsarbetsflöden.
Kräver utvecklarbekantskap men erbjuder utbyggbara, format-specifika installationer
Verktyget finns tillgängligt som ett Python-bibliotek och en CLI för PC, macOS och Linux, och det riktar sig mot Python 3.x-miljöer. Installationsprogrammet använder ett modulärt beroendesystem så att endast de codecs som behövs för specifika format installeras, och OCR-tillägg som Tesseract eller EasyOCR är valfria för skannade PDF-filer. Ett plugin-API och AST-transformationer låter utvecklare lägga till anpassade format eller justera parserbeteende programmatisk.
Passar in i AI-assistentpipelines via MCP och batchverktyg
Den inbyggda Model Context Protocol-servern kopplar konverteringspipen direkt till AI-assistenter, och projektet tillhandahåller ett ett-klick MCPB-paket för klienter som Claude Desktop. Kommandoradsverktyg stöder katalogövervakning, batchkonvertering, semantisk sökning och dokumentdiffning för att automatisera inmatning. Dessa integrationer hjälper till att mata strukturerad Markdown in i återvinningssystem och låter utvecklare införliva konverterat innehåll i nedströms modellprompter eller RAG-lager.
Praktiskt val för utvecklare som bygger modellinmatningspipelines
För team som konstruerar återvinnings- och kontextlager ger verktyget mätbar kontroll över källtrohet och ursprung; dess modulära, kod-först design passar för skriptade pipelines och batchoperationer. Icke-tekniska användare stöter sannolikt på en brant installationskurva. Praktiskt råd: generera GitHub Flavored Markdown och föredra semantisk eller rubrikbaserad chunking för att hålla ursprunget intakt när dokument importeras till modellkontextlagringssystem. Aktivera OCR-tillägg för bildbaserade PDF-filer innan batchkörningar.