Dokument-zu-Markdown-Konverter mit MCP-Server und bidirektionalem Export
all2md, entwickelt von Thomas Villani, konvertiert komplexe Dokumentformate in strukturiertes Markdown für LLM-Eingaben und automatisierte Dokumenten-Workflows. Das Tool führt eine bidirektionale Konvertierung über 40+ Formate durch, betreibt einen integrierten Model Context Protocol-Server und bietet RAG-native Chunking sowie AST-basierte Transformationen für hochpräzises Parsing. Es umfasst erweiterte PDF-Tabellenwiederherstellung, optionale OCR-Unterstützung und CLI-Batch-Dienstprogramme. Zielbenutzer sind LLM- und RAG-Entwickler, Python-Entwickler und Power-User, die programmatische Dokumentenvorbereitung durchführen.
Transformiert komplexe Dateien in LLM-bereites Markdown für RAG-Eingabe
Das Tool konvertiert über 40 Dateitypen, einschließlich PDFs, DOCX, PPTX, HTML, E-Mails und Tabellenkalkulationen, in sauberes, GitHub Flavored Markdown, das für die Eingabe von Modellkontexten konzipiert ist. Die Pipeline verwendet einen abstrakten Syntaxbaum, um die Dokumentstruktur zu bewahren und programmgesteuerte Transformationen zu ermöglichen, und sie kann Markdown zurück in reichhaltige Formate wie DOCX und PDF schreiben, was eine Rundreise-Bearbeitung von modellgenerierten Inhalten ermöglicht.
Erzeugt strukturierte Ausgaben mit messbarer Treue für komplexe Layouts
Die PDF-Verarbeitung konzentriert sich auf die Wiederherstellung von Tabellen, die Analyse von Mehrspaltenlayouts und die Entfernung von Kopf- und Fußzeilen, was die Menge an irreführendem oder 'erfundenem' Text im Vergleich zu einfacheren Parsern reduziert. Das Projekt berichtet über Benchmarking gegen Docling und pymupdf4llm und betont niedrige Raten an erfundenem Text. RAG-native Chunking bietet elf Strategien, einschließlich semantischer, Überschrift- und Token-Splits, während die Herkunft von Abschnitten und Seiten für Abruf-Workflows bewahrt bleibt.
Erfordert Entwicklervertrautheit, bietet jedoch erweiterbare, formatspezifische Installationen
Das Tool ist als Python-Bibliothek und CLI für PC, macOS und Linux verfügbar und richtet sich an Python 3.x-Umgebungen. Der Installer verwendet ein modulares Abhängigkeitssystem, sodass nur die Codecs installiert werden, die für bestimmte Formate benötigt werden, und OCR-Extras wie Tesseract oder EasyOCR sind optional für gescannte PDFs. Eine Plugin-API und AST-Transformationen ermöglichen es Entwicklern, benutzerdefinierte Formate hinzuzufügen oder das Parsing-Verhalten programmgesteuert anzupassen.
Passt in AI-Assistenten-Pipelines über MCP und Batch-Tools
Der integrierte Model Context Protocol-Server verbindet die Konvertierungspipeline direkt mit AI-Assistenten, und das Projekt liefert ein One-Click MCPB-Bundle für Kunden wie Claude Desktop. Befehlszeilen-Dienstprogramme unterstützen das Überwachen von Verzeichnissen, die Batch-Konvertierung, die semantische Suche und das Dokumenten-Diffing, um die Eingabe zu automatisieren. Diese Integrationen helfen, strukturiertes Markdown in Abrufsysteme einzuspeisen und ermöglichen es Entwicklern, konvertierte Inhalte in nachgelagerte Modellaufforderungen oder RAG-Speicher zu integrieren.
Praktische Wahl für Entwickler, die Modellaufnahme-Pipelines erstellen
Für Teams, die Abruf- und Kontextschichten konstruieren, bietet das Tool messbare Kontrolle über die Quellenfidelity und Provenienz; sein modulares, code-zuerst Design eignet sich für skriptbasierte Pipelines und Batch-Operationen. Nicht-technische Benutzer werden wahrscheinlich mit einer steilen Einrichtungskurve konfrontiert. Praktischer Rat: Geben Sie GitHub Flavored Markdown aus und bevorzugen Sie semantisches oder überschriftenbasiertes Chunking, um die Provenienz beim Importieren von Dokumenten in Modellkontextspeicher intakt zu halten. Aktivieren Sie OCR-Extras für bildbasierte PDFs vor Batch-Läufen.





