Download für MCP

Anzeige ansehen und kostenlos herunterladen

Softonic-Testbericht

Dokument-zu-Markdown-Konverter mit MCP-Server und bidirektionalem Export

all2md, entwickelt von Thomas Villani, konvertiert komplexe Dokumentformate in strukturiertes Markdown für LLM-Eingaben und automatisierte Dokumenten-Workflows. Das Tool führt eine bidirektionale Konvertierung über 40+ Formate durch, betreibt einen integrierten Model Context Protocol-Server und bietet RAG-native Chunking sowie AST-basierte Transformationen für hochpräzises Parsing. Es umfasst erweiterte PDF-Tabellenwiederherstellung, optionale OCR-Unterstützung und CLI-Batch-Dienstprogramme. Zielbenutzer sind LLM- und RAG-Entwickler, Python-Entwickler und Power-User, die programmatische Dokumentenvorbereitung durchführen.

Transformiert komplexe Dateien in LLM-bereites Markdown für RAG-Eingabe

Das Tool konvertiert über 40 Dateitypen, einschließlich PDFs, DOCX, PPTX, HTML, E-Mails und Tabellenkalkulationen, in sauberes, GitHub Flavored Markdown, das für die Eingabe von Modellkontexten konzipiert ist. Die Pipeline verwendet einen abstrakten Syntaxbaum, um die Dokumentstruktur zu bewahren und programmgesteuerte Transformationen zu ermöglichen, und sie kann Markdown zurück in reichhaltige Formate wie DOCX und PDF schreiben, was eine Rundreise-Bearbeitung von modellgenerierten Inhalten ermöglicht.

Erzeugt strukturierte Ausgaben mit messbarer Treue für komplexe Layouts

Die PDF-Verarbeitung konzentriert sich auf die Wiederherstellung von Tabellen, die Analyse von Mehrspaltenlayouts und die Entfernung von Kopf- und Fußzeilen, was die Menge an irreführendem oder 'erfundenem' Text im Vergleich zu einfacheren Parsern reduziert. Das Projekt berichtet über Benchmarking gegen Docling und pymupdf4llm und betont niedrige Raten an erfundenem Text. RAG-native Chunking bietet elf Strategien, einschließlich semantischer, Überschrift- und Token-Splits, während die Herkunft von Abschnitten und Seiten für Abruf-Workflows bewahrt bleibt.

Erfordert Entwicklervertrautheit, bietet jedoch erweiterbare, formatspezifische Installationen

Das Tool ist als Python-Bibliothek und CLI für PC, macOS und Linux verfügbar und richtet sich an Python 3.x-Umgebungen. Der Installer verwendet ein modulares Abhängigkeitssystem, sodass nur die Codecs installiert werden, die für bestimmte Formate benötigt werden, und OCR-Extras wie Tesseract oder EasyOCR sind optional für gescannte PDFs. Eine Plugin-API und AST-Transformationen ermöglichen es Entwicklern, benutzerdefinierte Formate hinzuzufügen oder das Parsing-Verhalten programmgesteuert anzupassen.

Passt in AI-Assistenten-Pipelines über MCP und Batch-Tools

Der integrierte Model Context Protocol-Server verbindet die Konvertierungspipeline direkt mit AI-Assistenten, und das Projekt liefert ein One-Click MCPB-Bundle für Kunden wie Claude Desktop. Befehlszeilen-Dienstprogramme unterstützen das Überwachen von Verzeichnissen, die Batch-Konvertierung, die semantische Suche und das Dokumenten-Diffing, um die Eingabe zu automatisieren. Diese Integrationen helfen, strukturiertes Markdown in Abrufsysteme einzuspeisen und ermöglichen es Entwicklern, konvertierte Inhalte in nachgelagerte Modellaufforderungen oder RAG-Speicher zu integrieren.

Praktische Wahl für Entwickler, die Modellaufnahme-Pipelines erstellen

Für Teams, die Abruf- und Kontextschichten konstruieren, bietet das Tool messbare Kontrolle über die Quellenfidelity und Provenienz; sein modulares, code-zuerst Design eignet sich für skriptbasierte Pipelines und Batch-Operationen. Nicht-technische Benutzer werden wahrscheinlich mit einer steilen Einrichtungskurve konfrontiert. Praktischer Rat: Geben Sie GitHub Flavored Markdown aus und bevorzugen Sie semantisches oder überschriftenbasiertes Chunking, um die Provenienz beim Importieren von Dokumenten in Modellkontextspeicher intakt zu halten. Aktivieren Sie OCR-Extras für bildbasierte PDFs vor Batch-Läufen.

  • Vorteile

    • Bidirektionale Konvertierung zwischen Markdown und 40+ Formaten
    • Native Model Context Protocol-Server für die direkte Integration von KI-Assistenten
    • Fortgeschrittene PDF-Analyse mit Tabellenwiederherstellung und Mehrspaltenanalyse
    • RAG-eigenes Chunking mit elf Strategien zur Wahrung der Herkunft
  • Nachteile

    • Entwickelt für Entwickler; nicht-technische Benutzer stehen vor einer steilen Einrichtungsphase
    • Benötigt eine Python 3.x-Umgebung für Bibliotheksfunktionen
    • OCR erfordert die Installation externer Extras für gescannte PDFs
    • Die Befehlszeilenfokussierung passt möglicherweise nicht zu GUI-ersten Arbeitsabläufen.

Details

  • Hersteller

  • Lizenz

    Kostenlos

  • Version

    v1.14.0

  • Aktualisierungsdatum

  • Plattform

    MCP

  • Sprache

    Englisch

Programm ist in anderen Sprachen verfügbar


Download für MCP

Anzeige ansehen und kostenlos herunterladen


Nutzer-Kommentare zu all2md

Haben Sie all2md ausprobiert? Seien Sie der Erste, der Ihre Meinung hinterlässt!

Bewertung hinzufügen
Bei Softonic angemeldet als