PDF Parser Shootout
Daten & Prozesse • Offener Vergleichstest

Repo: github.com/miraculix95/pdf-parser-shootout
Worum es geht
Ein praktischer Vergleich dreier moderner Dokumentenparser — LlamaParse, Mistral OCR und Docling — an genau dem Fall, um den die meisten Vergleiche einen Bogen machen: einem echten europäischen Zeitschriftentitel mit senkrecht gedrehtem Text, handgezeichneten Schlagzeilen, mehrspaltigem Satz und gemischten Sprachen. Das ist deshalb wichtig, weil die Ausgabe eines Parsers die Eingabe einer RAG-Kette ist: Verliert er Überschriften oder bringt er die Lesereihenfolge durcheinander, holt das keine noch so gute Nachbearbeitung wieder herein. Zwei der drei Parser sind an diesem Titel gescheitert.
Was dabei herauskam
| Parser | Textausbeute Titelseite | Lesereihenfolge Inhaltsverzeichnis | Senkrechter Text | Dauer (10 S.) | Kosten (10 S.) |
|---|---|---|---|---|---|
| LlamaParse Agentic | vollständig | korrekt | erkannt | ca. 30 s | 0,13 $ |
| Mistral OCR | überwiegend | korrekt | übersehen | ca. 5 s | 0,01 $ |
| Docling (CPU) | verloren | durcheinander | übersehen | ca. 216 s | 0 $ |
Das Ergebnis ist nicht nur eine Tabelle, sondern eine Regel für die Werkzeugwahl: Bei redaktionellen, gestalteten oder bildlastigen PDFs übersteht nur LlamaParse den Test; bei normalen Dokumenten — Verträgen, Rechnungen, Fachtexten — ist Mistral OCR der beste Kompromiss aus Preis und Leistung (schnell, günstig, in der EU gehostet). Das Repository enthält sämtliche Rohausgaben, sodass jeder den Test in fünf Minuten wiederholen kann.
Warum es hier steht
Es zeigt den Teil der KI-Arbeit, der nicht das Modell ist: das richtige Werkzeug anhand von Belegen auswählen, an echten Daten, und den Befund so aufschreiben, dass ein Team danach handeln kann. Nebenbei bestimmt er den Texterkennungs-Pfad der Demo Doc → Insight.
Stack
Python · LlamaParse · Mistral OCR · Docling · reproduzierbarer Testaufbau