PDF Parser Shootout

Daten & Prozesse • Offener Vergleichstest

PDF Parser Shootout |full

Repo: github.com/miraculix95/pdf-parser-shootout

Worum es geht

Ein praktischer Vergleich dreier moderner Dokumentenparser — LlamaParse, Mistral OCR und Docling — an genau dem Fall, um den die meisten Vergleiche einen Bogen machen: einem echten europäischen Zeitschriftentitel mit senkrecht gedrehtem Text, handgezeichneten Schlagzeilen, mehrspaltigem Satz und gemischten Sprachen. Das ist deshalb wichtig, weil die Ausgabe eines Parsers die Eingabe einer RAG-Kette ist: Verliert er Überschriften oder bringt er die Lesereihenfolge durcheinander, holt das keine noch so gute Nachbearbeitung wieder herein. Zwei der drei Parser sind an diesem Titel gescheitert.

Was dabei herauskam

Parser Textausbeute Titelseite Lesereihenfolge Inhaltsverzeichnis Senkrechter Text Dauer (10 S.) Kosten (10 S.)
LlamaParse Agentic vollständig korrekt erkannt ca. 30 s 0,13 $
Mistral OCR überwiegend korrekt übersehen ca. 5 s 0,01 $
Docling (CPU) verloren durcheinander übersehen ca. 216 s 0 $

Das Ergebnis ist nicht nur eine Tabelle, sondern eine Regel für die Werkzeugwahl: Bei redaktionellen, gestalteten oder bildlastigen PDFs übersteht nur LlamaParse den Test; bei normalen Dokumenten — Verträgen, Rechnungen, Fachtexten — ist Mistral OCR der beste Kompromiss aus Preis und Leistung (schnell, günstig, in der EU gehostet). Das Repository enthält sämtliche Rohausgaben, sodass jeder den Test in fünf Minuten wiederholen kann.

Warum es hier steht

Es zeigt den Teil der KI-Arbeit, der nicht das Modell ist: das richtige Werkzeug anhand von Belegen auswählen, an echten Daten, und den Befund so aufschreiben, dass ein Team danach handeln kann. Nebenbei bestimmt er den Texterkennungs-Pfad der Demo Doc → Insight.

Stack

Python · LlamaParse · Mistral OCR · Docling · reproduzierbarer Testaufbau