Doc → Insight

Daten & Prozesse • Arbeitsprobe

Doc → Insight |full

Live: extract.bastian-brand.com

Worum es geht

Unordentliche Rechnungen gehen hinein — als PDF, Bild oder Text — und heraus kommen strukturierte Daten samt Auffälligkeitsmarkern. Auf die Aufteilung kommt es an: Das Sprachmodell liest (und macht aus einem Dutzend verschiedener Layouts saubere Felder), feste Regeln prüfen (Summen, die nicht aufgehen, doppelte Rechnungsnummern im Stapel, fehlende Umsatzsteuer-ID oder fehlendes Datum, Ausreißerbeträge, Daten in der Zukunft). Genau dieses Muster — KI liest aus, Regeln kontrollieren — will ein Finanzteam tatsächlich: Automatisierung mit Leitplanken statt einer Blackbox, der man blind vertrauen muss.

Die Beispielrechnungen sind erfunden; „eigene hochladen oder einfügen” läuft live.

Wie ich es gebaut habe

Bei PDFs und Bildern wird der Text über Mistral OCR gewonnen — bewusst gewählt: Mein eigener PDF Parser Shootout hat es für normale Dokumente als besten Kompromiss aus Preis und Leistung ausgewiesen (schnell, günstig, in der EU gehostet). Anschließend liest ein Sprachmodell die Rechnungsdaten aus und gibt sie nach einem streng festgelegten JSON-Schema zurück (Lieferant, Nummer, Datum, Positionen, Zwischensumme, Umsatzsteuer, Gesamtbetrag), und eine Reihe schlichter Python-Regeln prüft den gesamten Stapel. Die Auslesung wiederholt sich bei einer gelegentlich leeren Antwort, damit ein gutes Ergebnis nicht an einem Aussetzer des Modells verloren geht; der Stapel wird zwischengespeichert, eigene Uploads sind mengenbegrenzt.

Besonderheiten

  • Drei Eingabearten — PDF, Bild oder Text — eine Verarbeitungskette
  • Die Wahl der Texterkennung ist durch meinen eigenen Vergleichstest belegt, nicht geraten
  • Feste Auffälligkeitsregeln über dem Sprachmodell: nachprüfbar statt magisch

Stack

Python · Streamlit · Mistral OCR · OpenRouter (Auslesung per Sprachmodell) · pandas