Referenz
Glossar zur Dokumentenextraktion
Verständliche Definitionen der Begriffe rund um überprüfbare Dokumentenextraktion. Jeder Eintrag beantwortet zunächst die Frage und erklärt sie dann.
Definitionen
- Überprüfbare Dokumentenextraktion
- Dokumentenextraktion, bei der sich jeder zurückgegebene Wert bis zu seinem Ursprung zurückverfolgen lässt. Bei Scans und Fotos enthält ein Feld den Text, aus dem es gelesen wurde, sowie, wenn die OCR ihn lokalisiert hat, Seite und Position; bei strukturierten E-Rechnungen wird der Wert aus der Quelldatei geparst. Der Sinn dahinter: Ein Prüfer oder ein nachgelagertes System kann einen Wert überprüfen, statt ihm blind zu vertrauen.
- Quellenbeleg
- Der einem aus einem gescannten oder fotografierten Dokument extrahierten Feld beigefügte Beleg: der zugeordnete Text und, wenn die OCR den Wert lokalisieren konnte, Seite und Begrenzungsrahmen. So kann jemand nachvollziehen, woher eine Zahl stammt, ohne die ganze Seite erneut zu lesen. Strukturierte E-Rechnungen werden aus ihren Daten geparst und haben keinen Begrenzungsrahmen.
- Zuordnungsstatus
- Ein Feld-Flag, das angibt, wie ein Wert mit der Quelle verknüpft wurde. Die möglichen Werte sind exact, fuzzy, llm_located, not_found, not_applicable und user_entered. Ein Wert, den die OCR nicht verknüpfen kann, wird als not_found zurückgegeben, statt stillschweigend akzeptiert zu werden.
- Begrenzungsrahmen
- Das Rechteck auf dem Seitenbild, an dem die OCR einen Wert lokalisiert hat. DocSolved zeichnet es auf dem annotierten PDF ein, farblich codiert nach der Konfidenzskala. Ein Rahmen existiert nur, wenn OCR-Belege den Wert lokalisiert haben; E-Rechnungsfelder haben konstruktionsbedingt keinen.
- Strukturierte E-Rechnung
- Eine Rechnung, die als maschinenlesbare Daten statt als Scan geliefert wird: Factur-X, ZUGFeRD und XRechnung (CII), UBL 2.1 sowie KSeF FA(3). DocSolved liest die Werte direkt aus der Datei, ohne OCR und ohne KI-Vermutungen — es gibt also nichts falsch zu lesen.
- KSeF FA(3)
- Das XML-E-Rechnungsformat des polnischen nationalen E-Rechnungssystems (KSeF). DocSolved liest die FA(3)-Datei selbst ein und validiert sie deterministisch; es besteht keine KSeF-API-Verbindung und es sind keine Zugangsdaten involviert.
- OCR (optische Zeichenerkennung)
- Die Umwandlung eines Textbilds (Scan oder Foto) in maschinenlesbare Zeichen und deren Positionen auf der Seite. In DocSolved erzeugt die OCR die Tokens und Rahmen, die später jedes extrahierte Feld mit seiner Quelle verknüpfen.
- Konfidenzwert
- Ein Wert pro Feld für Daten, die die KI aus einem Scan oder Foto extrahiert hat; Werte mit geringer Konfidenz werden zur Prüfung hervorgehoben. Felder strukturierter E-Rechnungen tragen stattdessen einen eigenen Vertrauensstatus, da bei ihnen nichts geraten wurde.
- Dokumenttyp-Erkennung
- Die automatische Erkennung, um welche Art von Dokument es sich handelt — Rechnung, Beleg, Bestellung, Lieferschein, Lebenslauf und mehr — mit einem Konfidenzwert. Der erkannte Typ bestimmt, welche Felder DocSolved extrahiert.
- Annotiertes PDF
- Eine herunterladbare Kopie des Dokuments, bei der jeder extrahierte Wert auf der Seite eingerahmt und nach Konfidenz farblich codiert ist, sodass sich die gesamte Extraktion auf einen Blick prüfen lässt.
Sehen Sie diese Konzepte live an einem echten Dokument — kein Konto nötig.