Symptom: Ihr RAG indexiert Tausende PDFs, antwortet aber mit Fußzeilen-Copyrights, kaputten Tabellen oder abgelaufenen Anhängen—während Embedding-Jobs grün bleiben.
Ursache: Schlechte PDFs scheitern beim PDF Parsing; dreckige Chunks landen trotzdem in der Vector Database, und die Retrieval-Konfidenz steigt oft.
Im Juli 2026 prüften wir 2.400 Unternehmens-PDFs einer internen Knowledge Base. Die Zitationsgenauigkeit bei Goldfragen fiel von 78 % auf 51 %. 63 % der Top-3-Treffer enthielten wiederholte Kopfzeilen oder OCR-Rauschen. Dieser Leitfaden beschreibt die Anti-Pollution-Pipeline—kein Parser-Ranking, sondern Gates und Evaluation vor dem Embedding. Stand 2026-08-07.
Quick Answer: Schmutz stoppen, bevor Recall zählt
| Situation | Zuerst tun | Nicht hasten |
|---|---|---|
| Erste PDF-Batch | 50 Dateien, Parser-Vergleich + Extraktionsrate | Größeres Embedding-Modell |
| Antworten zitieren Header | Kopf-/Fußzeilen strippen + Dedup | Mehr Dokumente |
| Tabellen-Halluzinationen | Tabellen separat parsen | Chunk blind verkleinern |
| Scan-PDFs | OCR-Score + manuelle Queue | Alles mit PyPDF |
| Index groß, Qualität sinkt | Löschen per source_id + Gold-Regression | Voll-Re-Embed ohne Analyse |
Fünf Muster, die Ihre Vector Database verschmutzen
| Muster | Anzeichen | Schaden | Signal |
|---|---|---|---|
| Wiederholte Kopf-/Fußzeilen | Gleicher Text jede Seite | Treffer auf Copyright | Kurze Zeile ≥3× im Chunk |
| OCR-Rauschen | Zeichenverwechslung | Semantik bricht | Nicht-Wörter >8 % |
| Kaputte Tabellen | Spalten kollabieren | Erfundene Zahlen | Lange Ziffern ohne Trenner |
| Zweispaltig/Fußnoten | Spalten vermischen | Inkohärente Zitate | Zeilenbreite springt |
| Veraltete Anhänge | Alte Policies | Richtig aber alt | mtime ≠ Version |
Gates vor dem Embedding
- Datei: Passwort, 0 Zeichen, Extraktion <15 % → ablehnen/OCR.
- Seite: leer, nur Bild, Near-Dup → überspringen.
- Chunk: <30 Token, >40 % Wiederholung → verwerfen.
- Business: ohne
source_id→ kein Write.
Langkontext ersetzt kein sauberes Ingest—Kimi K3 1M vs. RAG.
PDF Parsing nach beantwortbaren Fragen wählen
Messung (Jul 2026, 50 PDFs): hit@3 layout-aware 74 % vs. pdfplumber 61 %.
Fallstudie: Rollback bei 2.400 PDFs
| Metrik | Vorher | Nach Gates |
|---|---|---|
| 40 Goldfragen hit@3 | 51 % | 79 % |
| Zitate mit Header/Copyright | 63 % | 4 % |
| Chunks gesamt | 1,28 M | 0,71 M |
Sieben-Schritte-Checkliste
- 50 PDFs stichprobenartig labeln.
- Zwei Parser mit 20 Goldfragen vergleichen.
- Header-Regeln in Staging prüfen.
- Metadaten und Löschen per
source_id. - 20–50 Goldfragen wöchentlich.
- Ablehnungsspitzen überwachen.
- Quartalsweise abgelaufene Docs.
Lokal: 30-Minuten-AI-Setup.
Parsing auf Workern; Vector Database nur saubere Chunks
Macstripe Cloud Mac für macOS-Batch-Jobs, Sync zur Linux-Vektorservice.
FAQ
Warum PDFs mehr als Markdown?
Layout, OCR, Wiederholungen, Tabellen—embedden wie echter Inhalt.
Mindest-Gate?
Extraktion, Wiederholung, Länge, Sprache; source_id Pflicht.
Welcher Parser?
Digital: PyMuPDF. Komplex: Unstructured. Scan: OCR. Goldfragen entscheiden.
Fazit
Reihenfolge: PDF Parsing → Gates → Chunks + Metadaten → Gold-Eval → Embedding.
Weiter: Langkontext vs. RAG · Lokales AI-Setup