Base de connaissances IA, parsing PDF et qualité de base vectorielle

Symptôme : votre RAG indexe des milliers de PDF, mais cite des copyrights de pied de page, des tableaux illisibles ou des annexes périmées—tandis que les jobs d'embedding restent verts.
Cause : les PDF de mauvaise qualité cassent au PDF Parsing ; les chunks sales entrent quand même dans la Vector Database, et la confiance de retrieval monte souvent.

En juillet 2026, audit de 2 400 PDF pour une Knowledge Base interne : précision de citation passée de 78 % à 51 %. 63 % des top-3 contenaient en-têtes répétés ou bruit OCR. Guide de la pipeline anti-pollution—pas un classement de parseurs, mais des portes et évaluations avant embedding. Au 2026-08-07.

Livraison : guide type A—Quick Answer, cinq motifs, matrice parseurs, checklist en sept étapes.

Quick Answer : bloquer la saleté avant le rappel

SituationAction prioritaireNe pas précipiter
Premier lot PDF50 fichiers, comparer parsers + taux d'extractionChanger de modèle d'embedding
Réponses citent copyrightRetirer en-têtes/pieds + dédoublonnerAjouter plus de docs
Tableaux hallucinésParser tableaux à partRéduire chunk aveuglément
Scans majoritairesScore OCR + file manuellePyPDF partout
Gros index, baisse qualitéSupprimer par source_id + régression goldRe-embed total sans analyse

Cinq motifs qui polluent votre Vector Database

MotifSigneDégâtSignal
En-têtes/pieds répétésMême texte chaque pageHits sur copyrightLigne courte ≥3×
Bruit OCRConfusion de caractèresSémantique fausseCaractères hors lexique >8 %
Tableaux cassésColonnes effondréesNombres inventésLongues suites de chiffres
Deux colonnes/notesColonnes entremêléesCitations incohérentesLargeur de ligne saute
Annexes périméesAnciennes politiquesVrai mais obsolètemtime ≠ version métier

Portes avant embedding

  1. Fichier : mot de passe, 0 caractère, extraction <15 % → rejeter/OCR.
  2. Page : vide, image seule, quasi-doublon → ignorer.
  3. Chunk : <30 tokens, >40 % répétition → jeter.
  4. Métier : sans source_id → pas d'écriture.

Le long contexte ne remplace pas un ingest propre—Kimi K3 1M vs RAG.

PDF Parsing : taux de questions répondables, pas nombre de caractères

Mesure (juil. 2026, 50 PDF) : hit@3 layout-aware 74 % vs pdfplumber 61 %.

Étude de cas : rollback sur 2 400 PDF

MétriqueAvantAprès gates
40 questions hit@351 %79 %
Citations header/copyright63 %4 %
Chunks totaux1,28 M0,71 M

Checklist en sept étapes

  • 50 PDF en échantillon.
  • Deux parsers sur 20 questions gold.
  • Règles en-tête/pied en staging.
  • Métadonnées et suppression par source_id.
  • 20–50 questions gold chaque semaine.
  • Pic de rejets surveillé.
  • Trimestriel : docs expirés.

Local : environnement IA en 30 minutes.

Parsing sur workers ; Vector Database = chunks propres

Mac Mac cloud Macstripe pour jobs batch macOS, sync vers service vectoriel Linux.

FAQ

Pourquoi PDF plus que Markdown ?

Layout caché, OCR, répétitions, tableaux—embeddés comme du vrai contenu.

Gate minimum ?

Extraction, répétition, longueur, langue ; source_id obligatoire.

Quel parser ?

Numérique : PyMuPDF. Complexe : Unstructured. Scan : OCR. Questions gold.

Conclusion

Ordre : PDF Parsing → portes → chunks + métadonnées → éval gold → embedding.

Suite : Long contexte vs RAG · Setup IA local