Aivanov_scan_ogc

Author	SHA1	Message	Date
Dom	b47f5c47e0	feat(schema): module de nettoyage des JSONs pour consommation aval Le pipeline produit un JSON riche pendant l'exécution (ratios checkbox, OCR raw, flags _parse_error/_truncated_loop/_crop_recodage, _source, _elapsed_s…). Utile en audit, mais pollue quand on veut exposer le résultat à un consommateur aval (Excel, dashboard, API). pipeline/schema.py : - SCHEMA_VERSION "2.0" - clean_dossier(raw) : retourne une copie propre avec structure stable (en-tête → codage → GHM/GHS → décisions) et validation ATIH en format compact (summary + cross_checks + flags par champ). - CLEAN_FIELDS_RECUEIL / CLEAN_FIELDS_CONCERTATION_{1,2} / CLEAN_FIELDS_PREUVES documentent les champs stables par type de page. - CLI : `python -m pipeline.schema` → nettoie `output/v2/*.json` vers `output/v2_clean/`. Séparation claire : `output/v2/` reste le JSON raw (audit), `output/v2_clean/` est la sortie propre et stable pour livrables. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-04-24 15:54:50 +02:00
Dom	7d45018139	feat(extract): normaliser ghs_injustifie en 0/1 (P2) Qwen renvoie typiquement le libellé complet `0 SE 1 2 3 4 ATU FFM FSD` dans le champ ghs_injustifie alors qu'une seule valeur 0/1 est attendue. Ajout de `pipeline.checkboxes.parse_ghs_injustifie` qui extrait le premier chiffre 0/1 via regex, ou "" si illisible. Post-traitement appliqué à chaque extraction recueil et aux 18 JSONs V2 existants (10 fichiers corrigés en place — les 8 autres avaient déjà ghs_injustifie absent ou vide). Note sur les 7 cases SE1-4/ATU/FFM/FSD : zones trop petites pour être calibrées à l'œil et aucun cas positif (`ghs_injustifie=1`) dans l'échantillon 2018 pour valider visuellement. La détection est en placeholder, à recalibrer sur un cas positif réel. Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-04-24 15:54:16 +02:00
Dom	b6dd9ff1df	chore(bench): résultats V2 et rapports de benchmarking Snapshot des 18 JSONs produits par le pipeline V2 (Qwen2.5-VL-3B + checkboxes densité + validation ATIH), utiles au collaborateur comme référence de ce que la chaîne actuelle produit. Rapports : - bench_v2_report.md : comparaison V2 vs legacy docTR+VLM (couverture, divergences, régressions notables sur codage_reco et praticien). - validation_report.md : résumé de la validation ATIH sur les 18 JSONs (131/149 → 140/149 codes valides après fix suffixes `*` et `+N`, 0 incohérence GHM↔GHS, 8 suggestions de correction OCR). Script de comparaison : - bench_v11_vs_legacy.py : tableau d'accord champ par champ entre un run du pipeline (output/v2/) et les JSONs legacy (output/). Co-Authored-By: Claude Opus 4.7 (1M context) <noreply@anthropic.com>	2026-04-24 15:06:30 +02:00
Dom	0c0f62fbf1	feat: extraction OGC et génération de PDFs propres Pipeline complet pour extraire les données structurées des fiches OGC scannées (recueil praticien conseil + concertation) et générer des PDFs propres et lisibles à partir des JSON extraits. Co-Authored-By: Claude Opus 4.6 (1M context) <noreply@anthropic.com>	2026-03-26 10:12:21 +01:00

4 Commits