Extracteur de données de marché
Un PDF de rapport entre, une table structurée sort, chaque valeur avec sa source et son indice de confiance.
Le problème
Une direction études achète des rapports de marché à plusieurs dizaines de milliers d'euros par an. Chaque trimestre, quelqu'un ressaisit les chiffres à la main dans Excel. Brancher un LLM dessus paraît évident, jusqu'au moment où l'on s'aperçoit qu'un modèle répond toujours, même quand il invente, et qu'un chiffre inventé dans une étude de marché n'est repéré par personne avant le comité de direction.
Ce que j'ai construit
Un pipeline qui découpe le document, extrait chaque donnée chiffrée dans un schéma Pydantic validé (indicateur, valeur, unité, période, pays, segment), rattache à chaque valeur le passage source exact avec sa page, et calcule un indice de confiance par champ. Sous le seuil, la donnée n'entre pas dans la sortie : elle part en file de revue.
Le résultat
Une extraction vérifiable champ par champ, et un jeu d'évaluation qui mesure la précision sur des documents de référence. La ressaisie trimestrielle devient une relecture des seuls champs douteux.
La stack
- Python
- Pydantic
- LLM
- Streamlit
Parlons-en trente minutes
Un renfort sur un chantier en cours, un sujet data à cadrer, des documents à exploiter. Dites-moi où vous en êtes. Sans engagement et sans présentation commerciale : je vous dis ce qui me paraît faisable, à quel coût, et dans quel ordre. Si je pense que ça ne vaut pas le coup, je vous le dis aussi.
Réserver un créneauOu directement
Réponse sous 24 heures ouvrées.