← Toutes les réalisations

Extracteur de données de marché

Un PDF de rapport entre, une table structurée sort, chaque valeur avec sa source et son indice de confiance.

Le problème

Une direction études achète des rapports de marché à plusieurs dizaines de milliers d'euros par an. Chaque trimestre, quelqu'un ressaisit les chiffres à la main dans Excel. Brancher un LLM dessus paraît évident, jusqu'au moment où l'on s'aperçoit qu'un modèle répond toujours, même quand il invente, et qu'un chiffre inventé dans une étude de marché n'est repéré par personne avant le comité de direction.

Ce que j'ai construit

Un pipeline qui découpe le document, extrait chaque donnée chiffrée dans un schéma Pydantic validé (indicateur, valeur, unité, période, pays, segment), rattache à chaque valeur le passage source exact avec sa page, et calcule un indice de confiance par champ. Sous le seuil, la donnée n'entre pas dans la sortie : elle part en file de revue.

Le résultat

Une extraction vérifiable champ par champ, et un jeu d'évaluation qui mesure la précision sur des documents de référence. La ressaisie trimestrielle devient une relecture des seuls champs douteux.

La stack

  • Python
  • Pydantic
  • LLM
  • Streamlit

Parlons-en trente minutes

Un renfort sur un chantier en cours, un sujet data à cadrer, des documents à exploiter. Dites-moi où vous en êtes. Sans engagement et sans présentation commerciale : je vous dis ce qui me paraît faisable, à quel coût, et dans quel ordre. Si je pense que ça ne vaut pas le coup, je vous le dis aussi.

Réserver un créneau

Ou directement

Réponse sous 24 heures ouvrées.