« On a des dashboards partout… »
…et deux services qui ne trouvent pas le même chiffre pour le même indicateur. Chaque comité commence par un débat sur la donnée au lieu d’une décision.
Data science · Data analyse · IA
Data science et data analyse en renfort de vos équipes : Python, SQL, Power BI, Dataiku. Et de l'IA documentaire quand vos réponses dorment dans des PDF.
Missions réalisées en cabinet de conseil et en régie, chez ces clients finaux.
Ce que j'entends chez mes clients
…et deux services qui ne trouvent pas le même chiffre pour le même indicateur. Chaque comité commence par un débat sur la donnée au lieu d’une décision.
…mais pas qui va partir, ni ce qu’il faut lui proposer. Les analyses existent, en notebooks : elles ne sont jamais devenues un score que le métier utilise.
…plusieurs dizaines de milliers d’euros par an, que trois personnes dépouillent à la main dans Excel, chaque trimestre.
Dans les trois cas, le problème n'est pas de produire un chiffre. C'est de pouvoir s'y fier.
Offres
Vous achetez un livrable et un périmètre écrit, pas des jours d'homme. Chaque offre indique ce qu'elle comprend, ce qu'elle ne comprend pas, et ce dont j'ai besoin de votre côté. C'est cette dernière partie qui évite les mauvaises surprises.
Vos chantiers data existent déjà et il vous manque une paire de bras senior. Je m'intègre à l'équipe, sur vos outils et vos rituels, sans passer par une phase d'avant-vente. C'est la moitié de mes missions.
Si vous ne savez pas encore ce qu'il y a à faire, commencez plutôt par l'audit ci-dessous : trois à cinq jours suffisent à savoir si le sujet vaut un projet.
01
Mission longue
Renfort Data Scientist ou Data Analyst sur vos chantiers en cours. Python, SQL sur BigQuery et Snowflake, PySpark, Power BI, LLM et NLP. Secteurs assurance, retail et luxe, grande consommation.
Ce qui n'est pas compris
Ce dont j'ai besoin de votre côté
600 – 700 € HT / jour
Quatre jours par semaine maximum.
Audit, puis preuve de concept, puis mise en production. Chaque étape se décide à la fin de la précédente : rien ne vous engage à suivre la séquence en entier.
02
3 à 5 jours
Je cartographie vos sources documentaires inexploitées, je construis un prototype d’extraction sur un échantillon réel de vos documents, et je vous remets une feuille de route chiffrée en trois scénarios.
Ce qui n'est pas compris
Ce dont j'ai besoin de votre côté
2 500 – 4 000 € HT
Déduit du projet si vous poursuivez.
03
3 à 4 semaines
Un système opérationnel qui lit vos documents et en sort des données structurées, chacune accompagnée de sa source exacte et d’un indice de confiance. Vos équipes l’utilisent via une interface web, sans compétence technique.
Ce qui n'est pas compris
Ce dont j'ai besoin de votre côté
12 000 – 18 000 € HT
40 % à la commande, 60 % à la livraison. Deux semaines de support incluses.
04
6 à 10 semaines, puis mensuel
Le passage du prototype au service utilisé tous les jours : montée en volume, intégration à votre datalake et à votre BI, tableau de bord de qualité d’extraction, reprise d’historique, formation de vos équipes. J’interviens sur la chaîne de données et sur la qualité ; l’exploitation de l’infrastructure reste chez vous ou chez votre infogéreur.
Ce qui n'est pas compris
Ce dont j'ai besoin de votre côté
18 000 – 45 000 € HT
Suivi qualité ensuite : 900 – 2 000 € HT par mois.
Devis valable 30 jours. Périmètre écrit et figé ; tout ajout fait l'objet d'un avenant. Paiement à 30 jours fin de mois. Pénalités de retard au taux légal triplé, plus 40 € d'indemnité forfaitaire. TVA non applicable, article 293 B du CGI.
Le différenciateur
C'est le volet IA de mon activité, et celui sur lequel je me distingue. N'importe qui branche un LLM sur un PDF ; presque personne ne livre de la donnée auditable. Un modèle répond toujours, même quand il invente. Un chiffre inventé dans une étude de marché n'est repéré par personne avant d'atterrir en comité de direction.
…la part de marché de la catégorie atteint 18,4 % au deuxième trimestre, en progression de +2,1 points sur un an, portée par le segment premium…
p. 14, §3
{
"part_marche": 18.4, 0.97
"evolution_pts": 2.1, 0.95
"periode": "2026-Q2", 0.99
"segment": "premium", 0.71
"source": "p.14 §3",
}
→ 1 champ envoyé en file de revue humaine
Le passage exact du document, avec sa page, pour chaque valeur extraite.
Un score par champ, pas par document. Ce sont les champs douteux qu’on veut isoler, pas les documents.
Sous un seuil que vous fixez, la donnée part en file de validation au lieu d’entrer silencieusement dans vos tableaux.
Le principe déborde largement l'IA : un indicateur de pilotage qu'on ne peut pas remonter à sa requête et à sa table pose exactement le même problème, et c'est ce que je vais chercher en premier sur une mission de data analyse.
Sans inscription, sans clé API.
Méthode
Un projet data échoue rarement sur la technique. Il échoue sur la donnée d'entrée, sur l'impossibilité de vérifier ce qui sort, ou sur une restitution que personne n'utilise. C'est vrai d'un modèle de langage comme d'un tableau de bord, et je traite ces trois points dans cet ordre.
Tout chiffre doit pouvoir être remonté à ce dont il est issu : le passage exact du document pour une donnée extraite, la requête et la table pour un indicateur de pilotage. Sans cette règle, aucune direction régulée ne mettra le système en production, et elle aura raison.
Un document extrait à 95 % peut porter la valeur fausse au seul endroit qui compte, et un tableau de bord juste à 99 % se fait démolir en comité sur le 1 % restant. Le score s’attache au champ, à l’indicateur, et le seuil vous appartient.
Le système ne cherche pas à tout trancher. Il isole ce dont il n’est pas sûr, une extraction douteuse ou un écart d’indicateur inexpliqué, et le remonte à quelqu’un. C’est ce qui rend tout le reste utilisable sans relecture.
Les trois principes ci-dessus ne dépendent pas du format. Ce qui suit décrit l'audit, l'engagement le plus cadré et le seul qui suive un protocole écrit ; en régie, ils s'appliquent tels quels à vos chantiers en cours. Dans les deux cas, vous savez ce que vous achetez avant de le payer.
Ateliers avec vos équipes : quelles sources documentaires existent, lesquelles sont exploitées, et quels cas d’usage portent réellement de la valeur.
Extraction sur 10 à 30 documents réels de votre périmètre. Pas une démonstration générique : vos documents.
Taux d’extraction, précision, temps humain économisé. Des chiffres, pas une impression.
Démonstration en direct, rapport écrit, et roadmap chiffrée en trois scénarios : minimal, recommandé, ambitieux.
À la fin de la semaine, vous savez ce qui est faisable, ce que ça rapporte et ce que ça coûte. Y compris si la réponse est « rien ».
Si la roadmap vous convainc, on passe au PoC : trois à quatre semaines, périmètre écrit et figé, 40 % à la commande. Si elle ne vous convainc pas, vous gardez la cartographie, le prototype et le chiffrage, et vous savez pourquoi vous n'y allez pas. Les deux issues sont des résultats.
Le code, dans votre dépôt, commenté. La documentation d'exploitation. Une passation avec vos équipes. Et un compte rendu écrit après chaque point d'étape, qui dit ce que j'ai compris, ce que je propose, la prochaine échéance et son responsable.
Réalisations
Trois systèmes publics, démontrables en trois minutes, code source ouvert. Vous pouvez tout ouvrir avant de me parler.
Ce sont des projets d'IA appliquée, les seuls que je puisse montrer. Ce que je livre en mission appartient à mes clients, qu'il s'agisse de modèles de scoring, de tableaux de bord ou de migrations de patrimoine de données. Le parcours plus bas dit ce que ça recouvre.
Un PDF de rapport entre, une table structurée sort, chaque valeur avec sa source et son indice de confiance.
Un gestionnaire sinistres pose sa question en français, le système répond en citant ses sources.
Une question métier en langage naturel, l'analyse adaptée exécutée automatiquement.
À propos
« Sept ans côté métier avant l'IA. C'est pour ça que je sais ce qu'il faut extraire, et ce qu'il faut vérifier. »
Data Scientist et Data Analyst senior, formé à l'Université Panthéon-Assas en Ingénierie Statistique et Financière. Statisticien, économiste et informaticien, la combinaison qui permet de modéliser un problème et de le restituer à ceux qui doivent en décider. Freelance depuis l'été 2026.
Le leader mondial des panels de grande consommation. Études prix, assortiment, promotion et full mix, modélisation GLM, automatisation des chaînes de production d’études. Le métier de la donnée de marché appris de l’intérieur : agréger des sources hétérogènes, les fiabiliser, et en sortir des recommandations utilisables.
Quatre missions successives. La migration d’un patrimoine de données critique de SAS vers Azure et PySpark. De la modélisation NLP en production dès 2020, sur des avis Google et des messages Twitter. L’architecture d’un système de détection d’alertes sinistres monté de zéro, avec API, A/B testing, Kafka et Celonis. C’est là que j’ai appris à livrer sur des données sales, incomplètes et multi-sources.
Études clients sur BigQuery et Python, segmentation, parcours omnicanal, valeur client, pipelines Dataiku, et des tableaux de bord utilisés au quotidien par les équipes marketing, CRM et retail. Le moment où j’ai compris que la restitution n’est pas la dernière étape d’un projet data : c’est celle qui décide s’il sert à quelque chose.
Python (pandas, scikit-learn, PySpark) · SQL (BigQuery, Snowflake, Oracle) · SAS · VBA
LLM et extraction structurée · RAG · NLP · Scoring et segmentation · Économétrie et GLM · A/B testing
Power BI · Looker Studio · Streamlit · Dataiku · Azure · Google Cloud · Celonis · GitHub
Master 2 Ingénierie Statistique et Financière, Université Panthéon-Assas, Paris II · Dataiku Core Designer · Dataiku ML Practitioner · Datascientest Data Science Advanced
Questions fréquentes
Oui, et c’est la moitié de mon activité. Data Scientist ou Data Analyst senior intégré à votre équipe : Python, SQL sur BigQuery et Snowflake, PySpark, Power BI, Dataiku, scoring et segmentation. Pas de phase d’avant-vente, pas de protocole imposé, je prends vos outils et vos rituels. L’IA documentaire est ma spécialité, pas mon seul sujet.
Non, c’est une contrainte d’architecture qu’on cadre au premier jour. Trois montages possibles : une instance Azure OpenAI ou Bedrock dans votre propre tenant, avec hébergement en UE et données non réutilisées pour l’entraînement ; un modèle open source hébergé chez vous ; ou une anonymisation en amont du traitement. J’ai travaillé quatre ans sur des données d’assurance, je connais l’exercice.
C’est précisément le problème que je traite. Je ne livre jamais une sortie de LLM brute. Chaque donnée extraite porte sa citation source et un indice de confiance, et tout ce qui passe sous le seuil que vous fixez part en revue humaine. Le système est conçu pour être auditable, pas pour être magique.
Alors votre sujet n’est pas le modèle : c’est la donnée qui entre et la qualité qui sort. C’est exactement là que j’interviens, en complément de ce qui existe déjà, pas en remplacement.
Le code, la documentation et la connaissance. Tout ce que je livre est déposé dans votre dépôt, commenté, avec une passation. Je ne construis rien qui dépende de ma présence pour continuer à tourner.
Selon le format. Un audit se cale sous deux à trois semaines. Une mission longue demande un peu plus d’anticipation. Le plus simple est de prendre trente minutes pour en parler.
Un renfort sur un chantier en cours, un sujet data à cadrer, des documents à exploiter. Dites-moi où vous en êtes. Sans engagement et sans présentation commerciale : je vous dis ce qui me paraît faisable, à quel coût, et dans quel ordre. Si je pense que ça ne vaut pas le coup, je vous le dis aussi.
Réserver un créneauOu directement
Réponse sous 24 heures ouvrées.