Data science · Data analyse · IA

Vous avez la donnée. Ce qui manque, c'est d'en tirer une décision.

Data science et data analyse en renfort de vos équipes : Python, SQL, Power BI, Dataiku. Et de l'IA documentaire quand vos réponses dorment dans des PDF.

  • Allianz
  • IRI Worldwide
  • Christian Dior Couture
  • Galeries Lafayette
  • Philip Morris France
  • 7 ans en environnement grand compte
  • 2020 mes premiers modèles NLP en production
  • 4 ans sur des données d’assurance

Missions réalisées en cabinet de conseil et en régie, chez ces clients finaux.

Ce que j'entends chez mes clients

Trois phrases que j'ai entendues cette année

« On a des dashboards partout… »

…et deux services qui ne trouvent pas le même chiffre pour le même indicateur. Chaque comité commence par un débat sur la donnée au lieu d’une décision.

« On sait qui a acheté… »

…mais pas qui va partir, ni ce qu’il faut lui proposer. Les analyses existent, en notebooks : elles ne sont jamais devenues un score que le métier utilise.

« On paie des rapports de marché… »

…plusieurs dizaines de milliers d’euros par an, que trois personnes dépouillent à la main dans Excel, chaque trimestre.

Dans les trois cas, le problème n'est pas de produire un chiffre. C'est de pouvoir s'y fier.

Offres

Quatre façons de travailler ensemble

Vous achetez un livrable et un périmètre écrit, pas des jours d'homme. Chaque offre indique ce qu'elle comprend, ce qu'elle ne comprend pas, et ce dont j'ai besoin de votre côté. C'est cette dernière partie qui évite les mauvaises surprises.

Le point d'entrée le plus courant

Vos chantiers data existent déjà et il vous manque une paire de bras senior. Je m'intègre à l'équipe, sur vos outils et vos rituels, sans passer par une phase d'avant-vente. C'est la moitié de mes missions.

Si vous ne savez pas encore ce qu'il y a à faire, commencez plutôt par l'audit ci-dessous : trois à cinq jours suffisent à savoir si le sujet vaut un projet.

Ou la séquence projet, en trois temps

Audit, puis preuve de concept, puis mise en production. Chaque étape se décide à la fin de la précédente : rien ne vous engage à suivre la séquence en entier.

02

Audit « Données dormantes »

3 à 5 jours

Je cartographie vos sources documentaires inexploitées, je construis un prototype d’extraction sur un échantillon réel de vos documents, et je vous remets une feuille de route chiffrée en trois scénarios.

  • Cartographie des sources
  • Prototype fonctionnel, code livré
  • Chiffrage du gain en heures par an
  • Roadmap en 3 scénarios budgétés
Périmètre précis

Ce qui n'est pas compris

  • Développement en production
  • Intégration à votre SI
  • Traitement de plus de 30 documents

Ce dont j'ai besoin de votre côté

  • Un interlocuteur métier référent
  • Un échantillon de documents réels
  • Deux demi-journées d’atelier

2 500 – 4 000 € HT

Déduit du projet si vous poursuivez.

03

PoC IA documentaire

3 à 4 semaines

Un système opérationnel qui lit vos documents et en sort des données structurées, chacune accompagnée de sa source exacte et d’un indice de confiance. Vos équipes l’utilisent via une interface web, sans compétence technique.

  • Pipeline d’ingestion
  • Extraction à schéma validé ou RAG sourcé
  • Couche qualité et file de revue humaine
  • Interface métier
  • Documentation et passation
Périmètre précis

Ce qui n'est pas compris

  • Mise en production
  • Reprise d’historique complet
  • Développements SI hors périmètre écrit

Ce dont j'ai besoin de votre côté

  • Accès aux données réelles
  • Un référent métier disponible une heure par semaine
  • Un environnement d’exécution ou l’autorisation d’en créer un

12 000 – 18 000 € HT

40 % à la commande, 60 % à la livraison. Deux semaines de support incluses.

04

Mise en production & suivi qualité

6 à 10 semaines, puis mensuel

Le passage du prototype au service utilisé tous les jours : montée en volume, intégration à votre datalake et à votre BI, tableau de bord de qualité d’extraction, reprise d’historique, formation de vos équipes. J’interviens sur la chaîne de données et sur la qualité ; l’exploitation de l’infrastructure reste chez vous ou chez votre infogéreur.

  • Traitement par lots à l’échelle
  • Intégration datalake, warehouse, Power BI
  • Tableau de bord de qualité et de dérive
  • Reprise d’historique
  • Documentation d’exploitation et formation
Périmètre précis

Ce qui n'est pas compris

  • Hébergement et exploitation de l’infrastructure
  • Astreinte et engagement de disponibilité
  • Refonte de votre datalake
  • Développements applicatifs métier

Ce dont j'ai besoin de votre côté

  • Un PoC validé
  • Un sponsor identifié
  • Un accès aux environnements cibles
  • Un interlocuteur côté exploitation ou infogérance

18 000 – 45 000 € HT

Suivi qualité ensuite : 900 – 2 000 € HT par mois.

Devis valable 30 jours. Périmètre écrit et figé ; tout ajout fait l'objet d'un avenant. Paiement à 30 jours fin de mois. Pénalités de retard au taux légal triplé, plus 40 € d'indemnité forfaitaire. TVA non applicable, article 293 B du CGI.

Le différenciateur

Chaque donnée remonte à sa source

C'est le volet IA de mon activité, et celui sur lequel je me distingue. N'importe qui branche un LLM sur un PDF ; presque personne ne livre de la donnée auditable. Un modèle répond toujours, même quand il invente. Un chiffre inventé dans une étude de marché n'est repéré par personne avant d'atterrir en comité de direction.

rapport_marche_Q2.pdf → extraction confiance moyenne 0.93

…la part de marché de la catégorie atteint 18,4 % au deuxième trimestre, en progression de +2,1 points sur un an, portée par le segment premium

p. 14, §3

{

  "part_marche": 18.4, 0.97

  "evolution_pts": 2.1, 0.95

  "periode": "2026-Q2", 0.99

  "segment": "premium", 0.71

  "source": "p.14 §3",

}

→ 1 champ envoyé en file de revue humaine

Citation source

Le passage exact du document, avec sa page, pour chaque valeur extraite.

Indice de confiance

Un score par champ, pas par document. Ce sont les champs douteux qu’on veut isoler, pas les documents.

Revue humaine

Sous un seuil que vous fixez, la donnée part en file de validation au lieu d’entrer silencieusement dans vos tableaux.

Le principe déborde largement l'IA : un indicateur de pilotage qu'on ne peut pas remonter à sa requête et à sa table pose exactement le même problème, et c'est ce que je vais chercher en premier sur une mission de data analyse.

Essayer la démo en ligne

Sans inscription, sans clé API.

Méthode

Comment je travaille

Un projet data échoue rarement sur la technique. Il échoue sur la donnée d'entrée, sur l'impossibilité de vérifier ce qui sort, ou sur une restitution que personne n'utilise. C'est vrai d'un modèle de langage comme d'un tableau de bord, et je traite ces trois points dans cet ordre.

  1. 01

    Rien ne sort sans sa source.

    Tout chiffre doit pouvoir être remonté à ce dont il est issu : le passage exact du document pour une donnée extraite, la requête et la table pour un indicateur de pilotage. Sans cette règle, aucune direction régulée ne mettra le système en production, et elle aura raison.

  2. 02

    La confiance se mesure au détail, pas en moyenne.

    Un document extrait à 95 % peut porter la valeur fausse au seul endroit qui compte, et un tableau de bord juste à 99 % se fait démolir en comité sur le 1 % restant. Le score s’attache au champ, à l’indicateur, et le seuil vous appartient.

  3. 03

    L’humain garde la main sur le doute.

    Le système ne cherche pas à tout trancher. Il isole ce dont il n’est pas sûr, une extraction douteuse ou un écart d’indicateur inexpliqué, et le remonte à quelqu’un. C’est ce qui rend tout le reste utilisable sans relecture.

L'audit « Données dormantes », jour par jour

Les trois principes ci-dessus ne dépendent pas du format. Ce qui suit décrit l'audit, l'engagement le plus cadré et le seul qui suive un protocole écrit ; en régie, ils s'appliquent tels quels à vos chantiers en cours. Dans les deux cas, vous savez ce que vous achetez avant de le payer.

  1. J1

    Cartographie

    Ateliers avec vos équipes : quelles sources documentaires existent, lesquelles sont exploitées, et quels cas d’usage portent réellement de la valeur.

  2. J2–3

    Prototype

    Extraction sur 10 à 30 documents réels de votre périmètre. Pas une démonstration générique : vos documents.

  3. J4

    Mesure

    Taux d’extraction, précision, temps humain économisé. Des chiffres, pas une impression.

  4. J5

    Restitution

    Démonstration en direct, rapport écrit, et roadmap chiffrée en trois scénarios : minimal, recommandé, ambitieux.

À la fin de la semaine, vous savez ce qui est faisable, ce que ça rapporte et ce que ça coûte. Y compris si la réponse est « rien ».

Après l'audit

Si la roadmap vous convainc, on passe au PoC : trois à quatre semaines, périmètre écrit et figé, 40 % à la commande. Si elle ne vous convainc pas, vous gardez la cartographie, le prototype et le chiffrage, et vous savez pourquoi vous n'y allez pas. Les deux issues sont des résultats.

Ce que je livre, à chaque fois

Le code, dans votre dépôt, commenté. La documentation d'exploitation. Une passation avec vos équipes. Et un compte rendu écrit après chaque point d'étape, qui dit ce que j'ai compris, ce que je propose, la prochaine échéance et son responsable.

Réalisations

Du code qui tourne, pas des slides

Trois systèmes publics, démontrables en trois minutes, code source ouvert. Vous pouvez tout ouvrir avant de me parler.

Ce sont des projets d'IA appliquée, les seuls que je puisse montrer. Ce que je livre en mission appartient à mes clients, qu'il s'agisse de modèles de scoring, de tableaux de bord ou de migrations de patrimoine de données. Le parcours plus bas dit ce que ça recouvre.

RAG documentaire assurance

Un gestionnaire sinistres pose sa question en français, le système répond en citant ses sources.

  • LangChain
  • ChromaDB
  • Claude
  • Streamlit

À propos

Un parcours en trois temps

Guillaume Hvala
« Sept ans côté métier avant l'IA. C'est pour ça que je sais ce qu'il faut extraire, et ce qu'il faut vérifier. »

Data Scientist et Data Analyst senior, formé à l'Université Panthéon-Assas en Ingénierie Statistique et Financière. Statisticien, économiste et informaticien, la combinaison qui permet de modéliser un problème et de le restituer à ceux qui doivent en décider. Freelance depuis l'été 2026.

  1. Temps 1

    IRI Worldwide · 2 ans · Chargé d’études statistiques

    Le leader mondial des panels de grande consommation. Études prix, assortiment, promotion et full mix, modélisation GLM, automatisation des chaînes de production d’études. Le métier de la donnée de marché appris de l’intérieur : agréger des sources hétérogènes, les fiabiliser, et en sortir des recommandations utilisables.

  2. Temps 2

    Allianz · 4 ans · Data Scientist

    Quatre missions successives. La migration d’un patrimoine de données critique de SAS vers Azure et PySpark. De la modélisation NLP en production dès 2020, sur des avis Google et des messages Twitter. L’architecture d’un système de détection d’alertes sinistres monté de zéro, avec API, A/B testing, Kafka et Celonis. C’est là que j’ai appris à livrer sur des données sales, incomplètes et multi-sources.

  3. Temps 3

    Retail et luxe · Galeries Lafayette, Christian Dior Couture

    Études clients sur BigQuery et Python, segmentation, parcours omnicanal, valeur client, pipelines Dataiku, et des tableaux de bord utilisés au quotidien par les équipes marketing, CRM et retail. Le moment où j’ai compris que la restitution n’est pas la dernière étape d’un projet data : c’est celle qui décide s’il sert à quelque chose.

Langages et données

Python (pandas, scikit-learn, PySpark) · SQL (BigQuery, Snowflake, Oracle) · SAS · VBA

IA et modélisation

LLM et extraction structurée · RAG · NLP · Scoring et segmentation · Économétrie et GLM · A/B testing

Restitution et plateformes

Power BI · Looker Studio · Streamlit · Dataiku · Azure · Google Cloud · Celonis · GitHub

Master 2 Ingénierie Statistique et Financière, Université Panthéon-Assas, Paris II · Dataiku Core Designer · Dataiku ML Practitioner · Datascientest Data Science Advanced

Questions fréquentes

Ce qu'on me demande avant de signer

Vous intervenez en renfort sur nos chantiers data en cours ?

Oui, et c’est la moitié de mon activité. Data Scientist ou Data Analyst senior intégré à votre équipe : Python, SQL sur BigQuery et Snowflake, PySpark, Power BI, Dataiku, scoring et segmentation. Pas de phase d’avant-vente, pas de protocole imposé, je prends vos outils et vos rituels. L’IA documentaire est ma spécialité, pas mon seul sujet.

Nos données ne peuvent pas sortir de chez nous. C’est bloquant ?

Non, c’est une contrainte d’architecture qu’on cadre au premier jour. Trois montages possibles : une instance Azure OpenAI ou Bedrock dans votre propre tenant, avec hébergement en UE et données non réutilisées pour l’entraînement ; un modèle open source hébergé chez vous ; ou une anonymisation en amont du traitement. J’ai travaillé quatre ans sur des données d’assurance, je connais l’exercice.

Et l’hallucination des modèles ?

C’est précisément le problème que je traite. Je ne livre jamais une sortie de LLM brute. Chaque donnée extraite porte sa citation source et un indice de confiance, et tout ce qui passe sous le seuil que vous fixez part en revue humaine. Le système est conçu pour être auditable, pas pour être magique.

On a déjà une équipe IA, ou un Copilot. Vous servez à quoi ?

Alors votre sujet n’est pas le modèle : c’est la donnée qui entre et la qualité qui sort. C’est exactement là que j’interviens, en complément de ce qui existe déjà, pas en remplacement.

Qu’est-ce qu’il reste si on arrête après le PoC ?

Le code, la documentation et la connaissance. Tout ce que je livre est déposé dans votre dépôt, commenté, avec une passation. Je ne construis rien qui dépende de ma présence pour continuer à tourner.

Vous êtes disponible quand ?

Selon le format. Un audit se cale sous deux à trois semaines. Une mission longue demande un peu plus d’anticipation. Le plus simple est de prendre trente minutes pour en parler.

Parlons-en trente minutes

Un renfort sur un chantier en cours, un sujet data à cadrer, des documents à exploiter. Dites-moi où vous en êtes. Sans engagement et sans présentation commerciale : je vous dis ce qui me paraît faisable, à quel coût, et dans quel ordre. Si je pense que ça ne vaut pas le coup, je vous le dis aussi.

Réserver un créneau

Ou directement

Réponse sous 24 heures ouvrées.

Vos coordonnées servent uniquement à vous répondre. Elles ne sont ni revendues ni utilisées pour de la prospection.