Dimanche 4 octobre 2026 Newsletter Contact
Mesure & attribution

Holdout géographique : protocole pour évaluer le lift média

Holdout géographique : protocole pour évaluer le lift média

Mesurer le lift média exige de sortir de l’attribution déclarative


Le holdout géographique consiste à volontairement priver certaines zones d’une campagne média afin de comparer leur évolution à celle de zones exposées. Ce protocole répond à une question que les reportings d’attribution traitent souvent mal : quelle part des ventes, visites ou conversions aurait eu lieu sans investissement média ? Dans un environnement où le RTB, real-time bidding, mécanisme d’enchères en temps réel permettant d’acheter une impression lorsqu’elle devient disponible, permet d’activer rapidement des audiences, des lieux et des contextes, la tentation est forte de piloter sur des conversions attribuées. Mais l’attribution, méthode qui assigne une conversion à un ou plusieurs points de contact marketing, ne prouve pas la causalité.

Le problème est particulièrement sensible pour les campagnes drive-to-store, retail media offsite, vidéo locale, DOOH, search régionalisé ou display programmatique. Une campagne peut afficher un CPA, coût par acquisition, montant dépensé pour générer une conversion attribuée, attractif parce qu’elle cible des zones déjà très intentionnistes. Elle peut aussi afficher un ROAS, return on ad spend, ratio entre chiffre d’affaires attribué et dépenses publicitaires, élevé parce qu’elle capte des acheteurs naturels proches de l’acte d’achat. Dans ces cas, la performance n’est pas nécessairement créée par le média ; elle est parfois simplement revendiquée par lui.

Le holdout géographique vise à isoler l’effet incrémental, c’est-à-dire la différence entre la performance observée avec campagne et la performance qui aurait probablement été observée sans campagne. Il ne remplace pas toutes les mesures, mais il apporte une lecture plus robuste que le post-view ou le last click lorsque l’exposition individuelle est difficile à contrôler ou lorsque les données utilisateurs sont limitées par le consentement, la disparition des cookies tiers ou les environnements walled gardens. Pour un professionnel du marketing, son intérêt est stratégique : décider si un budget crée réellement de la demande, déterminer les zones où le média est rentable, calibrer la pression et corriger les modèles d’allocation.

Un protocole sérieux ne consiste toutefois pas à couper arbitrairement quelques régions et à comparer les ventes. Les zones diffèrent par population, potentiel commercial, saisonnalité, concurrence, pression promotionnelle, météo, stock, historique média et maturité de marque. Sans méthode, le holdout géographique produit une illusion de rigueur. Avec un design robuste, il devient l’un des outils les plus opérationnels pour passer d’un pilotage par attribution à un pilotage par contribution.

Définir l’hypothèse de lift avant de choisir les zones


La première étape est de formuler une hypothèse mesurable. Un holdout géographique ne doit pas tester vaguement si la campagne fonctionne. Il doit tester un effet précis, sur un KPI précis, dans une fenêtre précise et avec une granularité adaptée. Par exemple : une campagne programmatique locale augmente-t-elle les visites en magasin de 5 % dans les zones exposées par rapport aux zones non exposées sur quatre semaines ? Une vague vidéo et display améliore-t-elle les ventes e-commerce localisées de 8 % sur les codes postaux activés ? Une campagne DOOH autour de points de vente génère-t-elle un coût par visite incrémentale inférieur à 4 euros ?

Cette hypothèse doit être reliée au funnel, c’est-à-dire au parcours allant de la notoriété à la considération, puis à la conversion et à la fidélisation. Une campagne haut de funnel, par exemple vidéo ou DOOH, ne doit pas nécessairement être jugée uniquement sur les ventes à sept jours. Elle peut être évaluée sur des recherches de marque, des visites qualifiées, du trafic magasin ou un brand lift localisé. Une campagne bas de funnel, comme du retargeting géolocalisé ou du retail search régionalisé, peut être évaluée sur ventes nettes, marge, nouveaux clients ou visites incrémentales.

Le KPI principal doit être choisi avant le test. Ajouter après coup plusieurs métriques jusqu’à trouver un résultat positif revient à fragiliser l’analyse. Les KPI secondaires peuvent exister, mais ils doivent être hiérarchisés. Pour un retailer, le KPI principal peut être le chiffre d’affaires net magasin dans les zones test, tandis que les KPI secondaires seront le trafic, le panier moyen, la part de nouveaux clients encartés et la marge. Pour un annonceur e-commerce, le KPI principal peut être les commandes nettes géolocalisées, avec comme KPI secondaires le taux de conversion, le CAC, customer acquisition cost ou coût d’acquisition client, et la LTV, lifetime value ou valeur économique attendue d’un client sur la durée de sa relation avec la marque.

Il faut également définir la fenêtre d’observation. Une campagne promotionnelle courte peut produire un effet mesurable en quelques jours. Une campagne de considération peut nécessiter deux à six semaines. Un test trop court risque de confondre bruit et effet média. Un test trop long augmente le risque de contamination par des promotions, ruptures de stock, actions concurrentes ou changements de prix. Dans beaucoup de cas retail, une fenêtre de pré-test de quatre à huit semaines et une fenêtre de campagne de trois à six semaines offrent un compromis acceptable, mais la durée doit être ajustée à la fréquence d’achat de la catégorie.

Construire des zones test et contrôle comparables, pas seulement disponibles


Le choix des zones est le cœur du protocole. Une zone test reçoit la campagne. Une zone contrôle, ou holdout, ne la reçoit pas ou la reçoit à un niveau suffisamment réduit pour être considérée comme non exposée. La comparaison n’a de valeur que si les zones sont comparables avant activation. Comparables ne signifie pas identiques, mais suffisamment proches sur les variables qui influencent naturellement le KPI.

Les variables de matching à examiner sont généralement : ventes historiques, trafic magasin ou site, population, revenu médian, densité urbaine, pression concurrentielle, pénétration de marque, nombre de points de vente, disponibilité produit, intensité promotionnelle, saisonnalité locale, météo, jours fériés, événements et historique média. Pour une campagne drive-to-store, il faut aussi intégrer les zones de chalandise et les flux de mobilité. Pour une campagne e-commerce, les régions de livraison, coûts logistiques et délais peuvent influencer la conversion indépendamment du média.

Un design simple consiste à apparier chaque zone test avec une zone contrôle similaire. Un design plus robuste utilise des groupes de zones équilibrés, par exemple 30 zones exposées et 30 zones contrôle, sélectionnées selon des scores de propension. Le score de propension estime la probabilité qu’une zone soit assignée au test en fonction de caractéristiques observables. L’objectif est de réduire le biais de sélection : ne pas exposer uniquement les zones à fort potentiel et conserver en contrôle des zones structurellement faibles.

Lorsque le volume le permet, la randomisation reste préférable. Après avoir exclu les zones non éligibles, par exemple absence de stock, contraintes commerciales ou impossibilité technique d’exclusion média, les zones comparables sont réparties aléatoirement entre test et contrôle. Cette logique se rapproche d’un essai contrôlé randomisé, mais appliqué à des unités géographiques. Elle limite le risque que le choix humain favorise inconsciemment les zones où le lift est attendu.

Un exemple concret : une enseigne dispose de 180 magasins. Après exclusion de 25 magasins en travaux, en rupture de stock chronique ou situés dans des zones avec opérations locales atypiques, il reste 155 magasins éligibles. L’équipe regroupe les magasins par potentiel de chiffre d’affaires, typologie urbaine, pression concurrentielle et saisonnalité. Elle sélectionne ensuite 60 zones comparables : 30 en test, 30 en contrôle. Les deux groupes affichent sur les huit semaines précédentes un chiffre d’affaires moyen hebdomadaire proche, par exemple 42 000 euros pour le test et 41 500 euros pour le contrôle, avec des tendances parallèles. Cette dernière condition est essentielle : deux groupes peuvent avoir le même niveau moyen mais des trajectoires divergentes.

Vérifier la puissance statistique et le MDE avant d’investir


Un holdout géographique peut échouer non pas parce que le média ne produit aucun effet, mais parce que le test est incapable de détecter l’effet attendu. C’est le sujet de la puissance statistique. La puissance désigne la probabilité de détecter un effet réel. Le MDE, minimum detectable effect, correspond au plus petit effet que le protocole peut détecter avec un niveau de confiance donné. Si la campagne espère générer un lift de 3 %, mais que le design ne peut détecter que des effets supérieurs à 10 %, le test sera peu utile.

Le MDE dépend du nombre de zones, de la variance du KPI, de la durée d’observation, de la corrélation entre pré-période et période test, et de l’ampleur attendue du lift. Les zones très volatiles nécessitent davantage d’unités ou une période plus longue. Les catégories à achats peu fréquents, comme automobile, équipement ou services financiers, demandent des volumes plus importants que la grande consommation ou la restauration rapide. Une règle opérationnelle est de calculer le MDE avant le lancement, puis de décider si le budget du test justifie l’effort.

Supposons qu’un réseau observe en moyenne 1 000 visites hebdomadaires par zone, avec une forte dispersion. Avec 10 zones test et 10 zones contrôle sur deux semaines, le protocole peut ne détecter qu’un lift supérieur à 12 % ou 15 %. Si l’effet média réaliste est de 4 %, le test conclura probablement à une absence d’effet mesurable. En passant à 40 zones test et 40 zones contrôle sur quatre semaines, et en utilisant les ventes historiques comme covariable, le MDE peut descendre autour de 4 % à 6 %, selon la variance. Le test devient alors exploitable.

Les équipes marketing doivent donc arbitrer entre ambition de précision et faisabilité commerciale. Réserver 20 % des zones en holdout peut être difficile si l’entreprise veut maximiser les ventes à court terme. Mais un holdout trop petit produit une mesure faible, puis des décisions budgétaires risquées. Le coût d’opportunité du contrôle doit être comparé au coût d’une mauvaise allocation média sur l’année. Sur un budget programmatique annuel de 2 millions d’euros, accepter un holdout de quelques semaines peut être rationnel si le test permet de réallouer 15 % à 25 % du budget vers les zones réellement incrémentales.

Des méthodes de réduction de variance peuvent aider. CUPED, controlled-experiment using pre-experiment data, technique utilisant les données pré-test pour réduire la variance de l’estimation, peut améliorer la précision lorsque la performance historique prédit bien la performance future. Les modèles de différence-en-différences comparent l’évolution entre avant et après dans les groupes test et contrôle, plutôt que les niveaux absolus. Les contrôles synthétiques construisent une zone contrôle pondérée à partir de plusieurs zones non exposées. Ces méthodes ne remplacent pas un bon design, mais elles améliorent la robustesse lorsque les données sont riches.

Contrôler l’exécution média pour éviter la contamination du holdout


Un protocole de holdout géographique est aussi solide que son exécution média. La contamination survient lorsque les zones contrôle sont exposées à la campagne, directement ou indirectement. En digital, elle peut venir d’un ciblage géographique imprécis, d’adresses IP mal localisées, de déplacements d’utilisateurs, de plateformes qui optimisent au-delà des zones prévues, ou de campagnes nationales parallèles. En DOOH, elle peut venir d’écrans situés à la frontière entre zones test et contrôle. En retail media, elle peut venir de plateformes qui ne permettent pas une exclusion géographique stricte.

Le plan média doit donc être conçu avec des barrières. Les zones test doivent être définies à une granularité exploitable par les plateformes : codes postaux, IRIS, départements, rayons autour de magasins, DMA ou zones de chalandise selon les marchés. Les zones contrôle doivent être exclues dans le DSP, demand-side platform, plateforme permettant aux annonceurs d’acheter des impressions publicitaires de manière automatisée, mais aussi dans les plateformes social, search, retail media et outils de retargeting. Si plusieurs agences ou équipes activent des campagnes, la gouvernance doit être centralisée.

Le RTB et le programmatique ajoutent un point de vigilance : les algorithmes optimisent vers les poches de performance. Si les zones test incluent des zones très proches des magasins et les zones contrôle des zones plus éloignées, l’algorithme peut mécaniquement surpondérer les audiences déjà intentionnistes. Le résultat sera un lift attribué élevé mais peu causal. Il faut donc encadrer l’allocation : budget homogène par zone, pacing contrôlé, capping cohérent, formats comparables et inventaires similaires. Le pacing désigne le rythme de dépense d’une campagne ; s’il est mal contrôlé, certaines zones peuvent recevoir une pression trop forte en début de test et d’autres trop faible.

La pression média doit être documentée avec précision : impressions, couverture estimée, fréquence, CPM, coût pour mille impressions, CPC, coût par clic, formats, viewability, ou visibilité publicitaire, environnements, horaires et inventaires. Un holdout ne mesure pas seulement exposé contre non exposé ; il doit permettre de relier le lift à une dose média. Si une zone test reçoit 500 000 impressions et une autre 50 000, leur contribution ne peut pas être interprétée de la même manière. Un bon protocole prévoit donc une distribution de pression relativement contrôlée ou, au minimum, des variables d’exposition utilisées dans l’analyse.

Il faut aussi contrôler les autres leviers commerciaux. Une promotion locale, une opération CRM, customer relationship management ou gestion de la relation client, une variation de stock ou une campagne radio régionale peuvent biaiser le résultat. L’idéal est de geler les actions locales majeures pendant le test, ou de les documenter pour les intégrer dans l’analyse. Dans la réalité, cette pureté est rarement parfaite. La discipline consiste alors à créer un journal d’expérience : dates de promotions, ruptures, changements de prix, événements locaux, actions concurrentes connues, incidents de tracking et modifications de campagne.

Analyser le lift avec une logique différence-en-différences


La méthode la plus utilisée pour analyser un holdout géographique est la différence-en-différences. Elle consiste à comparer l’évolution du KPI dans les zones test à l’évolution du KPI dans les zones contrôle. Si les zones test progressent de 8 % pendant la campagne et les zones contrôle de 3 %, le lift incrémental estimé est de 5 points, sous réserve que les tendances pré-test soient parallèles et que les autres facteurs soient contrôlés.

La formule opérationnelle est simple : lift incrémental égal variation test moins variation contrôle. Mais l’interprétation demande de la rigueur. Imaginons une campagne display et vidéo locale dépensant 120 000 euros sur 40 zones test pendant quatre semaines. Avant campagne, les zones test généraient 4,0 millions d’euros de chiffre d’affaires et les zones contrôle 3,9 millions. Pendant campagne, les zones test passent à 4,36 millions, soit +9 %, tandis que les zones contrôle passent à 4,06 millions, soit +4,1 %. Le lift relatif net est donc proche de 4,9 %. Appliqué au niveau attendu sans campagne des zones test, l’incrémental est d’environ 196 000 euros de chiffre d’affaires. Le ROAS incrémental est donc 196 000 / 120 000 = 1,63. Si la marge brute moyenne est de 35 %, la marge incrémentale est 68 600 euros, inférieure à la dépense média. La campagne crée du chiffre d’affaires, mais n’est pas rentable à court terme sur la marge directe.

Cette lecture est plus exigeante que le ROAS plateforme. La plateforme peut déclarer 650 000 euros de ventes attribuées, soit un ROAS de 5,4. Le holdout montre que seule une partie est incrémentale. La décision ne sera pas nécessairement d’arrêter la campagne : si elle recrute de nouveaux clients à forte LTV ou défend des zones concurrentielles, elle peut rester pertinente. Mais elle ne doit pas être optimisée comme si 100 % des ventes attribuées étaient créées par le média.

La significativité statistique doit être communiquée clairement. Un lift estimé à 5 % avec un intervalle de confiance de 1 % à 9 % est exploitable, même s’il reste incertain. Un lift estimé à 5 % avec un intervalle de -4 % à 14 % indique que les données ne permettent pas de conclure. Les équipes doivent éviter de transformer tout résultat positif en vérité définitive. La taille de l’effet, l’intervalle de confiance, le MDE et la cohérence avec les métriques intermédiaires doivent être présentés ensemble.

L’analyse doit également segmenter sans surinterpréter. On peut examiner le lift par typologie de zone, niveau de pression, format, distance au magasin, ancienneté client ou intensité concurrentielle. Mais plus les segments se multiplient, plus le risque de faux positifs augmente. La bonne pratique est de définir quelques segmentations avant le test : zones urbaines contre périurbaines, forte contre faible pénétration de marque, pression média haute contre pression média médiane. Ces analyses permettent d’identifier des règles d’allocation, par exemple surinvestir les zones à pénétration moyenne où le média génère un lift supérieur, et réduire les zones déjà saturées où il capte des ventes naturelles.

Transformer le résultat en règles d’allocation média


Un holdout géographique n’a de valeur que s’il modifie les décisions. Trop souvent, les tests sont traités comme des exercices d’insight, puis les campagnes suivantes reviennent aux mêmes logiques d’achat. Le résultat doit être converti en règles opérationnelles : seuil de pression, zones prioritaires, formats à conserver, budget maximum par cluster, coefficient de correction du ROAS plateforme, ou conditions de rentabilité par marge.

Une première règle consiste à créer un facteur d’incrémentalité. Si le reporting plateforme attribue 1 million d’euros de ventes et que le holdout estime que 35 % sont incrémentales, les plans futurs doivent utiliser un coefficient de 0,35 sur des campagnes comparables. Ce coefficient n’est pas universel. Il varie selon format, audience, catégorie, pression, saison et maturité de marque. Mais il évite de comparer naïvement un levier mesuré en attribution avec un levier mesuré en lift.

Une deuxième règle concerne la pression. Le holdout peut révéler qu’au-delà d’une certaine fréquence ou d’un certain budget par zone, la contribution marginale baisse. Par exemple, les zones recevant entre 3 et 5 impressions hebdomadaires par individu estimé génèrent un lift de 6 %, tandis que les zones au-dessus de 8 impressions génèrent seulement 6,5 % malgré un coût doublé. Le budget incrémental doit alors être redistribué vers des zones sous-exposées ou vers d’autres leviers du funnel.

Une troisième règle concerne la sélection géographique. Certaines zones ne réagissent pas parce que la marque y est déjà très forte, parce que la concurrence est faible ou parce que la distribution est insuffisante. D’autres zones réagissent fortement parce que la notoriété y est latente et la disponibilité produit bonne. Le média ne peut pas compenser un problème d’exécution commerciale. Si le lift est faible dans des zones à stock instable, la conclusion n’est pas que le média échoue ; c’est que le protocole met en évidence une contrainte de distribution.

Enfin, le holdout doit être intégré à la gouvernance budgétaire. Les équipes média, data, commerce, finance et CRM doivent partager la lecture. La finance validera la marge et le coût d’opportunité. Le commerce expliquera les variations de stock et promotions. La data qualifiera la robustesse statistique. Le média traduira les enseignements dans les DSP, les plateformes retail media, les plans DOOH ou les deals vidéo. Sans cette gouvernance, le lift reste un chiffre isolé au lieu de devenir un mécanisme d’allocation.

Conclusion : un protocole actionnable en huit décisions


Le holdout géographique est l’un des moyens les plus pragmatiques pour évaluer le lift média lorsque l’expérimentation individuelle est impossible ou insuffisante. Il impose une discipline qui manque souvent aux reportings d’attribution : accepter de ne pas exposer une partie du marché pour mesurer ce que le média crée vraiment. Cette discipline a un coût commercial immédiat, mais elle réduit le risque de financer durablement des conversions naturelles.

Une feuille de route robuste peut s’organiser en huit décisions. Premièrement, formuler une hypothèse de lift précise, associée à un KPI principal et à une fenêtre d’observation. Deuxièmement, sélectionner des zones test et contrôle comparables sur les ventes historiques, la saisonnalité, la distribution, la concurrence et la pression média. Troisièmement, vérifier les tendances pré-test pour éviter de comparer des trajectoires déjà divergentes. Quatrièmement, calculer la puissance statistique et le MDE avant lancement. Cinquièmement, verrouiller l’exécution média pour limiter la contamination du holdout. Sixièmement, documenter les promotions, stocks, prix et événements locaux. Septièmement, analyser le résultat en différence-en-différences, avec intervalles de confiance et lecture marge. Huitièmement, transformer le lift en règles d’allocation : coefficients d’incrémentalité, pression optimale, zones prioritaires et arbitrages budgétaires.

Le point clé est de ne pas attendre du holdout une précision absolue. Comme toute mesure marketing, il comporte des limites : bruit statistique, mobilité entre zones, contamination média, contraintes commerciales, temporalité courte et dépendance aux données historiques. Mais bien conçu, il améliore fortement la qualité des décisions. Il permet de distinguer les campagnes qui revendiquent des ventes de celles qui en créent, les zones où le média accélère réellement la demande de celles où il accompagne simplement une demande existante. Pour des organisations marketing avancées, c’est précisément cette différence qui doit guider l’allocation des budgets programmatique, retail media, DOOH et drive-to-store.

Sur le même sujet
adtechmag.fr