Quels signaux exploiter sans dégrader la conformité RGPD ?
La donnée exploitable n’est plus celle que l’on collecte, mais celle que l’on sait justifier
Pour les équipes marketing, la question n’est plus de savoir s’il reste des signaux activables après la fin progressive des cookies tiers, le durcissement des politiques navigateurs et l’application du RGPD, règlement général sur la protection des données, texte européen encadrant le traitement des données personnelles. Il en reste beaucoup. La vraie question est plus exigeante : quels signaux peuvent être utilisés sans créer une dette de conformité, sans fragiliser la mesure et sans installer une dépendance à des identifiants dont la durée de vie commerciale ou juridique est incertaine.
Le sujet est stratégique parce que la performance média repose historiquement sur trois familles de signaux : l’identité, le comportement et le contexte. L’identité permet de reconnaître ou rapprocher un individu, un foyer ou un device. Le comportement décrit des interactions : pages vues, achats, clics, visites magasin, paniers, recherches internes. Le contexte qualifie l’environnement d’exposition : contenu, moment, localisation approximative, météo, format, éditeur, catégorie. Le RGPD ne rend pas ces signaux inutilisables, mais il impose de clarifier leur base légale, leur finalité, leur durée de conservation, leur niveau de granularité et leur mode de partage.
La tentation opérationnelle consiste souvent à chercher un substitut unique au cookie tiers : email hashé, ID universel, clean room, cohortes, ciblage contextuel ou modélisation. C’est une erreur de diagnostic. Aucun signal ne remplace seul l’écosystème d’identification cross-site qui a structuré une partie du programmatique. La bonne approche consiste à construire un portefeuille de signaux, avec des niveaux de risque, de précision et d’utilité différents selon les cas d’usage : ciblage, capping, personnalisation, attribution, mesure d’incrémentalité, exclusion CRM, optimisation des enchères ou analyse de la LTV, lifetime value, valeur économique attendue d’un client sur la durée de sa relation avec la marque.
Pour un annonceur, la conformité ne doit pas être traitée comme une contrainte documentaire en aval. Elle détermine directement la qualité du signal. Une donnée collectée sans consentement valide ou utilisée pour une finalité non prévue peut devenir inexploitable, même si elle semble performante dans un DSP, demand-side platform, plateforme permettant aux acheteurs d’acheter des impressions publicitaires de manière automatisée. À l’inverse, un signal moins granulaire mais correctement gouverné peut produire une performance plus stable, parce qu’il est intégrable dans les modèles, partageable avec les partenaires et défendable en audit.
Partir des finalités : activation, mesure et apprentissage ne relèvent pas du même niveau de risque
Le premier framework à appliquer est celui de la finalité. Le RGPD repose notamment sur la limitation des finalités, la minimisation des données, la transparence et la sécurité. En pratique, cela signifie qu’un même signal ne peut pas être traité comme une ressource universelle. Un email collecté pour gérer une commande n’est pas automatiquement activable pour de la prospection programmatique. Une donnée de géolocalisation utile pour mesurer une visite magasin ne peut pas nécessairement servir à reciblage individuel. Un événement de navigation utilisé pour améliorer un site n’a pas la même sensibilité lorsqu’il alimente un profil publicitaire partagé.
Il faut donc segmenter les usages en trois blocs. Le premier est l’activation média : ciblage, exclusion, personnalisation, capping, lookalike ou enchères. Le deuxième est la mesure : attribution, conversion lift, ROAS, return on ad spend, ratio entre chiffre d’affaires attribué et dépenses publicitaires, CPA, coût par acquisition, montant dépensé pour générer une conversion attribuée, ou analyse du funnel, parcours allant de la notoriété à la conversion. Le troisième est l’apprentissage : segmentation, scoring, modèles de propension, MMM, marketing mix modeling, modélisation statistique qui estime la contribution des leviers marketing à partir de séries agrégées.
Ces trois blocs n’ont pas les mêmes exigences. L’activation individualisée est généralement la plus sensible, car elle implique souvent une reconnaissance de l’utilisateur, un ciblage publicitaire ou un partage avec des partenaires. La mesure agrégée peut être moins intrusive si elle repose sur des données pseudonymisées, des seuils d’agrégation et des durées courtes. L’apprentissage statistique peut parfois s’appuyer sur des signaux agrégés ou anonymisés, à condition que la réidentification soit raisonnablement exclue. Le point critique est d’éviter le glissement de finalité : collecter pour mesurer, puis utiliser pour cibler, sans information ni base légale adaptée.
Un exemple simple illustre l’arbitrage. Un retailer et une marque souhaitent analyser l’impact d’une campagne retail media sur les ventes catégorie. Si l’objectif est de mesurer, une clean room, environnement sécurisé permettant de croiser des données sans exposer les identifiants bruts, peut produire des résultats agrégés par segment, avec des seuils minimaux de population. Si l’objectif devient ensuite de réactiver individuellement les acheteurs non convertis, le niveau d’exigence change : il faut vérifier le consentement, la finalité publicitaire, les rôles respectifs de responsable de traitement ou sous-traitant, et les modalités d’opposition. La même infrastructure technique ne suffit pas à légitimer tous les usages.
La bonne pratique consiste à créer une matrice finalité-signal. En ligne, chaque signal doit être associé à un usage autorisé, une base légale, un niveau de granularité, une durée de conservation, un périmètre de partage et un propriétaire métier. Cette matrice évite que les équipes média considèrent toute donnée disponible comme activable. Elle permet aussi de prioriser : un signal contextuel peut être activé plus largement ; un identifiant login doit être réservé aux cas où la valeur incrémentale justifie le niveau de gouvernance.
Exploiter les signaux contextuels : moins précis individuellement, mais plus robustes juridiquement et opérationnellement
Le signal contextuel est souvent sous-estimé par les organisations qui ont construit leur performance sur l’audience individuelle. Pourtant, il est l’un des piliers les plus robustes d’une stratégie compatible avec la conformité. Le ciblage contextuel consiste à qualifier l’environnement d’exposition à partir du contenu, de la catégorie éditoriale, des mots-clés, du sentiment, du format, du device, du moment ou de la situation de consultation, sans nécessairement identifier l’utilisateur.
Son intérêt n’est pas seulement juridique. Il est aussi média. Dans un environnement RTB, real-time bidding, mécanisme d’enchères en temps réel permettant d’acheter une impression publicitaire lorsqu’elle devient disponible, le contexte influence fortement l’attention, la brand safety, la visibilité et la probabilité d’action. Une impression vidéo visible à 80 % dans un article à forte affinité catégorie n’a pas la même valeur qu’une impression display en bas de page sur un inventaire longue traîne, même si les deux touchent théoriquement la même audience.
Le comment est plus complexe qu’un simple ciblage par rubrique. Les solutions avancées utilisent le NLP, natural language processing, traitement automatique du langage, pour analyser sémantique, tonalité, entités, fraîcheur du contenu et proximité avec l’intention. Une marque automobile peut distinguer un contenu sur l’achat de véhicules électriques, un article sur les infrastructures de recharge, un comparatif fiscal pour flottes d’entreprise et un fait divers impliquant un accident. Ces contextes n’ont pas la même valeur ni le même risque. Un ciblage contextuel mature combine inclusion, exclusion et pondération de valeur, plutôt qu’une liste binaire de mots-clés.
Les limites doivent être assumées. Le contexte ne permet pas toujours de distinguer un prospect d’un client existant, ni de gérer une fréquence individuelle. Il peut surpondérer certains environnements premium et augmenter le CPM, coût pour mille impressions. Il peut aussi manquer les intentions latentes qui ne s’expriment pas dans le contenu consulté. Mais il offre trois avantages structurants : moindre dépendance aux identifiants, meilleure transparence pour l’éditeur et possibilité d’intégrer des critères de qualité média tels que viewability, ou visibilité publicitaire, brand safety et attention.
Un cas fréquent concerne les campagnes haut de funnel. Une marque B2B peut obtenir de meilleurs signaux d’attention en ciblant des contenus professionnels très qualifiés qu’en activant des segments tiers opaques censés représenter des décideurs. Même si le CTR, click-through rate ou taux de clic, est plus faible, la qualité des sessions et la progression dans le funnel peuvent être supérieures. Dans ce cas, le signal pertinent n’est pas l’identité supposée de l’utilisateur, mais la cohérence entre contexte, message et intention probable.
Mobiliser la first-party data consentie sans transformer le CRM en bombe à retardement
La first-party data, donnée collectée directement par une marque ou un éditeur auprès de ses propres utilisateurs, est devenue le centre de gravité des stratégies post-cookie. Elle inclut les données CRM, customer relationship management, système qui centralise les données clients, prospects, consentements et interactions relationnelles, les transactions, les préférences, les événements de navigation sur site, les inscriptions newsletter, les interactions app, les données de fidélité ou les demandes de devis.
Son avantage est évident : elle est plus proche de la relation client et peut être mieux documentée. Mais elle n’est pas automatiquement conforme ni automatiquement performante. Le fait qu’une donnée soit first-party ne dit rien, à lui seul, de la validité du consentement publicitaire, de la proportionnalité du traitement ou de la compatibilité entre finalité initiale et usage média. L’erreur la plus fréquente consiste à considérer une base CRM comme un réservoir d’audiences à pousser vers tous les walled gardens, DSP ou retailers.
Le premier signal exploitable est le statut client. Nouveau client, client actif, client dormant, acheteur catégorie, client à forte marge, abonné newsletter non acheteur : ces statuts peuvent alimenter des exclusions et des priorités d’activation. Or l’exclusion est souvent aussi créatrice de valeur que le ciblage. Exclure les clients récemment convertis d’une campagne d’acquisition peut réduire le CPA apparent, mais surtout éviter de payer une conversion naturelle. Exclure les clients à forte pression relationnelle peut limiter le churn, c’est-à-dire le risque de perte du client, et les désabonnements.
Le deuxième signal est l’événement transactionnel ou relationnel : achat, réachat, panier abandonné, devis non finalisé, ouverture d’email, clic, visite produit, réclamation, retour. Ces événements doivent être utilisés avec des fenêtres adaptées. Un abandon panier peut être pertinent pendant 24 à 72 heures ; il devient moins utile après plusieurs semaines. Un achat récent peut justifier une exclusion pendant un cycle de consommation, mais pas indéfiniment. La durée de conservation opérationnelle doit être liée au cas d’usage, et non fixée par défaut à la durée maximale techniquement possible.
Le troisième signal est la valeur économique. Une segmentation par marge, potentiel de réachat ou LTV permet d’éviter une optimisation aveugle au ROAS brut. Mais elle introduit une exigence supplémentaire : les modèles de scoring doivent être explicables, contrôlés et non discriminatoires. Une marque peut pondérer ses enchères plus fortement sur des clients à forte probabilité de réachat, mais elle doit documenter les variables utilisées, limiter les données sensibles et vérifier que le modèle ne crée pas d’effets indésirables sur certaines populations.
Le matching d’identifiants mérite une vigilance spécifique. L’email hashé, c’est-à-dire transformé par une fonction cryptographique, est souvent présenté comme une solution de confidentialité. Mais un hash d’email reste une donnée personnelle s’il permet de reconnaître ou rapprocher un individu. Le hashing réduit l’exposition de l’identifiant brut ; il ne supprime pas les obligations RGPD. Les taux de match observés entre CRM et plateformes varient fortement, souvent entre 20 % et 60 % selon la catégorie, le pays, la qualité des emails et la présence login. Ces taux ne doivent jamais être interprétés comme une couverture totale de la base, car les profils matchés peuvent être biaisés : plus digitaux, plus fidèles, plus acheteurs en ligne.
Utiliser les signaux agrégés et modélisés pour mesurer sans surindividualiser
La mesure est le terrain où les signaux agrégés et modélisés peuvent apporter le plus de valeur sans basculer dans une surveillance individuelle excessive. Les équipes marketing ont longtemps privilégié l’attribution user-level, c’est-à-dire l’assignation de conversions à des points de contact au niveau utilisateur ou device. Ce modèle devient moins complet, moins stable et plus risqué lorsque les identifiants disparaissent ou que les consentements se fragmentent. Il doit être complété par des approches agrégées.
Le MMM redevient central pour les budgets significatifs. Il exploite des données agrégées par période, zone, canal, pression média, prix, promotion, distribution et saisonnalité pour estimer la contribution des leviers. Son avantage RGPD est évident : il n’a pas besoin de suivre chaque individu. Son inconvénient est sa granularité plus faible : il répond mieux à des arbitrages budgétaires qu’à l’optimisation quotidienne d’une enchère. Dans une organisation mature, le MMM fixe les bornes stratégiques, tandis que l’attribution et les tests incrémentaux calibrent les décisions tactiques.
Les geo-tests constituent une autre approche robuste. Ils comparent des zones exposées et non exposées, ou des zones avec différents niveaux de pression, afin d’estimer l’effet incrémental. Pour une campagne drive-to-store, par exemple, il est possible de comparer l’évolution des visites ou ventes dans des zones exposées à un plan DOOH ou mobile géolocalisé, avec des zones contrôle similaires. Le signal utilisé est agrégé au niveau géographique, ce qui réduit le besoin de traçage individuel, à condition de maîtriser les biais : différences de potentiel magasin, météo, concurrence locale, stock, promotions et médias nationaux simultanés.
Les conversion lifts proposés par certaines plateformes peuvent également être utiles. Ils consistent à comparer un groupe exposé à un groupe témoin non exposé, souvent construit de manière aléatoire. Leur qualité dépend de plusieurs paramètres : taille d’échantillon, durée, indépendance de la mesure, transparence sur la population éligible, niveau de déduplication et prise en compte des conversions hors ligne. Pour des campagnes à faible volume, le test peut manquer de puissance statistique. Pour des campagnes fortement ciblées, le groupe témoin peut ne pas être parfaitement comparable.
La modélisation des conversions, souvent utilisée lorsque le consentement analytics n’est pas complet, doit être maniée avec prudence. Elle permet d’estimer les conversions manquantes à partir de comportements observés sur des populations consenties ou agrégées. Mais elle ne doit pas devenir une boîte noire qui reconstitue indirectement ce qu’il n’est pas possible de collecter directement. Le principe de minimisation impose de modéliser pour mesurer, pas pour contourner le choix utilisateur. Les résultats devraient être présentés avec des intervalles d’incertitude et non comme des chiffres exacts.
Un exemple chiffré montre l’enjeu. Une campagne display annonce 10 000 conversions attribuées via une plateforme. Après déduplication avec le search marque, exclusion des impressions non visibles et test holdout, la contribution incrémentale est estimée à 18 %. Si l’on applique une marge moyenne de 35 % et un panier de 80 euros, la marge incrémentale réelle est très différente de la marge attribuée brute. Cette lecture peut réduire la pression sur des retargeters très performants en apparence et réallouer vers des contextes ou audiences moins évidents mais plus contributifs.
Encadrer les signaux de géolocalisation : forte valeur business, forte sensibilité réglementaire
La géolocalisation est l’un des signaux les plus puissants pour le drive-to-store, la mesure de visites, le DOOH programmatique, la qualification de zones de chalandise et la personnalisation locale. Elle est aussi l’un des plus sensibles. Une coordonnée GPS précise, un historique de déplacements ou une visite dans certains lieux peuvent révéler des informations intimes. Même lorsque les données sont pseudonymisées, les trajectoires peuvent permettre une réidentification si elles sont trop détaillées.
Il faut distinguer plusieurs niveaux. La localisation précise en temps réel, au niveau GPS, est le niveau le plus intrusif. La localisation approximative, par ville, code postal ou zone de chalandise, est moins sensible mais reste une donnée personnelle si elle est rattachée à un identifiant. Le signal contextuel de lieu, par exemple un écran DOOH dans une gare ou un inventaire app consulté dans une région, peut être exploité de manière plus agrégée. Les données de mobilité agrégées, produites avec des seuils minimaux et sans identifiants exposés, sont généralement mieux adaptées à la planification et à la mesure.
Le comment repose sur la réduction de granularité. Pour planifier une campagne retail locale, il n’est pas toujours nécessaire de savoir qu’un individu précis est passé devant un magasin à 12h08. Il peut suffire de connaître les zones où la pression média a été forte, les bassins de provenance, les périodes de trafic et l’évolution agrégée des visites. De même, pour optimiser un plan DOOH, un cluster de mobilité peut apporter plus de valeur qu’une série de points GPS individuels.
Les seuils d’agrégation jouent ici un rôle opérationnel. Certaines organisations appliquent des règles de k-anonymity, principe selon lequel un résultat n’est restitué que si au moins k individus ou devices sont présents dans le groupe. En pratique, des seuils de 50, 100 ou davantage peuvent être utilisés selon la sensibilité, le volume et le risque de réidentification. Le choix du seuil doit être documenté : un seuil trop bas protège mal ; un seuil trop haut détruit la granularité utile. Les clean rooms et outils de mesure doivent aussi empêcher les requêtes répétées permettant de reconstituer des micro-segments.
Pour le marketing, l’arbitrage est clair. La localisation précise peut améliorer la pertinence de certaines activations, mais elle augmente les exigences de consentement, de transparence et de sécurité. La localisation agrégée peut être moins précise pour cibler, mais plus robuste pour planifier, mesurer et comparer des zones. Dans beaucoup de cas, le gain marginal de précision individuelle ne justifie pas le risque associé. Les équipes doivent donc réserver les signaux les plus sensibles aux cas où la valeur incrémentale est démontrée, par exemple via un test de lift, et non supposée.
Partager les données avec des partenaires : clean rooms, contrats et seuils ne remplacent pas la gouvernance
L’écosystème adtech repose sur le partage : annonceurs, agences, trading desks, DSP, SSP, supply-side platforms, plateformes utilisées par les éditeurs pour vendre leur inventaire, éditeurs, retailers, outils de mesure, plateformes sociales, CDP, customer data platform, plateforme permettant d’unifier et d’activer les données clients. Chaque transfert augmente la surface de risque. La conformité ne se limite donc pas à la collecte ; elle inclut la circulation, l’accès, la journalisation et la suppression des données.
Les clean rooms sont devenues un outil clé pour croiser des données annonceur, retailer ou plateforme sans exposer les identifiants bruts. Elles permettent des analyses de recouvrement d’audience, de mesure de ventes, de fréquence, de conversion lift ou de segmentation agrégée. Elles peuvent réduire le risque, mais elles ne créent pas automatiquement une base légale. Si les données importées n’ont pas été collectées pour la finalité prévue, si les consentements ne couvrent pas le partage ou si les sorties sont trop granulaires, la clean room ne protège pas l’organisation.
Le premier point à vérifier est le rôle des acteurs. Qui est responsable de traitement ? Qui est sous-traitant ? Y a-t-il responsabilité conjointe ? Qui détermine les finalités et les moyens ? Ces questions ne sont pas purement juridiques : elles conditionnent les obligations d’information, les droits des personnes, les durées de conservation, les audits et les responsabilités en cas d’incident. Un partenaire média qui décide lui-même des finalités d’optimisation ne se traite pas comme un simple prestataire technique.
Le deuxième point est la limitation des sorties. Une clean room doit idéalement produire des résultats agrégés, avec seuils minimaux, contrôles anti-différenciation et interdiction d’export d’identifiants individuels. Les segments activables doivent être suffisamment larges pour réduire le risque de réidentification. Une règle opérationnelle consiste à interdire les audiences trop petites, par exemple inférieures à quelques milliers d’individus pour l’activation média, sauf justification particulière et garanties renforcées. Le seuil exact dépend du canal, de la sensibilité et du pays, mais l’objectif est constant : éviter le micro-ciblage non maîtrisé.
Le troisième point concerne les logs et la traçabilité. Les équipes doivent savoir qui a accédé à quelles données, pour quelle requête, à quelle date et avec quelle sortie. Sans journalisation, la conformité repose sur des déclarations. Avec journalisation, elle devient vérifiable. Cette discipline est également utile pour le pilotage business : elle permet de relier les décisions d’activation aux signaux utilisés et d’identifier les modèles qui dégradent la qualité ou la conformité.
Conclusion : construire un portefeuille de signaux gradué par valeur et par risque
Exploiter des signaux sans dégrader la conformité RGPD ne consiste pas à choisir entre performance et protection des données. Il s’agit de hiérarchiser les signaux selon leur utilité marginale, leur sensibilité et leur robustesse. Les signaux contextuels sont souvent les plus simples à activer et les plus durables. Les données first-party consenties sont puissantes, mais exigent une gouvernance stricte des finalités, des consentements et des durées. Les signaux agrégés et modélisés sont essentiels pour mesurer l’incrémentalité sans surindividualiser. Les données de géolocalisation et les identifiants partagés doivent être réservés aux cas où leur valeur est prouvée et encadrée.
Une feuille de route actionnable peut s’organiser en huit décisions. Premièrement, cartographier les finalités : activation, mesure, apprentissage, exclusion, personnalisation. Deuxièmement, associer chaque signal à une base légale, une finalité, une durée de conservation et un niveau de granularité. Troisièmement, privilégier par défaut les signaux contextuels, agrégés ou pseudonymisés lorsque l’usage ne nécessite pas d’identification individuelle. Quatrièmement, réserver les identifiants CRM, emails hashés et données login aux cas où le consentement et la valeur incrémentale sont démontrés. Cinquièmement, réduire la granularité des signaux sensibles, notamment géolocalisation et trajectoires, dès que l’objectif peut être atteint par agrégation. Sixièmement, encadrer les clean rooms par des seuils de sortie, des contrats clairs et des logs d’accès. Septièmement, compléter l’attribution par des holdouts, geo-tests et MMM pour limiter la dépendance aux parcours individuels. Huitièmement, documenter les arbitrages dans une gouvernance associant marketing, data, juridique, média et finance.
Le critère décisif n’est pas la quantité de données disponibles, mais la capacité à expliquer pourquoi un signal est nécessaire, comment il est traité, quelle décision il améliore et quel risque il introduit. Une donnée qui améliore marginalement un CPA mais fragilise la base légale, augmente le risque d’audit ou réduit la confiance utilisateur n’est pas un actif durable. À l’inverse, un signal moins précis mais stable, transparent et mesurable peut produire une performance plus solide. Dans l’AdTech actuelle, la maturité ne se mesure plus à la profondeur des profils collectés, mais à la qualité des arbitrages entre valeur, preuve et conformité.