De l’audience lookalike au reach utile : bilan d’un cas data
Le lookalike n’est plus un objectif : c’est une hypothèse de départ à vérifier
Les audiences lookalike ont longtemps occupé une place confortable dans les plans d’acquisition digitale. Leur promesse était simple : partir d’une base de clients, de leads qualifiés ou d’acheteurs récents, puis demander à une plateforme d’identifier des profils statistiquement similaires dans un univers adressable plus large. Dans un contexte de cookies tiers abondants, de graphes d’identité plus stables et de coûts média encore contenus, cette logique pouvait produire des volumes significatifs à des CPA acceptables. Le CPA, coût par acquisition, désigne le montant dépensé pour générer une conversion attribuée, qu’il s’agisse d’un achat, d’un lead ou d’une visite qualifiée.
Le problème est que le lookalike est souvent devenu une mécanique de confort. Une équipe importe une seed audience, c’est-à-dire une population source, sélectionne un taux de similarité de 1 %, 3 % ou 5 %, active le segment dans un DSP, demand-side platform, plateforme permettant aux annonceurs d’acheter des impressions publicitaires de manière automatisée, puis pilote la campagne sur le clic, le CPA ou le ROAS. Le ROAS, return on ad spend, est le ratio entre chiffre d’affaires attribué et dépenses publicitaires. Cette séquence est opérationnelle, mais elle ne répond pas à la question essentielle : l’audience activée apporte-t-elle une couverture réellement utile, ou se contente-t-elle de retrouver des individus déjà proches de la conversion, déjà exposés ailleurs, ou déjà captés par d’autres canaux ?
Le cas data analysé ici part d’un constat fréquent chez un annonceur e-commerce multicanal : les audiences lookalike affichaient de bons indicateurs de plateforme, mais la croissance nette stagnait. Sur trois mois, le plan programmatique déclarait un ROAS moyen de 5,4 et un CPA inférieur de 18 % au benchmark social paid. Pourtant, les nouveaux clients nets progressaient peu, la part de ventes attribuées aux clients déjà actifs restait élevée, et les tests de pression CRM montraient une cannibalisation partielle entre email, retargeting et display prospecting. L’enjeu n’était donc pas de couper le lookalike, mais de le requalifier : passer d’une logique de similarité à une logique de reach utile.
Le reach utile désigne la couverture qui ajoute une probabilité de valeur réelle : toucher des individus non saturés, suffisamment proches de la catégorie pour être activables, mais pas déjà captés par les canaux organiques ou relationnels ; dans des environnements média visibles ; avec une contribution mesurable sur le funnel, parcours allant de la notoriété à la considération puis à la conversion. Il ne s’agit pas seulement de toucher plus de personnes, mais de toucher des personnes additionnelles, dans des contextes capables de produire un effet incrémental.
Partir d’une seed audience propre, mais surtout économiquement interprétable
Le premier enseignement du cas concerne la population source. Beaucoup de modèles lookalike sont construits à partir d’une base trop large : tous les acheteurs des 180 derniers jours, tous les visiteurs ayant ajouté au panier, tous les leads collectés, parfois même tous les inscrits newsletter. Cette approche maximise le volume, mais mélange des signaux de valeur très hétérogènes. Un acheteur promotionnel à faible marge, un client fidèle à forte LTV, lifetime value ou valeur économique attendue d’un client sur la durée de sa relation avec la marque, et un visiteur opportuniste ne doivent pas peser de la même façon dans une seed.
Dans le cas étudié, la base initiale comptait 620 000 profils CRM consentis. Le premier travail a consisté à la segmenter en quatre groupes : acheteurs récents rentables, acheteurs récents peu rentables, clients dormants à forte valeur historique et leads non convertis. Les critères retenus étaient la marge brute après remise, la fréquence d’achat, le taux de retour, l’ancienneté, le canal d’acquisition initial et la probabilité de réachat à 90 jours. Cette segmentation a immédiatement changé la lecture : seulement 28 % des profils représentaient 61 % de la marge nette sur douze mois.
La seed finalement utilisée pour le test principal n’a pas été la plus volumineuse, mais la plus interprétable : 95 000 clients ayant acheté au moins deux fois, avec une marge cumulée supérieure au troisième quartile, sans retour produit majeur et sans acquisition initiale exclusivement promotionnelle. Ce choix réduit mécaniquement la taille du modèle, mais il améliore la cohérence du signal. L’objectif n’était pas de trouver des personnes ressemblant à tous les clients, mais des personnes ressemblant aux clients que l’entreprise voulait réellement recruter.
Le matching, rapprochement entre une base annonceur et les identifiants disponibles dans une plateforme ou un environnement média, a ensuite été mesuré avec prudence. Sur les 95 000 profils, 54 000 ont été matchés dans l’environnement d’activation, soit 57 %. Ce taux peut sembler correct, mais il ne garantit pas la représentativité. Les profils matchés étaient plus urbains, plus mobiles et plus acheteurs en ligne que la seed complète. Le modèle lookalike risquait donc de surpondérer des comportements digitaux plutôt que la valeur commerciale réelle. Cette limite a été documentée avant activation, afin d’éviter de confondre précision technique et validité marketing.
Comparer la similarité statistique à la couverture additionnelle
La deuxième étape a consisté à distinguer audience similaire et audience additionnelle. Une audience lookalike peut être très proche de la seed, mais déjà largement couverte par les autres leviers : search de marque, social retargeting, emailing, affiliation ou accès direct. Dans ce cas, elle améliore les métriques d’attribution sans créer beaucoup de demande nouvelle. L’attribution, méthode qui assigne une conversion à un ou plusieurs points de contact marketing, mesure une proximité observée ; elle ne prouve pas à elle seule la causalité.
Le framework utilisé a croisé trois indicateurs. Le premier était le score de similarité fourni par la plateforme, réparti en déciles. Le deuxième était l’overlap média, c’est-à-dire la part des individus déjà exposés ou activés sur d’autres canaux payants et CRM sur les 30 derniers jours. Le troisième était la valeur de couverture additionnelle : nombre de profils touchables non présents dans les audiences CRM récentes, non visiteurs du site sur 14 jours, et non exposés au retargeting sur 7 jours.
Les résultats ont montré un arbitrage classique. Le décile le plus similaire à la seed affichait le meilleur CPA brut, à 24 euros, mais 46 % des profils étaient déjà présents dans des pools de retargeting ou de CRM actif. Les déciles 3 à 5 affichaient un CPA brut plus élevé, entre 33 et 39 euros, mais seulement 19 % d’overlap et une part plus élevée de nouveaux visiteurs. Les déciles 8 à 10 apportaient beaucoup de volume, mais des signaux comportementaux faibles : sessions courtes, faible taux de consultation produit et peu d’ajouts panier.
La décision n’a donc pas été de sélectionner mécaniquement le lookalike le plus proche. Le plan a privilégié une zone intermédiaire : suffisamment similaire pour rester activable, suffisamment éloignée pour ajouter de la couverture. C’est précisément la différence entre lookalike et reach utile. Le lookalike cherche la proximité statistique ; le reach utile cherche la contribution marginale. Dans un marché où les mêmes intentions sont revendiquées par plusieurs plateformes, cette distinction devient centrale.
Pour éviter un biais de volume, l’équipe a aussi calculé un coût par reach utile. Le CPM, coût pour mille impressions, était inférieur sur les segments larges, mais le coût par mille profils additionnels qualifiés était plus favorable sur les déciles intermédiaires. Une impression bon marché sur une audience redondante reste chère si elle ne crée aucun contact incrémental.
Réconcilier les signaux média, CRM et e-commerce pour éviter le faux positif
Le troisième enseignement concerne la mesure. Une campagne lookalike peut afficher de bons résultats si elle est évaluée uniquement dans le DSP ou dans l’outil d’attribution web. Le cas étudié a donc imposé une lecture multi-sources : logs d’exposition programmatique, événements analytics du site e-commerce, données CRM, ventes nettes après retours, statut nouveau client et marge. Les impressions étaient achetées en RTB, real-time bidding, mécanisme d’enchères en temps réel permettant d’acheter une impression lorsqu’elle devient disponible, avec des règles d’exclusion sur la fraude, la viewability et les environnements à faible qualité.
La viewability, ou visibilité publicitaire, a été intégrée comme filtre de base. Les impressions non mesurables ou non visibles n’ont pas été valorisées dans l’analyse de contribution. Le trafic invalide, ou IVT pour invalid traffic, a été exclu via un outil tiers et par analyse interne des anomalies : pics horaires incohérents, user agents suspects, taux de rebond extrême, clics depuis data centers et domaines à faible transparence. Cette discipline est essentielle : un modèle lookalike optimisé vers des clics contaminés apprend vite à acheter les poches d’inventaire les plus bruyantes.
Le rapprochement CRM a révélé un biais important. Parmi les conversions attribuées au lookalike sur une fenêtre de 30 jours post-view et 7 jours post-clic, 38 % concernaient des clients déjà connus, dont 22 % actifs sur les 60 derniers jours. Sans déduplication, la campagne semblait recruter massivement. Après déduplication avec le CRM et exclusion des acheteurs récents, le nombre de nouveaux clients attribués diminuait de 31 %. Ce n’était pas une erreur de plateforme ; c’était la conséquence d’une fenêtre d’attribution trop permissive et d’un chevauchement avec les canaux relationnels.
L’équipe a ensuite créé trois vues de reporting. La vue média suivait budget, impressions, CPM, CPC, coût par clic, viewability, fréquence, domaines et formats. La vue commerce suivait chiffre d’affaires net, marge, taux de retour, panier moyen et produits achetés. La vue client suivait statut CRM, ancienneté, exposition aux emails, exposition retargeting, nouveau client et réachat à 60 jours. La performance n’était validée que lorsque les trois vues restaient cohérentes. Un segment avec bon CPA mais faible marge ou forte part de clients actifs était dépriorisé.
Tester l’incrémentalité plutôt que croire le ROAS de plateforme
Le cœur du bilan repose sur l’incrémentalité. L’incrémentalité mesure la part des résultats qui n’aurait probablement pas eu lieu sans l’exposition marketing. C’est la différence entre performance observée et contribution causale. Dans le cas étudié, le ROAS plateforme initial du lookalike était de 5,4. Après nettoyage des impressions non visibles, déduplication CRM et réduction de la fenêtre post-view, le ROAS pondéré tombait à 3,8. Mais cette correction ne suffisait toujours pas à prouver l’effet réel.
Un holdout a donc été mis en place. Le holdout consiste à exclure volontairement une partie de l’audience éligible afin de comparer son comportement à celui des exposés. L’audience lookalike qualifiée a été divisée en deux groupes statistiquement comparables : 80 % activés, 20 % non exposés. Le test a duré six semaines, afin de couvrir deux cycles promotionnels et de limiter les effets de calendrier. Les KPI analysés étaient les visites qualifiées, les nouveaux clients, le chiffre d’affaires net, la marge incrémentale et le réachat à 60 jours.
Les résultats ont fortement nuancé le reporting initial. Sur le groupe exposé, le taux de conversion observé était supérieur de 0,34 point au groupe contrôle. Le lift relatif atteignait 18 %. Sur les conversions attribuées par la plateforme, seules 41 % étaient estimées incrémentales. Le ROAS incrémental, calculé sur le chiffre d’affaires net réellement additionnel, était de 2,1. En revanche, la marge incrémentale par nouveau client était supérieure à celle du retargeting, car les profils recrutés achetaient moins en promotion et retournaient moins les produits.
Ce résultat n’appelle pas une conclusion binaire. Oui, le ROAS de plateforme survalorisait la contribution. Non, le lookalike n’était pas inutile. Il jouait un rôle d’acquisition qualifiée, mais à condition de ne pas être jugé avec les mêmes seuils qu’un levier de bas de funnel. Le bas de funnel désigne les étapes proches de la conversion, comme le retargeting panier ou le search marque. Un levier de prospection doit accepter un ROAS court terme inférieur s’il recrute des clients à plus forte valeur future.
La bonne métrique est donc devenue un triptyque : coût par nouveau client incrémental, marge incrémentale à court terme et LTV projetée. Avec cette lecture, le lookalike intermédiaire était rentable au-delà de 120 jours, mais pas à 30 jours. Cette information a changé l’allocation budgétaire : baisse des investissements sur les segments trop proches du retargeting, maintien des déciles intermédiaires, arrêt des segments larges sans signal comportemental.
Optimiser le reach utile par fréquence, inventaire et séquence créative
Une fois l’audience redéfinie, le travail s’est déplacé vers l’exécution média. Une audience de qualité peut être détruite par une mauvaise fréquence, un inventaire médiocre ou une création trop uniforme. Le capping, limitation du nombre d’expositions publicitaires sur une période donnée, a été revu à partir de la contribution marginale. Au-delà de six impressions visibles par individu estimé sur sept jours, les visites qualifiées n’augmentaient plus, tandis que les conversions attribuées continuaient de progresser. Ce signal indiquait une attribution opportuniste : les impressions supplémentaires captaient du crédit sans créer beaucoup d’effet.
Le cap a été abaissé à quatre impressions visibles sur sept jours pour les profils sans interaction, mais maintenu à six pour les profils ayant consulté au moins deux pages produit. La logique n’était pas de réduire la pression partout, mais d’adapter la fréquence à l’intention observée. Les visiteurs qualifiés pouvaient recevoir une séquence plus insistante ; les profils froids devaient être exposés moins souvent, dans des contextes plus sélectifs.
L’inventaire a également été restructuré. Les placements open exchange à faible CPM représentaient 52 % des impressions, mais seulement 27 % des visites qualifiées et 18 % de la marge incrémentale. Les deals privés sur environnements éditoriaux affinitaires coûtaient 34 % plus cher en CPM, mais produisaient une meilleure profondeur de session et un taux de nouveaux clients supérieur. La supply path optimization, ou SPO, pratique consistant à rationaliser les chemins d’achat programmatique vers l’inventaire, a permis de réduire les chemins redondants et de privilégier les vendeurs directs ou les resellers transparents.
La création a enfin été alignée sur le niveau de maturité du profil. Les segments les plus proches de la seed recevaient une preuve produit et une offre modérée. Les segments intermédiaires recevaient d’abord un message de catégorie et de différenciation, puis une incitation produit seulement après interaction. Les segments larges, conservés en faible volume pour apprentissage, étaient activés avec des messages plus contextuels et moins promotionnels. Cette séquence a réduit le taux de clic brut, mais augmenté la part de sessions qualifiées. C’est un arbitrage souvent nécessaire : optimiser le clic peut dégrader la qualité du reach.
Ce que le cas enseigne sur la gouvernance data et média
Le principal enseignement organisationnel est que le lookalike ne peut plus être délégué entièrement aux plateformes. Les algorithmes sont performants pour identifier des proximités statistiques et arbitrer des enchères, mais ils optimisent selon les signaux qu’on leur fournit. Si la conversion remontée est brute, si la fenêtre d’attribution est large, si les clients existants ne sont pas exclus, et si la marge n’est pas transmise, le système apprendra à maximiser des conversions faciles plutôt qu’une croissance utile.
Une gouvernance robuste repose sur cinq décisions. Premièrement, définir la seed selon la valeur économique, pas seulement selon le volume. Deuxièmement, mesurer l’overlap avec CRM, retargeting, search et social pour identifier la couverture réellement additionnelle. Troisièmement, filtrer l’inventaire par qualité média : visibilité, fraude, transparence supply, environnement et fréquence. Quatrièmement, tester l’incrémentalité sur les budgets significatifs, avec holdout ou geo-test lorsque l’identification individuelle est insuffisante. Cinquièmement, restituer les résultats en distinguant attribution brute, performance pondérée et contribution incrémentale.
Ce cadre impose aussi une collaboration entre marketing, data, média, CRM et finance. Le marketing définit la cible et le rôle dans le funnel. La data contrôle les biais de matching, de représentativité et de mesure. Le média garantit la qualité d’achat et la pression. Le CRM apporte les statuts client, les consentements et les exclusions. La finance valide la marge et les seuils de rentabilité. Sans cette coordination, le lookalike reste un bouton d’activation ; avec elle, il devient un outil d’expansion contrôlée.
Il faut enfin accepter que le reach utile coûte parfois plus cher en apparence. Dans le cas analysé, le CPM moyen a augmenté de 21 % après réduction des inventaires faibles et concentration sur les segments intermédiaires. Mais le coût par nouveau client incrémental a baissé de 14 %, et la marge incrémentale à 120 jours a progressé de 23 %. La baisse du coût média unitaire n’est donc pas toujours le bon objectif. En acquisition, l’efficacité se mesure à la valeur créée par euro investi, pas au prix apparent de l’impression.
Conclusion : transformer le lookalike en instrument de croissance mesurée
Le passage de l’audience lookalike au reach utile n’est pas un changement de vocabulaire. C’est un changement de discipline. Il consiste à ne plus considérer la similarité comme une preuve de performance, mais comme une hypothèse à tester contre la couverture additionnelle, la qualité d’exposition, la déduplication client et l’incrémentalité.
Une feuille de route actionnable peut s’organiser en sept étapes. Premièrement, construire des seeds fondées sur la marge, la fréquence, la LTV et la qualité client. Deuxièmement, analyser le taux de match et les biais de représentativité avant activation. Troisièmement, comparer les déciles de similarité avec l’overlap CRM et média pour identifier la zone de reach utile. Quatrièmement, exclure ou pondérer les clients actifs, les visiteurs récents et les populations déjà surexposées. Cinquièmement, intégrer la qualité média dans l’optimisation : viewability, IVT, fréquence, supply path et contexte. Sixièmement, mesurer l’effet par holdout, lift ou geo-test, plutôt que par ROAS plateforme seul. Septièmement, piloter l’allocation sur le coût par nouveau client incrémental et la marge future, pas uniquement sur le CPA attribué.
La conclusion du cas est nuancée : le lookalike reste utile, mais il devient dangereux lorsqu’il sert de raccourci à la stratégie d’audience. Bien utilisé, il permet d’étendre la prospection au-delà des bases CRM et du retargeting. Mal gouverné, il recycle des intentions déjà captées, gonfle l’attribution et masque la saturation des canaux. Pour des professionnels du marketing, la question n’est donc plus : quelle audience ressemble le plus à mes clients ? Elle devient : quelle audience ajoute réellement de la couverture rentable, mesurable et non redondante ? C’est à cette condition que la data cesse d’être une mécanique d’amplification statistique pour devenir un levier de croissance incrémentale.