7 signaux pour détecter la fraude publicitaire en RTB
La fraude en RTB est moins un incident technique qu’un biais de pilotage média
Dans l’achat programmatique, la fraude publicitaire ne se limite pas à quelques bots détectables dans un rapport de vérification. Elle modifie la lecture de la performance, déforme les arbitrages budgétaires et peut conduire les algorithmes d’achat à optimiser vers de faux signaux. En RTB, real-time bidding, mécanisme d’enchères en temps réel permettant d’acheter une impression publicitaire au moment où elle devient disponible, chaque milliseconde agrège une décision d’audience, de prix, d’inventaire et de probabilité de conversion. Si le signal est contaminé, la décision l’est aussi.
Le problème est économique avant d’être technologique. Un inventaire frauduleux peut afficher un CPM, coût pour mille impressions, très compétitif, un CTR, click-through rate ou taux de clic, anormalement élevé, et parfois un CPA, coût par acquisition, artificiellement bas si les conversions sont mal attribuées. À court terme, il améliore certains tableaux de bord. À moyen terme, il détourne le budget de la couverture utile, affaiblit le ROAS, return on ad spend, ratio entre chiffre d’affaires attribué et dépenses publicitaires, et réduit la capacité des équipes à distinguer performance réelle et simple captation statistique.
Les estimations sectorielles varient selon les méthodologies, mais plusieurs études de vérification média situent régulièrement le trafic invalide entre 1 % et 3 % sur des environnements premium contrôlés, et au-delà de 10 % sur certaines poches d’inventaire ouvert, longues chaînes de revente ou applications peu transparentes. La fraude n’est donc pas uniformément distribuée. Elle se concentre là où la transparence est faible, où les incentives récompensent le volume, et où les modèles d’attribution acceptent trop facilement les impressions ou clics sans preuve de qualité.
Détecter la fraude publicitaire en RTB suppose de croiser des signaux. Aucun indicateur isolé ne suffit. Un taux de clic élevé peut être légitime sur un format natif très contextualisé. Une faible durée de session peut être normale sur une landing page transactionnelle. Un taux de viewability bas peut venir d’un mauvais format plutôt que d’un schéma frauduleux. La rigueur consiste à construire une grille d’alerte cumulant qualité média, cohérence comportementale, transparence de la chaîne d’approvisionnement, attribution et valeur business.
Signal 1 : un écart anormal entre volume acheté et attention réellement mesurable
Le premier signal de risque est la dissociation entre impressions servies, impressions mesurables, impressions visibles et attention effective. Une impression servie signifie seulement qu’un ad server a appelé une création. Elle ne garantit ni rendu, ni visibilité, ni exposition humaine. En RTB, ce décalage peut être amplifié par des inventaires en cascade, des pages surchargées, des emplacements sous la ligne de flottaison, des auto-refresh agressifs ou des environnements applicatifs peu audités.
La viewability, ou visibilité publicitaire, mesure généralement si une impression a eu une chance minimale d’être vue. Le standard MRC, Media Rating Council, considère une impression display comme visible lorsque 50 % des pixels sont affichés pendant au moins une seconde, et une impression vidéo lorsque 50 % des pixels sont affichés pendant au moins deux secondes. Ce seuil est utile, mais il reste minimal. Pour des décisions d’enchères, une impression visible une seconde ne devrait pas être pondérée comme une vidéo regardée à 75 % avec son actif.
Le signal devient préoccupant lorsque la campagne affiche un volume élevé, un CPM bas et une faible part d’impressions mesurables ou visibles. Par exemple, un deal open exchange qui livre 20 millions d’impressions avec seulement 42 % de mesurabilité et 38 % de visibilité doit être challengé, surtout si les domaines ou applications concernés ne sont pas stratégiques. À l’inverse, un inventaire premium peut afficher une visibilité modérée mais une forte qualité contextuelle ; c’est pourquoi le signal doit être comparé au format, au device, à la catégorie et au placement.
Le comment est opérationnel : isoler les impressions non mesurables, suivre la visibilité par seller, domaine, application, format et heure de diffusion, puis appliquer des seuils d’exclusion progressifs. Une bonne pratique consiste à ne pas couper uniquement au niveau campagne, mais à construire une liste de combinaisons à risque : domaine plus emplacement plus seller plus device. La fraude exploite souvent ces interstices plutôt qu’un domaine entier facilement détectable.
Signal 2 : des comportements post-clic ou post-impression incompatibles avec une audience humaine
Le deuxième signal se situe après l’exposition : que fait l’utilisateur supposé humain ? Les bots sophistiqués peuvent générer des impressions visibles, simuler des mouvements de souris, cliquer et parfois remplir des formulaires basiques. Mais ils produisent souvent des distributions comportementales atypiques : sessions de zéro à deux secondes, taux de rebond extrêmes, absence de scroll, répétition de parcours identiques, clics très concentrés sur certaines plages horaires, ou conversions sans cohérence avec le funnel.
Le funnel désigne le parcours allant de l’exposition initiale à la considération, puis à la conversion et à la fidélisation. Dans un funnel sain, on observe généralement une progression : impression, visite, consultation de contenu ou produit, ajout panier ou engagement, conversion éventuelle. La fraude casse souvent cette logique. Un inventaire peut générer un CTR de 3 % sur display, soit dix à vingt fois supérieur à certains benchmarks classiques, mais produire des sessions moyennes de 4 secondes et aucune micro-conversion. Ce n’est pas une bonne performance ; c’est un signal de trafic invalide ou mal qualifié.
Il faut également analyser les distributions, pas seulement les moyennes. Une durée moyenne de session correcte peut masquer deux populations : quelques vrais utilisateurs très engagés et un volume massif de sessions quasi nulles. Les équipes avancées utilisent des percentiles : part des sessions inférieures à 3 secondes, part des pages vues uniques, part des visiteurs sans interaction, distribution du temps entre clic et arrivée sur site. Des temps de latence trop réguliers ou trop rapides peuvent signaler des clics automatisés.
Le point critique est de relier ces signaux à l’achat média. Si un DSP, demand-side platform, plateforme utilisée par les acheteurs pour acheter des impressions publicitaires de manière automatisée, optimise vers le clic sans filtre de qualité post-clic, il peut apprendre à acheter les poches d’inventaire qui génèrent le plus d’interactions artificielles. La correction consiste à transmettre des signaux de qualité aux algorithmes : visite qualifiée, profondeur de session, événement métier, nouveau client, marge ou valeur de lead validée. Optimiser vers le clic brut revient souvent à ouvrir la porte aux mauvais incentives.
Signal 3 : une chaîne d’approvisionnement opaque, longue ou incohérente
La fraude en RTB prospère dans la complexité de la supply chain. Une même impression peut passer par plusieurs SSP, supply-side platforms, plateformes utilisées par les éditeurs pour vendre leur inventaire, revendeurs, exchanges et intermédiaires techniques. Plus le chemin est long, plus le risque d’arbitrage opaque, de revente non autorisée, de domaine spoofing ou de frais cachés augmente. Le domaine spoofing consiste à faire passer un inventaire de faible qualité pour un domaine premium afin d’obtenir une enchère plus élevée.
Les standards ads.txt et app-ads.txt ont réduit une partie du problème. Ads.txt est un fichier publié par les éditeurs pour déclarer les vendeurs autorisés de leur inventaire web ; app-ads.txt joue le même rôle dans les applications mobiles. Mais leur existence ne garantit pas l’absence de fraude. Une ligne autorisée peut correspondre à un reseller légitime, sans indiquer si le chemin est optimal, si le prix est transparent ou si l’inventaire est réellement qualitatif.
Le signal d’alerte apparaît lorsque des impressions supposées premium sont majoritairement achetées via des resellers multiples plutôt que via des relations directes, ou lorsque le même domaine est accessible à des prix très différents selon plusieurs chemins. Dans un audit supply path optimization, ou SPO, pratique consistant à rationaliser les chemins d’achat vers l’inventaire, on peut parfois constater que 30 % à 50 % des impressions proviennent de chemins redondants, avec des frais technologiques et des niveaux de transparence variables.
Le comment consiste à auditer les logs d’enchères et de diffusion : seller_id, type de relation direct ou reseller, exchange, domaine, application, bundle ID, prix clearing, taux de win, viewability et performance post-clic. Les acheteurs doivent privilégier les chemins courts, les deals contrôlés, les éditeurs authentifiés et les places de marché privées lorsque le risque est élevé. L’objectif n’est pas de supprimer l’open auction, mais de ne plus traiter tous les chemins comme équivalents.
Signal 4 : des anomalies de fréquence, de récurrence et de distribution temporelle
La fréquence est un signal puissant de fraude ou de mauvaise qualité. Une fréquence élevée peut être volontaire dans une stratégie de mémorisation ou de retargeting, mais certaines distributions sont difficilement défendables : utilisateurs exposés plusieurs dizaines de fois par jour, pics d’impressions à des heures où l’audience cible est peu active, répétition d’expositions sur des devices ou environnements improbables, concentration excessive sur quelques identifiants.
Dans un environnement sain, la fréquence suit généralement une courbe contrôlable : couverture initiale, répétition limitée, saturation progressive. Dans un environnement suspect, on observe parfois une forte densité d’impressions sur un petit nombre d’identifiants, avec peu d’impact sur les visites qualifiées ou les conversions incrémentales. Le problème est double : le budget est gaspillé et l’attribution peut créditer des conversions naturelles simplement parce qu’une impression a été servie juste avant l’achat.
Un cas fréquent concerne le retargeting programmatique. Une audience de 100 000 visiteurs récents peut recevoir plusieurs millions d’impressions en quelques jours si les caps de fréquence sont faibles ou mal synchronisés entre plateformes. Si le modèle d’attribution post-view attribue les ventes dans une fenêtre de 7 jours, la campagne peut afficher un ROAS élevé tout en capturant des conversions qui auraient eu lieu sans exposition. Le post-view désigne l’attribution d’une conversion à une impression vue ou supposée vue sans clic ; il doit être gouverné avec des fenêtres courtes et des coefficients d’incrémentalité.
Le test utile consiste à croiser fréquence et contribution marginale. Jusqu’à quelle exposition observe-t-on un gain de conversion ou d’engagement ? Que se passe-t-il après la cinquième, dixième ou quinzième impression ? Si les conversions attribuées continuent d’augmenter alors que les visites qualifiées stagnent et que le taux de nouveaux clients baisse, le modèle récompense probablement la surexposition. La correction passe par des caps de fréquence, des exclusions CRM, des fenêtres post-view réduites et des tests holdout, dans lesquels une partie de l’audience éligible est volontairement non exposée.
Signal 5 : une performance trop belle pour être expliquée par le contexte média
La fraude se cache souvent derrière une performance apparente. Un CPA divisé par deux, un CTR trois fois supérieur à la moyenne ou un ROAS très au-dessus du benchmark ne sont pas nécessairement des succès. Ils doivent être expliqués. Une performance réelle laisse des traces cohérentes : qualité de session, progression dans le funnel, nouveaux clients, marge, réachat, effet incrémental. Une performance frauduleuse ou opportuniste se limite souvent à un indicateur isolé.
Le signal d’alerte est particulièrement fort lorsque la performance est concentrée sur des inventaires inconnus, des applications longues traînes ou des segments non stratégiques. Par exemple, une campagne display B2B ciblant des décideurs IT qui génère la majorité de ses leads la nuit, depuis des applications de jeux mobiles, avec des adresses email invalides ou des domaines gratuits, doit être immédiatement auditée. Le coût par lead peut être bas ; la contribution commerciale est nulle.
Les annonceurs doivent distinguer conversion attribuée et conversion validée. L’attribution assigne une conversion à un point de contact média selon une règle donnée. Elle ne prouve pas la causalité ni la qualité business. Pour les leads, la validation doit inclure taux de doublons, email vérifié, téléphone joignable, qualification commerciale, passage en opportunité, chiffre d’affaires signé. Pour l’e-commerce, elle doit intégrer annulations, retours, marge, statut nouveau client et réachat.
Un framework simple consiste à classer les KPI en trois niveaux. Niveau 1 : métriques média, impressions, clics, visibilité, CPM, CPC. Niveau 2 : métriques comportementales, sessions qualifiées, pages vues, événements, temps utile. Niveau 3 : métriques business, ventes nettes, marge, nouveaux clients, LTV, lifetime value ou valeur économique attendue d’un client sur sa durée de relation avec la marque. Un inventaire qui surperforme au niveau 1 mais s’effondre aux niveaux 2 et 3 doit être pénalisé, même si la plateforme le recommande.
Signal 6 : des incohérences techniques dans les identifiants, devices et environnements
Le sixième signal est plus technique, mais déterminant : la cohérence des identifiants et des environnements. Les fraudeurs exploitent les zones grises de l’identification publicitaire : user agents falsifiés, adresses IP de data centers, device IDs réinitialisés ou générés artificiellement, bundles d’applications suspects, géolocalisations incohérentes, langues ou systèmes d’exploitation improbables au regard du marché ciblé.
Le trafic invalide, ou IVT pour invalid traffic, regroupe les impressions, clics ou interactions générés par des bots, des scripts, des fermes de clics, des devices infectés ou des pratiques non humaines. On distingue souvent le GIVT, general invalid traffic, relativement simple à détecter, comme des bots connus ou des data centers, et le SIVT, sophisticated invalid traffic, plus complexe, qui imite des comportements humains ou détourne des environnements légitimes.
Les incohérences doivent être analysées en grappes. Une adresse IP de data center n’est pas toujours frauduleuse dans un contexte B2B, car certaines entreprises routent le trafic via des infrastructures cloud ou VPN. Mais une concentration de clics venant de data centers, associée à des sessions de moins de deux secondes, à une absence de conversions validées et à des user agents obsolètes, devient fortement suspecte. De même, une campagne locale drive-to-store qui génère des visites supposées depuis des zones hors chalandise révèle soit une erreur de ciblage, soit une donnée de localisation dégradée.
Le contrôle passe par des outils de vérification indépendants, mais aussi par une hygiène interne : listes d’exclusion IP, filtrage des data centers connus, contrôle des bundles app, rapprochement entre logs DSP et analytics site, vérification des paramètres UTM, analyse par device et système d’exploitation. Les équipes doivent éviter de déléguer entièrement ce sujet aux plateformes qui vendent l’inventaire. Une mesure indépendante ou au moins contradictoire reste indispensable lorsque les budgets sont significatifs.
Signal 7 : une attribution qui crédite les mauvais points de contact
Le dernier signal est souvent le plus sous-estimé : la fraude peut être moins visible dans l’impression que dans l’attribution. Certains inventaires n’ont pas besoin de générer de vraies conversions ; il leur suffit d’apparaître dans le parcours juste avant une conversion naturelle pour capter du crédit. C’est particulièrement vrai lorsque les fenêtres post-view sont longues, que la déduplication inter-plateformes est faible et que le last touch, dernier point de contact avant conversion, reste dominant.
Un modèle d’attribution trop permissif récompense les acteurs capables de maximiser la proximité avec l’achat plutôt que ceux qui créent de la demande. Les campagnes de retargeting, les formats à très forte fréquence et certains inventaires à bas coût peuvent alors absorber une part disproportionnée du crédit. Le risque n’est pas toujours une fraude criminelle ; il peut s’agir d’une fraude économique au sens large, où le système rémunère une contribution faible ou inexistante.
Pour détecter ce biais, il faut comparer trois lectures. Premièrement, l’attribution brute : ce que les plateformes déclarent. Deuxièmement, l’attribution pondérée : ce qui reste après filtres de visibilité, qualité, fréquence, intention préalable et déduplication. Troisièmement, l’incrémentalité : ce qui aurait réellement changé sans campagne. L’incrémentalité mesure la différence entre un groupe exposé et un groupe comparable non exposé, via holdout, geo-test ou conversion lift.
Un exemple concret : une campagne affiche 8 000 conversions post-view sur 30 jours, avec un ROAS plateforme de 6. Après exclusion des impressions non visibles, plafonnement de fréquence et réduction de la fenêtre post-view à 24 heures pour les visiteurs panier, le volume pondéré tombe à 3 200 conversions. Un holdout montre ensuite un lift de 18 %. La contribution incrémentale estimée est donc très inférieure au reporting initial. Ce n’est pas un échec ; c’est une correction nécessaire pour éviter de financer de l’attribution opportuniste.
Conclusion : passer d’une détection défensive à une gouvernance active du risque
Détecter la fraude publicitaire en RTB ne consiste pas à chercher un indicateur magique. Les sept signaux à suivre sont complémentaires : attention mesurable, comportement post-clic, transparence supply, anomalies de fréquence, performance trop atypique, cohérence technique des identifiants et qualité de l’attribution. Leur valeur vient du croisement. Un signal isolé déclenche une question ; plusieurs signaux convergents déclenchent une action.
Une feuille de route actionnable peut s’organiser en cinq étapes. Premièrement, définir des seuils de qualité par format, device, pays et objectif de campagne, au lieu d’appliquer un benchmark unique. Deuxièmement, imposer une lecture multi-niveaux des KPI : média, comportement, business. Troisièmement, auditer la supply chain via ads.txt, app-ads.txt, seller_id, type de relation et performance par chemin. Quatrièmement, réduire les fenêtres d’attribution et tester régulièrement l’incrémentalité, en particulier sur le retargeting et les inventaires à forte fréquence. Cinquièmement, alimenter les DSP avec des signaux de valeur validés plutôt qu’avec des conversions brutes.
La lutte contre la fraude demande aussi une gouvernance. Les responsabilités doivent être explicites entre annonceur, agence, trading desk, DSP, SSP, outil de vérification et équipe analytics. Qui peut exclure un domaine ? Qui valide un seuil de viewability ? Qui arbitre entre volume et qualité ? Qui a accès aux logs ? Sans ce modèle de décision, la fraude reste un sujet de reporting trimestriel alors qu’elle devrait orienter les enchères au quotidien.
Le point essentiel est de ne pas confondre contrôle et paralysie. Un excès de filtrage peut réduire la couverture, augmenter les CPM et priver les campagnes de certains environnements utiles. Mais l’absence de filtrage dégrade l’apprentissage algorithmique et survalorise les inventaires les plus bruyants. La maturité consiste à accepter cet arbitrage : acheter moins d’impressions apparentes, mais davantage d’expositions vérifiables, humaines et contributives. En RTB, la qualité du signal n’est pas un supplément de mesure ; c’est la condition même de la performance.