Méthode pour tester la qualité d’un inventaire open auction
Tester l’open auction revient à mesurer une probabilité de valeur, pas seulement un prix d’accès
L’open auction, ou enchère ouverte, désigne l’achat programmatique d’impressions publicitaires accessibles à plusieurs acheteurs via des plateformes d’échange, sans accord privé préalable entre annonceur et éditeur. Elle reste un levier majeur de couverture, de découverte d’inventaire et d’efficience apparente. Mais c’est aussi l’environnement où la dispersion de qualité est la plus forte : mêmes formats déclarés, mêmes catégories de sites, mêmes CPM, coût pour mille impressions, peuvent cacher des niveaux très différents de visibilité, d’attention, de fraude, de duplication supply et de contribution business.
Pour les professionnels du marketing, la question n’est donc pas de savoir si l’open auction est bonne ou mauvaise. Elle est structurellement hétérogène. La bonne question est : comment tester un inventaire ouvert de manière assez rigoureuse pour distinguer ce qui mérite d’être scalé, plafonné, exclu ou transformé en deal direct ? Un inventaire open auction doit être évalué comme une hypothèse : il promet du reach, de la liquidité et un prix compétitif ; il doit démontrer une qualité mesurable et une contribution incrémentale.
Le risque classique consiste à piloter uniquement au CPA, coût par acquisition ou montant dépensé pour générer une conversion attribuée, ou au ROAS, return on ad spend, ratio entre chiffre d’affaires attribué et dépenses publicitaires. Ces indicateurs sont utiles, mais trop tardifs et souvent biaisés par l’attribution. L’attribution désigne la méthode qui assigne une conversion à un ou plusieurs points de contact média. En open auction, un inventaire peut capter des conversions post-view parce qu’il touche des utilisateurs déjà intentionnistes, sans créer de demande additionnelle. À l’inverse, un inventaire haut de funnel peut afficher peu de conversions directes mais contribuer à la couverture, à la mémorisation ou aux recherches marque.
Une méthode robuste doit donc articuler trois niveaux de preuve. Premier niveau : la qualité technique de l’impression, avec la mesurabilité, la viewability, visibilité publicitaire, l’IVT, invalid traffic ou trafic invalide généré par bots, comportements non humains ou placements falsifiés, et la conformité déclarative. Deuxième niveau : la qualité média, avec le contexte, l’encombrement, la taille du player, la position, la fréquence, la brand safety et l’attention. Troisième niveau : la valeur business, avec visites qualifiées, nouveaux clients, marge, incrémentalité et rôle dans le funnel, parcours allant de la notoriété à la considération puis à la conversion.
Définir le périmètre du test : isoler l’inventaire avant d’optimiser
Un test d’inventaire open auction échoue souvent parce que le périmètre est mal contrôlé. Si une ligne DSP mélange plusieurs formats, pays, devices, audiences, SSP et objectifs d’enchère, il devient impossible de savoir si la performance vient de la qualité supply, du ciblage, de la création ou de l’algorithme. Le DSP, demand-side platform, est la plateforme utilisée par l’acheteur pour acheter des impressions de manière automatisée. La SSP, supply-side platform, est la plateforme utilisée par les éditeurs pour vendre leur inventaire. Le RTB, real-time bidding, désigne l’enchère en temps réel déclenchée lorsqu’une impression devient disponible.
La première étape consiste à construire une cellule de test suffisamment isolée. Idéalement, elle comporte un objectif unique, un format homogène, un set créatif stable, une fenêtre temporelle définie, un budget minimal et une nomenclature stricte. Tester simultanément display mobile, vidéo outstream, instream desktop et in-app revient à comparer des comportements de consommation incompatibles. Un taux de visibilité de 70 % en display desktop n’a pas la même signification qu’un taux de complétion vidéo de 70 % en instream mobile.
Le budget doit être dimensionné pour produire des signaux exploitables. Une règle opérationnelle consiste à viser au moins 100 000 à 300 000 impressions par segment supply analysé lorsque l’objectif est la qualité média, et davantage si l’on cherche une lecture conversionnelle. Pour un test sur 20 domaines, 4 SSP et 2 devices, un budget trop faible conduira à des décisions fondées sur du bruit statistique. Il vaut mieux tester moins de segments mais les tester correctement.
Le périmètre doit aussi distinguer inventaire ouvert pur et open auction filtrée. Une open auction avec listes d’inclusion, pre-bid fraud filtering, seuils de viewability et catégories contextuelles restrictives n’est déjà plus un flux brut. C’est souvent souhaitable, mais cela doit être documenté. Si l’objectif est de mesurer la qualité intrinsèque d’une poche supply, les filtres doivent être connus. Si l’objectif est de construire un standard d’achat, les filtres font partie de la méthode et doivent être mesurés comme tels.
Un exemple simple : une marque retail teste 500 000 impressions display open auction sur mobile web. Si la ligne inclut à la fois retargeting visiteurs site, lookalike CRM et ciblage contextuel large, le résultat ne dira rien de clair sur l’inventaire. Le bon protocole sépare au minimum trois cellules : audience froide contextuelle, audience data prospecting et retargeting. La qualité supply peut alors être comparée à objectif constant, au lieu d’être confondue avec la propension d’audience.
Auditer la conformité supply : ads.txt, sellers.json, schain et cohérence des signaux
Avant même de regarder les performances, il faut vérifier si l’inventaire est correctement déclaré. Les standards ads.txt et app-ads.txt permettent aux éditeurs web et app de déclarer les vendeurs autorisés de leur inventaire. Sellers.json décrit les entités vendeuses côté SSP. Le SupplyChain Object, souvent abrégé schain, retrace la chaîne d’intermédiaires impliqués dans la vente d’une impression. Ces fichiers ne garantissent pas la qualité, mais ils réduisent l’opacité et permettent de détecter des chemins d’achat anormalement complexes.
La question centrale est : l’impression achetée provient-elle d’un vendeur direct, d’un reseller autorisé ou d’un chemin agrégé difficile à justifier ? Un seller direct n’est pas automatiquement meilleur, mais il offre généralement plus de lisibilité économique et technique. Un reseller peut être pertinent lorsqu’il apporte un accès spécifique ou une liquidité complémentaire. En revanche, une chaîne à plusieurs intermédiaires, sans valeur claire, augmente les frais, la latence, les risques déclaratifs et parfois la duplication des bid requests.
Le diagnostic doit croiser plusieurs signaux. Un domaine premium acheté via cinq SSP, dont trois resellers, avec des CPM différents et des taux de visibilité divergents, doit être examiné par chemin supply. La même page, le même format et le même utilisateur peuvent générer plusieurs opportunités d’enchère. Si le DSP ne déduplique pas parfaitement, l’acheteur peut surpayer une impression en entrant indirectement en concurrence avec lui-même. C’est un problème de SPO, supply path optimization ou optimisation des chemins d’approvisionnement.
Un score de conformité peut être construit sur 100 points. Par exemple : 25 points pour seller autorisé dans ads.txt ou app-ads.txt, 20 points pour cohérence sellers.json, 20 points pour schain complet et court, 15 points pour absence de mismatch domaine-app-bundle, 10 points pour transparence du placement, 10 points pour stabilité des identifiants de deal ou de seller. Ce score n’est pas une vérité absolue, mais il force une discipline : un inventaire à très bon CPA mais faible conformité doit être traité comme un risque, pas comme une victoire.
Dans un test avancé, il faut également regarder les anomalies de bidstream. Le bidstream désigne les données transmises dans la demande d’enchère : URL, app bundle, device, géographie, taille d’emplacement, consentement, user agent, format, contenu, prix plancher. Une surreprésentation d’URLs non déclarées, d’app bundles inconnus, de user agents incohérents ou de géolocalisations imprécises doit déclencher un filtrage. La qualité open auction commence par la cohérence des signaux techniques.
Mesurer la qualité média : viewability, IVT, attention et encombrement publicitaire
La qualité d’un inventaire ne peut pas être réduite à son CPM. Un inventaire à 1,20 euro peut coûter plus cher qu’un inventaire à 5 euros si seules 25 % des impressions sont visibles et si une part significative du trafic est invalide. La première métrique à normaliser est le vCPM, coût pour mille impressions visibles. Si un inventaire affiche un CPM de 2 euros et 40 % de visibilité, son vCPM est de 5 euros. Un autre inventaire à 4 euros de CPM et 80 % de visibilité a également un vCPM de 5 euros, mais peut offrir une qualité contextuelle supérieure.
Le standard du MRC, Media Rating Council, considère généralement une impression display comme visible lorsque 50 % des pixels sont affichés pendant au moins une seconde consécutive, et une vidéo comme visible lorsque 50 % des pixels sont affichés pendant au moins deux secondes. Ces standards sont utiles pour établir un minimum commun, mais ils ne mesurent pas l’attention réelle. Une impression visible une seconde en bas de page, dans un environnement saturé de publicités, n’a pas la même valeur qu’une impression visible huit secondes dans un contexte éditorial affinitaire.
Le test doit donc combiner indicateurs de seuil et indicateurs de profondeur. Les métriques minimales sont : taux de mesurabilité, taux de visibilité, durée visible moyenne, taux d’IVT général et sophistiqué, position dans la page, taille du format, taux d’audio activé pour la vidéo, taux de complétion, interaction et fréquence visible. Pour la vidéo, il faut distinguer starts, quartiles 25, 50, 75 et 100, complétions visibles et complétions audibles lorsque le message dépend du son.
L’encombrement publicitaire est un signal souvent sous-exploité. Deux domaines peuvent afficher le même taux de visibilité, mais l’un présente deux emplacements publicitaires par page et l’autre huit. Le second peut générer une visibilité techniquement valide mais une attention fragmentée. Les solutions de mesure d’attention intègrent généralement la durée visible, la taille, le contexte, le scroll, l’encombrement, l’audio et parfois des données panel. Elles ne sont pas parfaitement standardisées, mais elles permettent de hiérarchiser les inventaires au-delà de la simple viewability.
Exemple chiffré : sur un test de 1 million d’impressions, un inventaire A affiche un CPM de 2,50 euros, 52 % de visibilité, 2,8 % d’IVT et 4,2 secondes visibles moyennes. Un inventaire B affiche un CPM de 4,20 euros, 78 % de visibilité, 0,6 % d’IVT et 8,7 secondes visibles. En CPM brut, A paraît 40 % moins cher. En vCPM corrigé de l’IVT, A revient à environ 4,95 euros pour mille impressions visibles humaines, B à environ 5,41 euros. L’écart réel est faible. Si B génère plus de visites qualifiées ou de lift marque, il peut devenir le meilleur choix malgré son prix facial.
Construire une matrice de test : filtrer, comparer, puis challenger les gagnants
Une méthode efficace peut s’organiser en trois temps : filtrage, comparaison, validation. Le filtrage sert à retirer les sources manifestement non conformes. La comparaison sert à classer les segments encore éligibles. La validation sert à vérifier que les meilleurs segments média produisent aussi une valeur business ou une contribution au funnel.
Le filtrage doit être défini avant le test. Par exemple : exclure les placements dont la mesurabilité est inférieure à 70 %, l’IVT supérieur à 3 %, la visibilité inférieure à 45 % en display ou 55 % en vidéo, les sellers non autorisés, les app bundles inconnus, les schain incomplets ou les domaines dont le contenu est incompatible avec la brand safety. La brand safety désigne la capacité à éviter les environnements susceptibles de nuire à l’image de marque, comme contenus violents, haineux, illégaux ou fortement sensibles. Ces seuils doivent être adaptés à la catégorie et au format, mais ils évitent de rationaliser après coup des résultats douteux.
La comparaison peut ensuite s’appuyer sur une matrice pondérée. Une pondération possible pour un objectif de considération : 25 % qualité technique, 25 % visibilité et attention, 20 % contexte, 15 % coût par exposition utile, 15 % signaux business intermédiaires. Pour un objectif de conversion, la pondération peut donner plus de poids aux visites qualifiées, aux paniers, aux leads ou aux ventes incrémentales, mais sans abandonner les critères de qualité. Un CPA bas obtenu sur impressions peu visibles doit rester suspect.
Le coût par exposition utile devient l’indicateur pivot. Il peut être défini comme le coût pour mille impressions humaines, mesurables, visibles, brand safe et diffusées auprès de la cible. Si 1 million d’impressions coûtent 4 000 euros, mais que 80 % sont mesurables, 65 % visibles, 98 % non IVT, 90 % brand safe et 60 % dans la cible, le volume d’expositions utiles est environ 275 000. Le coût pour mille expositions utiles n’est donc pas 4 euros, mais 14,55 euros. Cette correction change radicalement l’arbitrage entre inventaires.
La validation consiste à challenger les gagnants. Un domaine ou une app peut obtenir un très bon score média sur une courte période, puis se dégrader lorsque le budget augmente. Il faut donc tester la scalabilité. Une poche supply capable de livrer 50 000 impressions de qualité ne peut pas forcément en livrer 5 millions sans dilution. La montée en charge doit être progressive, avec suivi du CPM marginal, de la visibilité marginale, de l’IVT marginal et de la fréquence.
Il est également utile de réserver une cellule de contrôle. Par exemple, 80 % du budget de test est alloué selon la matrice de qualité, 20 % reste en open auction plus large mais filtrée. Si la cellule optimisée améliore fortement la qualité média mais réduit trop le reach incrémental ou augmente excessivement le coût par visite qualifiée, le modèle doit être recalibré. Le but n’est pas d’obtenir l’inventaire le plus propre théoriquement, mais le meilleur compromis entre qualité, liquidité, coût et contribution.
Relier la qualité d’inventaire à la valeur business sans confondre attribution et causalité
La dernière étape, souvent la plus délicate, consiste à relier les résultats média aux résultats économiques. Un inventaire open auction peut générer un CPA attractif parce qu’il intervient tard dans le parcours, sur des utilisateurs déjà proches de la conversion. Le problème n’est pas que ces conversions soient fausses ; le problème est qu’elles ne sont pas nécessairement incrémentales. L’incrémentalité désigne la part de résultats qui n’aurait probablement pas eu lieu sans exposition publicitaire.
La première précaution consiste à distinguer conversions brutes, conversions qualifiées et conversions incrémentales. Les conversions brutes sont celles remontées par la plateforme. Les conversions qualifiées excluent, par exemple, les clients existants lorsque l’objectif est l’acquisition, les ventes annulées, les commandes à faible marge ou les doublons CRM. Les conversions incrémentales sont estimées via holdout, groupe non exposé servant de contrefactuel, geo-test, test d’uplift ou modélisation statistique.
Exemple : un test open auction génère 2 000 conversions attribuées pour 40 000 euros, soit un CPA apparent de 20 euros. Après qualification CRM, 1 300 conversions sont réellement nouvelles ou conformes à l’objectif. Le CPA qualifié passe à 30,77 euros. Un holdout estime que 45 % de ces conversions qualifiées sont incrémentales. Le CPA incrémental atteint alors 68,38 euros. Cette lecture peut sembler sévère, mais elle évite de scaler un inventaire qui capte surtout une demande déjà existante.
Pour les objectifs haut de funnel, les signaux business doivent être adaptés. On regardera plutôt le reach incrémental qualifié, la fréquence visible, les recherches marque, les visites directes, la mémorisation publicitaire, la considération ou les micro-conversions. Un inventaire peut ne pas générer de CPA compétitif à court terme mais améliorer la part de nouveaux visiteurs ou le taux de recherche marque dans les zones exposées. L’erreur serait de l’évaluer avec les mêmes critères qu’un retargeting bas de funnel.
La fenêtre d’attribution doit également être discutée. Une fenêtre post-view de 30 jours peut surcréditer l’open auction si la catégorie a un cycle d’achat court. À l’inverse, une fenêtre de 24 heures peut sous-estimer l’effet d’une campagne B2B ou automobile. La bonne pratique consiste à analyser plusieurs fenêtres : 1 jour, 7 jours, 14 jours, 30 jours, en observant comment la contribution varie. Si 80 % des conversions attribuées apparaissent entre le jour 15 et le jour 30 sur des audiences déjà chaudes, le signal doit être fortement pondéré.
Passer du test au pilotage : listes d’inclusion, exclusions, SPO et deals de qualité
Un test n’a de valeur que s’il produit des décisions d’achat. Les résultats doivent être traduits en quatre actions possibles : exclure, plafonner, maintenir en observation ou scaler. Exclure les sources non conformes ou à IVT élevé est la décision la plus simple. Plafonner les sources correctes mais instables permet de conserver de la liquidité sans leur donner trop de budget. Maintenir en observation les segments prometteurs mais insuffisamment volumétriques évite les conclusions prématurées. Scaler les inventaires de qualité suppose de suivre la dégradation marginale à mesure que la dépense augmente.
Les listes d’inclusion sont souvent plus efficaces que les blocklists infinies. Une blocklist retire les sources problématiques connues, mais laisse passer les nouvelles anomalies. Une inclusion list construit un périmètre positif de domaines, apps, sellers ou supply paths validés. En open auction, l’approche hybride est la plus réaliste : inclusion prioritaire pour les dépenses principales, open auction filtrée pour la découverte contrôlée, exclusions automatiques pour les risques avérés.
La SPO doit être intégrée à la boucle d’optimisation. Si un même éditeur est accessible via plusieurs SSP, il faut comparer les chemins sur CPM, vCPM, IVT, latence, taux de win, duplication et revenu éditeur lorsque l’information est disponible. Un chemin direct plus cher en CPM peut être plus efficient en exposition utile. À l’inverse, un reseller peut rester légitime s’il apporte une couverture incrémentale réelle ou une meilleure performance sur certains formats.
Lorsqu’une source open auction montre une qualité récurrente, elle peut être transformée en PMP, private marketplace, marché privé entre acheteurs et vendeurs sélectionnés, ou en deal ID. L’objectif n’est pas toujours de payer moins cher. Il peut être de sécuriser une priorité, une transparence de placement, un meilleur floor, un format spécifique ou des garanties de qualité. Le passage de l’open auction au deal doit être justifié par un gain mesurable : meilleure visibilité, moindre IVT, fréquence plus contrôlée, meilleur contexte ou contribution incrémentale supérieure.
Attention toutefois à ne pas tuer la fonction exploratoire de l’open auction. Un plan trop verrouillé sur une liste courte peut perdre en reach, en diversité contextuelle et en apprentissage algorithmique. Le bon modèle réserve une part du budget à l’exploration, par exemple 10 % à 20 %, avec des règles strictes de test et de sortie. L’open auction devient alors un laboratoire de découverte supply, pas un flux indifférencié.
Conclusion : industrialiser le test pour acheter moins d’impressions médiocres et plus d’expositions utiles
Tester la qualité d’un inventaire open auction exige une méthode plus exigeante que la lecture d’un CPM, d’un CTR, taux de clic, ou d’un CPA plateforme. L’enchère ouverte apporte de la liquidité, mais cette liquidité mélange des environnements premium, des sources acceptables, des placements faibles et des risques techniques. La maturité consiste à transformer cette hétérogénéité en avantage : identifier les poches performantes, les sécuriser, les scaler prudemment et exclure rapidement les zones destructrices de valeur.
Une feuille de route actionnable peut se résumer en huit décisions. Premièrement, isoler le périmètre du test par format, device, audience, objectif et SSP. Deuxièmement, imposer une taxonomie permettant d’analyser domaine, app, seller, schain, format, device et audience. Troisièmement, vérifier la conformité déclarative via ads.txt, app-ads.txt, sellers.json et SupplyChain Object. Quatrièmement, mesurer la qualité technique avec mesurabilité, viewability, IVT, latence et cohérence du bidstream. Cinquièmement, enrichir le diagnostic avec attention, encombrement, contexte et brand safety. Sixièmement, calculer le coût par exposition utile plutôt que le CPM brut. Septièmement, relier les segments supply à des signaux business qualifiés et, si possible, incrémentaux. Huitièmement, traduire les résultats en exclusions, plafonds, listes d’inclusion, SPO ou deals privés.
Le point critique est la discipline expérimentale. Un test open auction doit avoir des hypothèses, des seuils, une durée, un budget, des cellules comparables et une décision prévue avant le lancement. Sans ce cadre, l’optimisation devient opportuniste : on garde ce qui affiche le meilleur CPA court terme, même si la qualité est fragile, et on coupe des sources utiles parce que leur contribution est plus indirecte.
La qualité d’un inventaire ne se décrète pas ; elle se prouve par couches successives. Une impression doit être vendue par un chemin légitime, servie dans un contexte acceptable, rendue visible, reçue par un humain, toucher une audience pertinente, respecter une fréquence cohérente et contribuer à un objectif mesurable. L’open auction peut remplir ces conditions, mais rarement par défaut. C’est précisément pourquoi une méthode de test structurée devient un avantage compétitif pour les annonceurs : elle réduit la part de budget absorbée par des impressions simplement disponibles et augmente la part consacrée à des expositions réellement utiles.