Dimanche 4 octobre 2026 Newsletter Contact
DSP & SSP

Méthode pour comparer les algorithmes d’enchère DSP

Méthode pour comparer les algorithmes d’enchère DSP

Comparer un algorithme d’enchère, c’est tester une décision économique en temps réel


Un algorithme d’enchère DSP ne doit pas être évalué comme une simple fonctionnalité d’achat média. Dans un environnement RTB, real-time bidding, mécanisme d’enchères en temps réel permettant d’acheter une impression publicitaire au moment où elle devient disponible, l’algorithme décide en quelques millisecondes s’il faut enchérir, combien payer, sur quel inventaire, pour quel utilisateur, à quelle fréquence et avec quelle probabilité de contribution business. Le DSP, demand-side platform, plateforme utilisée par les annonceurs et agences pour acheter des impressions publicitaires de façon automatisée, devient donc un moteur d’allocation du capital média.

La difficulté vient du fait que deux algorithmes peuvent afficher le même CPA, coût par acquisition, c’est-à-dire le montant dépensé pour générer une conversion attribuée, tout en créant une valeur très différente. Le premier peut acheter des impressions incrémentales auprès de nouveaux prospects. Le second peut capter des conversions déjà probables sur des visiteurs récents, avec une attribution flatteuse mais une contribution réelle faible. De même, un algorithme peut améliorer le ROAS, return on ad spend, ratio entre chiffre d’affaires attribué et dépenses publicitaires, en comprimant les enchères sur des inventaires peu chers, mais dégrader la couverture utile, la qualité média ou la croissance à moyen terme.

Comparer des algorithmes d’enchère exige donc une méthode qui dépasse le reporting plateforme. Il faut isoler les effets de l’algorithme de ceux du ciblage, de la création, de la saisonnalité, de la pression concurrentielle, de la supply disponible, du pacing budgétaire et des fenêtres d’attribution. Sans protocole rigoureux, la comparaison devient une lecture biaisée de dashboards auto-attribués. Avec un protocole solide, elle permet de répondre à une question plus stratégique : quel modèle prend les meilleures décisions marginales pour l’objectif business réel de l’annonceur ?

La bonne comparaison ne cherche pas seulement à savoir quel DSP gagne le plus d’enchères ou réduit le plus le CPM, coût pour mille impressions. Elle doit mesurer la relation entre prix payé, probabilité d’exposition utile, qualité de l’audience, rôle dans le funnel, parcours allant de la notoriété à la considération puis à la conversion, et valeur incrémentale. C’est cette chaîne de preuve qui permet de distinguer un algorithme performant d’un algorithme simplement optimisé pour les métriques les plus faciles à revendiquer.

Définir l’objectif d’optimisation avant de lancer le test


La première erreur consiste à comparer des algorithmes sans clarifier ce qu’ils doivent optimiser. Un algorithme programmatique peut être orienté vers le CPA, le ROAS, la portée, la visibilité, la complétion vidéo, les visites qualifiées, le coût par nouveau client, la marge ou la valeur vie client. Ces objectifs ne sont pas équivalents. Un modèle optimisé au CPA privilégiera souvent les audiences chaudes et les inventaires proches de la conversion. Un modèle optimisé à la couverture cherchera davantage de reach, mais pourra accepter une performance directe plus faible. Un modèle optimisé à la marge doit intégrer des signaux produits, prix, promotions et statut client que beaucoup de plateformes ne reçoivent pas par défaut.

Il faut donc établir une hiérarchie d’objectifs. Pour une campagne d’acquisition e-commerce, le KPI principal peut être le coût par nouveau client rentable, et non le CPA global. Pour une campagne retail media offsite, le KPI peut être la marge incrémentale par catégorie, pondérée par les ruptures de stock. Pour une campagne vidéo de considération, l’objectif peut être le coût par exposition utile, combinant visibilité, durée visible, complétion et impact sur les recherches marque ou visites qualifiées. Comparer deux algorithmes sur un KPI mal aligné revient à récompenser le mauvais comportement.

La définition doit aussi préciser les contraintes non négociables. Un algorithme peut améliorer le CPA en achetant davantage d’inventaires long tail, mais augmenter le risque de brand safety, c’est-à-dire l’exposition de la marque à des contextes inadaptés ou nuisibles. Il peut réduire le CPM en diminuant la pression sur les inventaires premium, mais perdre des audiences stratégiques. Il peut maximiser le ROAS en retargeting, mais cannibaliser l’organique. Les critères de comparaison doivent donc inclure des garde-fous : taux d’IVT, invalid traffic, trafic invalide généré par bots ou comportements non humains, seuils de viewability, couverture minimale, fréquence maximale, part de nouveaux clients, qualité des conversions et conformité aux exclusions CRM.

Une matrice simple peut cadrer l’évaluation. En colonne : objectifs business, KPI média, KPI qualité, KPI audience, KPI incrémentalité. En ligne : chaque algorithme testé. Pour chaque cellule, il faut préciser la source de données, la fenêtre d’analyse et le niveau de confiance. Par exemple, le CPA peut venir du data warehouse annonceur à J+30, la visibilité d’un outil tiers, la marge de l’ERP, les nouveaux clients du CRM, et l’incrémentalité d’un holdout, groupe volontairement non exposé servant de contrefactuel. Cette clarification évite que le vainqueur soit simplement celui dont la plateforme mesure le plus généreusement.

Construire un protocole expérimental comparable, pas seulement deux campagnes en parallèle


Comparer deux algorithmes nécessite de neutraliser autant que possible les facteurs externes. Lancer deux campagnes similaires dans deux DSP différents, à deux périodes différentes ou sur des inventaires partiellement distincts, ne suffit pas. Les écarts peuvent venir de la saisonnalité, de la pression concurrentielle, d’une promotion, d’un changement de création, d’une disponibilité produit ou d’une différence de supply path. Le protocole doit donc chercher à créer des conditions d’exposition comparables.

Le design le plus robuste est un test randomisé au niveau utilisateur ou audience lorsque les identifiants le permettent. Une population éligible est divisée aléatoirement en deux groupes : algorithme A et algorithme B. Les deux groupes reçoivent les mêmes créations, les mêmes règles d’exclusion, les mêmes objectifs, des budgets proportionnels et une période identique. L’aléa réduit le risque que l’un des algorithmes bénéficie d’une audience naturellement plus intentionniste. Dans les environnements où la randomisation utilisateur est impossible, un geo-test peut être utilisé : zones comparables assignées à chaque algorithme, avec contrôle des historiques de vente, de média, de distribution et de concurrence.

Le split d’inventaire doit être surveillé avec attention. Si l’algorithme A a accès à des deals privés premium et l’algorithme B uniquement à l’open auction, marché ouvert programmatique accessible via enchères, la comparaison mesure autant la qualité de la supply que la qualité du modèle d’enchère. À l’inverse, imposer exactement les mêmes listes d’éditeurs peut réduire artificiellement l’avantage d’un DSP dont la force réside dans la découverte efficace de poches d’inventaire performantes. La bonne pratique consiste à définir un socle commun obligatoire, puis une zone d’exploration encadrée, avec reporting séparé.

La durée du test doit couvrir la phase d’apprentissage. Beaucoup d’algorithmes ont besoin de volume pour stabiliser leurs prédictions. Un test arrêté après trois jours peut favoriser le modèle le plus agressif en début de campagne, sans refléter sa performance à maturité. À l’inverse, un test trop long peut être contaminé par des changements de marché. En pratique, un minimum de 2 à 4 semaines est souvent nécessaire pour des campagnes e-commerce à volume significatif ; en B2B ou sur des cycles longs, l’évaluation business peut nécessiter 60 à 120 jours. Le protocole doit distinguer phase de learning, phase de stabilisation et phase de mesure principale.

La puissance statistique est un point trop souvent ignoré. Si chaque bras de test ne génère que 80 conversions, un écart de CPA de 12 % peut relever du bruit. Il faut estimer avant le lancement le volume minimal nécessaire pour détecter un effet pertinent. Par exemple, si l’objectif est de prouver une réduction de CPA de 10 % avec un niveau de confiance élevé, le test devra souvent réunir plusieurs centaines, voire plusieurs milliers de conversions selon la variance observée. À défaut, la conclusion doit rester prudente : signal directionnel, pas preuve robuste.

Analyser la mécanique d’enchère : bid rate, win rate, clearing price et pacing


La performance finale ne suffit pas. Pour comprendre pourquoi un algorithme gagne ou perd, il faut auditer sa mécanique d’achat. Le bid rate mesure la part des opportunités sur lesquelles le DSP décide d’enchérir. La win rate mesure la part des enchères remportées. Le clearing price correspond au prix effectivement nécessaire pour gagner une impression comparable. Le pacing désigne la façon dont le budget est dépensé dans le temps pour respecter les objectifs de livraison. Ces indicateurs révèlent la stratégie implicite du modèle.

Un algorithme avec un bid rate faible et une win rate élevée peut être très sélectif : il enchérira uniquement lorsque la probabilité de valeur est forte. Cela peut améliorer le CPA, mais limiter la couverture. Un algorithme avec un bid rate élevé et une win rate faible explore davantage, mais peut gaspiller des requêtes ou payer cher des impressions peu différenciantes. Un modèle qui dépense trop tôt dans la journée peut manquer des opportunités en soirée ; un modèle trop conservateur peut sous-livrer et augmenter les enchères en fin de campagne pour rattraper le budget, ce qui dégrade l’efficience.

Le bid shading doit aussi être intégré à l’analyse. Le bid shading désigne les techniques utilisées pour réduire le prix effectivement enchéri dans les enchères au premier prix sans perdre l’impression. Deux algorithmes peuvent prédire la même valeur d’impression, mais payer des prix très différents selon leur capacité à estimer le clearing price. Un modèle qui économise 15 % de CPM sans perte de qualité ni de reach crée une valeur média immédiate. Mais si cette économie se fait au prix d’une chute de 25 % de visibilité ou d’un déplacement vers des supply paths plus opaques, le gain est illusoire.

L’analyse doit descendre au niveau log-level lorsque possible, c’est-à-dire aux données événementielles par bid request, enchère, impression, clic ou conversion. Les agrégats masquent les arbitrages. Il faut comparer les distributions de CPM, pas seulement les moyennes ; les percentiles de win rate, pas seulement le taux global ; les chemins d’approvisionnement, SSP, supply-side platforms, plateformes permettant aux éditeurs de vendre leur inventaire, sellers directs ou resellers ; les environnements web, app, CTV ou retail offsite ; les formats et tailles d’emplacement. Un algorithme performant doit être capable de payer plus pour une impression rare et utile, et beaucoup moins pour une impression substituable.

Exemple : deux algorithmes dépensent chacun 100 000 euros. L’algorithme A affiche un CPM moyen de 4,20 euros et une viewability de 52 %. L’algorithme B affiche un CPM de 5,60 euros et une viewability de 74 %. Le vCPM, coût pour mille impressions visibles, est donc de 8,08 euros pour A et 7,57 euros pour B. L’inventaire apparemment plus cher est en réalité plus efficient sur exposition visible. Si B génère en plus une fréquence mieux distribuée et moins d’IVT, son avantage média est plus net que ne le suggère le CPM brut.

Mesurer la valeur business : attribution, déduplication et incrémentalité


L’attribution désigne la méthode qui assigne une conversion à un ou plusieurs points de contact marketing. Elle est indispensable pour piloter les algorithmes, mais elle ne prouve pas la causalité. Un algorithme peut paraître supérieur parce qu’il se positionne sur les derniers contacts avant achat, bénéficie d’une fenêtre post-view large ou revendique des conversions déjà attribuées par d’autres canaux. La comparaison doit donc distinguer conversion plateforme, conversion dédupliquée et conversion incrémentale.

La conversion plateforme est celle que le DSP ou son ad server revendique selon ses règles. La conversion dédupliquée est celle reconnue par la source de vérité annonceur, par exemple le data warehouse, le CRM ou le back-office transactionnel, après suppression des doublons entre plateformes. La conversion incrémentale est celle qui n’aurait probablement pas eu lieu sans exposition publicitaire. C’est ce dernier niveau qui doit orienter les décisions budgétaires importantes.

Un exemple chiffré illustre le risque. Deux algorithmes revendiquent 5 000 conversions pour 150 000 euros dépensés, soit un CPA apparent de 30 euros. Après déduplication, l’algorithme A conserve 3 800 conversions et l’algorithme B 3 200. À première vue, A reste meilleur. Mais un holdout montre que 25 % des conversions de A sont incrémentales contre 45 % pour B. Les conversions incrémentales sont donc 950 pour A et 1 440 pour B. Le CPA incrémental devient 158 euros pour A et 104 euros pour B. La hiérarchie s’inverse complètement.

La valeur doit aussi être pondérée par la marge et le statut client. Un algorithme qui génère beaucoup de réachats auprès de clients actifs peut afficher un excellent ROAS, mais créer peu de croissance. Un autre qui recrute des nouveaux clients à CPA plus élevé peut être préférable si la LTV, lifetime value, valeur économique attendue d’un client sur sa durée de relation avec la marque, est supérieure. Pour un annonceur à marge variable, la comparaison doit idéalement utiliser le profit incrémental plutôt que le chiffre d’affaires attribué. Une vente de 120 euros à 8 % de marge ne vaut pas une vente de 90 euros à 35 % de marge.

Les fenêtres temporelles sont également décisives. Un algorithme de retargeting peut produire des conversions en quelques heures. Un algorithme de prospection qualifiée peut influencer des recherches marque, des visites directes et des ventes sur plusieurs semaines. Comparer les deux à J+3 favorisera mécaniquement le bas de funnel. Une méthode robuste prévoit plusieurs lectures : performance immédiate à J+7 pour vérifier tracking et efficacité courte, performance consolidée à J+30 ou J+45, performance business à J+90 lorsque le cycle de décision l’exige. Le vainqueur n’est pas toujours le même selon l’horizon.

Contrôler les biais : audience chaude, cannibalisation, qualité média et effet boîte noire


Les algorithmes d’enchère optimisent ce qu’on leur donne à optimiser. Si le signal de conversion est biaisé, le modèle amplifie le biais. Le cas le plus classique est la survalorisation des audiences chaudes : visiteurs récents, paniers abandonnés, clients actifs, requêtes marque ou segments CRM fortement intentionnistes. Ces profils convertissent mieux, mais leur incrémentalité peut être limitée. Un algorithme très performant au CPA peut donc être surtout très compétent pour racheter une demande déjà existante.

La cannibalisation doit être mesurée explicitement. Si l’algorithme augmente les conversions attribuées sans augmenter les ventes totales, il déplace probablement du crédit depuis l’organique, l’email, le search marque ou le direct. Les courbes temporelles sont utiles : pression média, ventes totales, ventes nouveaux clients, visites directes, requêtes marque, ajouts panier, activité CRM. Un test de réduction de pression sur une audience chaude peut révéler que 60 % à 80 % des conversions attribuées se maintiennent sans exposition, selon les secteurs et la maturité de marque.

La qualité média est un autre biais majeur. Un modèle peut améliorer le CPA en achetant des impressions moins visibles mais proches de profils convertisseurs. Si l’attribution crédite des impressions post-view faiblement visibles, l’algorithme apprend que ces inventaires sont efficaces. Il faut donc conditionner les signaux d’apprentissage à des critères de qualité : impression mesurable, visible, non frauduleuse, fréquence acceptable, contexte adapté. Pour la vidéo, une impression visible deux secondes ne doit pas recevoir le même poids qu’une vidéo vue à 75 % dans un player de grande taille et un environnement éditorial pertinent.

L’effet boîte noire impose une gouvernance spécifique. Les DSP ne révèlent pas toujours les variables exactes utilisées par leurs modèles : scores de propension, historiques de prix, signaux contextuels, probabilités de visibilité, modèles de conversion, règles de bid shading. Cette opacité n’empêche pas la comparaison, mais elle impose de mesurer les sorties et les comportements observables. On ne peut pas auditer chaque coefficient interne ; on peut auditer les décisions prises : où l’algorithme achète, qui il touche, à quel prix, avec quelle fréquence, sur quels sellers, dans quels contextes, et avec quelle contribution incrémentale.

Il faut enfin surveiller les effets de bord. Un algorithme optimisé au ROAS peut réduire trop fortement la prospection et assécher le haut de funnel. Un modèle optimisé à la couverture peut augmenter la répétition sur des environnements peu qualitatifs si la déduplication cross-device est faible. Un algorithme très agressif en enchère peut gagner les meilleures impressions mais créer une inflation marginale non soutenable. La bonne comparaison doit donc intégrer la performance actuelle et la soutenabilité du modèle au prochain plan média.

Construire une scorecard de décision pour arbitrer entre les modèles


Une comparaison utile doit se terminer par une scorecard actionnable, pas par un classement simpliste. La scorecard permet de pondérer les dimensions selon le rôle du canal et la stratégie annonceur. Pour une campagne de conquête, la part de nouveaux clients, la couverture incrémentale et la marge à long terme peuvent peser davantage que le CPA immédiat. Pour une campagne d’écoulement promotionnel, le ROAS court terme et la disponibilité produit peuvent être prioritaires. Pour une campagne vidéo, le coût par exposition utile et le lift de considération peuvent primer sur le clic.

Une grille opérationnelle peut inclure sept blocs :


  1. Performance économique : CPA dédupliqué, ROAS net, marge, coût par nouveau client, valeur vie client estimée.
  2. Incrémentalité : résultats holdout, geo-test, conversion lift ou hypothèse pondérée selon les preuves disponibles.
  3. Qualité média : viewability, vCPM, IVT, brand safety, taux de complétion, attention proxy, qualité des environnements.
  4. Efficience d’enchère : bid rate, win rate, clearing price, bid shading, pacing, coût marginal de gain.
  5. Qualité audience : reach utile, fréquence visible, part de prospects froids, nouveaux clients, exclusions CRM respectées.
  6. Transparence supply : part de sellers directs, SSP, deals, duplication des chemins, cohérence ads.txt et sellers.json.
  7. Robustesse opérationnelle : stabilité, apprentissage, reporting, capacité d’intégration des signaux first-party, gouvernance et support.

Chaque bloc doit recevoir un score, mais aussi un niveau de confiance. Une amélioration de CPA observée sur 4 000 conversions dédupliquées a plus de poids qu’un gain de ROAS observé sur un échantillon faible. Un résultat incrémental issu d’un holdout propre est plus solide qu’une hypothèse issue d’un modèle d’attribution propriétaire. À l’inverse, un signal faible mais cohérent sur plusieurs campagnes peut justifier un test élargi. La décision ne doit pas être binaire ; elle peut recommander d’utiliser un algorithme pour la prospection, un autre pour le retargeting, un troisième pour la vidéo premium ou le retail offsite.

La restitution doit formuler des arbitrages précis. Par exemple : maintenir l’algorithme B sur les audiences de prospection car son CPA incrémental est inférieur de 18 % malgré un CPM brut supérieur ; limiter l’algorithme A au retargeting panier avec un plafond de fréquence de 4 impressions visibles sur 7 jours ; exclure les SSP dont le vCPM dépasse de 30 % la moyenne sans contribution additionnelle ; transmettre au DSP un signal de valeur pondéré par marge et nouveau client ; relancer un test à J+60 sur la LTV des cohortes recrutées.

Conclusion : comparer moins de promesses algorithmiques, davantage de décisions observables


Comparer les algorithmes d’enchère DSP ne consiste pas à élire la plateforme qui affiche le meilleur dashboard. C’est une démarche d’expérimentation contrôlée visant à comprendre quel modèle transforme le budget média en valeur business réelle. La méthode repose sur une chaîne logique : définir l’objectif, isoler les conditions de test, analyser la mécanique d’enchère, corriger l’attribution, mesurer l’incrémentalité, contrôler les biais et traduire les résultats en règles d’allocation.

Une feuille de route actionnable tient en huit décisions. Premièrement, choisir un KPI principal aligné sur l’économie de l’annonceur, pas seulement sur le reporting média. Deuxièmement, créer un protocole comparable : mêmes créations, mêmes périodes, mêmes exclusions, budgets équilibrés et groupes aussi aléatoires que possible. Troisièmement, distinguer phase d’apprentissage et phase de mesure. Quatrièmement, auditer les logs d’enchère : bid rate, win rate, clearing price, supply path, pacing et bid shading. Cinquièmement, calculer les coûts effectifs : vCPM, coût par exposition utile, CPA dédupliqué et profit incrémental. Sixièmement, tester ou estimer l’incrémentalité au lieu de se contenter des conversions attribuées. Septièmement, surveiller les effets de bord : cannibalisation, fréquence excessive, perte de reach, brand safety et surconcentration bas de funnel. Huitièmement, documenter les apprentissages pour alimenter les prochains briefs DSP.

La maturité ne se mesure pas à la sophistication déclarée d’un algorithme, mais à la qualité des décisions qu’il prend sous contrainte : quand enchérir, quand s’abstenir, combien payer, quelle audience privilégier, quel inventaire éviter et quelle valeur reconnaître à une conversion. Pour les professionnels du marketing, l’enjeu est de reprendre la maîtrise de cette décision économique. Les algorithmes peuvent optimiser à grande vitesse ; encore faut-il leur donner le bon objectif, les bons signaux et un cadre d’évaluation capable de distinguer la performance attribuée de la valeur réellement créée.

Sur le même sujet
adtechmag.fr