Cinq planches pour retrouver un cartel de travaux publics dans une base de 5 000 entreprises soumissionnaires
Le problème posé
Une autorité de régulation de la concurrence soupçonne l'existence d'ententes sur les appels d'offres publics
du secteur des travaux publics. Pour les détecter, elle dispose d'une base historique de
5 000 entreprises soumissionnaires. Que peut-elle en faire ?
Une entente sur appel d'offres ne laisse aucune trace visible : elle produit exactement ce que l'on
attend d'un marché sain — plusieurs offres, déposées dans les délais, formellement irréprochables. Le
soupçon ne peut donc pas naître de l'observation d'une offre isolée. Il ne peut naître que de la
forme de la distribution des offres, qui, elle, trahit le mécanisme qui les a produites.
Toute la difficulté tient à ceci : l'autorité ne sait pas quelles entreprises sont coupables. Elle ne
peut donc pas « apprendre » sur des exemples étiquetés. Elle doit construire des indicateurs — les
screens — dont la théorie économique prédit le comportement sous entente, les mesurer sur les
5 000 entreprises, puis classer.
Pour que l'on puisse juger ces indicateurs, cette page fabrique elle-même la base : appels d'offres,
coûts, marges, et une entente cachée dont elle connaît la composition exacte. Chaque détecteur est donc
noté sur une vérité connue — ce qu'aucune autorité ne peut faire sur ses données réelles. Tous les
nombres affichés sont recalculés à chaque réglage ; aucun n'est écrit d'avance.
Planche 1
La base, et ce qu'on y cherche
5 000 entreprises réparties sur douze départements déposent des offres sur 4 000 appels d'offres.
Chaque entreprise a son efficacité propre, sa marge habituelle et son appétit pour les marchés ; l'offre
qu'elle dépose est son coût majoré de sa marge, avec l'aléa du chiffrage. Dans trois départements, un
groupe d'entreprises s'est entendu. Il procède de deux façons, celles qu'on observe dans les affaires réelles :
Offres de couverture — le membre désigné dépose une offre chère ; les autres déposent des offres
fabriquées à partir de la sienne, un peu plus hautes, uniquement pour donner l'apparence de la concurrence. Répartition tournante — la désignation revient à celui qui a le moins gagné, de sorte que chacun
reçoive sa part sur la durée.
Nombre d'appels d'offres par département.
—entreprises
—appels d'offres
—offres déposées
—entreprises actives (≥ 6 offres)
—membres de l'entente
—marchés captés
—surprix mesuré
—préjudice pour l'acheteur
Le marché affiché : chaque barre est une offre, la plus basse l'emporte.
Le trait pointillé est l'estimation du maître d'ouvrage.
Planche 2
Les indicateurs de dispersion
Sous concurrence, les offres sont des chiffrages indépendants : elles se dispersent autant que les
coûts et les erreurs d'estimation. Sous entente, les offres de couverture sont calculées à partir
d'une seule offre : la dispersion s'effondre, et la distribution se déforme d'une manière très reconnaissable.
Le coefficient de variation mesure la dispersion relative de l'ensemble des offres. La
distance relative compare l'écart entre la meilleure et la deuxième offre à la dispersion des
offres perdantes entre elles : sous couverture, le désigné se détache nettement d'un peloton
anormalement serré. On y ajoute le kurtosis, l'asymétrie et le taux d'offres arrondies.
Courbe ROC : sensibilité en fonction du taux de fausse alerte, quand on
déplace le seuil. L'aire sous cette courbe (AUC) résume le pouvoir séparateur ;
0,5 = tirage à pile ou face, 1 = séparation parfaite.
—AUC de l'indicateur
—moyenne, marchés concurrentiels
—moyenne, marchés captés
—sensibilité au seuil
—spécificité au seuil
—valeur prédictive positive
Planche 3
Ce que disent les chiffres eux-mêmes
La loi de Benford est l'outil vedette de la détection de fraude : dans une population de nombres
couvrant plusieurs ordres de grandeur, le premier chiffre significatif vaut 1 dans 30,1 % des cas et
9 dans 4,6 % seulement. Un écart à cette loi passe pour une signature de manipulation. On va voir
qu'ici, elle ne sert à rien — et comprendre pourquoi.
P(premier chiffre = d) = log₁₀(1 + 1/d)
Part des offres dont le montant est un multiple exact de la somme indiquée.
Comparaison entre les marchés signalés par le score composite et les autres — une comparaison
que l'autorité peut faire sans connaître la vérité.
—χ² de Benford
—valeur critique à 5 % (8 ddl)
—écart maximal à Benford
—multiples de 1 000 €, marchés sains
—multiples de 1 000 €, marchés captés
—AUC du taux d'arrondi
Planche 4
Qui rencontre qui, et qui gagne quoi
Les planches précédentes notent des marchés. L'autorité, elle, doit désigner des
entreprises. Deux traces s'y prêtent. D'abord les rencontres : deux membres d'une entente se
retrouvent bien plus souvent qu'un tirage au sort ne le prévoirait. Si l'entreprise i a déposé
ki offres sur T marchés, on attend kikj/T rencontres
avec j ; le rapport de l'observé à l'attendu est le coefficient de rencontre.
lift(i, j) = cij ⁄ (ki kj / T)
Ensuite les parts de marché. La concurrence, qui récompense l'efficacité, les rend très inégales.
La répartition tournante, elle, les égalise — anomalie d'autant plus visible qu'elle est le contraire
de ce qu'on attend d'un marché sain.
Graphe des co-soumissions entre les entreprises les mieux classées. Les couleurs
distinguent les composantes connexes ; un cercle rouge marque, après révélation, les vrais membres.
—AUC au niveau entreprise
—précision sur les 20 premières
—précision sur les 50 premières
—composantes trouvées
—Herfindahl des parts observées
—Herfindahl contrefactuel
Les vingt premières du classement
Planche 5 — signature
Ce que le classement ne prouve pas
Un bon classement n'est pas une accusation. Trois obstacles séparent le score de la preuve, et
chacun se mesure.
Précision et rappel selon le nombre d'entreprises convoquées.
Les entreprises actives, rangées par score décroissant, ligne par ligne.
—prévalence dans la base
—précision
—rappel
—entreprises innocentes visées
Histogramme des p-valeurs des 4 000 marchés. Sous concurrence pure, il serait plat.
Procédure de Benjamini-Hochberg : p-valeurs triées contre la droite q·i/n.
—signalements à 5 % sans correction
—dont fausses alertes
—signalements après Benjamini-Hochberg
—taux réel de fausses découvertes
—rappel
—dispersion de référence σ₀
Un cartel qui apprend qu'on le dépiste peut réagir : il suffit de disperser davantage les offres de
couverture pour relever le coefficient de variation. Mais cette dispersion a un prix, et ce prix est
exactement ce qui fait tenir l'entente.
Pouvoir de détection et taux d'accident en fonction de l'ampleur du camouflage.
—CV moyen des marchés captés
—AUC du score composite
—couvertures gagnantes par accident
—marchés perdus par le désigné
La solution du problème
Voici la procédure que l'autorité doit appliquer à sa base de 5 000 entreprises, dans l'ordre, avec
les résultats que la page vient de mesurer sur la base simulée.
Reconstituer la base au bon niveau. Il ne faut pas une table d'entreprises mais une table
d'offres : un enregistrement par couple (marché, soumissionnaire), avec le montant, la date,
l'objet, le lot, le département, l'estimation du maître d'ouvrage et l'identité du gagnant. Sans les
offres perdantes, aucun des indicateurs qui suivent n'existe. C'est le point de blocage réel de la
plupart des autorités.
Calculer les indicateurs de dispersion marché par marché. Coefficient de variation, distance
relative, kurtosis, asymétrie, étendue. Sur la base simulée, le CV passe de
— en concurrence à — sous
entente, et sépare seul les marchés avec une AUC de —. À retenir :
l'écart brut entre la première et la deuxième offre, indicateur qui vient naturellement à l'esprit,
ne vaut rien (AUC —) ; c'est son rapport à la dispersion des
perdantes qui devient un excellent détecteur (AUC —).
Examiner les chiffres terminaux, pas les premiers. Le test de Benford est ici sans objet :
une entente ne fabrique pas l'ordre de grandeur des offres, qui reste dicté par le coût réel des
travaux. Ce qu'elle fabrique, ce sont les derniers chiffres — une couverture se calcule et s'arrondit.
Part d'offres multiples de 1 000 € : — sur les marchés sains contre
— sur les marchés captés.
Passer du marché à l'entreprise par le graphe. Agréger les scores de marché sur chaque
soumissionnaire, y joindre son taux d'arrondi et son coefficient de rencontre maximal, puis chercher
les composantes connexes du graphe des rencontres anormales. Sur la base simulée, le graphe fait
apparaître —, et le classement des entreprises atteint une AUC de
—, avec — de justes sur les
cinquante premières.
Confronter les parts de marché à un contrefactuel. Dans le groupe détecté, l'indice de
Herfindahl des victoires vaut —, à comparer à
— pour une répartition parfaitement égale et à
— si ces mêmes entreprises s'étaient affrontées sur ces mêmes
marchés. Des parts trop égales sont aussi suspectes que des prix trop proches.
Contrôler le taux de fausses découvertes, pas le seuil de signification. Sur 4 000 marchés
testés à 5 %, on obtient mécaniquement des centaines de fausses alertes. La procédure de
Benjamini-Hochberg à — ramène le taux réel de fausses découvertes à
—. C'est la différence entre une liste exploitable et une liste
ingérable.
Traiter le résultat comme une priorité d'enquête, jamais comme une preuve. Le score classe ;
il n'établit rien. La suite relève des pouvoirs d'enquête : demandes de renseignements, opérations de
visite et saisie, programme de clémence. La statistique sert à savoir où aller regarder, et à
justifier la mesure d'enquête devant le juge — pas à sanctionner.
L'effet le moins visible est le plus important. Même quand le dépistage n'aboutit à aucune
sanction, il agit : pour échapper à l'indicateur de dispersion, une entente doit relâcher ses offres de
couverture, donc renoncer à la certitude que le désigné l'emporte. Sur la base simulée, un camouflage
suffisant pour ramener l'AUC vers — fait perdre au désigné
— des marchés qu'il devait gagner. Le dépistage ne se contente
pas de détecter les ententes : il les rend coûteuses à tenir.