Méthodologie

Cette page documente comment les chiffres du site sont produits et, plus utilement, où ils sont fragiles. Elle est écrite pour qu'on puisse confronter n'importe quelle page du site à ce qui est annoncé ici.

Ce que couvrent les données

Les résultats utilisés sur le site proviennent d'informations publiquement accessibles concernant les compétitions HYROX. Ces informations sont retravaillées et consolidées pour produire les profils, classements et statistiques présentés ici. Rien n'est inventé, estimé ni comblé : une valeur indisponible reste vide plutôt qu'approchée.

Les faits bruts — un temps, un rang, une date, un lieu — ne sont pas notre création. Ce que nous construisons, c'est la consolidation : rattacher un résultat à une personne, une personne à une carrière, et une carrière à une population comparable.

Comment un résultat est rattaché à un athlète

C'est la partie la plus difficile du travail, et celle qui produit l'essentiel des erreurs que nous corrigeons.

Une participation n'est pas une identité

Chaque engagement en course porte un identifiant propre à une participation, pas à une personne. Il est assez stable pour dédoublonner des résultats, mais il est partagé par les deux membres d'un duo et ne suffit jamais, à lui seul, à affirmer que deux engagements appartiennent au même être humain.

Les homonymes

Deux personnes différentes portant le même nom peuvent se retrouver fusionnées en un seul profil. Quand cela arrive, nous les séparons par une décision persistante et relue, jamais par une heuristique — une heuristique qui scinderait des carrières automatiquement casserait plus de profils qu'elle n'en réparerait. L'autorité sur l'identité d'un athlète, c'est la déclaration de l'athlète, pas un score de ressemblance.

Les doublons

Une même performance peut apparaître plusieurs fois lorsqu'un événement est republié sous un autre identifiant. Un détecteur repère les engagements qui partagent un identifiant de participation d'un événement à l'autre, et les doublons confirmés sont supprimés.

À quelle fréquence les données sont rafraîchies

Les résultats sont collectés au fur et à mesure que les épreuves les publient, et les statistiques agrégées sont recalculées quotidiennement. Les sitemaps sont régénérés chaque jour. Les pages éditoriales portent une date de dernière révision visible, dérivée de l'historique réel de modification de la page et non du jour où vous la consultez — une date qui change tous les jours est du bruit, pas de la fraîcheur.

Comment les prédictions sont produites, et où elles sont faibles

Les outils de prédiction estiment un temps final à partir de l'historique propre à l'athlète. Ce ne sont explicitement pas des classements, et ils portent leur incertitude au lieu de la masquer.

Ce qui rend une prédiction fiable

  • Des courses solo récentes dans la catégorie visée. L'historique solo est le seul signal propre de la performance individuelle.
  • Pour une équipe, des courses que le même binôme a déjà faites ensemble — une allure de course commune connue et une répartition rodée des stations valent mieux que deux bons profils individuels.

Ce qui la rend peu fiable, et qui est signalé comme tel

  • Aucun historique dans la catégorie visée. Prédire une course Pro à partir d'un historique Open revient à supposer comment un athlète encaisse des charges plus lourdes.
  • Les temps de course issus des doubles. L'allure d'un duo est celle du plus lent des deux : elle dit peu de chose de chacun pris séparément, et n'est jamais utilisée pour estimer une allure individuelle.
  • Les runs 1 et 8 ne font pas exactement un kilomètre — la configuration des salles répartit la distance entre les deux — ce qui en fait les deux segments les moins prévisibles de la course.
  • Des données anciennes. Une course d'il y a plus d'un ou deux ans décrit un autre athlète.

Chaque prédiction expose un indice de confiance, un niveau de fiabilité et les raisons précises pour lesquelles elle peut se tromper. Quand les données manquent, l'outil le dit au lieu de produire un chiffre d'apparence assurée.

Ce que nous ne faisons pas

  • Nous ne publions ni temps, ni rang, ni statistique que nous ne puissions rattacher à un résultat enregistré.
  • Nous ne vendons pas de position. Aucune salle, aucun coach, aucun athlète ne peut payer pour mieux se classer, apparaître plus souvent ou faire modifier un chiffre.
  • Nous ne touchons de commission sur rien de ce que vous achetez, et nous ne laissons pas une relation commerciale modifier un contenu éditorial. Lorsqu'un encart partenaire apparaît dans un article, il est identifié et déclaré comme sponsorisé, et le conseil qui l'entoure est écrit sans référence à lui.
  • Nous ne présentons pas les conseils d'entraînement ou de nutrition comme un avis médical, et nous le disons sur les pages concernées.

Quand quelque chose est faux

À cette échelle, une base de données est fausse quelque part, toujours. Une course manquante, un homonyme fusionné, une salle fermée, un résultat attribué à la mauvaise personne : ces cas nous sont signalés régulièrement et sont corrigés.

Comment signaler une erreur