Buddlea · observatoire du web dormant

Un robot est peut-être passé sur votre site

Cette page dit qui nous sommes, ce que nous relevons, ce que nous ne faisons jamais, et comment nous demander de ne plus venir. La demande est prise en compte sans discussion et sans délai de réflexion.

Qui nous sommes

Buddlea est un projet mené par trois personnes en France. Nous mesurons l'âge du web public français, en commençant par les sites des communes. L'objectif est de publier un état des lieux chiffré et une méthode que n'importe qui peut critiquer et refaire.

Nous ne constituons aucun fichier de prospection à partir de ce que le robot relève. Il peut arriver que nous écrivions à une collectivité au sujet de son propre site, pour lui signaler ce que nous avons remarqué ou pour lui proposer un service. Nous reprenons alors l'adresse publiée par l'annuaire de l'administration, et un refus met fin à l'échange.

Ce que notre robot relève

Rien d'autre. Nous ne relevons ni le contenu des formulaires, ni les images, ni les documents.

Ce que nous ne faisons jamais

Ces cinq règles ne souffrent pas d'exception, y compris à la demande d'un client.

Comment reconnaître notre robot

Il s'annonce dans chaque requête avec cet identifiant, qui pointe vers la page que vous lisez.

buddlea-crawler/0.1 (+https://buddlea.com/)

Il envoie au plus une requête par seconde et par site, il respecte votre robots.txt ainsi que le délai qu'il demande, et il s'arrête dès qu'un serveur répond qu'il est surchargé.

Comment nous demander de ne plus venir

Deux moyens, les deux également valables.

Par votre fichier robots.txt, en ajoutant ces deux lignes. Le robot le relit à chaque passage.

User-agent: buddlea-crawler
Disallow: /

Ou par un message, en indiquant simplement l'adresse de votre site. Nous répondons sous quarante-huit heures ouvrées et le retrait est effectif sous sept jours, y compris pour les relevés déjà faits.

contact@buddlea.com

Ce que nous publions, et ce que nous ne publions pas

Nos publications sont des statistiques par territoire. Nous publions par exemple la part des communes d'un département dont le site n'a pas changé depuis cinq ans, jamais un classement nominatif des sites en mauvais état.

Si un relevé montre qu'un site présente un risque pour son propriétaire, nous le lui signalons en privé et avant toute publication. Le risque d'une commune ne se découvre pas dans un classement.

Les données personnelles

Les pages que nous relevons peuvent contenir des données personnelles, par exemple le nom d'un élu ou une adresse de mairie. Nous ne les extrayons pas et nous ne les republions pas. Le relevé sert à dater un contenu, pas à décrire des personnes.

Pour rattacher un site à une commune, nous utilisons des données ouvertes publiées par l'administration, et l'adresse de courriel qui y figure sert uniquement à déduire le nom de domaine, puis elle est supprimée de nos fichiers.

La base légale de ce traitement est l'intérêt légitime à produire une information publique chiffrée sur l'état du web des collectivités. Vous pouvez demander l'accès, la rectification, l'effacement ou l'opposition en écrivant à l'adresse ci-dessus.

Combien de temps nous gardons ce que nous relevons

La capture d'une page est conservée douze mois, le temps de mesurer l'erreur de notre datation et de permettre à quiconque de refaire le calcul. Passé ce délai elle est supprimée, et seules subsistent les mesures qui en sont tirées : une date, un intervalle de confiance, un poids de page. Ces mesures ne décrivent aucune personne.

Une demande de retrait efface la capture et les mesures, sans attendre les douze mois.

Les sources ouvertes que nous utilisons