Comment reconnaître les accès de RivalEye
RivalEye ne lit que des pages accessibles publiquement et indique son nom à chaque accès ; le diagnostic concurrentiel respecte en plus le robots.txt. Voici quels accès existent, ce qu’ils lisent et comment bloquer le diagnostic.
1. Vérification du propriétaire
Lorsqu’un client confirme qu’un site web lui appartient, RivalEye ne lit que la page d’accueil et jusqu’à 4 sous-pages telles que les mentions légales, le contact ou « à propos » de ce site qui lui appartient, afin d’y trouver l’adresse e-mail publiée. S’agissant du propre site du client, cet accès ne tient pas compte du robots.txt. Il s’identifie ainsi :
RivalEye-Verify/1.0 (+https://rivaleye.pro/methodik.html)
2. Diagnostic concurrentiel gratuit
Dans le diagnostic concurrentiel gratuit, chacun saisit son propre site web et jusqu’à trois sites concurrents. RivalEye lit alors chaque site saisi au maximum une fois par diagnostic, automatiquement et selon des règles fixes. Sont lus au maximum :
- le robots.txt – de l’adresse saisie, de la même adresse avec ou sans « www. » et, si la page d’accueil redirige vers une autre adresse, également le robots.txt de cette adresse,
- la page d’accueil – si elle ne répond pas en https, à défaut via http:// ou avec/sans « www. »,
- un test vérifiant si l’adresse en http:// redirige vers https://,
- le llms.txt,
- le sitemap (celui indiqué dans le robots.txt, sinon sitemap.xml ou sitemap_index.xml) et, pour un index de sitemaps, jusqu’à 2 sous-sitemaps du même domaine.
Si la page d’accueil redirige vers une autre adresse (par exemple avec « www. »), nous lisons aussi si besoin le llms.txt, le sitemap et le test de redirection à cette adresse. Aucune sous-page, aucun formulaire, aucune connexion. Plusieurs accès à la même adresse au sein d’un même diagnostic sont regroupés.
Mise en cache : si le même site web est saisi peu après dans un autre diagnostic, nous réutilisons le résultat enregistré et ne le récupérons pas à nouveau – jusqu’à 6 heures en tant que concurrent, jusqu’à 10 minutes en tant que site propre. Le nombre de diagnostics par site web est en outre limité.
Délais : pour le robots.txt et la page d’accueil, nous attendons au maximum 7 secondes ; pour le llms.txt, le test de redirection et les sitemaps, au maximum 4 secondes ; pour un site web au total, au maximum 18 secondes. Si le llms.txt, le test de redirection ou le sitemap ne répondent pas à temps, nous les omettons ; le rapport indique alors « non déterminé » plutôt qu’une perte de points.
Conseil IA : après la confirmation du diagnostic, le Conseil IA de RivalEye rédige et vérifie les textes du rapport. Il travaille uniquement avec les données déjà mesurées et n’accède à aucun site web – il n’y a pas d’autre accès avec une identification différente.
Cet accès s’identifie ainsi :
Mozilla/5.0 (compatible; RivalEye-Check/1.0; +https://rivaleye.pro/bot.html)
Comment nous respectons le robots.txt
Le robots.txt est lu en premier et respecté avant tout autre accès – y compris à chaque redirection vers une autre adresse. Nous l’interprétons selon la norme RFC 9309 : le groupe User-agent: RivalEye-Check s’applique, sinon un groupe User-agent: RivalEye, sinon User-agent: * ; au sein du groupe, la règle la plus longue correspondant l’emporte, et en cas d’égalité, Allow gagne.
- Pas de robots.txt (erreur 4xx), inaccessible ou pas de réponse à temps : tout est alors considéré comme autorisé – comme le prévoit la norme.
- Erreur serveur (5xx) : par précaution, nous ne lisons alors rien de plus. En tant que concurrent, le site apparaît comme « illisible » ; en tant que site propre, il ne peut alors pas être diagnostiqué – parce que son robots.txt a signalé une erreur serveur, et non parce qu’il nous bloque.
- Robots.txt très long : nous lisons les 200 premiers Ko. Si le groupe qui nous concerne compte plus de 1 000 règles, nous le traitons comme un blocage complet.
Blocage via robots.txt :
User-agent: RivalEye-Check Disallow: /
Un groupe avec User-agent: RivalEye s’applique également. Si votre site est bloqué, le diagnostic n’en lit plus que le robots.txt : en tant que concurrent, il apparaît dans la comparaison comme « illisible » ; en tant que site propre, il ne peut pas être diagnostiqué. Les résultats déjà mis en cache (voir ci-dessus) expirent au plus tard après 6 heures.
3. Veille régulière dans l’abonnement
La veille régulière incluse dans l’abonnement recevra sa propre identification. Nous la publierons ici avec son user-agent et son jeton robots.txt avant sa première exécution.
4. Contact
Questions ou réclamations concernant nos accès : contact@semia-agent.de, +49 (0) 155 1038 9104 ou via la page de contact. Nous répondons sous un jour ouvré. Pour en savoir plus sur notre méthode : Méthodologie.