ALL SYSTEMS OPERATIONALUPTIME 99.97%FLEET 18/18IN-MUM · US-LAX · EU-FSN EST. 2003 · +91 11 4998 4038

SAVOIRS · TUTORIAUX

Robots.txt expliqué

Dernière mise à jour 2025-06-06

Robots.txt explique en un mot :

Robots.txt est un outil utile lorsqu'il est utilisé pour limiter l'accès des robots à votre site, comme le contenu dans le travail et les informations sensibles. Le Groupe de travail sur les normes d'exclusion des robots n'a pas approuvé à l'heure actuelle une directive autorisant les robots à indexer des portions de le site. Cela peut encore être initié en établissant un lien interne et externe avec votre site Web.

Vous avez peut-être remarqué lors de l'examen des statistiques d'utilisation de votre site une référence à un fichier nommé 'robots.txt'. C'est un fichier de configuration de base que les robots (araignées de moteur de recherche) utilisent pour noter quels fichiers et répertoires ils ne devraient pas indexer.

Il est important d'avoir un fichier appelé robots.txt dans la racine de votre site (http://www.yourdomain.com/robots.txt). L'utilisation de base des robots.txt est de noter quels fichiers et répertoires les robots ne doivent pas indexer.

Il y a 2 composants dans la syntaxe de la structure du fichier robots.txt : la ligne d'agent utilisateur et la ligne de refus.

La syntaxe est la suivante :

Agent utilisateur
A list of the robots visiting your site may be viewed in the stats logs of your website. A listing of user-agents may be viewed at http://www.robotstxt.org/wc/active.html

Un robot spécifique peut être référencé dans la syntaxe User-Agent.

Utilisateur-agent: Googlebot

Une carte joker peut également être utilisée pour correspondre à tous les fichiers robots.txt.

Agent utilisateur: *

Refuser
Cette section de la syntaxe indique quels fichiers et répertoires ne doivent pas être indexés.

Si vous avez une page nommée 'addresses.html' et que vous ne voulez pas que le robot l'indexe , ajouter la ligne suivante après la syntaxe User-agent :

Refuser : adresses.html

Vous pouvez également limiter le robot au niveau du répertoire. Si le répertoire '/facturation' de votre site Web doit être limité à l'indexation, placez le texte suivant après la syntaxe User-agent.

Refus: /facturation/

Une carte joker peut également être utilisée pour noter tous les fichiers sur un site.

Refuser: /

Comment faire des commentaires dans mon fichier robots.txt?
Les commentaires de codage peuvent être placés dans le fichier robots.txt en plaçant '#' avant tout texte. Un exemple est :

# spécifie googlebot comme l'agent utilisateur.
Utilisateur-agent: Googlebot

Il est de bonne pratique de faire figurer vos commentaires sur une ligne distincte que la Directive. Aussi, limitez l'espace blanc au début des lignes directrices.


Mettre en place robots.txt à utiliser:
Maintenant que nous connaissons la fonctionnalité de robots.txt, mettons-le à l'entraînement.

Si vous voulez permettre à TOUS les robots de visiter TOUTES les pages de votre site Web, vous devez utiliser la carte "*" dans votre syntaxe dans le fichier robots.txt.

Agent utilisateur: *
Refuser:

Pour refuser toute indexation de votre site, entrez le texte suivant dans votre fichier robots.txt :

Agent utilisateur: *
Refuser: /

Ne pas autoriser les robots à partir des pages d'indexation dans un répertoire nommé 'billing'.

Agent utilisateur: *
Refus: /facturation/

Interdire les robots d'indexer des pages dans des répertoires appelés "facturation" et "adresse".

Agent utilisateur: *
Refus: /facturation/
Refuser: /adresse/

Ne pas laisser googlebot de votre site.

Utilisateur-agent: googlebot
Refuser: /

Ne pas autoriser googlebot à accéder à votre page de contact (contact-us.html).

Utilisateur-agent: googlebot
Refuser: /contact-us.html

Ne pas autoriser googlebot à accéder à votre page de contact (about-us/contact-us.html).

Utilisateur-agent: googlebot
Refuser: /about-us/contact-us.html
 

Limiteurs

Si vous avez beaucoup de liens sur votre site (par exemple, si vous avez des forums), il est probable que le bot de Yahoo puisse ramper les liens trop rapidement et finir par utiliser beaucoup de bande passante et d'autres ressources. Pour éviter cela, ajoutez ces lignes à votre fichier robots.txt :

Utilisateur-agent: Slurp
Délais de ramassage: 60

Cela va dire à Yahoo Slurp de ne ramper qu'une page toutes les 60 secondes.

← Tous les articles de la base de connaissances

Dites-nous ce qui doit rester debout.

A short conversation with an engineer. No quote-bot, no callback queue. We'll tell you honestly if we're not the right fit.