CONOCIMIENTOS · TUTORIAS
Robots.txt explicado
Última actualización 2025-06-06
Robots.txt explicado en una nuez:
Robots.txt es una herramienta útil cuando se utiliza para limitar el acceso de robots a su sitio, como el contenido en el trabajo y la información sensible. En este momento no hay ningún respaldo del Grupo de Trabajo Estándar de Exclusión Robots para una directiva que permita que los robots ingresen a partes índices de el sitio. Esto todavía puede iniciarse mediante la conexión interna y externa a su sitio web.
Usted puede haber notado al revisar sus estadísticas de uso de la página web una referencia a un archivo llamado 'robots.txt'. Este es un archivo de configuración básico que los robots (espídetes de motor de búsqueda) utilizan para notar qué archivos y directorios no deben indexar.
Es importante tener un archivo llamado robots.txt en la raíz de su sitio web (http://www.yourdomain.com/robots.txt). El uso básico de los robots.txt es notar qué archivos y directorios los robots no deben indexar.
Hay 2 componentes en la sintaxis de la estructura de archivos robots.txt: la línea de agente de usuario y la línea de desactivada.
La sintaxis es la siguiente:
Usuario-agent
A list of the robots visiting your site may be viewed in the stats logs of your website. A listing of user-agents may be viewed at http://www.robotstxt.org/wc/active.html
Un robot específico puede ser referenciado en la sintaxis de Usuario-Agente.
Usuarios: Googlebot
Un comodín también puede ser utilizado para combinar todos los archivos robots.txt.
*
Distribuir
Esta sección de la sintaxis indica que los archivos y directorios no deben ser indexados.
Si tiene una página llamada 'addresses.html' y no quiere que el robot indexe , agregue la siguiente línea después de la sintaxis de Usuario-agente:
Aceptar: direcciones.html
También puede limitar el robot a nivel del directorio. Si el directorio '/billing' en su sitio web debe restringirse de indexación, coloque el texto siguiente después de la sintaxis de usuario-agente.
Distribución: /billing/
Un comodín también puede ser utilizado para notar todos los archivos en un sitio.
Disallow: /
¿Cómo hago comentarios en mi archivo robots.txt?
Los comentarios de codificación pueden ser colocados en el archivo robots.txt colocando '#' antes de cualquier texto. Un ejemplo es:
# especifica googlebot como el agente de usuario.
Usuarios: Googlebot
Es buena práctica tener sus comentarios en una línea separada que la directiva. Además, limite el espacio blanco al comienzo de las líneas directivas.
Poniendo robots.txt para usar:
Ahora que sabemos la funcionalidad de robots.txt, pongamoslo a práctica.
Si desea permitir que TODOS los robots visiten TODAS las páginas de su sitio web, debe utilizar el comodín "*" en su sintaxis en el archivo robots.txt.
*
- Sí.
Para desactivar toda la indexación de su sitio, introduzca el siguiente texto en su archivo robots.txt:
*
Disallow: /
Desactivar robots de páginas de indexación dentro de un directorio llamado 'billing'.
*
Distribución: /billing/
Dejar a los robots de las páginas de indexación dentro de directorios llamados "billing" y "address".
*
Distribución: /billing/
Desplazamiento: /dirección /
Deja de hablar de Googlebot de tu sitio.
Usuario-agent: googlebot
Disallow: /
Dejar de acceder a Googlebot de la página de contacto (contact-us.html).
Usuario-agent: googlebot
Desactivado: /contact-us.html
Dejar de acceder a Googlebot de la página de contacto (about-us/contact-us.html).
Usuario-agent: googlebot
Disallow: /about-us/contact-us.html
Robots.txt es una herramienta útil cuando se utiliza para limitar el acceso de robots a su sitio, como el contenido en el trabajo y la información sensible. En este momento no hay ningún respaldo del Grupo de Trabajo Estándar de Exclusión Robots para una directiva que permita que los robots ingresen a partes índices de el sitio. Esto todavía puede iniciarse mediante la conexión interna y externa a su sitio web.
Usted puede haber notado al revisar sus estadísticas de uso de la página web una referencia a un archivo llamado 'robots.txt'. Este es un archivo de configuración básico que los robots (espídetes de motor de búsqueda) utilizan para notar qué archivos y directorios no deben indexar.
Es importante tener un archivo llamado robots.txt en la raíz de su sitio web (http://www.yourdomain.com/robots.txt). El uso básico de los robots.txt es notar qué archivos y directorios los robots no deben indexar.
Hay 2 componentes en la sintaxis de la estructura de archivos robots.txt: la línea de agente de usuario y la línea de desactivada.
La sintaxis es la siguiente:
Usuario-agent
A list of the robots visiting your site may be viewed in the stats logs of your website. A listing of user-agents may be viewed at http://www.robotstxt.org/wc/active.html
Un robot específico puede ser referenciado en la sintaxis de Usuario-Agente.
Usuarios: Googlebot
Un comodín también puede ser utilizado para combinar todos los archivos robots.txt.
*
Distribuir
Esta sección de la sintaxis indica que los archivos y directorios no deben ser indexados.
Si tiene una página llamada 'addresses.html' y no quiere que el robot indexe , agregue la siguiente línea después de la sintaxis de Usuario-agente:
Aceptar: direcciones.html
También puede limitar el robot a nivel del directorio. Si el directorio '/billing' en su sitio web debe restringirse de indexación, coloque el texto siguiente después de la sintaxis de usuario-agente.
Distribución: /billing/
Un comodín también puede ser utilizado para notar todos los archivos en un sitio.
Disallow: /
¿Cómo hago comentarios en mi archivo robots.txt?
Los comentarios de codificación pueden ser colocados en el archivo robots.txt colocando '#' antes de cualquier texto. Un ejemplo es:
# especifica googlebot como el agente de usuario.
Usuarios: Googlebot
Es buena práctica tener sus comentarios en una línea separada que la directiva. Además, limite el espacio blanco al comienzo de las líneas directivas.
Poniendo robots.txt para usar:
Ahora que sabemos la funcionalidad de robots.txt, pongamoslo a práctica.
Si desea permitir que TODOS los robots visiten TODAS las páginas de su sitio web, debe utilizar el comodín "*" en su sintaxis en el archivo robots.txt.
*
- Sí.
Para desactivar toda la indexación de su sitio, introduzca el siguiente texto en su archivo robots.txt:
*
Disallow: /
Desactivar robots de páginas de indexación dentro de un directorio llamado 'billing'.
*
Distribución: /billing/
Dejar a los robots de las páginas de indexación dentro de directorios llamados "billing" y "address".
*
Distribución: /billing/
Desplazamiento: /dirección /
Deja de hablar de Googlebot de tu sitio.
Usuario-agent: googlebot
Disallow: /
Dejar de acceder a Googlebot de la página de contacto (contact-us.html).
Usuario-agent: googlebot
Desactivado: /contact-us.html
Dejar de acceder a Googlebot de la página de contacto (about-us/contact-us.html).
Usuario-agent: googlebot
Disallow: /about-us/contact-us.html
Limitando los rastreadores
Si tienes muchos enlaces en tu sitio (por ejemplo, si tienes foros), es probable que el bot de Yahoo pueda arrastrar los enlaces demasiado rápido y terminar usando un montón de ancho de banda y otros recursos. Para evitarlo, agregue estas líneas a su archivo robots.txt:
Usuario-agent: Slurp
Crawl-delay: 60
Esto le dirá a Yahoo Slurp que sólo arrastra una página cada 60 segundos.
Díganos qué tiene que estar levantado.
A short conversation with an engineer. No quote-bot, no callback queue. We'll tell you honestly if we're not the right fit.