Robots.txt es un archivo que contiene instrucciones sobre cómo rastrear un sitio web. También se conoce como protocolo de exclusión de robots, y los sitios utilizan este estándar para indicar a los bots qué parte de su sitio web necesita indexación. Además, puede especificar qué áreas no desea que estos rastreadores procesen; tales áreas contienen contenido duplicado o están en desarrollo. Los bots como los detectores de malware, los recolectores de correo electrónico no siguen este estándar y buscarán debilidades en sus valores, y hay una probabilidad considerable de que comiencen a examinar su sitio desde las áreas que no desea indexar.
Un archivo Robots.txt completo contiene "User-agent", y debajo de él, puede escribir otras directivas como "Allow", "Disallow", "Crawl-Delay", etc., si se escribe manualmente, puede llevar mucho tiempo, y puede ingresar varias líneas de comandos en un archivo. Si desea excluir una página, deberá escribir "No permitir: el enlace que no desea que visiten los bots", lo mismo aplica para el atributo de permiso. Si cree que eso es todo lo que hay en el archivo robots.txt, entonces no es fácil, una línea incorrecta puede excluir su página de la cola de indexación. Por lo tanto, es mejor dejar la tarea a los profesionales, deje que nuestro generador Robots.txt se encargue del archivo por usted. Mas sobre Robots.txt...
El archivo txt de Robots es fácil de hacer, pero las personas que no saben cómo hacerlo, deben seguir las siguientes instrucciones para ahorrar tiempo.