El archivo robots.txt vive en la raíz de tu dominio (tudominio.com/robots.txt) y da instrucciones a los rastreadores de buscadores sobre qué partes de la web pueden recorrer y cuáles no. Es un archivo de texto plano, sin ningún misterio técnico, pero con un poder desproporcionado: una directiva mal escrita puede sacar tu web entera del rastreo de Google sin que recibas ningún aviso evidente, más allá de ver caer el tráfico poco a poco.
El caso más habitual y más doloroso ocurre justo después de migrar una web o lanzar un rediseño. Durante el desarrollo, es normal (y recomendable) bloquear el acceso de los rastreadores al entorno de pruebas con una línea como Disallow: /. El problema aparece cuando esa misma configuración se sube por error al dominio real en producción, y de repente le estás diciendo a Google que no visite absolutamente nada de tu web.
Qué puede y qué no puede hacer robots.txt
Puede impedir que un rastreador acceda a una carpeta o página concreta, lo cual es útil para zonas privadas, paneles de administración o contenido duplicado que no aporta valor indexado (como resultados de filtros internos de una tienda). Lo que no hace es eliminar una URL ya indexada: si una página ya aparece en Google y la bloqueas después por robots.txt, puede seguir apareciendo en los resultados (a veces sin descripción, solo con la URL), porque bloquear el rastreo no es lo mismo que desindexar. Para eso existe la etiqueta noindex, que es una instrucción distinta y complementaria.
Errores más comunes
Además del bloqueo total accidental, son frecuentes tres fallos: bloquear por error las carpetas donde viven los archivos CSS y JavaScript (lo que impide a Google renderizar la página correctamente y entender cómo se ve de verdad), bloquear parámetros de URL de forma tan amplia que se lleva por delante páginas que sí querías indexar, y olvidar declarar la ubicación del sitemap XML dentro del propio robots.txt, un enlace que ayuda a los rastreadores a encontrarlo sin depender de que lo hayas declarado solo en Search Console.
Cómo comprobar el tuyo ahora mismo
Basta con escribir en el navegador tudominio.com/robots.txt y leer el resultado, o usar el probador de robots.txt integrado en Google Search Console, que además indica si una URL concreta está bloqueada y por qué línea exacta del archivo. Es una revisión de dos minutos que conviene hacer después de cualquier migración, cambio de hosting o rediseño, precisamente porque es el momento donde más se cuela este tipo de error.
Preguntas frecuentes
¿Cómo sé si mi web tiene este problema ahora mismo?
Entra en Google Search Console, en el apartado de rastreo, y revisa si hay páginas marcadas como "bloqueadas por robots.txt". Si aparecen páginas importantes en esa lista, tienes el problema activo.
¿Bloquear una página con robots.txt es suficiente para ocultarla de Google?
No necesariamente, como se explica arriba: la forma fiable de que una página deje de aparecer en los resultados es usar la etiqueta noindex en la propia página, no bloquear su rastreo por robots.txt.
¿Necesito un robots.txt aunque quiera que Google indexe toda mi web?
Sí, sigue siendo recomendable tener uno, aunque sea muy simple, permitiendo el rastreo completo y apuntando a tu sitemap. Su ausencia no bloquea nada, pero tenerlo bien configurado es una buena práctica que evita ambigüedades.