robots.txt en WordPress: qué bloquear y qué no

Guía práctica para entender robots.txt en WordPress: qué controla, qué no, qué conviene bloquear y cómo evitar errores de rastreo e indexación.

Ilustración tecnológica de un portátil con una interfaz abstracta de rastreo web para explicar robots.txt en WordPress

El archivo robots.txt es una de las piezas más sencillas del SEO técnico y, al mismo tiempo, una de las que más confusión genera. Su función principal es indicar a los rastreadores qué URLs pueden o no pueden solicitar. Eso no significa que sirva para ocultar una página de Google: rastreo e indexación son procesos distintos.

En WordPress conviene entender bien esta diferencia antes de añadir reglas “por si acaso”. Un bloqueo demasiado agresivo puede impedir que Google acceda a recursos necesarios para interpretar una página, mientras que un robots.txt demasiado elaborado puede no aportar ninguna mejora real.

Qué hace realmente robots.txt

Google define robots.txt como un mecanismo para gestionar el acceso de los rastreadores a determinadas URLs. Su uso principal es controlar el tráfico de rastreo, no excluir páginas de los resultados de búsqueda.

Esto tiene una consecuencia importante: una URL bloqueada por robots.txt puede seguir apareciendo en Google si el buscador descubre su existencia mediante enlaces u otras señales. En ese caso, Google puede conocer la URL aunque no haya rastreado su contenido.

Si el objetivo es que una página no aparezca en los resultados, la solución habitual es permitir el rastreo y aplicar una directiva noindex, o restringir el acceso mediante autenticación cuando el contenido sea privado. Bloquear primero la URL en robots.txt puede impedir que Google llegue a leer el noindex.

Cómo funciona robots.txt en WordPress

WordPress puede generar una respuesta dinámica para /robots.txt. En su implementación por defecto, WordPress incluye una regla para impedir el rastreo de /wp-admin/ y permite expresamente /wp-admin/admin-ajax.php. Esa lógica forma parte de la función do_robots() del propio núcleo.

Un ejemplo mínimo y razonable para muchas instalaciones sería:

User-agent: *
Disallow: /wp-admin/
Allow: /wp-admin/admin-ajax.php
Sitemap: https://ejemplo.com/sitemap_index.xml

La línea Sitemap debe utilizar una URL absoluta. En una instalación con plugin SEO, la URL real del sitemap puede variar, por lo que conviene comprobarla antes de copiar ningún ejemplo.

Qué significa cada directiva

User-agent

Indica a qué rastreador se aplica el grupo de reglas. El valor * representa de forma general a todos los rastreadores que respetan el estándar.

Disallow

Indica una ruta que el rastreador no debería solicitar. Las rutas se interpretan desde la raíz del sitio y su coincidencia es sensible a mayúsculas y minúsculas.

Allow

Permite una ruta concreta dentro de un ámbito que podría estar bloqueado por una regla más amplia. WordPress lo utiliza por defecto para permitir el acceso a admin-ajax.php dentro de /wp-admin/.

Sitemap

Permite indicar la ubicación de uno o varios sitemaps. No sustituye al sitemap ni mejora por sí sola el posicionamiento, pero ayuda a los rastreadores a descubrir su ubicación.

Qué no conviene bloquear en WordPress

Una regla demasiado amplia puede ser contraproducente. Google advierte de que, si se bloquean recursos necesarios para comprender una página, el buscador puede analizarla peor. Por eso no suele ser buena idea bloquear de forma indiscriminada directorios completos de CSS, JavaScript, imágenes o recursos del tema.

También conviene evitar recetas antiguas que añaden decenas de reglas para parámetros, feeds, plugins o carpetas internas sin haber comprobado antes si realmente existe un problema de rastreo. Un robots.txt no debería convertirse en una lista de exclusiones acumuladas durante años.

robots.txt no sustituye a noindex

Esta es probablemente la diferencia más importante de todo el artículo:

  • robots.txt controla principalmente si un rastreador puede solicitar una URL.
  • noindex indica que una página rastreada no debe incluirse en el índice.

Si bloqueas una URL en robots.txt y, al mismo tiempo, esperas que Google lea una etiqueta noindex dentro de esa página, puedes crear una contradicción: el rastreador no entra y, por tanto, no ve la directiva de indexación.

Para una revisión más amplia de estas señales puedes consultar la guía de SEO técnico en WordPress e indexación.

Cuándo sí tiene sentido editar robots.txt

Modificarlo puede tener sentido cuando existe una necesidad concreta y verificable, por ejemplo:

  • evitar el rastreo de áreas técnicas que no aportan valor al buscador;
  • reducir solicitudes sobre URLs generadas masivamente que no necesitan ser rastreadas;
  • declarar la ubicación de un sitemap;
  • resolver un problema de rastreo diagnosticado con datos, no por intuición.

En sitios pequeños o medianos, muchas veces el archivo por defecto de WordPress, combinado con una buena configuración de indexación y sitemap, es suficiente.

Errores frecuentes

1. Bloquear todo el sitio durante una migración y olvidarlo

Una regla global como Disallow: / puede impedir el rastreo completo. En entornos de staging es preferible combinar controles de acceso y una configuración clara que no dependa de recordar un cambio manual al publicar.

2. Usarlo para eliminar URLs de Google

Robots.txt no está diseñado para eso. Si una URL ya está indexada, hay que revisar la estrategia de indexación, canonicalización, contenido o retirada según el caso.

3. Copiar archivos de otros sitios

Cada arquitectura es distinta. Una regla correcta para una tienda, un medio o un WordPress con búsquedas internas puede ser innecesaria o dañina en otra instalación.

4. Bloquear recursos necesarios para renderizar

Si Google no puede acceder a archivos importantes para comprender la página, la interpretación del contenido puede empeorar.

Checklist antes de tocar robots.txt

  1. Comprueba qué contiene actualmente /robots.txt.
  2. Define qué problema quieres resolver.
  3. Verifica si el problema es de rastreo o de indexación.
  4. Comprueba que no bloqueas CSS, JavaScript o recursos necesarios para el renderizado.
  5. Confirma la URL real del sitemap.
  6. Revisa que las reglas no afecten a URLs que sí quieres posicionar.
  7. Después del cambio, valida las URLs afectadas con las herramientas de inspección de Google Search Console.

Fuentes oficiales

Conclusión

Un buen robots.txt suele ser más corto de lo que parece. La clave no está en bloquear muchas rutas, sino en entender qué necesita rastrear Google, qué contenido debe indexarse y qué señales corresponden a cada objetivo.

Si estás revisando la arquitectura técnica de tu web y no tienes claro si el problema está en rastreo, indexación o estructura, puedes ver el servicio de posicionamiento SEO para WordPress o contarme tu caso.

Foto del avatar
GonzaloCN
Artículos: 14

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *