
Rastreadores de IA: ¿deberías permitir o bloquear GPTBot?
Oíste que puedes «bloquear la IA» en tu web, y suena prudente. ¿Por qué dejar que un bot vacíe tus textos para entrenar un modelo que luego compite contigo? Pero esa frase corta, «bloquear la IA», esconde una decisión que puede volverse en tu contra sin que te des cuenta. Algunos rastreadores de IA entrenan modelos. Otros son la forma en que ChatGPT y Perplexity te encuentran y te citan cuando alguien busca un negocio como el tuyo. Bloquea los equivocados y no protegerás tu sitio: lo borrarás de las respuestas en las que la gente ahora confía. Aquí verás cómo distinguirlos y elegir con criterio.
¿Qué es un rastreador de IA y por qué debería importarme?
Un rastreador de IA es un programa automático que visita tus páginas y las lee, igual que el rastreador de Google lleva años haciéndolo. La diferencia está en lo que ocurre después. Algunos rastreadores de IA copian tu contenido para ayudar a entrenar un modelo. Otros visitan tus páginas para que un asistente pueda citarte en una respuesta en vivo, con un enlace, en el momento en que alguien hace una pregunta de tu área. Ambos llaman a la misma puerta: un pequeño archivo llamado robots.txt que dice a los bots qué pueden leer. Entender los dos trabajos lo es todo, porque «permitir» y «bloquear» significan cosas muy distintas según el rastreador del que hables.
¿Cuál es la diferencia entre rastreadores de entrenamiento y de búsqueda?
Esta es la división que importa, y casi ningún tutorial de «bloquear la IA» la explica. Si pones en fila a los rastreadores principales, se separan en dos familias con consecuencias opuestas para tu visibilidad.
Rastreadores que entrenan modelos
Recogen contenido de la web para mejorar la siguiente generación de modelos. OpenAI lo dice sin rodeos sobre su rastreador de entrenamiento: GPTBot rastrea contenido que puede usarse para entrenar sus modelos generativos, y no permitirlo indica que el contenido del sitio no debería usarse en el entrenamiento (OpenAI). Bloquear estos mantiene tus textos fuera del entrenamiento futuro. No te quita de las respuestas que los modelos dan hoy, porque de eso se encarga otro rastreador.
- GPTBot (OpenAI) recoge contenido que puede usarse para entrenar los modelos de OpenAI.
- ClaudeBot (Anthropic) recoge contenido web para entrenar los modelos de Claude.
- Google-Extended controla si Google puede usar tu contenido para entrenar futuros modelos Gemini y para fundamentar respuestas (grounding). Es un token independiente de robots.txt, y Google aclara que «no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento» (Google).
Rastreadores que generan respuestas de IA en vivo
Leen y citan tus páginas cuando alguien le hace una pregunta a un asistente ahora mismo. OpenAI describe su rastreador de búsqueda con claridad: OAI-SearchBot muestra sitios en los resultados de las funciones de búsqueda de ChatGPT (OpenAI). Perplexity dice lo mismo de su bot: está «diseñado para mostrar y enlazar sitios en los resultados de búsqueda» y «no se usa para recoger contenido con el que entrenar modelos» (Perplexity). Bloquéalos y puedes caer fuera de los resultados de IA que tu clientela ya está leyendo.
- OAI-SearchBot (OpenAI) muestra y enlaza sitios en la búsqueda de ChatGPT.
- PerplexityBot (Perplexity) indexa páginas para mostrarlas y enlazarlas en las respuestas de Perplexity, y no se usa para entrenar modelos.
- Claude-SearchBot (Anthropic) recorre la web para mejorar la calidad de los resultados de búsqueda de Claude (Anthropic).
- Googlebot sigue siendo el rastreador detrás de la Búsqueda de Google y sus AI Overviews. Bloquearlo es la forma de desaparecer del propio Google.
- Recuperadores por petición (ChatGPT-User, Perplexity-User, Claude-User) visitan una sola página solo cuando una persona se lo pide al asistente. Son acciones en tu nombre, no un rastreo masivo.
¿Bloquear los rastreadores de IA me hará invisible en las respuestas de IA?
Si bloqueas los rastreadores de búsqueda, sí. Esa es la trampa del consejo de «bloquear la IA». Cuando alguien le pide a ChatGPT o a Perplexity que recomiende un fontanero, una panadería o un contable cerca, esas herramientas se apoyan en sus rastreadores de búsqueda para encontrar páginas actuales y citarlas. Si OAI-SearchBot y PerplexityBot no pueden leer tu sitio, no estás en la lista. Perplexity señala que, si no permites su bot, aún puede mostrar tu dominio y un breve resumen factual, pero no usará el contenido completo de la página, así que apareces más pobre, si es que apareces.
Y ocurre por descuido, porque la mayoría de los fragmentos de «bloquear la IA» que circulan por internet pegan una lista larga que prohíbe todo lo que lleve «AI» en el nombre, rastreadores de búsqueda incluidos. La gente lo ejecuta para mantener su contenido fuera del entrenamiento y, de paso, apaga en silencio su visibilidad en la búsqueda con IA. Es justo lo contrario de lo que quiere un negocio que intenta que lo encuentren.
¿Debería bloquear GPTBot y los rastreadores de entrenamiento?
Esta sí es una decisión de criterio, no una regla de seguridad, así que ignora a quien diga que «hay que» hacerlo. Bloquear GPTBot, ClaudeBot y Google-Extended mantiene tu contenido fuera del entrenamiento futuro. Lo que cedes es poco para la mayoría de los negocios pequeños, porque los rastreadores de entrenamiento no son los que te consiguen citas en las respuestas en vivo. Lo que ganas también es modesto: tus páginas públicas ya son públicas, y bloquear el entrenamiento no recupera nada que un modelo ya haya aprendido.
Bloquear los rastreadores de entrenamiento tiene más sentido si tus páginas guardan material realmente original y costoso que preferirías no regalar a un modelo: guías a fondo, investigación propia, un gran cuerpo de textos que es en sí el producto. Google-Extended es el de menor riesgo para bloquear si esa es tu postura, ya que Google confirma que «no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento». Para un negocio local típico que sobre todo quiere más clientela, permitir los rastreadores de entrenamiento es una opción por defecto muy razonable, y no algo por lo que perder el sueño.
¿Cómo controlo los rastreadores de IA con robots.txt?
Todo esto vive en un único archivo de texto en tusitio.com/robots.txt, el mismo que guía a los buscadores desde hace décadas. Escribes una regla corta por rastreador, nombrando el user-agent y si está permitido. Si ya puedes abrir tusitio.com/robots.txt en el navegador, ya tienes uno; si no, la plataforma de tu web o un plugin puede añadirlo. Esto es distinto de un archivo llms.txt, que sugiere tus mejores páginas a la IA pero no puede permitir ni bloquear nada. robots.txt es el que tiene los interruptores de verdad.
Los nombres de user-agent son lo importante, porque una regla solo se aplica al nombre exacto que escribes. Agrúpalos por los dos trabajos:
- Rastreadores de entrenamiento que puedes optar por bloquear: GPTBot, ClaudeBot, Google-Extended.
- Rastreadores de búsqueda que normalmente querrás permitir: OAI-SearchBot, PerplexityBot, Claude-SearchBot.
- Googlebot, que casi nunca deberías bloquear, porque impulsa la Búsqueda de Google y sus AI Overviews.
Dos advertencias honestas. robots.txt funciona por confianza: los rastreadores serios de OpenAI, Anthropic y Google lo respetan, pero es una petición, no un candado, y a algunos rastreadores se les ha pillado ignorándolo. Y cuidado con un «Disallow: /» perdido bajo el encabezado equivocado, que puede descartar mucho más de lo que pretendías, Google incluido. Ante la duda, cambia una regla cada vez y vuelve a revisar el archivo en el navegador.
¿Cuál es una opción por defecto sensata para un negocio pequeño?
Hazlo simple. A menos que tengas un motivo concreto para guardarte el contenido, deja que el mundo de la IA lea el sitio que ya publicas, y presta atención de verdad solo a la decisión sobre el entrenamiento. Una opción por defecto que sirve a la mayoría de los negocios pequeños es esta:
- Permite los rastreadores de búsqueda, OAI-SearchBot, PerplexityBot y Claude-SearchBot, para que los asistentes puedan encontrarte y citarte.
- Nunca bloquees a Googlebot; con ese solo gesto apagas la Búsqueda de Google y sus AI Overviews.
- Bloquea GPTBot, ClaudeBot y Google-Extended solo si mantener tu contenido fuera del entrenamiento de modelos te importa de verdad.
- Abre tusitio.com/robots.txt y comprueba que no estás bloqueando los rastreadores de búsqueda sin querer.
Y recuerda que el archivo es la palanca menor. Que la IA te cite depende mucho más de si tienes páginas claras que respondan sin rodeos a lo que pregunta la clientela, que es la verdadera razón por la que la IA no encuentra algunos negocios. Vale la pena aprender a aparecer en la búsqueda con IA y lograr que ChatGPT te recomiende antes de dedicar una tarde a afinar un archivo de texto. Si mantener esas páginas al día es justo lo que nunca llegas a hacer, ese hueco lo cubre Laspi: su plugin de WordPress escribe artículos para SEO y búsqueda con IA basados en tu negocio real, de modo que el sitio que leen los rastreadores se mantiene claro y actualizado.
Entonces, ¿permitir o bloquear GPTBot? Permítelo salvo que tengas un motivo de peso para no hacerlo y, decidas lo que decidas, mantén a los rastreadores de búsqueda como invitados bienvenidos. «Bloquear la IA» nunca fue una sola decisión. Son dos, y solo una tiene que ver con proteger tu contenido. La otra tiene que ver con seguir en las respuestas en las que tu clientela ya confía.
Preguntas frecuentes
- ¿Debería bloquear GPTBot?
- Para la mayoría de los negocios pequeños, no. GPTBot solo recoge contenido que puede entrenar futuros modelos de OpenAI; bloquearlo te deja fuera del entrenamiento, pero no te protege ni te promociona en las respuestas en vivo. Bloquéalo solo si mantener tu contenido original fuera del entrenamiento te importa de verdad.
- ¿Bloquear los rastreadores de IA perjudica mi posición en Google?
- Bloquear los rastreadores de entrenamiento, no. Google aclara que Google-Extended no afecta a la inclusión ni a la posición de tu sitio en la Búsqueda de Google. Pero nunca bloquees a Googlebot, porque es el rastreador detrás de la Búsqueda de Google y sus AI Overviews.
- ¿Qué es OAI-SearchBot y debería bloquearlo?
- OAI-SearchBot es el rastreador de OpenAI que muestra y enlaza sitios en las funciones de búsqueda de ChatGPT. Si quieres que te encuentren y te citen cuando alguien le pide a ChatGPT un negocio como el tuyo, permítelo. Bloquearlo es un descuido común que te vuelve invisible en la búsqueda de ChatGPT.
- ¿Bloquear los rastreadores de IA en robots.txt funciona de verdad?
- Con los bots serios, casi siempre sí. Los rastreadores grandes de OpenAI, Anthropic y Google respetan robots.txt. Pero es una petición, no un candado firme: a algunos rastreadores se les ha pillado ignorándolo, así que robots.txt es una señal fuerte, no una garantía.
- ¿Cuál es la diferencia entre GPTBot y OAI-SearchBot?
- GPTBot rastrea contenido que puede usarse para entrenar los modelos de OpenAI. OAI-SearchBot es un rastreador aparte que muestra sitios en los resultados de búsqueda de ChatGPT. Bloquear GPTBot solo afecta al entrenamiento; bloquear OAI-SearchBot te quita de las respuestas de búsqueda en vivo de ChatGPT.
Fuentes
- OpenAI, 2025 — El GPTBot de OpenAI rastrea contenido que puede usarse para entrenar sus modelos generativos, mientras que su rastreador aparte OAI-SearchBot muestra sitios en los resultados de las funciones de búsqueda de ChatGPT; ambos pueden bloquearse en robots.txt.
- Google, 2025 — Google-Extended es un token independiente de robots.txt que controla si el contenido de un sitio puede usarse para entrenar futuros modelos Gemini y para fundamentar respuestas; Google indica que no afecta a la inclusión de un sitio en la Búsqueda de Google ni se usa como señal de posicionamiento.
- Perplexity, 2025 — PerplexityBot está diseñado para mostrar y enlazar sitios en los resultados de búsqueda de Perplexity y no se usa para recoger contenido con el que entrenar modelos; Perplexity-User visita una página solo cuando un usuario hace una pregunta.
- Anthropic, 2025 — Anthropic tiene tres rastreadores que respetan robots.txt: ClaudeBot recoge contenido web para entrenar los modelos de Claude, Claude-SearchBot recorre la web para mejorar la calidad de la búsqueda y Claude-User visita una página cuando un usuario de Claude hace una pregunta.