Saltar al contenido
citara Solicitar diagnóstico

¿Qué son los crawlers de IA?

Actualizado el 15 de agosto de 2026

Los crawlers de IA son los programas que las empresas de inteligencia artificial usan para leer páginas web. No todos hacen lo mismo: unos recolectan contenido para entrenar modelos, otros construyen el índice de búsqueda que un asistente consulta al responder, y otros van a buscar una página puntual porque un usuario la pidió en ese momento. Bloquear el equivocado te saca de las respuestas sin que te enteres.

¿Cuál es la diferencia entre entrenar, indexar y traer una página?

Es la distinción que más dinero cuesta cuando se confunde.

  • Entrenar. El bot recolecta texto que se usará para entrenar un modelo futuro. Bloquearlo no afecta si el asistente te menciona hoy.
  • Indexar para búsqueda. El bot construye el índice que el asistente consulta cuando necesita información actual. Bloquearlo sí te saca de las respuestas con citas.
  • Traer una página en vivo. El bot va por una URL específica porque un usuario o una tarea la pidió. Bloquearlo hace que el asistente no pueda abrir tu página cuando alguien se la pasa.

Mucha gente bloquea los tres de una sola vez creyendo que solo está evitando el entrenamiento.

¿Cuáles son los principales crawlers de IA?

Bots de las principales empresas de IA. Última revisión: 15 de agosto de 2026.
Bot Empresa Para qué se usa Cómo se controla
GPTBot OpenAI Recolecta páginas para entrenar modelos. No alimenta las respuestas en vivo de ChatGPT. robots.txt, entrada propia para GPTBot.
OAI-SearchBot OpenAI Construye el índice de búsqueda que ChatGPT consulta al responder. Bloquearlo te saca de los resultados con citas. robots.txt, entrada propia para OAI-SearchBot.
ChatGPT-User OpenAI Va a buscar una página en el momento, porque un usuario o una tarea lo pidió. No indexa ni entrena. robots.txt, entrada propia para ChatGPT-User.
ClaudeBot Anthropic Recolecta páginas para entrenamiento. robots.txt, entrada propia para ClaudeBot.
Claude-User Anthropic Trae una página en el momento cuando un usuario de Claude lo pide. robots.txt, entrada propia para Claude-User.
Claude-SearchBot Anthropic Indexa páginas para mejorar los resultados de búsqueda que Claude usa al responder. robots.txt, entrada propia para Claude-SearchBot.
PerplexityBot Perplexity Indexa páginas para que puedan aparecer citadas en las respuestas de Perplexity. robots.txt, entrada propia para PerplexityBot.
Google-Extended Google No es un crawler: es un control. Decide si el contenido que Googlebot ya trajo puede usarse para entrenar Gemini y alimentar sus respuestas. robots.txt. Bloquearlo no afecta tu posición en la búsqueda de Google.
Applebot-Extended Apple Tampoco es un crawler: controla si lo que Applebot ya trajo puede usarse para entrenar los modelos de Apple. robots.txt. Bloquearlo no afecta a Siri ni a Spotlight.
meta-externalagent Meta Recolecta páginas para entrenar los modelos de Meta y para sus productos de IA. robots.txt, entrada propia para meta-externalagent.
Bravebot Brave Alimenta el índice de Brave Search, que a su vez alimenta la búsqueda web de Claude. Es el bot menos conocido de la lista y el que más gente deja fuera sin darse cuenta. Caso aparte: ver la nota debajo de la tabla.

Esta tabla envejece rápido: las empresas de IA agregan, renombran y retiran user-agents varias veces al año. La fecha de arriba dice cuándo se revisó por última vez contra la documentación oficial de cada empresa.

¿Por qué Brave aparece en esta lista?

Porque el índice de Brave Search alimenta la búsqueda web de Claude, y casi nadie lo tiene en cuenta al revisar su robots.txt.

Anthropic no ha nombrado oficialmente a su proveedor de búsqueda, pero incluyó a Brave Search en su lista pública de subprocesadores bajo la categoría de búsqueda web, y varios análisis independientes encontraron que Claude y Brave devuelven las mismas citas para la misma consulta. La evidencia es fuerte, aunque no sea una confirmación directa.

La consecuencia práctica es la que importa: si no eres visible para Brave, es probable que no seas citable por Claude, aunque tengas ClaudeBot perfectamente permitido en tu robots.txt.

Fuentes: lista de subprocesadores del Trust Center de Anthropic; TechCrunch, “Anthropic appears to be using Brave to power web search for its Claude chatbot”, marzo 2025.

¿Cómo se controla el crawler de Brave?

Es el caso raro de la lista, y conviene entenderlo antes de tocar nada.

Brave documenta que su crawler no anuncia un user-agent diferenciado, precisamente para no ser discriminado por sitios que solo dejan pasar a Google. De ahí se sigue la regla que casi nadie conoce: si Googlebot no puede rastrear una página, el bot de Brave tampoco lo hará.

Eso invierte el consejo habitual. No sirve de nada agregar una línea para un bot de Brave en tu robots.txt; lo que hay que revisar es que no estés bloqueando a Googlebot en las secciones que quieres que la IA pueda citar. Directorios cerrados, entornos de prueba con Disallow: /, y bloqueos heredados de una migración son las causas más comunes.

Algunos directorios de bots reportan un user-agent Bravebot. Conviene incluirlo en robots.txt por si acaso —cuesta una línea— pero sin depender de él: la documentación de Brave sigue diciendo que el control efectivo pasa por el acceso de Googlebot.

Fuente: centro de ayuda de Brave Search, “Brave Search Crawler”.

¿Qué conviene revisar en un sitio?

Cuatro cosas, en este orden:

  1. Que robots.txt no bloquee a Googlebot en las secciones que quieres que la IA pueda leer. Este solo punto explica una parte de los casos en que una marca no aparece en ninguna respuesta.
  2. Que los bots de indexación estén permitidos, aunque decidas bloquear los de entrenamiento. Son entradas distintas: OAI-SearchBot no es GPTBot.
  3. Que no haya bloqueos fuera de robots.txt. Un firewall, un WAF o una regla de Cloudflare pueden estar rechazando bots que robots.txt permite. Esto no se ve sin mirar los logs del servidor.
  4. Que las páginas críticas no dependan de JavaScript para mostrar su contenido. Varios de estos bots no ejecutan JavaScript: lo que se renderiza en el navegador puede no existir para ellos.

Términos relacionados

Ver también mención y cita, tráfico oscuro de IA y query fan-out.