Cómo aparecer en ChatGPT: los tres bots de OpenAI y tu robots.txt
Para que ChatGPT te cite tiene que poder leerte, y ahí es donde mucha gente se queda fuera sin saberlo. OpenAI no entra en tu web con un rastreador, sino con tres, y cada uno hace una cosa distinta. Bloquear el que no toca es la forma más rápida y silenciosa de quedarte fuera de las respuestas.
Este artículo va solo de eso: de ChatGPT y de lo que sí depende de ti. El método general del GEO está en la Guía GEO 2026, y la comparación con otros motores, en Perplexity y Gemini.
Los tres rastreadores, y para qué sirve cada uno
OpenAI los documenta en su página de bots, que es la fuente a la que conviene ir siempre, porque esto cambia:
| Agente | Para qué entra | Si lo bloqueas |
|---|---|---|
GPTBot | Recoger contenido para entrenar modelos futuros | No entras en el entrenamiento. No afecta a que te citen hoy |
OAI-SearchBot | Construir el índice con el que ChatGPT busca en la web | Dejas de ser citable en las respuestas con búsqueda |
ChatGPT-User | Visitar una página concreta cuando alguien se lo pide en una conversación | ChatGPT no puede abrir tu página aunque el usuario la pida |
La confusión habitual es tratarlos como uno solo. Son decisiones separadas y tienen consecuencias distintas: puedes quedarte fuera del entrenamiento y seguir siendo perfectamente citable, porque son mecanismos diferentes.
La decisión que de verdad importa
Si lo que quieres es que ChatGPT te mencione cuando alguien pregunte por lo tuyo,
el agente que no puedes bloquear es OAI-SearchBot. Es el que alimenta el
índice del que salen las citas con enlace.
GPTBot es otra conversación, y legítima: hay quien no quiere que su contenido
entre en el entrenamiento de un modelo comercial. Se puede decir que no a eso y
seguir apareciendo en las respuestas. En robots.txt, la forma de expresarlo es
por agente:
User-agent: OAI-SearchBot
Allow: /
User-agent: ChatGPT-User
Allow: /
User-agent: GPTBot
Disallow: /
Antes de tocar nada, comprueba qué dice hoy el tuyo. Un Disallow: / heredado
de una migración, o un plugin de «bloquear IA» instalado sin leer, hacen este
trabajo por ti y en la dirección contraria.
Lo que no controla tu robots.txt
Aquí conviene ser honesto, porque es donde se vende humo:
- No puedes forzar una cita. Puedes permitir el acceso, ponérselo fácil y merecerla. El resto lo decide el modelo.
- No puedes corregir una respuesta. No hay panel de reclamaciones. Si dice algo desactualizado de ti, la vía es que la información correcta exista, esté bien marcada y se repita de forma coherente donde el modelo mira.
- No hay pago que te meta dentro. Nadie vende posiciones en una respuesta generada.
- La respuesta cambia entre consultas. Dos preguntas casi idénticas dan citas distintas. Por eso una comprobación suelta no es una medición: lo cuento en Cómo medir el GEO.
Después del acceso, la identidad
Dejar entrar al rastreador es la condición necesaria, no la suficiente. Lo siguiente es que, cuando lea, entienda sin ambigüedad quién eres: eso se declara con datos estructurados, y lo desarrollo en Datos estructurados y citabilidad.
El siguiente paso
Revisa tu robots.txt hoy mismo: es gratis y es el único punto de esta lista
donde un error te deja a cero. Si prefieres que lo revisemos nosotros, lo hace
el equipo de SMedialab en Tenerife.