AEO/GEO
Cómo funciona ChatGPT Search: qué ve, qué muestra y qué cita
Qué es un LLM, qué es el query fan-out y por qué ChatGPT abre 1 de cada 80 páginas que recupera. La guía completa, para técnicos y no técnicos.
Cuando ChatGPT nombra o recomienda una marca, ¿qué leyó exactamente para decidirlo? Me hacen esa pregunta en todos los proyectos y casi nadie la responde con datos. La respuesta corta es que, en la enorme mayoría de los casos, no leyó la página: vio un título, una dirección y un fragmento de unas tres líneas.
Ese fragmento es la parte que sorprende. No lo escribe ChatGPT mientras te responde: lo tomó del inicio de tu página en una visita anterior, lo guardó y lo reutiliza tal cual. Puede tener semanas de antigüedad y tú no elegiste su contenido. De dónde sale, qué cabe dentro y por qué casi nunca se actualiza es buena parte de lo que explica este artículo.
Para entender por qué funciona así hay que empezar bastante antes. Casi todo lo que se publica sobre visibilidad en IA da por sabido qué es un modelo de lenguaje, qué es el grounding y qué es un fan-out. En mi experiencia ese supuesto es falso, incluso entre gente que lleva años trabajando en marketing digital.
Así que este artículo va en cuatro tramos. Primero los fundamentos: qué es un LLM, qué diferencia hay entre lo que sabe y lo que consulta, y cómo se descompone tu pregunta antes de tocar un solo resultado. Después el sistema en detalle, con las cifras medidas y su atribución. Luego qué hacer, separado según si eres o no la persona que va a tocar el código. Y al final las preguntas frecuentes.
Cómo leer este artículo si no eres técnico: los bloques de cifras y las tablas están puestos para que puedas saltártelos sin perder el hilo. La explicación conceptual va siempre en el texto corrido, antes del dato. Si eres técnico, es al revés: el texto te da el marco y los bloques te dan el número con su fuente.
Los fundamentos de la IA que hay que entender primero
Esta primera parte no tiene nada de novedoso para quien construye con modelos de lenguaje, y lo tiene todo para el resto. Es la base sin la cual los porcentajes de la segunda parte son números sueltos. Si ya sabes qué es el conocimiento paramétrico y qué es un fan-out, puedes saltar directo al sistema en detalle.
Qué es un modelo de lenguaje y por qué eso decide si te nombra
Un modelo de lenguaje grande, o LLM por sus siglas en inglés, es un sistema que predice qué texto viene a continuación. Durante el entrenamiento procesó una cantidad enorme de texto y ajustó miles de millones de parámetros, que son números internos. Cuando le escribes, no busca tu pregunta en ningún archivo: calcula, palabra a palabra, cuál es la continuación más probable.
La analogía que mejor me funciona con clientes es la de un profesional que leyó una biblioteca entera y después le quitaron la biblioteca. Se acuerda de cómo se argumenta, de cómo se estructura un informe y de la forma general de casi cualquier tema. No se acuerda de la página exacta de la que sacó cada cifra, y si le insistes, va a producir una cifra plausible con la misma seguridad con la que produce una correcta.
De ahí salen las dos propiedades que ordenan todo lo demás. Un LLM es excelente redactando, resumiendo, traduciendo y estructurando, porque eso es exactamente lo que aprendió. Y es poco fiable recordando hechos precisos, recientes o poco frecuentes, porque nunca guardó los hechos: guardó regularidades del lenguaje.
Esa segunda debilidad es la razón de existir de la búsqueda dentro de ChatGPT. No se le añadió para competir con Google, se le añadió porque un modelo que solo tira de memoria no puede darte el precio de hoy, la normativa vigente ni el nombre de una agencia en Santiago con su enlace. Si el modelo fuera fiable recordando, tu marca no tendría por dónde entrar.
Lo que el modelo sabe de memoria y lo que consulta en vivo
Esta es la distinción que más falta hace y la que casi nadie tiene clara. En cualquier respuesta de ChatGPT conviven dos orígenes de información distintos, con propiedades opuestas, y saber cuál está operando cambia por completo lo que puedes hacer al respecto.
El primero es el conocimiento paramétrico: lo que quedó grabado en los parámetros durante el entrenamiento. Está congelado en el tiempo, no tiene fuente identificable y no se puede editar desde fuera. Si el modelo dice que tu empresa se dedica a algo que dejaste de hacer en 2023, probablemente está tirando de ahí.
El segundo es la recuperación en vivo: el modelo lanza una búsqueda, recibe resultados y redacta apoyándose en ellos. Ese material sí tiene procedencia, sí se puede citar con un enlace y sí refleja lo que hay publicado hoy. Es la única capa donde una marca puede intervenir con trabajo de SEO y AEO.
| Conocimiento paramétrico | Recuperación en vivo | |
|---|---|---|
| De dónde sale | Del entrenamiento del modelo | De una búsqueda hecha en el momento |
| Cuándo se fijó | Está congelado en la fecha de corte | Se resuelve al responder |
| Tiene fuente citable | No, no hay URL que mostrar | Sí, por eso aparecen las citas |
| Puedes influir en ello | Casi nada, y a muy largo plazo | Sí, es donde se juega el AEO |
| Cómo falla | Inventa con seguridad, y suena bien | Cita mal, cita de más o cita a un tercero |
Regla práctica para leer cualquier respuesta de ChatGPT: si no hay citas, estás viendo memoria del modelo y no hay página tuya involucrada. Si hay citas, hubo una búsqueda y ahí sí hay una competencia que puedes trabajar. Es lo primero que miro cuando un cliente me manda una captura preguntando por qué la IA dice algo raro de su marca.
Buscar en la web es solo una de las cosas que ChatGPT puede hacer
Otro supuesto que conviene romper temprano: ChatGPT no es un buscador con otra interfaz. La búsqueda es una herramienta entre varias, y el modelo decide en cada turno si la usa. Cuando alguien dice que su marca no aparece en ChatGPT, lo primero que hay que averiguar es si en esa conversación hubo búsqueda.
- Responder de memoria, sin salir a ningún lado. Es el modo por defecto y el más frecuente en preguntas conceptuales.
- Buscar en la web, que es lo que cubre este artículo y lo único donde tu página compite.
- Ejecutar código, para cálculos, análisis de datos y gráficos, en un entorno aislado.
- Leer un archivo que subes, un PDF, una hoja de cálculo o una imagen, que no pasa por ninguna búsqueda.
- Generar imágenes a partir de una descripción.
- Usar herramientas y conectores externos, desde el correo del usuario hasta sistemas de una empresa conectados por protocolo.
- Recordar cosas de conversaciones anteriores, si el usuario tiene la memoria activada.
La consecuencia para el trabajo de visibilidad es directa: tu contenido solo entra en juego en una de esas siete rutas. Auditar la presencia de una marca en IA sin distinguir qué ruta se activó en cada prueba es la causa más común de conclusiones equivocadas que veo en informes de agencia.
Cuándo decide buscar y cuándo responde de memoria
Aquí hay una creencia muy extendida y que las mediciones no respaldan: la idea de que escribiendo hoy, ahora o actualizado en el prompt obligas al modelo a salir a buscar. En los corpus capturados en 2026 esos disparadores léxicos no producen un cambio medible en el comportamiento de búsqueda.
Lo que sí determina la búsqueda es la naturaleza de la pregunta: la vertical a la que pertenece y la volatilidad real del dato que pides. Preguntas sobre precios, disponibilidad, noticias, normativa o negocios concretos disparan búsqueda con mucha más frecuencia que preguntas conceptuales, que el modelo resuelve de memoria porque la respuesta no cambia de un mes a otro.
es lo que producen las marcas temporales del tipo hoy o ahora en el prompt. El disparador real de la búsqueda en vivo es la vertical de la pregunta y la volatilidad del dato pedido
Fuente: Resoneo, julio 2026, sobre capturas del stream en condiciones reales
Esto tiene una lectura estratégica que suelo plantear temprano en los proyectos. Si tu categoría es de las que el modelo resuelve de memoria, el trabajo no es optimizar un fragmento: es hacer que la marca esté suficientemente presente en el corpus público como para que el modelo la nombre sin buscar. Son dos batallas distintas y se ganan con tácticas distintas.
Qué es el grounding en un modelo de lenguaje
Grounding es anclar la respuesta del modelo en material externo verificable, en vez de dejar que la produzca solo con su memoria. En castellano llano: el sistema busca, mete los resultados en la conversación como contexto y le pide al modelo que redacte apoyándose en eso.
El detalle que casi nadie tiene interiorizado es que el modelo no visita tu web. Recibe un paquete de texto ya preparado por otro componente, y ese paquete es todo lo que sabe de ti en ese turno. No hay navegador, no hay renderizado, no hay diseño, no hay experiencia de usuario. Hay texto plano en una lista.
Por eso el grounding es la pieza que convierte el SEO en algo que sigue existiendo dentro de un chat. Si el modelo redacta a partir de un paquete de resultados, entonces todo se reduce a dos preguntas: si entras en ese paquete, y con qué texto entras. El resto del artículo es, básicamente, el desarrollo de esas dos preguntas con datos.
Grounding no es sinónimo de verdad. Anclar la respuesta en fuentes reduce mucho la invención, pero el modelo sigue pudiendo resumir mal una fuente correcta, atribuir a un sitio una frase que estaba en otro, o mezclar el dato de una página con el nombre de otra. He visto las tres cosas en el mismo informe de auditoría.
Query fan-out: tu pregunta se rompe en búsquedas que nunca escribiste
Este es el mecanismo central y el más desconocido de todos. Cuando ChatGPT decide buscar, no manda tu pregunta tal cual al motor. La descompone en varias sub-consultas más cortas y específicas, las lanza en paralelo, y cada una vuelve con su propia lista de resultados. Eso es el query fan-out.
Un ejemplo concreto. Si alguien pregunta cuál es la mejor agencia de SEO en Santiago para un ecommerce mediano, esa frase no se busca nunca. Se convierte en algo parecido a agencias SEO Santiago Chile, SEO para ecommerce Chile, precios consultoría SEO Chile y casos de éxito SEO ecommerce. Cuatro búsquedas distintas, cuatro conjuntos de resultados, y una sola respuesta redactada encima de todos ellos.
El fan-out existe porque una pregunta compleja no se resuelve con una búsqueda. Una consulta larga y conversacional devuelve resultados mediocres en cualquier motor, ya que ninguna página está escrita exactamente con esas palabras. Descomponerla en consultas cortas y concretas recupera mucho mejor material, y además permite cubrir varias facetas del problema a la vez.
La implicación para tu visibilidad es la que más cuesta digerir y la más importante de este artículo: compites en búsquedas que nunca escribiste y que no aparecen en ninguna herramienta de keywords. Tu página no tiene que rankear para la pregunta del usuario, tiene que rankear para las sub-consultas que el sistema generó a partir de ella. Y esas sub-consultas cambian de una ejecución a otra.
De ahí sale también la muerte de una práctica que funcionó quince años: mapear un grupo de palabras clave a una landing y darlo por cerrado. Con fan-out, el sistema puede traer una página distinta de tu sitio para cada faceta, así que lo que importa es la cobertura del tema completo, no la optimización de una sola URL.
La cantidad de fan-outs depende del modo. En modo instantáneo, que es el que corre en las cuentas gratuitas, el sistema se conforma con una sola ronda de búsqueda en más de ocho de cada diez casos. En modo thinking, el de las cuentas de pago, el proceso es iterativo: lanza una tanda, lee lo que volvió, decide qué le falta y lanza otra.
| Modo instantáneo | Modo thinking | |
|---|---|---|
| Rondas de búsqueda | 1 en la mayoría de los casos | 6 en la mediana |
| Cómo se comporta | Una tanda de sub-consultas y a redactar | Busca, evalúa lo recuperado y vuelve a buscar |
| Qué significa para ti | Una sola oportunidad de entrar | Más superficies, y más competidores dentro |
Y no es una rareza de OpenAI: es hacia donde se movió la industria entera. El AI Mode de Google funciona con el mismo principio de descomponer la consulta en subconsultas y recuperar fuentes para cada una, lo que multiplica el costo de cómputo por respuesta y explica buena parte de la inversión en infraestructura de los últimos dos años.
Cómo se trabaja el contenido cuando la unidad de competencia deja de ser la keyword y pasa a ser el recorrido de decisión completo lo desarrollo en la guía de SEO para IA, AEO y GEO, que es el pilar donde está el marco estratégico y el detalle del fan-out en AI Mode de Google.
Qué es un índice de búsqueda y qué es una cache
Dos palabras más y terminamos con los fundamentos, porque sin ellas la parte central del artículo no se entiende. Un índice y una cache son cosas distintas, y ChatGPT usa las dos para cosas distintas.
Un índice es un catálogo pensado para encontrar. Guarda de cada página una versión reducida, básicamente su título, su dirección y un fragmento corto de texto, y está organizado para que puedas llegar a ella con palabras clave. Es el equivalente digital del fichero de una biblioteca: no contiene los libros, contiene la ficha que te lleva al libro.
Una cache es una copia guardada para no tener que volver a pedir el original. Guarda la página completa, pero no se llega a ella con palabras clave: se llega con la dirección exacta, porque ya sabes qué quieres. Es la fotocopia del libro que alguien dejó archivada tras pedirlo la primera vez.
La diferencia práctica es que el índice decide si te encuentran y la cache decide qué se lee de ti cuando ya te encontraron. Son dos almacenes con dos edades distintas, escritos por robots distintos, y confundirlos produce diagnósticos equivocados. Vuelvo sobre esto con las mediciones más abajo.
Qué está medido y qué es ingeniería inversa
Hasta acá, fundamentos que cualquiera puede verificar en la literatura pública sobre modelos de lenguaje. De aquí en adelante entramos en el terreno medido, y ahí toca la advertencia, porque es especialmente importante. Nada de lo que sigue es documentación oficial de OpenAI.
Son mediciones de ingeniería inversa: captura del stream del servidor, análisis de logs, laboratorios de páginas marcadas e instrumentación de la API. Los nombres internos que aparecen se leyeron de campos que OpenAI expuso sin querer y que, en algunos casos, ya eliminó.
El caso más claro es un campo llamado result_source, que acompañaba cada resultado e identificaba el motor que lo había traído. Suganthan Mohanadasan fue el primero en publicarlo, leyendo el tráfico de red en lugar de las respuestas, y documentó sus cuatro valores. Ese campo desapareció del stream entre el 20 y el 22 de julio de 2026. Buena parte de lo que sabemos viene de una ventana que ya se cerró.
El trabajo original sobre cómo ChatGPT elige sus fuentes, leyendo el tráfico de red y no las respuestas, es de Suganthan Mohanadasan, y es la base sobre la que se construyó casi todo lo que vino después.
Regla de lectura para todo lo que sigue: donde digo que algo se midió, hay un protocolo detrás y digo de quién es. Donde hay desacuerdo entre investigadores, lo señalo en vez de elegir el dato que me conviene. Este tema está en construcción y presentarlo como cerrado sería el error más común del rubro.
ChatGPT no lee tu página, lee una ficha de tres líneas
Ya sabemos que el modelo recibe un paquete de resultados y redacta encima. Ahora la pregunta concreta: qué hay exactamente en ese paquete. La respuesta es lo mismo que ves tú al buscar, para cada página un título, un fragmento y una URL. Nada más. Sobre esa red de resultados, y solo sobre ella, el modelo escribe la respuesta y decide a quién cita.
Esos tres campos son tu única representación ante el modelo en la mayoría de los casos. No tu diseño, no tu autoridad de dominio, no la profundidad de tu contenido. Un título, una dirección y unos doscientos caracteres.
páginas recuperadas llega a abrirse y leerse completa. El resto queda representado solo por su título, su URL y su fragmento
Fuente: Resoneo, julio 2026, sobre 1.249 respuestas capturadas en condiciones reales
Esto explica una frustración habitual. Marcas con contenido excelente y muy completo que no aparecen en las respuestas, mientras compite y gana una página más pobre pero mejor presentada en sus primeras líneas. No es injusticia del algoritmo: es que el modelo nunca vio el contenido excelente. Vio la ficha.
El embudo de citación: recuperada, listada, promovida, citada
Acá está el hallazgo que más cambia la forma de medir. Entre aparecer en la recuperación de ChatGPT y ser citado en el texto de la respuesta hay varios escalones, y casi nada los sube. Confundirlos es la razón por la que las cifras de visibilidad en IA varían tanto de un estudio a otro: cada uno cuenta en una capa distinta sin decirlo.
| Escalón | Qué significa | Cuánto pasa |
|---|---|---|
| Recuperada | El motor la trae como resultado y el modelo la recibe | 100% de la base |
| Listada | Aparece en el panel de fuentes, casi siempre bajo el pliegue de la sección More | Cerca del 88% |
| Ligada a una cita | Queda enganchada a una afirmación de la respuesta | 12,4% |
| Fuente principal visible | Es la que da nombre a la píldora de la cita que el lector ve | 8,2% |
| Abierta y leída | El modelo pide la página completa y la procesa | 1,2% |
Nueve de cada diez páginas recuperadas se quedan al fondo del panel lateral, detrás de un clic, sin promoverse nunca ni recogerse en el texto. Técnicamente visibles, prácticamente invisibles. Una respuesta mediana lista unas veinte páginas, promueve cinco, cita tres en su texto y no abre ninguna.
Hay un matiz que se pierde en casi todos los reportes: ser citado no es binario. Un ancla de cita puede llevar varias fuentes, pero la píldora muestra el nombre de la primera y marca las demás con un más uno. Cerca de un tercio de las URLs citadas existe sin ser la fuente que el lector ve primero.
Abrir una página multiplica por diez la probabilidad de que la cite
Es raro, pero cambia todo. Cuando ChatGPT abre de verdad una página y la lee, la cita en tres de cada cuatro casos. Cuando solo la tiene como resultado recuperado, la cita en menos de uno de cada trece.
es la probabilidad de ser citado si el modelo abrió y leyó la página, frente a la de estar solo presente en la red de resultados recuperados
Fuente: Resoneo, julio 2026, sobre las 440 páginas abiertas expuestas como objetos de resultado
El problema es que abrir es excepcional y no depende de ti. De las aperturas registradas en el corpus, prácticamente todas ocurrieron en modo thinking de cuentas de pago. En cuenta gratuita, el modelo casi nunca abre nada.
Lo que sí depende de ti es el tipo de página que el modelo decide abrir cuando abre. El patrón es nítido: material regulatorio, documentación oficial, fuentes primarias, páginas de precios, salas de prensa. Páginas profundas del árbol, casi nunca home pages. Si quieres ser de los que se abren, publica el documento fuente, no el resumen del documento fuente.
El presupuesto de grounding: tu título, tu H1 y 146 caracteres
Una cita no es una dirección, es una coordenada dentro de una caché ordenada. Lo que entró en el almacén durante la recuperación determina lo que puede citarse al escribir. Tu calidad y tu frescura solo entran en la ecuación si sobreviviste al paso anterior.Resoneo, julio 2026
Si el modelo decide con un fragmento, la pregunta operativa es de dónde sale ese fragmento. Y acá viene el hallazgo más accionable de todos: el snippet del índice interno de OpenAI no se toma de tu meta description, se toma del inicio del cuerpo renderizado de tu página, y se corta pasados los 202 caracteres.
Tu meta description no es inútil, pero cambia de rol. Sirve cuando el resultado llega vía Google scrapeado, que la usa aproximadamente una de cada tres veces. Para el índice propio de OpenAI, sencillamente se ignora.
El ancla de ese fragmento es el H1. En las páginas que tienen uno, el H1 aparece dentro del snippet el 83,6% de las veces, y en el 77% de esos casos es el primer carácter del fragmento. El corte casi nunca cae en mitad del H1: sobre cerca de cuatrocientos snippets que lo contenían, solo cuatro lo truncaban.
| Bloque | Espacio mediano | Qué es |
|---|---|---|
| Antes del H1 | 7 caracteres | Lo que el template mete entre el inicio del cuerpo y tu H1 |
| El H1 | 51 caracteres | Tu titular real, que casi nunca se corta |
| Después del H1 | 146 caracteres | Lo único que te queda para convencer |
caracteres de contenido propio, después del H1, es lo que en la práctica tienes para convencer al modelo en modo instantáneo
Fuente: Resoneo, julio 2026, sobre 534 páginas citadas y contrastadas con el snippet almacenado
Dos comprobaciones hacen que este dato sea más fuerte de lo que parece. El fragmento no se elige según la pregunta: siete variantes regionales del mismo comunicado, consultadas con la misma petición, devolvieron siete anclajes distintos. Y no se construye en el momento de la búsqueda: la enorme mayoría de las páginas vistas bajo consultas diferentes devuelve un snippet idéntico. Está congelado desde el rastreo, y envejece.
Esto conecta con algo que ya venía documentado por otra vía. El análisis de Kevin Indig sobre 1,2 millones de respuestas mostró que el 44,2% de las citas en ChatGPT proviene del primer 30% del contenido. La medición del presupuesto de grounding explica el mecanismo detrás de ese porcentaje: no es que el modelo prefiera el principio, es que muchas veces el principio es lo único que tiene.
Qué consume el espacio de tu snippet antes del H1
Si el fragmento arranca en el cuerpo renderizado, todo lo que tu plantilla imprima antes del H1 te está robando espacio. Y lo que más roba no es lo que la gente supone: las migas de pan y la firma del autor son marginales.
| Qué aparece antes del H1 | Frecuencia | Caracteres que consume |
|---|---|---|
| Kicker, sección o categoría | 29% | 18 |
| Fecha de publicación o actualización | 11% | 25 |
| Alt text de la primera imagen, la que va bajo el título | 9% | 50 |
| Nombre del sitio o de la marca | 7% | 44 |
| Miga de pan | 7% | 23 |
| Firma del autor | 3% | 45 |
El alt text de la primera imagen es el ladrón silencioso. Cuando aparece, se come unos 50 caracteres, un tercio largo de todo tu presupuesto útil. Un alt descriptivo y honesto sigue siendo obligatorio por accesibilidad, pero si tu plantilla mete una imagen decorativa justo bajo el título, ese alt está compitiendo contra tu propio contenido.
La primera palanca, sin embargo, no está en esa tabla. Una de cada siete páginas analizadas simplemente no tiene H1 marcado. Ahí el anclaje se vuelve impredecible: el fragmento arranca en algún subtítulo que elige la plantilla y dejas de controlar por completo lo que el modelo ve de ti.
Este punto se cruza con el rendimiento de forma incómoda, y lo desarrollo en la guía de SEO técnico y Core Web Vitals: en un proyecto propio, un H1 que dependía de JavaScript costó 2,4 segundos de LCP. Ese mismo H1 tardío también rompe el anclaje del snippet. Un solo error, dos costos.
El ChatGPT que usa la mayoría es el gratuito, y no razona
Acá hay un sesgo que arruina muchos análisis. Casi todas las herramientas del mercado observan la interfaz deslogueada o una cuenta de pago, y ese es uno de los regímenes menos representativos de lo que realmente ocurre.
En el corpus medido, ninguna de las respuestas de cuenta gratuita entró en modo thinking. El modo instantáneo se conforma con una sola ronda de búsqueda en más de ocho de cada diez casos, y nunca abre una página para leerla.
| Comportamiento | Gratuito, modo instantáneo | De pago, modo thinking |
|---|---|---|
| Rondas de búsqueda | 1 | 6 |
| Páginas recuperadas | 11 | 100 |
| Dominios distintos consultados | 8 | 28 |
| Páginas abiertas y leídas | 0 | 1 conversación de cada 6 |
La implicación práctica es directa. Si tu público usa ChatGPT gratis, y estadísticamente la mayoría lo hace, entonces tu marca compite en un entorno que recupera once páginas, consulta ocho dominios y no lee ninguno. El margen para destacar por profundidad de contenido es nulo. El margen para destacar por cómo se presentan tus primeras líneas es enorme.
Dos almacenes distintos: el que te encuentra y el que te lee
Con la distinción entre índice y cache ya sobre la mesa, esta parte se lee sola. OpenAI mantiene tu página en dos sitios diferentes, escritos por robots distintos, y confundirlos lleva a diagnósticos equivocados. Uno sirve para encontrarte, el otro para leerte. No contienen las mismas páginas.
| El índice | La cache de lectura | |
|---|---|---|
| Qué guarda | Un fragmento corto, congelado en el rastreo | La página entera, ya convertida a Markdown |
| Cómo se llega | Con una consulta, con palabras clave | Con una dirección, la URL exacta |
| Para qué sirve | Encontrar tu página | Leerla |
| Quién lo escribe | OAI-SearchBot | ChatGPT-User, y también OAI-SearchBot |
| Qué lo actualiza | Una visita de OAI-SearchBot, y nada más | Una petición de usuario, pasados unos 30 minutos |
El punto contraintuitivo es este: ChatGPT-User nunca toca el índice. Vuelve a leer tus páginas y refresca su copia completa, y nada de eso cambia el fragmento que la búsqueda muestra. Ser rastreado y estar disponible son dos cosas distintas, y ser encontrable no es lo mismo que ser legible.
El robot de entrenamiento, por su parte, no entra en ninguno de los dos. Casi toda entrada del índice es más reciente que la última visita de GPTBot, es decir, se refrescó después de que pasara y no gracias a él. Esto importa mucho para decidir qué bloquear, y lo trato aparte.
Precisión sobre el terreno inferido: los nombres y el funcionamiento de estos dos almacenes no están documentados por OpenAI. Se reconstruyeron leyendo campos internos, cabeceras y logs de servidor. La estructura de dos almacenes la observan varios equipos por vías independientes, que es lo que le da solidez, pero sigue siendo ingeniería inversa y no una especificación.
Qué bot alimenta qué, y qué se pierde de verdad al bloquear cada uno, lo desarrollo en robots.txt y bots de IA, con la configuración exacta que uso en este sitio y por qué.
La copia que ChatGPT tiene de ti tiene una edad, y no la eliges
El mecanismo es una cache que sirve primero y comprueba después. Por debajo de una ventana de unos treinta minutos, la página no se vuelve a abrir siquiera. Pasada esa ventana, ChatGPT te muestra igual la versión antigua y luego va a refrescar en segundo plano: la versión fresca solo se sirve en la petición siguiente.
De ahí sale una lectura de logs que casi todo el mundo hace al revés. Cuando ves ChatGPT-User en tus registros, no es una lectura para el usuario que está preguntando en ese momento. Es un refresco de la cache de OpenAI, del que se beneficiará el visitante siguiente.
Hay dos hallazgos más de esta cache que conviene conocer antes de tomar decisiones técnicas. Primero: es compartida entre usuarios. La copia creada por una cuenta se sirve a otra cuenta, en otro país y con otro plan, sin que llegue una sola petición a tu servidor. La clave de la cache es la dirección de la página, no el usuario. Segundo: las páginas que enviaban una cabecera Cache-Control con no-store, que prohíbe explícitamente cualquier almacenamiento, se cachearon igual.
El hallazgo que abrió toda esta línea de investigación, un parámetro de la API que consulta el almacén de OpenAI sin salir a la web, es de Jérôme Salomon y está documentado de forma independiente en el análisis del índice cacheado de OpenAI. Es la prueba concreta de que el índice de descubrimiento y la cache de lectura existen.
En qué no están de acuerdo quienes miden ChatGPT
Publico los desacuerdos por dos razones. La primera es honestidad: quien te vende certezas sobre un sistema cerrado te está vendiendo algo que no tiene. La segunda es didáctica, porque ver dónde falla el consenso enseña más sobre cómo se investiga esto que cualquier lista de tácticas.
Qué es labrador, el índice interno de OpenAI
labrador es el nombre que apareció en uno de los valores del campo interno de OpenAI, y hay dos lecturas enfrentadas. Suganthan Mohanadasan lo interpreta como una lista de publishers con acuerdo o con trato preferente. Las mediciones de Resoneo no respaldan esa lectura, porque encuentran ahí dominios que no encajan con ninguna hipótesis de acuerdo comercial. Yo no tengo datos propios para arbitrar, y prefiero decirlo así antes que elegir la versión más citable.
Cuánto tiempo retiene OpenAI la copia de tu página
La retención observada pasó de unos 30 días en las mediciones publicadas a fines de 2025 a más de 90 días en las de julio de 2026, esta última documentada con una línea de log de servidor por Jérôme Salomon (Oncrawl). No sé si el sistema cambió o si los protocolos miden cosas distintas. Lo que se sostiene en ambas mediciones es que nadie observó una expiración.
Qué robot alimenta el índice de descubrimiento
La cobertura de 2025 asumía que ChatGPT-User, el robot que abre páginas bajo demanda, añadía esas páginas al índice de búsqueda. El estudio de julio de 2026 lo corrige: ChatGPT-User alimenta la cache de lectura y nunca el snippet del índice. La diferencia es muy práctica, porque significa que provocar visitas de ese robot no mejora tu descubribilidad.
El estudio de julio de 2026 que sostiene la mayor parte de las cifras de este artículo no tiene una URL pública localizable, así que lo cito por autoría: es de Resoneo, y sus publicaciones sobre el tema están en el hub de investigación de Resoneo, donde también está su trabajo previo sobre web.run y los fan-outs.
Cinco verticales, cinco sistemas sin conexión entre sí
Lo que vale para la búsqueda web no vale para ninguna de las otras superficies. Cada una tiene su propia cadena de suministro, y cuatro de las cinco no tienen relación alguna con los motores de búsqueda. Una estrategia de visibilidad en ChatGPT que solo trabaje la búsqueda web deja cuatro puertas cerradas.
| Superficie | De dónde saca los datos | Qué implica para ti |
|---|---|---|
| Búsqueda web | Índice interno o Google scrapeado | La única donde el trabajo sobre tu página cuenta directo |
| Noticias | Resúmenes generados por máquina, más feeds de partners | El resumen no se extrae de tu artículo, se reescribe. Y puede funcionar sin rastreo previo |
| Local y mapas | Feeds de Yelp, TripAdvisor y Google Maps | La copia no viene de tu sitio. Se juega en SEO local y en tu ficha de Google Business |
| Shopping | Catálogo propio alimentado por feeds de comerciantes | No comparte una sola URL con los motores. Rankear no te mete en el carrusel |
| Imágenes | Re-alojadas en servidores de OpenAI | Aparecen sin que llegue una petición a tu servidor, y sin dejar rastro en tus logs |
El caso de shopping es el más contundente para quien vende. El carrusel de productos no comparte ninguna dirección con los motores de búsqueda, y la ficha de producto es un objeto cacheado durante semanas, idéntico de una cuenta a otra y entre países. Estar en la primera consulta de un producto vale más que rankear bien después.
En local aparece un detalle revelador: cerca de una de cada cinco fichas etiquetadas como Yelp llevaba un enlace copiado del perfil de Google Business del negocio, mientras Yelp mostraba solo la dirección. La etiqueta del proveedor no te dice de dónde salió cada campo, y tu ficha de Google Business puede estar alimentando respuestas donde ni siquiera aparece nombrada.
Cómo se trabaja cada una de esas superficies fuera de la búsqueda web lo cubro en las guías de SEO local y de comercio agéntico, porque son disciplinas distintas y no se resuelven con el mismo trabajo.
Por qué tus mejores citas no llevan utm_source
ChatGPT añade el parámetro utm_source con el valor chatgpt.com al 95% de los enlaces que muestra, y en modo instantáneo a todos. Hay una familia que se escapa siempre: las páginas que el modelo abrió y leyó él mismo nunca llevan ese parámetro.
Léelo dos veces, porque es incómodo. Las citas que más valen, las que vienen de una página que el modelo se molestó en abrir y que por eso tiene un 74% de probabilidad de ser citada, son exactamente las que tu herramienta de analítica no va a atribuir a ChatGPT. Si mides el impacto de la IA contando sesiones con utm, estás sistemáticamente subestimando el caso bueno.
El comportamiento de cero clic que hay detrás de todo esto, con el panel de datos que lo cuantifica, está documentado por iPullRank en su análisis de comportamiento de cero clic. Es la referencia que uso cuando alguien discute si la caída de clics es real o es una impresión.
Este sesgo es una de las razones por las que insisto en separar lo que se ve, lo que se infiere y lo que se supone. Lo trabajo en detalle en cómo medir la visibilidad en IA, junto con los KPIs que sí resisten un escrutinio serio.
Cuidado con los rankings de visibilidad en IA
Con el embudo sobre la mesa, hay una conclusión que afecta directo a cómo se compran herramientas. Cuando un estudio lista a arXiv o a Reddit entre los sitios más visibles en ChatGPT, lo que está diciendo, sin saberlo, es que la herramienta detrás no distingue una página recuperada de una citada.
El dato es difícil de discutir: arXiv apareció más de dos mil seiscientas veces en el corpus y se citó diez. Nunca se abrió. Y no es por llegar sin fragmento, porque en las ciento diecisiete ocasiones en que sí llegó con fragmento, se citó exactamente cero veces. Reddit sigue el mismo patrón: masivamente recuperado, prácticamente nunca mostrado al lector.
El modelo lee preprints y discusiones de Reddit para formarse una opinión, y luego expone al lector páginas web ordinarias. Confundir ambas capas es la diferencia entre medir visibilidad y medir tráfico potencial.
Qué hacer si no eres técnico: qué pedirle a tu equipo
Esta parte es para quien dirige, contrata o decide, y no va a tocar una línea de código. Todo lo anterior se traduce en cinco encargos concretos que puedes pedirle a tu equipo o a tu agencia, con su forma de verificación al lado.
- Pide que cada página tenga un H1 real y único, y que sea el titular de verdad. Verifícalo abriendo la página, pulsando control y U, y buscando la etiqueta h1 en el código. Si no aparece, no está.
- Pide despejar lo que la plantilla imprime entre el inicio del contenido y ese titular. Verifícalo mirando la página: si sobre el titular hay categoría, fecha, firma y una imagen decorativa, ahí se está yendo tu presupuesto.
- Pide que las dos primeras frases después del titular digan lo esencial, con la marca y la propuesta de valor dentro. Verifícalo leyendo solo esas dos frases y preguntándote si alguien que no te conoce entendería a qué te dedicas.
- Pide fuentes primarias publicadas en el sitio: datos propios, documentación, precios, metodología. Verifícalo comprobando que exista una URL propia para cada una, y no un PDF suelto ni una diapositiva.
- Pide que la medición de IA distinga entre aparecer como fuente y ser citado en el texto. Verifícalo pidiendo las dos cifras por separado en el informe. Si te dan una sola, no están midiendo lo que crees.
Y una pregunta que sirve para evaluar a cualquier proveedor en esta materia: pídele que te explique en qué se diferencia una página recuperada de una citada. Si no distingue las dos capas, sus informes de visibilidad en IA están contando páginas que ningún lector vio nunca.
Qué hacer si eres técnico: checklist de optimización
El checklist de implementación. Ninguna de estas acciones es sofisticada, y esa es justamente la ventaja: casi nadie las está haciendo con intención.
- Marca un H1 real en cada página. Es el ancla del fragmento que te representa, y una de cada siete páginas no lo tiene.
- Despeja la pista entre el H1 y el primer párrafo. Todo lo que la plantilla imprima antes te quita espacio del presupuesto.
- Revisa el alt de la primera imagen. Si es decorativa y va justo bajo el título, te puede costar 50 de tus 146 caracteres útiles.
- Escribe los primeros 146 caracteres después del H1 como si fueran lo único que se va a leer, porque en modo instantáneo suele serlo.
- Cuida los primeros 60 caracteres del título: si el resultado llega vía Google scrapeado, se corta ahí y con elipsis en uno de cada cuatro casos.
- Sirve el H1 en el HTML del servidor, no por JavaScript. Un H1 tardío rompe el anclaje del snippet y castiga el LCP a la vez.
- Cubre el tema completo y no una sola keyword, porque el fan-out va a buscar facetas que tú no escribiste.
- Publica fuentes primarias y documentación propia si quieres estar en el grupo que el modelo abre: material oficial, datos originales, páginas profundas, no home pages.
- Deja de asumir que tu meta description te representa ante ChatGPT. Para su índice propio, se ignora.
Y una advertencia de método que vale más que cualquier táctica: el enrutado no es determinista. La misma pregunta, dos días después, en la misma cuenta, puede cambiar de motor por completo. Un tercio de los prompts repetidos cambia de comportamiento. Ninguna conclusión sobre visibilidad en IA se sostiene sobre una sola captura.
Preguntas frecuentes sobre ChatGPT Search
¿Cuál es la diferencia entre ChatGPT y un buscador?
Un buscador te devuelve una lista de páginas para que elijas. ChatGPT redacta una respuesta y, cuando busca, se apoya en un paquete de resultados que recibe como texto. La diferencia práctica es que el buscador te muestra diez opciones y ChatGPT te muestra una conclusión con dos o tres fuentes. Además, buscar es solo una de sus funciones: también responde de memoria, ejecuta código, lee archivos y genera imágenes.
¿ChatGPT busca en Google?
A veces sí, de forma indirecta. Las mediciones de 2026 identifican dos orígenes principales para los resultados web: un índice propio de OpenAI y resultados de Google obtenidos por scraping. Cuál se activa depende de la consulta y del modo, y no es determinista: la misma pregunta repetida días después puede resolverse por otra vía.
¿ChatGPT navega por internet en tiempo real?
No como lo haría una persona. No abre tu web en un navegador ni ve tu diseño. Recibe una lista de resultados con título, URL y un fragmento de texto, y solo en casos excepcionales pide la página completa, que además suele venir de una copia guardada y no de tu servidor. En el corpus medido en julio de 2026 se abrió cerca de 1 de cada 80 URLs recuperadas.
¿Qué es el query fan-out?
Es la descomposición de tu pregunta en varias sub-consultas más cortas que se lanzan en paralelo, cada una con su propia lista de resultados. Existe porque una pregunta larga y conversacional recupera mal en cualquier motor. Para una marca significa que compite en búsquedas que nadie escribió y que no aparecen en las herramientas de keywords. El modo instantáneo suele hacer una sola ronda; el modo thinking hace unas seis.
¿ChatGPT sabe cosas de este año?
De memoria, no: su conocimiento paramétrico está congelado en la fecha de corte del entrenamiento. Lo reciente solo entra si el sistema decide buscar en la web durante esa conversación. Por eso una respuesta sin citas sobre un tema actual hay que tratarla con desconfianza: es memoria, no consulta.
¿Por qué ChatGPT a veces inventa una fuente?
Porque un modelo de lenguaje genera la continuación más probable, y una URL con forma verosímil es una continuación probable. Cuando no hubo búsqueda, no hay ninguna lista real de la que sacar el enlace, así que lo construye. Cuando sí hubo búsqueda, el error cambia de forma: suele atribuir a un sitio una afirmación que estaba en otro de los resultados.
¿ChatGPT lee mi página completa cuando me cita?
Casi nunca. En el corpus medido en julio de 2026, se abrió y leyó cerca de 1 de cada 80 URLs recuperadas, y prácticamente todas esas aperturas ocurrieron en modo thinking de cuentas de pago. En el resto de los casos el modelo trabaja con tu título, tu URL y un fragmento de unos 200 caracteres.
¿Sirve de algo la meta description para ChatGPT?
Depende del motor que traiga el resultado. Cuando llega vía Google scrapeado, la meta description se usa aproximadamente una de cada tres veces. Cuando llega del índice propio de OpenAI, se ignora: el fragmento se toma del inicio del cuerpo renderizado de la página, anclado en el H1.
¿Por qué mi página aparece en las fuentes pero no en la respuesta?
Porque son escalones distintos. De más de 61.000 pares respuesta y página medidos, un 12,4% quedó ligado a alguna cita y solo un 8,2% fue la fuente principal visible. Nueve de cada diez páginas recuperadas se quedan al fondo del panel de fuentes, sin promoverse ni recogerse en el texto.
¿ChatGPT guarda una copia de mi página?
Sí, en dos lugares distintos: un índice con un fragmento corto que sirve para encontrarte, y una cache de lectura con la página completa convertida a Markdown. Esa cache se comparte entre usuarios y países, se sirve sin volver a tocar tu servidor y las mediciones observan retenciones de semanas o meses, sin expiración registrada.
¿Cada cuánto se actualiza lo que ChatGPT sabe de mi página?
El fragmento del índice solo se refresca cuando lo visita OAI-SearchBot, y puede quedar semanas por detrás. La copia completa tiene una ventana de frescura de unos 30 minutos, pero funciona sirviendo primero la versión antigua y refrescando después, así que la versión nueva se entrega recién en la petición siguiente.
¿Escribir hoy o ahora en el prompt obliga a ChatGPT a buscar?
No, esas marcas temporales no producen un cambio medible en el comportamiento de búsqueda. Lo que dispara la recuperación en vivo es la vertical de la pregunta y la volatilidad real del dato: precios, disponibilidad, noticias o normativa activan búsqueda mucho más que una pregunta conceptual.
¿Posicionar bien en Google me asegura aparecer en ChatGPT?
Ayuda en la búsqueda web, sobre todo en modo thinking, donde buena parte de los resultados proviene de Google scrapeado. Pero no sirve para las otras cuatro superficies: shopping, local, noticias e imágenes se alimentan de feeds y catálogos propios. El carrusel de productos, por ejemplo, no comparte una sola URL con los motores de búsqueda.
En resumen: te juegas la visibilidad en tus primeras líneas
El recorrido completo, en una frase: un modelo que predice texto y no recuerda hechos necesita buscar, esa búsqueda se descompone en sub-consultas que tú nunca escribiste, y de cada resultado el modelo recibe una ficha de tres líneas con la que decide a quién nombrar.
Una página puede ser encontrada y no mostrada, mostrada y no citada, citada sin haber sido leída nunca, o leída desde una copia vieja de hace meses. Para la mayoría de las respuestas, la representación real de una marca ante ChatGPT se reduce a un título, un H1 y unos 146 caracteres.
Ese es el cambio de mentalidad que propongo. No se trata de escribir más, se trata de entender que el modelo casi siempre decide con un fragmento congelado y no con una lectura completa. Los primeros elementos semánticos de tu página pesan más, hoy, que gran parte del contenido que viene después.
Si quieres trabajar la visibilidad de tu marca en respuestas de IA con este nivel de detalle, y no con recetas genéricas, una agencia de AEO como Milimetrix puede ayudarte a auditarlo y ejecutarlo. Trabajamos con datos medidos, no con supuestos. Hablemos.









