AEO/GEO
Cómo medir la visibilidad en IA: KPIs, métricas y prompts
Que la IA te cite no es lo mismo que te mande tráfico. Cómo medir la visibilidad en IA: qué mirar, qué ignorar y por qué el prompt lo decide todo.
La medición es, sinceramente, la parte que más me apasiona y la que peor se hace en la industria. Casi todos los reportes de visibilidad en IA que reviso miden lo fácil, no lo que mueve la aguja. Esta guía es la forma en que medimos de verdad: qué mirar, qué ignorar, y cómo evitar el autoengaño de un número que suena bien pero no dice nada.
El error de medir la IA con sesiones
El tráfico referido por IA existe, pero es el piso del impacto, no el techo. Las personas descubren, comparan y validan una marca dentro de la conversación, muchas veces sin llegar al sitio. Medir solo las sesiones que llegan es como juzgar una conversación por las veces que alguien pidió tu número: pasó mucho antes de eso.
de clic logran los enlaces de las fuentes citadas alrededor de una AI Overview: la cita da visibilidad, no necesariamente la visita
Fuente: Estudio de eye-tracking, 2026
Si la cita casi no genera clic, entonces medir el impacto solo por el clic deja fuera la mayor parte del valor. Por eso la presencia en la respuesta hay que registrarla como un activo en sí mismo, distinto de la visita.
Aparecer no es una cosa: son seis escalones distintos
Acá está, para mí, el problema más serio de la medición actual. Casi todas las herramientas del mercado dicen medir visibilidad, pero no aclaran en qué capa cuentan. Y hay al menos seis capas entre que un motor recupera tu página y que alguien llegue a tu sitio. Contar en una y reportar como si fuera otra es lo que produce esos tableros llenos de datos que no sirven para decidir.
| Escalón | Qué significa de verdad | Cuánto sobrevive |
|---|---|---|
| Recuperada | El motor la trae y el modelo la recibe entre sus resultados | La base de todo |
| Listada | Aparece en el panel de fuentes, casi siempre bajo el pliegue | Cerca del 88% |
| Ligada a una cita | Queda enganchada a una afirmación de la respuesta | 12,4% |
| Fuente principal visible | Da nombre a la píldora de cita que el lector realmente ve | 8,2% |
| Abierta y leída | El modelo pide la página completa y la procesa | 1,2% |
| Tráfico | Alguien hace clic y llega al sitio | Otra medición, y con un sesgo propio |
Los porcentajes salen de medir más de 61.000 pares de respuesta y página en julio de 2026. Lo que dicen es que nueve de cada diez páginas recuperadas se quedan al fondo del panel, detrás de un clic, sin promoverse nunca ni recogerse en el texto. Están técnicamente visibles y son prácticamente invisibles.
Prueba rápida para evaluar una herramienta de visibilidad en IA: pregúntale en qué escalón cuenta. Si no sabe responder, o si mezcla recuperadas con citadas en la misma métrica, sus números no son comparables con nada, ni siquiera consigo mismos entre versiones.
El síntoma más fácil de detectar es este: cuando un ranking de visibilidad lista a arXiv o a Reddit entre los sitios más visibles en ChatGPT, está delatando que no distingue una página recuperada de una citada. En el corpus medido, arXiv apareció más de dos mil seiscientas veces y se citó diez, sin abrirse nunca. Y no es por llegar sin fragmento: en las ciento diecisiete ocasiones en que sí llegó con fragmento, se citó cero veces.
El punto ciego que arruina la atribución por UTM
Hay un detalle técnico que conviene conocer antes de confiar en el informe de tráfico referido. ChatGPT añade el parámetro utm_source con el valor chatgpt.com al 95% de los enlaces que muestra, y en modo instantáneo a todos. Pero hay una familia que se escapa siempre: las páginas que el modelo abrió y leyó él mismo nunca llevan ese parámetro.
es la probabilidad de ser citado si el modelo abrió la página, frente a la de estar solo recuperado. Y son justo esas citas, las que más valen, las que llegan sin parámetro de atribución
Fuente: Resoneo, julio 2026
El sesgo es sistemático y va en una sola dirección. Una página que el modelo se molestó en abrir tiene un 74% de probabilidad de ser citada, frente al 7% de una que solo recuperó. Es el mejor caso posible, y es exactamente el que tu analítica no va a atribuir a ChatGPT. Si mides el impacto de la IA contando sesiones con UTM, estás subestimando precisamente lo que mejor funciona.
El mecanismo completo, con los dos almacenes de OpenAI y qué ve realmente el modelo de una página, lo desarrollo en cómo funciona ChatGPT Search.
Dos preguntas distintas: ¿aparezco? y ¿vendo?
Antes de armar cualquier tablero conviene separar dos planos que casi siempre se mezclan. Uno mide el negocio; el otro, la visibilidad. Confundirlos es la razón por la que tantos reportes de IA se ven llenos de datos y no sirven para decidir nada.
| Plano | Qué responde | Qué se mira |
|---|---|---|
| Negocio | ¿Esto se traduce en ventas? | Ingresos y compras que vienen desde LLMs, conversión y conversiones asistidas por IA |
| Visibilidad | ¿Aparezco donde debería? | Share of voice por motor, cantidad de menciones y citas, sentimiento de la mención |
Los del plano de negocio son la estrella polar: si suben, todo lo demás valió la pena. Los de visibilidad son direccionales, ayudan a explicar el movimiento y a detectar problemas temprano, pero no son el fin. Un share of voice altísimo que no mueve una sola venta es una métrica de vanidad con mejor marketing.
Recuperación, cita y recomendación no son lo mismo
La primera pregunta es la obvia: ¿aparezco en las preguntas donde mi marca debería aparecer, o solo en las fáciles? Pero aparecer tiene capas, y no todas valen lo mismo. Conviene medirlas por separado, porque una marca puede estar en una y quedarse afuera de la siguiente.
- Recuperación: el modelo usa la información de tu sitio para construir la respuesta, aunque no te nombre. Es la base, la señal de que tu contenido entró al proceso.
- Cita: el modelo referencia un pasaje o una parte concreta de tu contenido. Ya es presencia visible.
- Recomendación: el modelo te menciona dentro de las opciones que recomienda. Es la forma más valiosa de ser considerado por un LLM, y la única que de verdad mueve una decisión.
Y hay una capa aparte que puede arruinar todas las anteriores: la exactitud. Puede que te recuperen, te citen y te recomienden, pero si el modelo entrega información equivocada de tu negocio, omite algo por falta de datos o repite algo obsoleto que ya no representa lo que tu marca quiere comunicar, tienes un problema igual de serio. Que hablen bien de ti no sirve de nada si lo que dicen está mal.
Separar lo que se ve, lo que se infiere y lo que se supone
No toda la visibilidad en IA se puede atribuir con la misma confianza. La medición honesta clasifica cada señal según cuánto se puede probar, y las reporta por separado.
- Lo que se ve, del lado del negocio: sesiones y conversiones que llegan con referrer o UTM desde una respuesta de IA. Poca cobertura, pero máxima confianza.
- Lo que se ve, del lado del modelo: el tracking de prompts. Registrar qué responde el modelo a un conjunto fijo de preguntas es un dato objetivo y reproducible, no una inferencia. No es una venta ni una sesión, pero es una medición directa de tu visibilidad, y por eso vale tanto como un UTM: no depende de que alguien haga clic.
- Lo que se infiere: señales que acompañan a la influencia sin probarla. El lift de búsqueda de marca en Search Console, el tráfico directo a páginas que aparecen en respuestas, y una pregunta simple en el formulario de contacto: ¿cómo nos encontraste?
- Lo que se supone: estimaciones con supuestos sobre las capas anteriores. Sirven para armar el caso de inversión, nunca para reportar resultados como si fueran hechos.
No fundas las tres capas en un solo número de impacto en IA. Reporta por separado lo que viste, lo que inferiste y lo que supusiste. El número único que mezcla las tres es la forma más elegante de mentirse a uno mismo.
El detalle que casi nadie cuida: cómo se plantea el prompt
Acá está, para mí, la diferencia entre una medición seria y un dashboard bonito. La mayoría de estas mediciones se hace por API, preguntándole al modelo. Y el prompt no es un detalle de la medición: es el instrumento. Un instrumento mal calibrado no da error, da una lectura falsa con toda seguridad.
Un ejemplo de lo que vemos en Milimetrix. Con un cliente, sin tocar una sola línea de su contenido, solo rediseñando cómo planteábamos los prompts de medición, la foto cambió por completo. Pasamos de respuestas genéricas y sesgadas a información mucho más realista, específica y comparable entre semanas. El mismo modelo, la misma marca, la misma ventana de tiempo. Lo único distinto era la pregunta. Ahí quedó claro que quien mide con prompts flojos no está midiendo su visibilidad, está midiendo el sesgo de su propia pregunta.
Estos criterios son los que usamos para que el prompt no contamine la lectura:
- Fijar la geolocalización: país y, si aplica, ciudad. Una marca chilena medida sin país compite contra el mundo.
- Obligar al modelo a recomendar o comparar, no solo a describir.
- Partir de problemas reales del usuario, no de keywords genéricas.
- No nombrar marcas en el prompt: si las mencionas tú, dejas de medir y empiezas a sugerir.
- Variar perfiles y necesidades para cubrir distintos tipos de usuario.
- Empujar al modelo a buscar información actualizada, para que responda buscando en la web y no desde sus datos de entrenamiento.
Por dónde empezar a medir
No hace falta medir todo el primer día. Conviene armar un conjunto acotado de preguntas que cubra el recorrido completo, de la que recién descubre la categoría a la que ya está por comprar, y empezar por donde hay más para ganar rápido: los temas donde la marca ya es relevante pero la IA todavía no tiene una buena fuente a la que enlazar. Esas victorias tempranas dan tracción y, sobre todo, compran la confianza para pelear después los temas difíciles. Y como siempre en SEO, lo que importa no es la foto de un día sino el evolutivo: registrar cómo se mueven las menciones en el tiempo y marcar los hitos (contenido, PR, técnica) para poder atribuir efectos.
Qué le pido a una herramienta de medición
Aparecen plataformas nuevas todo el tiempo (Trakkr, Profound, Batwise, SearchBrand.ai, entre otras). Más allá del nombre, les pido siempre lo mismo:
- Una capa analítica de verdad, no solo dashboards: poder segmentar, cruzar y exportar los datos.
- Volumen de prompts suficiente: como el modelo es probabilístico, sin muestra la señal es ruido.
- Varios modelos: ChatGPT domina, pero medir uno solo deja la foto a medias.
- Integraciones: GA4, Search Console, Looker Studio, salida a CSV o carga a una base, idealmente automática.
- Visibilidad de fuentes: de dónde saca la información el modelo y qué sitios influyen en cada recomendación. Ahí está lo accionable.
- Que distinga una página recuperada de una citada. Es el filtro que más herramientas reprueba, y sin él los números no son comparables ni consigo mismos.
Esta guía es parte del pilar sobre AEO y GEO, donde explico por qué la visibilidad en IA se juega en cada respuesta.
Y para conectar estas señales con el negocio, más allá del tráfico, está la guía sobre cómo medir el impacto real del SEO.
Preguntas frecuentes sobre medición en IA
¿Cómo se mide la visibilidad de una marca en ChatGPT o Perplexity?
Con un conjunto de preguntas representativas por motor, midiendo cuántas veces la marca aparece citada o recomendada, si la recomiendan o solo la incluyen, y con qué exactitud la describen. Se mide motor por motor, porque una marca puede ser fuerte en uno y no aparecer en otro.
¿Por qué el tráfico no basta para medir el impacto de la IA?
Porque buena parte de la influencia ocurre dentro de la respuesta, sin clic. Los enlaces de las fuentes en una AI Overview apenas logran un 13,6% de clic. El tráfico referido es el piso del impacto, no el techo, así que la presencia en la respuesta se mide como un valor en sí mismo.
¿Qué es el share of voice en IA?
Es el porcentaje de respuestas, dentro de un conjunto de preguntas, que cita o recomienda a la marca frente a sus competidores directos. Es una métrica de visibilidad, direccional: sirve para comparar presencia, no para probar ventas.
¿Por qué importa tanto cómo se redacta el prompt de medición?
Porque el prompt es el instrumento. Cambiar cómo se plantea la pregunta, sin tocar el contenido de la marca, cambia por completo la respuesta que se mide. Un prompt flojo o sesgado no mide tu visibilidad, mide el sesgo de tu propia pregunta.
Lo que de verdad importa
Medir la IA no es sumar dashboards. Es tener el criterio para distinguir la cita del tráfico, la presencia de la venta, y lo que se ve de lo que se supone. La herramienta ayuda, pero el que decide qué preguntar y cómo leerlo sigue siendo el que sabe.
En Milimetrix somos expertos en AEO y montamos la medición de visibilidad en IA por motor, conectada al negocio y cuidando lo que casi nadie cuida: cómo se plantea cada prompt. Si quieres un tablero que no te mienta, hablemos.









