Auditoría de correlación de variables de tráfico para SEO

Herramientas SEO

Auditoría de correlación de variables de tráfico para SEO

Cómo auditar con Pearson si los clics, las sesiones, la inversión y las conversiones se mueven juntos: valida el tracking y detecta canibalización.

Hay una pregunta que conviene hacerse antes de reportar cualquier número de un proyecto de SEO: los datos que estoy mirando, ¿son confiables? No si están bien presentados, ni si el gráfico se ve prolijo, sino si registran lo que dicen registrar. La auditoría de correlación de variables de tráfico es la forma más barata que conozco de responderla, y de paso deja ver cosas que ninguna herramienta muestra por su cuenta.

El método es viejo y prestado: es correlación de Pearson, estadística de primer año, aplicada a las series de tráfico, de inversión y de conversión de un sitio. Lo que cambia es para qué se usa. Aquí no se busca un hallazgo de marketing, se busca saber si dos variables que deberían moverse juntas efectivamente lo hacen, y qué significa cuando dejan de hacerlo.

Adentro está el procedimiento completo en planilla, con las fórmulas de Google Sheets y de Excel, cómo quitar la tendencia antes de creerle al coeficiente, cómo aislar los eventos que lo sesgan, cómo se detecta canibalización entre orgánico y pagado, y los límites del método, que son varios y conviene decirlos antes de que alguien tome una decisión de presupuesto con una r en la mano.

Qué es una auditoría de correlación de variables de tráfico

Es un análisis que mide, sobre una tabla con una fila por día y una columna por variable, cuánto se mueven juntas las variables de tráfico, inversión y conversión de un sitio. Se calcula con el coeficiente de correlación de Pearson, que resume en un número entre -1 y 1 la fuerza y el sentido de la relación lineal entre dos series.

No es un informe que se entregue al cliente, es un instrumento de diagnóstico interno. Responde tres preguntas que ninguna herramienta responde sola.

  • ¿La medición es confiable? Si dos variables que miden lo mismo desde puntos distintos dejan de moverse juntas, el problema está en el marcaje y no en el desempeño.
  • ¿El pagado sustituye al orgánico? Cuando las campañas compran clics que el sitio habría ganado igual, la relación entre los dos canales cambia de forma detectable.
  • ¿El sitio responde a la demanda de su categoría? Cruzar el interés de búsqueda con el tráfico propio dice si el sitio captura las subidas del mercado o se las pierde.

La correlación no implica causalidad, y esta auditoría no es la excepción. Su resultado es una hipótesis con evidencia, nunca un veredicto. Leerla como veredicto es la forma más común de sesgar la conclusión: el mismo coeficiente que bien leído destapa un problema de medición, mal leído justifica una decisión de presupuesto equivocada.

Ese es el techo del método y conviene ponerlo al principio, no al final. Lo que sigue explica cómo correr la auditoría bien, y también cómo no sobreinterpretarla.

Cuántos datos hay de verdad, y qué se puede concluir con eso

Antes de abrir la planilla hay que saber cuánta historia existe, porque no se puede correlacionar lo que no se tiene. Y aquí hay una regla que decide todo lo demás: la correlación necesita pares de observaciones en las mismas fechas, así que la ventana utilizable de cada par es la intersección de las dos series. Manda la más corta.

La consecuencia es que tener más historia en una variable no compensa tener menos en la otra: la nivela hacia abajo. Un par que involucre Search Console se calcula sobre 16 meses o no se calcula, aunque GA4 tenga sesiones desde 2021.

El techo lo pone Search Console

  • Search Console guarda 16 meses, tanto en el informe de Rendimiento como en la Search Analytics API. Son cerca de 480 a 490 observaciones diarias. Google documenta la salida explícita: para extender esa ventana hay que usar la API o las exportaciones masivas y guardar los datos en sistemas propios.
  • GA4 no está topado en 14 meses en los informes estándar. La configuración de retención (dos meses por defecto, catorce como máximo en propiedades estándar) afecta solo a las exploraciones y a los embudos, no a los informes agregados, que llegan hasta el inicio de la recolección.
  • Pero por la regla de la intersección eso no rescata la auditoría: la historia extra de GA4 solo se aprovecha en los pares que no tocan Search Console, como sesiones orgánicas contra inversión, contra clics de pagado o contra Google Trends.
  • Subir la retención de GA4 de dos a catorce meses no recupera lo que ya se borró: el cambio aplica a los datos ya recolectados y no eliminados. Es una configuración para tocar al inicio del proyecto, no la semana en que se encarga la auditoría.
  • Google Ads hoy tiene más historia que Search Console: desde el 1 de junio de 2026 su política de retención deja 37 meses para datos diarios, semanales y por hora, y 11 años para datos mensuales o anuales. Después de esas ventanas los datos quedan inaccesibles por interfaz y por API.

Las exportaciones a BigQuery no rellenan histórico

La exportación masiva de Search Console a BigQuery existe desde febrero de 2023 y es la forma correcta de escapar al techo de 16 meses, con una advertencia grande: es solo hacia adelante. La documentación de Google lo dice sin ambigüedad, la primera exportación incluye los datos del día en que se configura, y para lo anterior remite a la API o a los informes. Google además declaró públicamente que no tiene planes de agregar relleno histórico.

Una vez adentro, los datos sí escapan al techo: se acumulan de forma indefinida en el proyecto, salvo que se configure una expiración. La exportación en sí no se cobra, pero el almacenamiento y las consultas de BigQuery sí, y Google recomienda fijar una expiración de partición de al menos 14 días para controlar el costo.

Del lado de GA4 pasa algo parecido con un matiz que conviene decir bien. Las tablas de eventos crudos no se rellenan hacia atrás, y una propiedad estándar tiene un tope de un millón de eventos diarios: si se supera de forma consistente, la exportación se pausa y los días anteriores no se reprocesan. En cambio el servicio de transferencia de datos de BigQuery para GA4 sí admite relleno, pero de informes agregados y dentro de la propia política de retención, no de eventos crudos.

No se correlaciona lo que no se tiene, y el momento de decidirlo es al inicio del proyecto. Montar la exportación masiva cuesta una tarde cuando se empieza, y no cuesta nada cuando el cliente pide la auditoría dos años después y el histórico simplemente no existe.

Con 16 meses el problema no es el tamaño de muestra, es la estacionalidad

250

es el número de observaciones al que se acerca el n necesario para que una correlación se estabilice en escenarios típicos, según un estudio Monte Carlo del corredor de estabilidad. En datos diarios son cerca de ocho meses; en datos mensuales, más de veinte años.

Fuente: Schönbrodt y Perugini, Journal of Research in Personality 47(5), 2013, pp. 609-612

Los 16 meses de Search Console son cerca de 488 observaciones diarias, o sea que están por encima de ese orden de magnitud. El tamaño de muestra no es el problema. Lo que 16 meses no alcanzan a dar son dos ciclos año contra año completos: para eso hacen falta 24. Se puede comparar contra un ciclo, no contra dos, y esa es la limitación real de una auditoría sin respaldo propio.

Dos cautelas más, sin las cuales el número de 488 es engañoso. La primera es que el n cercano a 250 supone observaciones independientes: el estudio simula extracciones independientes, mientras una serie diaria de tráfico está fuertemente autocorrelacionada y arrastra ciclo de día de semana, así que el n efectivo es bastante menor. La segunda es que agregar destruye el excedente: Search Console agregó vistas semanales y mensuales en diciembre de 2025, y en semanal quedan cerca de 70 observaciones y en mensual cerca de 16, las dos muy por debajo del umbral. Las 488 solo existen en granularidad diaria.

Qué mide el coeficiente de Pearson y qué queda afuera

El coeficiente de correlación de Pearson, que se escribe r, resume en un número entre -1 y 1 cuánto se parece el movimiento de dos series. Un 1 es movimiento idéntico en la misma dirección, un -1 es movimiento idéntico en dirección opuesta y un 0 es ausencia de relación lineal. Es simétrico, o sea que da lo mismo cuál variable va primero, y no tiene unidades, así que se pueden comparar coeficientes de pares que miden cosas distintas.

Esa última propiedad es la que vuelve útil el método para auditar medición: se puede poner en la misma matriz la relación entre clics y sesiones, entre inversión y conversiones, y entre interés de búsqueda y tráfico, y leerlas todas en la misma escala. Lo que no hace Pearson es mirar el nivel. Dos series pueden diferir mucho en magnitud y tener una correlación altísima, porque r mide la forma del movimiento y no la distancia entre las curvas.

Que los clics de Search Console y las sesiones orgánicas de GA4 no coincidan en nivel es esperable y no es un error. Lo que se audita es otra cosa: que se muevan igual. El nivel cambia por medición y por consentimiento, el movimiento no debería.

Y estas son las tres cosas que Pearson no ve, que conviene tener presentes desde el principio porque cada una tiene su remedio más adelante.

  • No ve relaciones no lineales: la inversión en medios pagados tiene retornos decrecientes, así que su relación con los clics no es lineal en todo el rango y r la subestima.
  • No ve efectos con rezago: una campaña que mueve la búsqueda de marca tres días después aparece plana si no se desplaza una de las dos series antes de correlacionar.
  • No ve causalidad ni terceras variables: una r alta entre dos series puede deberse por completo a una tercera que mueve a las dos, y la estacionalidad es la tercera variable más común en marketing.

Desde qué valor se considera alta una correlación

Un 0,7 se puede considerar una correlación alta, y sirve como punto de partida de la conversación. Pero de qué depende importa más que el número: depende de las particularidades del proyecto y de qué variable se está cruzando con qué otra. No existen bandas universales de interpretación para este dominio, y los dos contraejemplos siguientes explican por qué.

  • Hacia arriba: dos series diarias que comparten ciclo de día de semana pasan de 0,90 sin ningún contenido informativo. Ahí un 0,90 no certifica nada, porque lo que están compartiendo es el calendario y no una relación entre ellas.
  • Hacia abajo: un 0,45 entre inversión diaria y conversiones diarias en una cuenta chica puede ser una relación real y accionable, porque la conversión es un evento escaso y ruidoso y el coeficiente carga con ese ruido.

De ahí sale la regla que reemplaza la tabla de bandas: cada coeficiente se juzga contra tres referencias, su propia historia en la ventana móvil, un par de control que se sabe no relacionado dentro del mismo conjunto de datos, y su intervalo de confianza. Los tres se calculan más adelante en esta guía, y los tres son más informativos que cualquier umbral fijo.

Qué variables vale la pena correlacionar

La matriz se arma con las variables que el proyecto ya tiene, más dos controles que casi nadie incluye y que son los que vuelven honesto el método. Esta es la lista que uso como base.

VariableFuentePara qué sirve en la matriz
Clics orgánicosSearch ConsoleLado de la SERP del par de medición. Es la referencia contra la que se valida GA4
Impresiones orgánicasSearch ConsoleSepara un problema de demanda de un problema de CTR o de posición
Posición mediaSearch ConsoleControl: si cae el tráfico y la posición no se movió, el problema no es de ranking
Sesiones orgánicasGA4Lado del sitio del par de medición. Su razón contra los clics es el indicador clave
Eventos clave del canal orgánicoGA4Conecta el tráfico con el negocio, y detecta marcaje roto de conversiones
Inversión en medios pagadosGoogle Ads o la plataformaVariable independiente de la mayoría de las preguntas de incrementalidad
Clics de búsqueda pagadaGoogle AdsContra los clics orgánicos del mismo término, es el par de canibalización
Conversiones de búsqueda pagadaGoogle AdsDistingue sustitución de clics de sustitución de resultados
Interés de búsquedaGoogle TrendsControl de demanda externa: dice si el movimiento es del sitio o del mercado
Bandera de eventoCalendario del proyectoMarca promociones, campañas offline, migraciones, caídas y despliegues de etiqueta
Día de la semanaCalculadoControl de estacionalidad semanal, la tercera variable más común

Los dos últimos no son datos de tráfico y por eso se olvidan, pero son los que permiten distinguir una relación real de una coincidencia de calendario. Sin la columna de día de la semana no hay forma de saber si una correlación alta es información o es el mismo lunes empujando a las dos series.

Google Trends entrega un índice relativo que se reescala en cada consulta según el rango y la geografía pedidos. Dos exportaciones de rangos distintos no están en la misma escala y no se pueden pegar en una sola columna. Es un error silencioso que invalida la matriz completa sin dar ninguna señal de error.

Por eso conviene entender qué mide Trends antes de meterlo en una matriz: el índice sirve como control de demanda, no como métrica de volumen. Cómo leerlo sin sobreinterpretarlo lo desarrollo en la guía sobre cómo usar Google Trends.

Metodología: cómo se corre la auditoría paso a paso

La auditoría empieza con una pregunta y no con una matriz. Generar todos los coeficientes posibles a ver qué aparece es exactamente la práctica que produce hallazgos falsos, porque con suficientes pares alguno va a salir alto por azar. Estos son los ocho pasos en el orden en que los corro.

1. Definir la pregunta, la ventana y la granularidad

Una pregunta por auditoría. Las tres canónicas son si la medición es confiable, si el pagado sustituye al orgánico y si el sitio responde a la demanda de su categoría. Cada una necesita pares distintos y admite conclusiones distintas, y mezclarlas en una sola matriz es la forma más rápida de leer mal el resultado.

La granularidad es diaria, y la razón es aritmética. Un año de datos diarios son 365 observaciones; un año de datos mensuales son 12. Con doce puntos no se puede distinguir una relación moderada de una casi perfecta, y ninguna fórmula arregla eso después.

La granularidad no es una preferencia de formato, es el techo de lo que se puede concluir. Doce puntos mensuales no alcanzan para separar una relación moderada de una casi perfecta, y agregar a semanal o mensual destruye el excedente de muestra que da la serie diaria.

2. Armar la tabla base: una fila por día, una columna por variable

Una sola hoja plana, sin celdas combinadas, sin filas de subtotales y sin huecos. Un día en blanco no es un cero: CORREL trata las celdas vacías y los ceros de forma distinta, y meter ceros donde faltaba el dato es inventar observaciones.

A  fecha
B  clics_organicos_gsc
C  impresiones_organicas_gsc
D  posicion_media_gsc
E  sesiones_organicas_ga4
F  eventos_clave_organico_ga4
G  inversion_medios_pagados
H  clics_paid_search
I  conversiones_paid_search
J  interes_trends
K  bandera_evento
L  dia_semana
Esquema de la hoja Datos. Una fila por día en orden cronológico, una columna por variable, sin celdas combinadas ni filas de totales intermedios.

La unión entre Search Console y GA4 se hace por página de destino, nunca por consulta, y no es una preferencia de método.

Search Console omite las consultas anonimizadas, las que no hicieron más de unas pocas decenas de usuarios en un período de dos a tres meses, así que sumar las filas de consultas nunca da el total del gráfico. Fuente: Google Search Central, A deep dive into Search Console performance data filtering and limits, octubre de 2022. La consecuencia práctica es una sola: la unión se hace por página de destino.

De dónde sale cada columna del lado de la SERP, y cómo exportar clics e impresiones sin caer en la trampa de la posición media, lo trabajo en detalle en la guía sobre cómo usar Google Search Console.

3. Calcular la matriz completa, no un par de celdas

El par que todo el mundo calcula, clics contra sesiones, es el menos informativo de la matriz. El valor está en las celdas que nadie mira: inversión contra clics orgánicos, posición media contra sesiones, interés de búsqueda contra eventos clave.

=CORREL(Datos!B2:B488, Datos!E2:E488)
=PEARSON(Datos!B2:B488, Datos!E2:E488)
El coeficiente de un par. Google Sheets documenta CORREL(data_y, data_x) con la variable dependiente primero y Excel documenta PEARSON(array1, array2) con la independiente primero. Pearson es simétrico, así que el resultado es idéntico y lo único que difiere es la documentación. En planillas con configuración regional en español el separador de argumentos puede ser punto y coma en vez de coma.

Google documenta de forma explícita que CORREL es sinónimo de PEARSON. Microsoft publica la misma fórmula subyacente para las dos y devuelven resultados idénticos en Excel moderno, aunque nunca declara la equivalencia por escrito. Da lo mismo cuál se use: conviene elegir una y mantenerla en todo el archivo.

=CORREL(
  OFFSET(Datos!$A$2:$A$488, 0, MATCH($A3, Datos!$A$1:$L$1, 0) - 1),
  OFFSET(Datos!$A$2:$A$488, 0, MATCH(B$2, Datos!$A$1:$L$1, 0) - 1)
)
La matriz completa en una sola fórmula arrastrable. Los nombres de las variables van en la fila 2 como encabezados de columna y en la columna A como encabezados de fila, escritos igual que en la fila 1 de la hoja Datos.

Si las variables tienen ventanas de historia distintas hay que elegir: truncar todas las columnas a la ventana común deja los coeficientes comparables entre celdas porque comparten el mismo n, y calcular cada par sobre su propia intersección usa más dato pero deja cada celda con un n distinto, o sea con un intervalo de confianza de ancho distinto. En el segundo caso las celdas dejan de ser comparables entre sí, y la matriz obliga a publicar el n al lado de cada coeficiente. Mi recomendación es truncar para la matriz principal y usar intersecciones por par solo como análisis complementario.

4. Quitar la tendencia antes de creerle a la r

Este paso es el que separa una auditoría de una anécdota. Dos series que crecen a lo largo del período van a correlacionar alto aunque no tengan ninguna relación entre ellas, porque las dos comparten la tendencia. El remedio estándar es diferenciar: en vez de correlacionar los niveles, correlacionar el cambio día a día.

=Datos!B3 - Datos!B2
Diferenciado de primer orden en una hoja Diff paralela a Datos. La primera fila queda vacía porque no hay día anterior, y el rango de la correlación se corre una fila.

Después se calcula la matriz dos veces, sobre los niveles y sobre las diferencias, y se publican las dos. Cuando el coeficiente sobre niveles es alto y sobre diferencias se desploma, la relación era tendencia compartida y no relación. Cuando se sostiene en las dos, hay algo real que mirar.

5. Aislar los eventos que sesgan el coeficiente

La columna de bandera de evento se llena durante el proyecto, no al final: promociones, campañas offline, apariciones en prensa, migraciones, caídas de servidor, despliegues de etiqueta y cambios en el banner de consentimiento. Cada uno de esos días es un día que puede cargar el coeficiente completo.

=CORREL(
  FILTER(Datos!B2:B488, Datos!K2:K488 = ""),
  FILTER(Datos!E2:E488, Datos!K2:K488 = "")
)
El mismo coeficiente calculado solo sobre los días sin marca, usando FILTER para excluir las filas con bandera. La disciplina es publicar los dos números, con y sin los días aislados, y decir qué días se sacaron.

La diferencia entre los dos números es información en sí misma. Si el coeficiente cambia mucho al sacar cinco días de mil, esos cinco días eran el hallazgo y no un estorbo: algo pasó ahí que vale la pena entender.

6. Partir el periodo: correlación por tramos y correlación móvil

Un coeficiente del período completo esconde cuándo cambió la relación. Por eso conviene calcularlo por tramos (antes y después de un despliegue, antes y después de un cambio de consentimiento) y también como serie móvil, para ver la relación evolucionar en el tiempo en vez de resumirla en un número.

=CORREL(
  OFFSET(Datos!$B$1, ROW() - 30, 0, 30, 1),
  OFFSET(Datos!$E$1, ROW() - 30, 0, 30, 1)
)
Correlación móvil de 30 días con ventana rezagada, o sea que cada celda mira los 30 días anteriores y no los 30 siguientes. La fórmula se escribe en la fila 31 y se arrastra hacia abajo. La versión que circula en varios tutoriales construye una ventana hacia adelante y termina correlacionando con celdas vacías en la cola.

Graficada, esa serie móvil es el objeto más útil de toda la auditoría. Un salto de nivel en la correlación tiene fecha, y con fecha se puede ir al calendario del proyecto y buscar qué se hizo esa semana. Es la diferencia entre saber que algo está mal y saber cuándo empezó a estar mal.

7. Poner intervalo de confianza a cada coeficiente

Una r sin su n al lado no se puede interpretar. El procedimiento estándar es la transformación z de Fisher, que existe como función nativa en Google Sheets y en Excel: se transforma el coeficiente, se calcula el intervalo en esa escala y se vuelve con la inversa.

=FISHERINV(FISHER($B$2) - 1.96 / SQRT($B$3 - 3))
=FISHERINV(FISHER($B$2) + 1.96 / SQRT($B$3 - 3))
Intervalo de confianza al 95% de un coeficiente por la transformación z de Fisher, con el coeficiente en B2 y el número de observaciones en B3. FISHER y FISHERINV están documentadas en Google Sheets y en Excel.
Observaciones (n)r = 0,70Ancho aproximado del intervalo
30de 0,45 a 0,850,40, o sea que el coeficiente casi no restringe nada
90de 0,58 a 0,790,21
250de 0,64 a 0,750,11
488de 0,66 a 0,740,08, el orden que da un año y cuatro meses de datos diarios

La tabla es cálculo propio con la transformación z de Fisher, y su lectura es la que importa: el mismo 0,70 significa cosas muy distintas con 30 observaciones y con 488. Con 30, el intervalo cubre desde una relación moderada hasta una muy fuerte, o sea que el coeficiente no permite decidir nada. Reportar r, n y el intervalo como un trío evita esa discusión completa.

8. Cambiar a Spearman cuando los datos no se portan, y mirar el scatter siempre

Pearson supone una relación lineal y sufre con los valores atípicos. Cuando los datos no están distribuidos de forma normal, cuando son ordinales o cuando hay atípicos relevantes, la alternativa es la correlación de Spearman, que mide asociación monótona sobre los rangos en vez de sobre los valores (Schober, Boer y Schwarte, Anesthesia & Analgesia 126(5), mayo de 2018).

Ni Excel ni Google Sheets tienen una función nativa de Spearman. Se construye aplicando CORREL a dos columnas de rangos, y conviene usar RANK.AVG para que los empates se promedien en vez de repetirse.

=RANK.AVG(Datos!B2, Datos!$B$2:$B$488)
=RANK.AVG(Datos!E2, Datos!$E$2:$E$488)

=CORREL(N2:N488, O2:O488)
Spearman construido como Pearson sobre los rangos. Las dos primeras fórmulas van en columnas auxiliares y se arrastran; la tercera calcula el coeficiente sobre ellas.

Para los efectos con rezago, el ajuste es desplazar una serie contra la otra y volver a correlacionar. Si una campaña mueve la búsqueda de marca tres días después, la relación aparece recién con ese desplazamiento y en el par sin desplazar sale plana.

=CORREL(Datos!B2:B485, Datos!E5:E488)
Correlación con rezago de tres días: la segunda serie se corre tres filas, así que cada valor de la primera se compara con el de tres días después. Conviene probar varios rezagos y quedarse con el que maximiza el coeficiente, declarando cuál se usó.

Y una regla que no tiene fórmula: antes de reportar cualquier coeficiente, graficar el diagrama de dispersión del par. Toma treinta segundos y es lo único que muestra si el número está describiendo una relación o describiendo un punto atípico.

Cuando la matriz crece y la planilla empieza a quedar chica, el paso natural es mover el cálculo a un script. Cómo armar ese tipo de automatización con pandas sobre los datos de Search Console y GA4 lo cubro en la guía sobre Python y automatización SEO.

Clics de Search Console contra sesiones orgánicas de GA4: qué correlación es esperable

Este es el par que todo el mundo quiere auditar, y conviene empezar por la parte incómoda: no existe una metodología publicada ni un valor de referencia aceptado para este par. Cualquier umbral presentado como estándar, incluido el 0,8 que circula, lo inventó quien lo escribió. Lo digo porque el resto del artículo argumenta que los números sin fuente son el problema, y sería inconsistente inventar uno aquí.

Hay algo peor todavía. Con granularidad diaria, la correlación entre clics y sesiones orgánicas es casi segura en cualquier sitio con estacionalidad semanal, porque las dos series comparten el mismo ciclo de día de semana. Una r alta ahí no certifica que la medición esté sana: certifica que los lunes se parecen a los lunes.

Por qué las dos series no pueden coincidir

Antes de interpretar cualquier coeficiente conviene tener claro por qué el nivel difiere. Son razones estructurales, no errores, y cada una empuja la diferencia en una dirección conocida.

  • Punto de medición distinto: Search Console registra el clic en la búsqueda, GA4 necesita que la etiqueta cargue y dispare page_view. Todo lo que ocurra entre esos dos momentos se pierde de un lado y no del otro.
  • Consentimiento denegado: quien rechaza el banner desaparece de GA4, mientras Search Console registra el clic igual. Es diseño, no falla, pero cambia el nivel de la serie de GA4 sin tocar la de Search Console.
  • Bloqueo de JavaScript y bloqueadores de anuncios: GA4 es del lado del cliente y Search Console no, así que cualquier bloqueo resta solo de un lado.
  • Abandono antes de que dispare la etiqueta: en móvil con página lenta, la persona se va antes de que GA4 alcance a contar la sesión. El clic ya quedó registrado.
  • Clics repetidos: Search Console cuenta cada clic, GA4 pliega los clics dentro de treinta minutos en una sola sesión. Este empuja en la misma dirección que los anteriores, pero por una razón perfectamente sana.

El diagnóstico que sí funciona: la serie de razón

Si la r está inflada por el calendario y el nivel no puede coincidir, lo que queda por auditar es la estabilidad de la relación. La forma que uso es dividir las dos series y graficar el resultado: sesiones orgánicas de GA4 divididas por clics de Search Console, día a día, a lo largo de todo el período.

Una razón estable en el tiempo, en cualquier nivel, indica medición consistente. Da lo mismo si el número es 0,72 o 0,91: lo que importa es que no se mueva. Un salto de nivel o una deriva sostenida en esa serie fecha un incidente de medición, y con la fecha en la mano se busca en el calendario del proyecto qué se hizo esa semana.

Los sospechosos habituales de un salto en la razón son cuatro: un despliegue de etiqueta, un cambio en el banner de consentimiento o en la plataforma de gestión del consentimiento, una cadena de redirecciones nueva que pierde la referencia, y una migración de dominio. Los cuatro dejan una marca limpia en la serie de razón y casi ninguna en el coeficiente del período completo.

Conviene decir que este diagnóstico es criterio de trabajo propio y no un hallazgo publicado. No hay un paper que lo respalde: es la consecuencia lógica de que la r esté contaminada por estacionalidad compartida y de que el nivel no pueda coincidir por construcción. Lo prefiero declarado así antes que presentado como estándar de la industria.

Sobre la magnitud del hueco entre las dos series, circulan cifras (un 20 a 30% típico, pérdidas de visitas de alrededor del 60% detrás de un banner conforme, tasas de rechazo de consentimiento entre 35 y 55%) que provienen de proveedores y de fuentes secundarias que no pude verificar en el original. Por eso no van en este artículo. Quien quiera una magnitud confiable tiene un camino mejor: medir la razón en sus propios proyectos y usar ese número, que además es más útil que cualquier promedio ajeno.

Del lado de GA4, aislar bien el canal orgánico antes de correlacionar cualquier cosa es requisito previo, porque una serie que mezcla canales no se puede comparar contra los clics orgánicos de Search Console. Ese paso, y los informes donde vive cada cifra, están en la guía sobre cómo usar Google Analytics 4 para SEO.

Cómo se detecta canibalización entre orgánico y pagado

Esta es la aplicación que más valor produce, y también la que exige más cuidado al concluir. La canibalización entre canales ocurre cuando una campaña de búsqueda pagada compra clics que el sitio habría ganado igual de forma orgánica: el clic se paga, la visita habría llegado gratis, y la cuenta de resultados no lo distingue porque el clic aparece atribuido al canal que lo cobró.

La señal que se busca en la matriz

El par central es clics de búsqueda pagada contra clics orgánicos, restringido a la misma familia de términos o al mismo grupo de páginas de destino, sobre series diferenciadas. La firma de la sustitución es una correlación negativa que se sostiene en el tiempo y no solo en un tramo.

Y hace falta un control, porque una correlación negativa sola no alcanza. Si los clics orgánicos bajan mientras las impresiones y la posición media se mantienen planas, la demanda y el ranking no cambiaron: cambió quién se llevó el clic. Si las impresiones también bajaron, lo que hubo fue menos demanda y la lectura de canibalización es equivocada.

El dato de Google sobre sus propios anuncios

La mejor referencia pública sobre este fenómeno la publicó Google, y va contra su propio interés comercial. Es un meta-análisis de 390 estudios de pausa de anuncios, publicado en marzo de 2012, que midió qué porcentaje de los clics pagados era realmente incremental según la posición orgánica que ya tenía el anunciante.

Posición orgánica del anuncianteClics pagados incrementalesLectura práctica
Primer resultado orgánico50%La mitad de los clics pagados se habría conseguido igual sin pagar
Posiciones 2 a 482%La mayor parte del clic pagado es tráfico nuevo
Bajo la posición 496%Casi todo el clic pagado es incremental: el anuncio compra visibilidad que el orgánico no tiene

Los caveats son de Google y hay que citarlos: los resultados de anunciantes individuales varían, el estudio mide clics y no conversiones, y Google recomienda de forma explícita que cada anunciante corra sus propios experimentos aleatorizados. Con eso dicho, la estructura del resultado es robusta y contraintuitiva: la canibalización es peor justo donde el sitio ya rankea primero, que es donde más tienta poner un anuncio defensivo.

El contrapeso con revisión de pares

La evidencia independiente más citada apunta en la misma dirección y viene de un experimento de campo a gran escala en eBay, publicado en Econometrica en enero de 2015 por Thomas Blake, Chris Nosko y Steven Tadelis. Su conclusión sobre las keywords de marca es directa: no mostraron beneficio de corto plazo medible. Y en las keywords sin marca encontraron que los usuarios frecuentes, que concentran la mayor parte del gasto publicitario, no cambian su comportamiento por el anuncio, lo que produce retornos promedio negativos.

Los anuncios sobre keywords de marca no mostraron beneficios de corto plazo medibles.Blake, Nosko y Tadelis, Econometrica 83(1), enero de 2015

Vale la pena notar de dónde vienen las dos fuentes. Una es de Google midiendo la efectividad de sus propios anuncios, la otra es de investigadores con revisión de pares midiendo el gasto de un anunciante. Tienen incentivos opuestos y llegan a la misma conclusión práctica sobre un caso concreto: el clic comprado donde el sitio ya es el primer resultado orgánico es el menos incremental de todos.

Google también publicó su defensa del canal y corresponde citarla en juego limpio. Un estudio de 2011 en el Journal of Advertising Research midió un 89% de clics incrementales promedio entre verticales, sobre más de 400 estudios de pausa. Google mismo revisó ese número a la baja poco después, a 85% sobre más de 5.300 casos hasta agosto de 2011. Conviene citar el 85%, porque es la cifra vigente y casi todo el contenido de marketing sigue repitiendo el 89%.

El techo del método: la correlación no prueba incrementalidad

Todo lo anterior levanta una hipótesis fuerte y no la prueba. La incrementalidad es una pregunta causal, y las preguntas causales se responden con experimentos. Hay dos caminos, en orden de rigor.

  • Geo holdout: regiones geográficas que no se solapan, asignadas al azar a control y tratamiento mediante segmentación geográfica de las campañas, con replicación entre geografías para obtener intervalos de confianza. La metodología está documentada en Vaver y Koehler, Measuring Ad Effectiveness Using Geo Experiments, Google, 2011, con una implementación abierta publicada por Google.
  • Pausa de campaña: apagar la campaña con la métrica, la duración y el criterio de decisión declarados antes de empezar. Es más barato y menos limpio que el geo holdout, y sirve cuando no hay volumen para partir por geografía.
  • Lo que no sirve: apagar la campaña, mirar el total del mes y comparar contra el mes anterior. Ahí la estacionalidad y cualquier otra cosa que haya pasado entran en el resultado sin manera de separarlas.

Nada de esto es un argumento para cortar medios pagados. Los dos hallazgos acotan la afirmación a un caso específico: los clics comprados sobre términos donde el sitio ya ocupa el primer resultado orgánico. Fuera de ese caso, la evidencia de Google apunta a que la mayor parte del clic pagado es tráfico que el orgánico no estaba capturando.

Y la pregunta que viene después de medir clics incrementales es si esos clics producen negocio incremental, que es un problema distinto y más difícil. Cómo llevar la medición del tráfico al resultado lo desarrollo en la guía sobre cómo medir el impacto real del SEO más allá del tráfico.

El patrón más frecuente: cuando el problema era la medición

El escenario se repite con una regularidad que ya no me sorprende. Un cliente reporta que el tráfico orgánico cayó, el equipo empieza a revisar contenido y enlaces, y nadie mira si la caída ocurrió en el sitio o en la medición del sitio. Son dos problemas distintos y el segundo es mucho más rápido de resolver.

La secuencia de la auditoría en ese caso es corta. Se arma la tabla diaria con clics de Search Console y sesiones orgánicas de GA4, se grafica la razón entre las dos y se mira si tiene un salto. Si Search Console no registró ninguna caída de clics ni de impresiones y la razón cayó en un día concreto, la conclusión ya está: la búsqueda siguió funcionando igual y lo que se rompió fue la medición.

Con la fecha del salto se va al calendario del proyecto, y ahí aparece la causa. Las cuatro que más he visto son un cambio en el banner de consentimiento, un despliegue que dejó la etiqueta cargando dos veces o ninguna, una cadena de redirecciones nueva que pierde el referrer, y una migración parcial donde una parte del sitio quedó sin etiquetar. Ninguna de las cuatro se ve en el informe de rendimiento, y todas se ven en la serie de razón.

El diagnóstico correcto no fue que el SEO estaba fallando, fue que el instrumento estaba mal calibrado. Y esa distinción tiene consecuencias de presupuesto: un equipo que cree tener un problema de contenido invierte meses escribiendo, cuando lo que necesitaba era una tarde revisando el marcaje.

La lección que saco de repetir este ejercicio es que la auditoría de correlación no reemplaza el análisis de SEO: lo habilita. Mientras no se sepa si los datos son confiables, cualquier conclusión sobre desempeño es una conclusión sobre el instrumento.

Límites del método y errores comunes al leer una correlación

Los ordeno por cuántas auditorías arruina cada uno, no por cuán interesantes son. Cada uno viene con su arreglo, porque un límite sin arreglo es una excusa.

Correlación no es causalidad, y una auditoría mal leída sesga la conclusión

Este es el punto que decide si la auditoría suma o resta, y es el primero porque es el que todo el mundo acepta en teoría y viola en la lámina siguiente. Una r alta no dice qué variable mueve a la otra, ni descarta que una tercera variable mueva a las dos. Tres formas concretas en que la lectura sale sesgada: leer una correlación alta entre inversión y conversiones como retorno de la inversión, cuando las dos suben en temporada; leer una correlación negativa entre pagado y orgánico como canibalización probada, cuando puede haber sido un traspaso de presupuesto entre meses; y leer una r baja como ausencia de relación, cuando Pearson simplemente no ve lo no lineal ni lo rezagado. El arreglo: escribir el mecanismo antes de escribir el coeficiente, y si el mecanismo no se puede escribir, el coeficiente no es un hallazgo.

Una tendencia compartida fabrica correlación sola

Granger y Newbold lo demostraron en 1974: dos caminatas aleatorias independientes, o sea dos series sin ninguna relación entre ellas, producen relaciones aparentemente significativas en la mayoría de los ensayos cuando se las correlaciona sin filtrar (Journal of Econometrics 2(2), julio de 1974, pp. 111-120). En marketing esto no es una curiosidad estadística: un sitio que crece y una inversión que crece van a correlacionar alto por construcción. El arreglo es diferenciar o desestacionalizar antes de correlacionar, y publicar los dos coeficientes, sobre niveles y sobre diferencias.

Con pocos datos, la r no significa nada

El estudio Monte Carlo del corredor de estabilidad concluye que en escenarios típicos el n se acerca a 250 observaciones para que una correlación se estabilice (Schönbrodt y Perugini, Journal of Research in Personality 47(5), 2013). En datos diarios son cerca de ocho meses; en datos mensuales, más de veinte años. El arreglo es trabajar en granularidad diaria y publicar siempre el intervalo de confianza. Con una advertencia: ese umbral supone observaciones independientes, y una serie diaria de tráfico está autocorrelacionada, así que el n efectivo es menor que el número de filas.

Un solo evento puede cargar todo el coeficiente

Anscombe lo mostró en 1973 con cuatro conjuntos de once puntos que comparten casi todos sus estadísticos de resumen, correlación incluida, y tienen formas completamente distintas (The American Statistician 27(1), febrero de 1973, pp. 17-21). Traducido a un proyecto: un Black Friday puede sostener el coeficiente de un año entero. El arreglo son dos cosas simples, el diagrama de dispersión antes de reportar y la columna de bandera de evento para recalcular sin los días marcados.

Una r sin intervalo de confianza es una opinión con decimales

Un 0,70 sobre 30 observaciones y un 0,70 sobre 488 son afirmaciones de fuerza muy distinta, y el número solo no lo dice. El arreglo es reportar siempre el trío completo: coeficiente, número de observaciones e intervalo de confianza al 95% por la transformación z de Fisher. Es una fórmula más en la planilla y elimina discusiones enteras sobre si un coeficiente alcanza para decidir algo.

No existen bandas universales de interpretación

Un 0,7 se puede considerar alto y sirve como punto de partida, pero depende del proyecto y del par de variables. Las bandas académicas que más se reproducen provienen de Schober, Boer y Schwarte (Anesthesia & Analgesia 126(5), mayo de 2018), y no las reproduzco aquí porque no pude verificar los rangos exactos en una copia accesible del original: publicar un número por vía secundaria sería justo el error que este artículo señala en otros. El arreglo es juzgar cada coeficiente contra su propia historia en la ventana móvil, contra un par de control que se sabe no relacionado y contra su intervalo de confianza.

Pearson solo ve relaciones lineales y sin rezago

Dos consecuencias concretas. La inversión en medios pagados tiene retornos decrecientes, así que su relación con los clics no es lineal en todo el rango y Pearson la subestima en los extremos. Y un efecto con rezago, como una campaña que mueve la búsqueda de marca días después, sale plano si las series no se desplazan. El arreglo es Spearman sobre los rangos cuando la relación es monótona pero no lineal, y correlación con desplazamiento cuando se sospecha un rezago, declarando siempre cuál se usó.

Cómo combinar la auditoría con otras fuentes de datos

La auditoría de correlación es un instrumento de diagnóstico, no un reporte, y rinde cuando se conecta con el resto del sistema de medición del proyecto.

  • Con el calendario de trabajo del proyecto: sin la bitácora de despliegues, publicaciones y campañas, un salto en la correlación tiene fecha pero no causa. Las anotaciones de GA4 sirven bien para esto, porque quedan sobre el mismo gráfico.
  • Con los logs del servidor: cuando la razón entre clics y sesiones cae y el marcaje está sano, la respuesta suele estar en los logs, en redirecciones o en errores que la interfaz de GA4 no muestra.
  • Con la exportación a BigQuery: es lo que permite escapar del techo de 16 meses de Search Console y llegar a dos ciclos año contra año, que es lo mínimo para separar tendencia de estacionalidad.
  • Con un experimento: cuando la matriz sugiere canibalización, el paso siguiente no es otra correlación, es un geo holdout o una pausa de campaña con criterio de decisión declarado.

Y la aplicación más frecuente de todo esto es el diagnóstico de una caída: la auditoría de correlación es el instrumento que permite descartar la medición antes de revisar el contenido. El flujo completo de ese diagnóstico está en la guía sobre cómo abordar una caída en el tráfico orgánico.

Preguntas frecuentes sobre la auditoría de correlación de variables de tráfico

¿Cuál es la fórmula de la correlación de Pearson en Excel y en Google Sheets?

En las dos se escribe CORREL. Google documenta de forma explícita que CORREL es sinónimo de PEARSON, así que ambas devuelven la misma r. Microsoft publica la misma fórmula subyacente para CORREL y PEARSON y devuelven resultados idénticos en Excel moderno, aunque nunca declara la equivalencia por escrito. Un detalle de documentación: Sheets escribe CORREL(data_y, data_x) con la variable dependiente primero y Excel escribe PEARSON(array1, array2) con la independiente primero. Pearson es simétrico, así que el resultado es el mismo y lo único que difiere es la documentación.

¿Desde qué valor se considera alta una correlación?

Un 0,7 se puede considerar alto y sirve como punto de partida, pero depende de las particularidades del proyecto y de qué variable se cruza con qué otra. No existen bandas universales para este dominio, y hay razones concretas: dos series diarias que comparten ciclo de día de semana pasan de 0,90 sin contenido informativo, mientras un 0,45 entre inversión y conversiones diarias en una cuenta chica puede ser una relación real. La forma correcta de juzgar un coeficiente es contra su propia historia, contra un par de control no relacionado y contra su intervalo de confianza.

¿Cuántos datos se necesitan para que una correlación sea confiable?

Más de los que usa la mayoría de los reportes. Un estudio Monte Carlo del corredor de estabilidad concluye que en escenarios típicos el n se acerca a 250 observaciones para que la estimación se estabilice (Schönbrodt y Perugini, Journal of Research in Personality 47(5), 2013): cerca de ocho meses de datos diarios, o más de veinte años de datos mensuales. La respuesta operativa es trabajar en granularidad diaria y publicar siempre el intervalo de confianza. Ese umbral, además, supone observaciones independientes, y una serie diaria de tráfico está autocorrelacionada, así que el n efectivo es menor.

¿Hasta cuándo alcanza la historia de datos para correr la auditoría?

La ventana utilizable de cada par es la intersección de las dos series, así que manda la más corta. Search Console guarda 16 meses, y eso topa cualquier par que lo involucre aunque GA4 tenga sesiones desde el inicio de la recolección en sus informes estándar. Con 16 meses el problema no es el tamaño de muestra, son cerca de 488 observaciones diarias, sino la estacionalidad: no alcanzan para dos ciclos año contra año. Las exportaciones a BigQuery resuelven el techo pero no rellenan histórico, así que hay que configurarlas al inicio del proyecto.

¿Es normal que los clics de Search Console y las sesiones orgánicas de GA4 no coincidan?

Sí, y la diferencia es estructural. Search Console registra el clic en la búsqueda; GA4 necesita que la etiqueta cargue y dispare page_view. El consentimiento denegado, el bloqueo de JavaScript, los bloqueadores de anuncios y el abandono en páginas lentas eliminan sesiones que Search Console contó igual. Y Search Console cuenta cada clic mientras GA4 pliega los clics dentro de treinta minutos en una sola sesión. No se supone que calcen: lo que se audita es que se muevan juntas.

¿Qué correlación es esperable entre clics de Search Console y sesiones orgánicas de GA4?

No existe metodología publicada ni valor de referencia aceptado para ese par, y cualquier umbral presentado como estándar, incluido el 0,8 que circula, lo inventó quien lo escribió. Además, con granularidad diaria una r alta está casi garantizada porque las dos series comparten el ciclo de día de semana, lo que la vuelve poco informativa. El diagnóstico útil es otro: la razón entre sesiones y clics graficada en el tiempo. Una razón estable, en cualquier nivel, indica medición consistente; un salto fecha un incidente.

¿Cómo se detecta canibalización entre Google Ads y el tráfico orgánico?

Correlacionando clics de búsqueda pagada contra clics orgánicos para la misma familia de términos o el mismo grupo de páginas, sobre series diferenciadas, y comprobando que las impresiones y la posición media se mantuvieron planas. Una correlación negativa que se sostiene es la firma de la sustitución. Como referencia previa: el meta-análisis de Google sobre 390 estudios de pausa de anuncios (marzo de 2012) encontró que los clics pagados son 50% incrementales cuando el anunciante ya tiene el primer resultado orgánico.

¿La correlación prueba que la inversión en medios pagados genera incrementalidad?

No. La correlación levanta la hipótesis y no puede resolverla, porque la incrementalidad es una pregunta causal. Se establece con un experimento: un geo holdout con regiones asignadas al azar a control y tratamiento, metodología documentada en Vaver y Koehler, Measuring Ad Effectiveness Using Geo Experiments (Google, 2011), o una pausa de campaña con la métrica, la duración y el criterio de decisión declarados de antemano. Google mismo recomienda que cada anunciante corra sus propios experimentos aleatorizados.

¿Cuándo conviene usar Spearman en vez de Pearson?

Cuando los datos no están distribuidos de forma normal, cuando son ordinales o cuando hay valores atípicos relevantes, según Schober, Boer y Schwarte (Anesthesia & Analgesia 126(5), mayo de 2018), que describen Spearman como una medida de asociación monótona para esos casos. Ni Excel ni Google Sheets tienen función nativa de Spearman: se construye aplicando CORREL a dos columnas de rangos, usando RANK.AVG para que los empates se promedien en vez de repetirse.

¿Cómo se aísla un evento para que no sesgue la correlación?

Con una columna de bandera que se llena durante el proyecto (promociones, campañas offline, migraciones, caídas, despliegues de etiqueta) y un segundo coeficiente calculado solo sobre los días sin marca, usando FILTER. La disciplina es publicar los dos números y decir qué días se excluyeron. La razón es Anscombe (1973): cuatro conjuntos de once puntos con la misma correlación y formas completamente distintas, que es por qué un solo pico puede cargar el coeficiente entero.

En resumen: qué decide una auditoría de correlación

La auditoría de correlación de variables de tráfico no decide qué hacer, decide si los datos con los que se iba a decidir sirven. Es un paso previo y barato: una tabla diaria, una matriz de coeficientes, un diferenciado para quitar la tendencia, una ventana móvil para fechar los cambios y un intervalo de confianza para saber cuánto pesa cada número.

Lo que entrega no son certezas, son hipótesis bien fundadas y, sobre todo, la capacidad de descartar. Descartar que la caída sea de medición antes de revisar el contenido. Descartar que la relación entre inversión y resultados sea estacionalidad compartida antes de renovar el presupuesto. Descartar que un coeficiente alto sea información antes de llevarlo a una reunión.

Montar este tipo de instrumentación y leerla con criterio es parte del trabajo diario con datos de búsqueda, y en Milimetrix somos una agencia de SEO técnico que trabaja exactamente esto con clientes en Chile y Latinoamérica.

La estadística no vuelve verdadero un dato malo, solo lo hace más convincente. Por eso el orden importa: primero se audita el instrumento, después se mide el sitio.