Hay una diferencia entre una herramienta que contó 12 847 visitas y una que contó 1284 y las multiplicó por diez. Las dos enseñan 12 847. Solo una de ellas seguirá diciendo 12 847 mañana.
Tres mecanismos distintos sustituyen recuentos por estimaciones, se confunden con frecuencia, y solo uno de ellos se llama muestreo.
El muestreo
La herramienta procesa un subconjunto de los datos y escala el resultado.
Existe por una buena razón de ingeniería: responder a una pregunta arbitraria sobre miles de millones de filas sale caro, y una muestra del 1 % responde a la mayoría de las preguntas con un margen útil por una centésima parte del coste. Para «¿el tráfico sube o baja este mes?», una muestra va perfectamente bien.
Deja de ir bien cuando cortas fino. El margen de error crece a medida que el subconjunto encoge, así que un informe sobre todo el tráfico puede ser exacto hasta una fracción de punto porcentual mientras que el mismo informe filtrado a una campaña, un país y una página de aterrizaje está construido sobre once sesiones muestreadas y es en esencia ruido enseñado con cuatro cifras significativas.
Dos hechos sobre las herramientas que usa la mayoría:
- GA4 muestrea las exploraciones por encima de un umbral; la documentación de Google lo pone en 10 millones de eventos para una propiedad estándar. Los informes estándar no se muestrean. Así que el muestreo llega exactamente cuando dejas de leer el panel y empiezas a hacer una pregunta de verdad.
- Cloudflare Web Analytics muestrea de forma adaptativa. Por debajo de cierto volumen no muestrea en absoluto, y por encima las cifras se escalan desde una muestra. Para un sitio pequeño eso significa ningún muestreo, y por eso una afirmación seca del tipo «muestrea» sería falsa para la mayoría de los sitios que probablemente lean esto.
La señal que lo delata es un informe que da números ligeramente distintos cada vez que lo cargas, o un pequeño aviso sobre la calidad de los datos que la mayoría se ha entrenado para no ver.
El modelado
La herramienta no observó la cosa en absoluto, y la estimó a partir de lo que sí observó.
Es lo que hace el modo Consentimiento: cuando un visitante rechaza el consentimiento, GA4 no tiene ningún identificador para él, así que las conversiones y los usuarios se modelan a partir del comportamiento del tráfico consentido. Es también lo que significan las «conversiones modeladas» en la mayoría de las plataformas publicitarias.
El modelado no es muestreo. Una muestra es un subconjunto de observaciones reales; un modelo es un cálculo sobre observaciones que no se hicieron nunca. La estimación puede ser buena, y es la única opción una vez que los datos subyacentes no están disponibles de verdad. Pero depende de que la población modelada se comporte como la observada, y en el caso del consentimiento esa es exactamente la hipótesis con más probabilidades de ser falsa: la gente que rechaza no es una muestra aleatoria de tus visitantes.
La consecuencia práctica es que unas cifras modeladas no se pueden cuadrar con nada. Si tus conversiones incluyen conversiones modeladas y tu CRM no, las dos no van a coincidir nunca, y ninguna investigación va a encontrar la diferencia, porque no es un error.
El umbral
La herramienta tiene el número y no te lo va a enseñar.
GA4 suprime las filas donde el grupo es lo bastante pequeño como para que se pueda identificar a un individuo, en particular cuando hay datos demográficos o Signals de por medio. La fila desaparece, y los totales dejan de ser la suma de las partes visibles.
Este provoca confusión de verdad porque parece que faltan datos y no que se estén reteniendo. Alguien exporta un informe, suma una columna, la compara con el total de cabecera, encuentra un hueco, y se va a buscar un fallo de seguimiento que no existe.
Por qué importa más de lo que parece
Cada uno de estos es defendible por separado. Juntos producen un fallo concreto: no puedes saber si un cambio en un número es un cambio en el mundo.
Si la semana pasada enseñaba un 4,2 % de conversión y esta enseña un 3,8 %, la pregunta útil es si ha pasado algo. Con datos contados, ha pasado algo. Con datos muestreados, la diferencia puede estar dentro del margen. Con datos modelados, el modelo puede haberse reentrenado. Con datos con umbral, una fila puede haber cruzado un límite de privacidad y desaparecido.
Es también por lo que una analítica muestreada y las pruebas A/B se llevan mal. Una prueba es un ejercicio de decidir si una diferencia pequeña es real, y hacerla sobre estimaciones añade una fuente de varianza que no puedes cuantificar desde dentro de la herramienta.
Qué preguntar sobre una herramienta
- ¿A partir de qué volumen empieza a muestrear, y se puede desactivar?
- ¿Distingue las cifras observadas de las modeladas en la interfaz? Si se suman en un solo número, no las vas a poder separar después.
- ¿Suprime las filas pequeñas? Si es así, ¿a partir de qué umbral?
- ¿La misma consulta sobre el mismo periodo devuelve siempre el mismo número? Es la prueba más fácil y la puedes hacer tú: carga un informe dos veces y compara.
La cuarta atrapa el muestreo de inmediato. Hazla sobre un informe filtrado y no sobre uno de cabecera, porque es ahí donde el subconjunto se queda pequeño.
Dónde se sitúa Skomi
Skomi no muestrea a ningún volumen. Cada informe es un recuento de las filas, y un informe filtrado es un recuento de las filas que coincidieron, así que una consulta sobre una campaña, en un país, en una página responde a partir de esas visitas y no de una extrapolación de ellas.
No hay cifras modeladas, porque no hay ningún hueco de consentimiento que modelar: no se escribe nada en el dispositivo del visitante con el ajuste de serie, así que no hay ninguna población de visitantes que hayan rechazado y se hayan vuelto invisibles. Y las filas no se suprimen: las partes suman el total.
Las páginas de comparación ponen esto al lado de lo que hace cada alternativa, incluidas las filas en las que la alternativa gana. Las afirmaciones sobre muestreo que hay ahí se comprobaron contra la documentación de los fabricantes en vez de repetirse de memoria, que es también por lo que dos de ellas dicen «depende» en vez de «no».
Skomi no muestrea: cada visita se cuenta, sea cual sea el volumen, que es una de las filas que el producto Analytics está hecho para sostener. Muestreo expone el término tal como se emplea aquí.