Есть разница между инструментом, который посчитал 12 847 визитов, и инструментом, который посчитал 1284 и умножил на десять. Оба показывают 12 847. Только один из них скажет 12 847 и завтра.

Подсчёт заменяют оценкой три отдельных механизма, их постоянно путают, и выборкой называется только один из них.

Выборка

Инструмент обрабатывает часть данных и масштабирует результат вверх.

Это существует по хорошей инженерной причине: отвечать на произвольный вопрос по миллиардам строк дорого, а выборка в 1% отвечает на большинство вопросов с пригодной погрешностью за сотую часть стоимости. Для «вырос трафик за месяц или упал» выборка действительно годится.

Годиться она перестаёт, когда вы режете тонко. Погрешность растёт по мере того, как часть уменьшается, поэтому отчёт по всему трафику может быть точен до долей процента, а тот же отчёт, отфильтрованный до одной кампании, одной страны и одной страницы входа, построен на одиннадцати выбранных сессиях и по сути является шумом, показанным с четырьмя значащими цифрами.

Два факта об инструментах, которыми пользуется большинство:

  • GA4 выбирает по образцу исследования выше порога; документация Google ставит его на 10 миллионах событий для стандартного ресурса. Стандартные отчёты не выбираются. То есть выборка приходит ровно тогда, когда вы перестаёте читать панель и начинаете задавать настоящий вопрос.
  • Cloudflare Web Analytics выбирает адаптивно. Ниже некоторого объёма он не выбирает вовсе, а выше цифры масштабируются из выборки. Для маленького сайта это значит отсутствие выборки, и поэтому ровное «он выбирает» было бы неверно для большинства сайтов, которые это читают.

Признак — отчёт, дающий слегка разные числа при каждой загрузке, или небольшое примечание о качестве данных, которое большинство приучило себя не замечать.

Моделирование

Инструмент вообще не наблюдал явление и оценил его по тому, что наблюдал.

Это то, что делает Consent Mode: когда посетитель отказывается от согласия, у GA4 нет для него идентификатора, поэтому конверсии и пользователи моделируются по поведению согласившегося трафика. Это же означают «смоделированные конверсии» в большинстве рекламных платформ.

Моделирование — не выборка. Выборка — часть настоящих наблюдений; модель — расчёт о наблюдениях, которые никогда не производились. Оценка может быть хорошей, и это единственный вариант, когда исходные данные действительно недоступны. Но она зависит от того, что смоделированная совокупность ведёт себя как наблюдённая, а в случае с согласием это ровно то предположение, которое с наибольшей вероятностью ложно: те, кто отказывается, — не случайная выборка ваших посетителей.

Практическое следствие в том, что смоделированные цифры нельзя ни с чем свести. Если в ваши конверсии входят смоделированные, а в вашу CRM нет, эти двое не сойдутся никогда, и никакое расследование разницы не найдёт, потому что это не ошибка.

Порог отсечения

Число у инструмента есть, и он вам его не покажет.

GA4 подавляет строки, где группа достаточно мала, чтобы отдельного человека можно было опознать, особенно когда задействованы демография или Signals. Строка исчезает, а итоги перестают складываться из суммы видимых частей.

Именно это вызывает настоящую путаницу, потому что выглядит потерянными данными, а не придержанными. Кто-то выгружает отчёт, складывает колонку, сравнивает с итогом в заголовке, находит разрыв и идёт искать ошибку отслеживания, которой не существует.

Почему это важнее, чем звучит

Каждое из этого по отдельности защитимо. Вместе они дают одну конкретную поломку: вы не можете понять, является ли изменение числа изменением в мире.

Если на прошлой неделе конверсия была 4,2%, а на этой 3,8%, полезный вопрос — не случилось ли чего. С посчитанными данными что-то случилось. С выбранными разница может лежать внутри погрешности. Со смоделированными модель могли переобучить. С отсечёнными строка могла перейти границу приватности и исчезнуть.

Поэтому же аналитика с выборкой и A/B-тесты плохо уживаются. Тест — это упражнение в решении, настоящая ли небольшая разница, и проведение его на оценках добавляет источник разброса, который изнутри инструмента не измерить.

Что спросить об инструменте

  1. При каком объёме он начинает выбирать по образцу и можно ли это выключить?
  2. Различает ли он наблюдённые и смоделированные цифры в интерфейсе? Если они сложены в одно число, разделить их потом нельзя.
  3. Подавляет ли он маленькие строки? Если да, при каком пороге?
  4. Всегда ли один и тот же запрос за один и тот же период возвращает одно и то же число? Это самая простая проверка, и провести её можно самому: загрузите отчёт дважды и сравните.

Четвёртая ловит выборку сразу. Проводите её на отфильтрованном отчёте, а не на сводном, потому что маленькой часть становится именно там.

Где здесь Skomi

Skomi не выбирает по образцу ни при каком объёме. Каждый отчёт — подсчёт строк, а отфильтрованный отчёт — подсчёт строк, которые совпали, так что запрос об одной кампании в одной стране на одной странице отвечает из этих визитов, а не из экстраполяции по ним.

Смоделированных цифр нет, потому что нет пробела по согласию, который надо было бы моделировать: на настройке по умолчанию на устройство посетителя не пишется ничего, поэтому нет и совокупности отказавшихся и ставших невидимыми посетителей. А строки не подавляются, так что части складываются в итог.

Страницы сравнения ставят это рядом с тем, что делает каждая альтернатива, включая строки, которые альтернатива выигрывает. Утверждения о выборке там сверены с документацией поставщиков, а не повторены по памяти, и поэтому же два из них говорят «зависит», а не «нет».

Skomi не выбирает по образцу: считается каждый визит, при любом объёме, и это одна из тех строк, ради которых построен продукт Analytics. Выборка излагает термин в том виде, в каком он здесь используется.