Если вы тестируете правки под AI-видимость, важно корректно выдвигать гипотезы и так же корректно их проверять. Рассказываем, как оценивать влияние контента на видимость в нейросетях.

Одно удачное упоминание бренда еще ничего не говорит об эффекте работ по GEO, потому что повторный ответ может оказаться другим — ведь за время между замерами обновятся модель, поиск, индекс и материалы конкурентов. Если сразу перенести «сработавшую» правку на десятки страниц, компания рискует потратить бюджет на случайный, по сути, статистический всплеск.

В этой статье разберем эксперимент для контентной гипотезы на собственном сайте: например, помогает ли отдельный блок на странице тарифа точнее передавать ограничения продукта. Для технических гипотез нужен другой набор проверок — от доступности URL до извлечения основного текста; этот маршрут мы собрали в статье «Как открыть сайт для AI: что делают маркетолог, SEO и разработчик». Эксперименты с внешними публикациями, отзывами и карточками тоже требуют отдельного дизайна, поскольку компания контролирует такие источники лишь частично.

Единицей измерения служит один промпт в одной AI-системе

AI-видимость — общее название для нескольких наблюдаемых характеристик. В зависимости от задачи мы оцениваем упоминаемость бренда, его роль в ответе, цитируемость нужных страниц, точность сведений, тональность и состав источников.

Для эксперимента нужна еще более точная единица анализа: один и тот же промпт, отправленный в одну AI-систему при закрепленных условиях. Ответы Алисы AI, ChatGPT с веб-поиском и Gemini нельзя «складывать» в одну выборку: у систем различаются поиск, набор источников, число цитирований и устойчивость результатов.

Исследование Don’t Measure Once: Measuring Visibility in AI Search прямо рекомендует фиксировать отдельные базовые значения для каждой платформы.

Каждый прогон сохраняют отдельной строкой. В ней фиксируют точную формулировку промпта и его стабильный ID, AI-систему и доступное название режима, наличие веб-поиска, дату и время, язык и регион, устройство и браузер, статус входа, состояние памяти, контекст диалога и полный текст ответа. В отдельных полях отмечают упоминание и роль бренда, показанные источники, целевой URL и точность проверяемого факта.

Каждый прогон лучше запускать в новом диалоге. Для авторизованных сервисов используют отдельный тестовый аккаунт с одинаковыми настройками; память отключают, если такая возможность есть. Режим инкогнито уменьшает влияние cookies и истории браузера, но IP-адрес и регион остаются доступными сервису. Google, например, использует IP для оценки общей географии даже без точной геолокации.

Один ответ годится как наблюдение, а вот для оценки вероятности упоминания нужна серия. Авторы исследования Don’t Measure Once, которое мы упоминали выше, получили нижний ориентир в 7 повторов одного промпта в один день для бренда и 8 повторов для источников. При семи прогонах 95-процентный интервал в их данных составлял около ±15,8 процентного пункта. Для устойчивой оценки отдельного бренда исследователи советуют повторять сбор и агрегировать данные за две–четыре недели.

Эти числа нельзя считать универсальным стандартом: исследование охватывало четыре системы, четыре тематики и преимущественно немецкоязычные промпты. Для первого среза по-прежнему полезны 3–5 прогонов, которые мы рекомендуем в GEO-бенчмарке, это оптимально по ресурсам — а это исследование приводим скорее как доказательство тезиса о необходимости контрольных прогонов.

К тому же не забывайте, что объем проверяемых данных будет расти. Даже одна исходная и одна повторная волна для десяти промптов, восьми прогонов, двух систем и двух кластеров — тестового и контрольного — дают целых 640 ответов, поэтому экспериментальный набор обычно все-таки более узкий, чем постоянный промпт-сет для мониторинга.

Решение принимают по доле в серии, поскольку результаты отдельных прогонов различаются.

Результат меняют генерация, платформа и информационный фон

Если сравнить выдачу по одному ответу до и после правки, нельзя понять, что именно вызвало изменение: на результат могли повлиять случайность генерации, обновление модели или поискового индекса, появление новых источников, регион и настройки пользователя. Контентная правка — лишь один из возможных факторов. Поэтому условия эксперимента нужно зафиксировать, а замеры повторить несколько раз.

Генерация создает случайный разброс

AI-система заново формирует каждый ответ. При одинаковом промпте могут измениться набор брендов, формулировки и источники. Все в том же исследовании Don’t Measure Once среднее пересечение наборов источников в повторах внутри 24 часов составило примерно 32–43%, брендов — 33–48%. Значения заметно различались по темам и системам.

Поэтому долю упоминаний следует воспринимать скорее как оценку вероятности: например, «в этой серии бренд появился в 6 из 8 ответов». Формулировка «бренд виден на 75%» без описания выборки создает ложное ощущение, что это какой-то точный и даже стабильный результат.

Платформа и индекс меняются со временем

За период эксперимента сервис может обновить модель, поиск, правила выбора источников или интерфейс. Отдельно меняется индекс, то есть новая версия страницы может уже открываться в браузере, хотя поисковая система или AI-поиск еще использует прежнюю.

Поэтому дата публикации не служит началом повторного периода — нужно зафиксировать именно обход страницы и появление нового текста в доступном индексе, когда платформа дает такие данные. Для системы без прозрачного статуса индекса отмечают первую дату, когда новая формулировка появилась в ответе или цитируемом фрагменте, и сохраняют это ограничение в отчете.

Результат может измениться из-за обновления модели или веб-поиска, даже если страницу не редактировали.

Внешние источники и рынок создают общий фон

Пока идет тест, конкурент может обновить посадочную страницу, профильное медиа — выпустить новый рейтинг, а агрегатор — изменить карточку компании. AI-система получает новый набор доступных сведений, и доля бренда меняется вместе с ним.

Сезонный объем спроса сам по себе не меняет долю упоминаний в фиксированном промпт-сете. Календарь влияет косвенно: обновляются цены и ассортимент, появляются свежие публикации, меняется состав релевантных источников. Для трафика и конверсий сезонность имеет прямое значение. Яндекс отмечает, что его Share of Voice менее чувствителен к сезонным колебаниям спроса.

События между исходной и повторной сериями могут повлиять на результат независимо от правки.

Промпт и настройки меняют саму задачу

Запросы «Какая онлайн-бухгалтерия лучше?» и «Какая онлайн-бухгалтерия подходит ИП на УСН без сотрудников?» описывают разные ситуации выбора. Даже небольшая правка может изменить критерии сравнения и источники.

Формулировки основного набора фиксируют до старта. Новые вопросы можно проверять параллельно, в некой ротационной части промпт-сета, не включая их в главную метрику.

Существенно измененный промпт всегда получает новый ID, то есть фиксируется как отдельный.

Подробный порядок сборки набора есть в статье «Как собрать промпт-сет для мониторинга бренда в ИИ-ответах».

Формулировку запроса, регион, аккаунт и режим веб-поиска закрепляют до начала прогонов.

Гипотеза заранее связывает наблюдение с проверкой

Полная GEO-гипотеза содержит шесть элементов; иначе говоря, ее формулировка отвечает на шесть вопросов: 1) что повторилось в исходных замерах; 2) чем это можно объяснить; 3) какое изменение проверит предполагаемую причину; 4) какой результат ожидается; 5) когда проводить повторный замер; 6) что делать при полном, частичном или нулевом эффекте.

Для сервиса онлайн-бухгалтерии гипотеза может выглядеть так:

Что происходит: в Алисе AI целевая страница тарифа регулярно появляется в источниках, однако ограничение «только для ИП на УСН без сотрудников» отсутствует или передается с ошибкой.

Возможная причина: условие спрятано внутри длинного описания тарифа и сформулировано по-разному на нескольких блоках страницы.

Как проверяем: добавляем блок «Кому подходит тариф», приводим формулировки на этой странице к одной версии и сохраняем остальные существенные факторы. Через 21 день после подтвержденной индексации доля ответов с корректным условием должна вырасти относительно контрольного кластера.

В каком случае масштабируем: если эффект превышает заранее выбранный порог.

Что значит «заранее выбранный порог»? Например, команда может решить, что изменение меньше 10 п. п. не оправдывает траты ресурсов на доработку остальных страниц таким же образом. Само это значение зависит от цены внедрения и важности проверяемого факта.

Гипотезу переводят в измеримый показатель, метрику и критерий продолжения теста.

Главную метрику выбирают по проблеме

В одной серии ответов можно считать несколько метрик. Допустим, один промпт 100 раз проверили в Алисе AI при одинаковых условиях:

  • в 80 ответах система упомянула бренд — упоминаемость составила 80%;

  • в 50 ответах среди источников появилась нужная страница — доля ответов с целевым URL составила 50%;

  • в 30 ответах система правильно передала ограничение тарифа — доля корректных ответов составила 30%.

Упоминание бренда, выбор целевого URL и точность факта оценивают раздельно.

Один ответ может учитываться сразу во всех трех расчетах. Метрики отвечают на разные вопросы: рекомендует ли система компанию, показывает ли нужную страницу и правильно ли передает конкретный факт.

Главную метрику выбирают по проблеме, которую должна решить правка. Если бренд и раньше часто появлялся в ответах, но нейросеть ошибалась в условиях тарифа, оценивают прежде всего долю корректных ответов. Остальные метрики помогают понять, с чем связан результат:

  • доля корректных ответов выросла вместе с упоминаниями целевого URL — вероятно, обновленная страница повлияла на результат;

  • целевой URL стал появляться чаще, а ошибок меньше не стало — система находит страницу, но плохо извлекает нужное условие;

  • число корректных ответов выросло без изменений по целевому URL — факт мог прийти из другого источника или измениться по внешней причине;

  • упоминаемость бренда заметно снизилась — это могло повлиять и на число ответов с корректным условием.

Главная метрика определяет решение, диагностические показатели помогают объяснить результат.

Все доли рассчитывают отдельно для каждой AI-системы. До повторного замера также фиксируют, какой рост будут считать достаточным для подтверждения гипотезы.

Отчеты самих платформ дают дополнительный контекст. Bing показывает цитирования, активность отдельных URL и примеры запросов. Google добавил в Search Console отчеты по generative AI features с данными о показах, страницах, странах, устройствах и датах. Яндекс рассчитывает SoV для запросов, по которым сайт присутствовал в поисковой выдаче и Алиса AI сформировала ответ.

Эти отчеты охватывают другие наборы запросов и используют собственные способы расчета. Поэтому их анализируют отдельно от ручных прогонов и не объединяют с ними в общий процент.

Появление целевого URL среди источников еще не доказывает, что система взяла нужный факт именно с этой страницы. Но связь выглядит уже убедительнее, если ссылка стоит рядом с проверяемым утверждением, формулировка совпадает с текстом страницы, а результат повторяется в серии ответов. Подробнее оценку источников мы разбирали в статье о GEO-бенчмарке.

Контентный эксперимент проходит шесть шагов

Шесть шагов сохраняют сопоставимость данных.

Шаг 1. Выберите один сценарий и зафиксируйте протокол

Экспериментальный кластер включает 5–10 близких промптов, связанных с одной пользовательской задачей. Запросы, например, о выборе тарифа, настройке личного кабинета и восстановлении доступа разводят по разным тестам: им соответствуют разные страницы, критерии и источники.

Для каждого промпта закрепляют AI-систему, режим поиска, язык, регион и остальные поля протокола. Каждую систему анализируют отдельно. Диалоговый сценарий тоже отделяют от одиночного запроса: все реплики в нем входят в фиксированный сценарий.

Один кластер объединяет промпты с общей задачей пользователя.

Шаг 2. Соберите исходные данные и оцените обычный разброс

Исходные данные собирают до публикации правок. Для строгой проверки* каждый промпт повторяют в одной дневной волне не менее 7 раз для упоминаний и не менее 8 раз для источников, затем проводят такие волны по закрепленному расписанию в течение двух–четырех недель. Все ответы сохраняют. Среднее значение по дням не должно скрывать размах и отдельные ошибки.

* Напомним, что мы используем три прогона: по нашему опыту, это оптимальный расход бюджета на проверки в платных сервисах. Хотя дополнительные прогоны, которые рекомендуют зарубежные исследователи, разумеется, способны довести точность проверки почти до стопроцентной.

Ниже — сокращенный пример одной серии. Во всех восьми строках использованы один промпт «Какая онлайн-бухгалтерия подходит ИП на УСН без сотрудников?», Алиса AI и одинаковые настройки.

Прогон 1. Бренд — да; целевой URL — да; условие передано верно.
Прогон 2. Бренд — нет; целевой URL — нет; условие отсутствует.
Прогон 3. Бренд — да; целевой URL — нет; условие передано частично.
Прогон 4. Бренд — да; целевой URL — да; условие передано с ошибкой.
Прогон 5. Бренд — нет; целевой URL — да; условие передано верно.
Прогон 6. Бренд — да; целевой URL — нет; условие передано верно.
Прогон 7. Бренд — да; целевой URL — да; условие передано с ошибкой.
Прогон 8. Бренд — да; целевой URL — да; условие передано верно.

В этой серии упоминаемость составляет 6 из 8, доля ответов с целевым URL — 5 из 8, точность условия — 4 из 8. Строки 5 и 6 показывают, почему метрики считают раздельно: источник может появиться без бренда в тексте, а верный факт — без целевого URL. Серия ChatGPT с веб-поиском получит собственную таблицу и собственные базовые значения.

Шаг 3. Подберите сопоставимую контрольную группу и оцените общий фон

Контрольный кластер обязательно должен быть похож на тестовый по типу страниц, интенту, исходной видимости, сезонности и частоте обновления.

Однако близкие стартовые значения сами по себе не гарантируют сопоставимость. До вмешательства полезно провести несколько контрольных точек и проверить, менялись ли группы сходным образом. Если одна группа росла, а другая падала еще до правки, простая разница изменений будет ненадежной.

Контроль перестает быть чистым, когда правка затрагивает весь сайт. Обновление единого прайс-листа, навигации, шаблона, Schema.org или крупная PR-кампания может повлиять на обе группы. Такое вмешательство оценивают как пакетную правку и прямо указывают ее состав.

Тестовую и контрольную группы наблюдают параллельно при одинаковых условиях.

Шаг 4. Внесите одно изменение, чтобы проверить предполагаемую причину

В нашем примере, напомним, мы проверяем гипотезу «критичное условие трудно извлечь со страницы». Значит, команда добавляет отдельный блок «Кому подходит тариф» и приводит формулировку условия в пределах целевой страницы к единой версии.

Одновременное обновление цен по всему сайту, новые отзывы и внешние публикации усложнят вывод: станет непонятно, какое изменение связано с результатом.

Иногда бизнесу требуется сразу исправить что-то — например, ошибку в ценах или юридически опасную формулировку. Разумеется, такие правки нельзя откладывать ради чистоты теста: просто в отчете их фиксируют как дополнительные вмешательства, а силу причинного вывода снижают.

В тест включают один пакет изменений; PR-кампанию и новые отзывы учитывают отдельно.

Шаг 5. Начните повторный период после того, как новая версия станет доступна

После публикации проверяют, что целевая страница открывается, новый блок присутствует в HTML и поисковая система получила актуальную версию. Для Яндекса можно использовать статистику обхода и другие доступные данные Вебмастера. Для каждой AI-системы сохраняют фактические признаки того, что новая версия могла попасть в ответ.

Повторный период должен совпадать с исходным по длительности, частоте прогонов, промптам и настройкам. Тестовый и контрольный кластеры проверяют параллельно. Если новая версия появилась в индексах разных систем в разные даты, для каждой системы задают свою границу периода.

Дата индексации отделяет исходный период от повторного.

Шаг 6. Вычтите фоновое изменение и проверьте надежность результата

Показатель может измениться сам по себе — например, из-за обычных колебаний в ответах нейросети. Контрольная группа помогает учесть такой фоновый рост.

Допустим, в тестовой группе доля корректных ответов выросла с 20 до 38% — на 18 п. п. В контрольной группе, где никаких изменений не вносили, показатель вырос с 19 до 22% — на 3 п. п.

Если бы тестовую группу тоже оставили без изменений, в ней можно было бы ожидать сопоставимый рост на 3 п. п. Поэтому его вычитают из полученных 18 п. п.:

18 п. п. − 3 п. п. = 15 п. п.

Предполагаемый эффект внесенных изменений в среднем по сайту составляет, таким образом, 15 п. п.

Затем проверяют, насколько надежна эта оценка. Для этого учитывают количество ответов в обеих группах и рассчитывают доверительный интервал. Он показывает, насколько результат может колебаться из-за случайности. Если интервал включает ноль, собранных данных пока недостаточно, чтобы уверенно связать рост с внесенными изменениями.

Разница изменений дает оценку эффекта; интервал показывает ее точность.

Убедительность результата растет с повторяемостью

Для принятия решения удобно разделить результаты на пять уровней.

  • Единичное наблюдение. Целевой URL или верная формулировка появились один раз.

  • Повторяющаяся динамика. Метрика выросла в нескольких сериях, контроль изменился сходным образом или отсутствует. Причина пока не установлена.

  • Отличие от контроля. Тестовый кластер обогнал контроль, интервал эффекта не включает ноль. Исходная динамика групп была сопоставимой.

  • Воспроизводимость. Сходный эффект появился на втором независимом кластере или в другом периоде.

  • Сохранение бизнес-результата. Эффект удерживается, точность ответов выросла, конверсия и органические показатели обновленных страниц не ухудшились.

Масштабирование обосновано после повторения эффекта и проверки бизнес-показателей.

Вывод должен точно повторять условия эксперимента. Допустим, правку проверяли в ChatGPT и Яндекс Поиске с Алисой, на страницах услуг, по 20 промптам одной тематики и в течение месяца. Тогда результат подтверждает, что правка повысила AI-видимость именно в этих условиях.

Другие нейросети, темы, типы страниц и периоды в эксперименте не проверялись. Поэтому данных для вывода «эта правка повышает AI-видимость во всех случаях» пока нет. Чтобы расширить вывод, эксперимент нужно повторить в других условиях.

Отчет показывает, что именно проверили и что делать дальше

Из отчета должно быть ясно: какую гипотезу проверяли, какой эффект получили и какое решение приняли. Для этого фиксируют тестовый и контрольный кластеры, AI-системы и условия прогонов, даты и объем выборки, метрики и их значения до и после теста, оценку эффекта. Отдельно указывают другие изменения за период и ограничения эксперимента.

Такой отчет позволяет повторить проверку, оценить надежность результата и понять, почему команда выбрала следующий шаг.

Читайте также:

Комплексный маркетинг в 2026 году: каналы, аналитика, AI-поиск и продажи

Как ставить KPI в GEO, если нельзя гарантировать результат

Стратегия AI-видимости: как связать бизнес-задачи, факты о бренде и потребности клиента