Все материалы

    Сырые логи сервера, 18 июля до 1 августа 2026

    Что AI-краулеры на самом деле делают на сайте

    Почти всё, что пишут про видимость в AI, спорит на уровне спецификации: что llms.txt должен делать, какой краулер что обязан читать. Свои логи публикует почти никто. Вот наши, без правок: 1425 запросов AI-краулеров за 15 дней на небольшом многоязычном сайте. Ни один из них не запросил llms.txt.

    · источников: 12

    Кто приходил на самом деле

    Одна строка лога это один запрос. В таблице ниже считается одно совпадение на строку, и это важнее, чем кажется: User-Agent краулера обычно содержит его имя дважды, один раз как название и один раз внутри контактного URL. Поэтому подсчёт вхождений вместо строк завышает любую цифру примерно вдвое. Ошибка лёгкая, мы сами её и допустили на первом проходе.

    КраулерЗапросовЧей и что питает
    meta-externalagent521Meta. Не питает ни одного ассистента, который мы меряем
    ClaudeBot485Anthropic
    GPTBot353OpenAI, обучение
    OAI-SearchBot52OpenAI, индекс, стоящий за ChatGPT Search
    ChatGPT-User14OpenAI, заход по вопросу пользователя
    PerplexityBot, Google-Extended, CCBot, Applebot-Extended, Bingbot0Не приходили ни разу, хотя robots.txt их пускает
    Один сайт, 18 июля до 1 августа 2026, из access-лога nginx, отфильтрованного по карте User-Agent. Всего 1425 запросов.

    Вывод первый: llms.txt не запросили ни разу

    Не редко. Ноль из 1425 запросов за пятнадцать дней на сайте, где файл существует, валиден, на него стоит ссылка и он объявлен. Это сходится с тем, что показало крупное исследование примерно на 300 000 доменов: значимой связи между наличием llms.txt и частотой цитирования в AI нет. Наш лог этого не доказывает, один сайт ничего доказать не может, но это точка из поля, а не из спецификации, и смотрит она в ту же сторону.

    Это не довод удалить файл. Он ничего не стоит, читается человеком, и часть агентов может его прочесть, когда захочет посмотреть. Это довод не продавать его и не покупать как то, из-за чего вас начнут цитировать.

    Вывод второй: краулер, который питает ChatGPT Search, в явном меньшинстве

    Уберём Meta, чей краулер питает Meta и ни одного ассистента, к которому люди реально обращаются, останется 904 запроса. Из них на OAI-SearchBot приходится 52, то есть 5,8 процента. Остальное это ClaudeBot и GPTBot, а GPTBot у OpenAI отвечает за обучение, а не за поиск. OpenAI документирует их как разные агенты, которые и управляются в robots.txt раздельно.

    Отсюда частая и дорогая ошибка: заблокировать GPTBot, чтобы отказаться от обучения, ощущается как блокировка ChatGPT, но это не тот краулер, который решает, сможет ли ChatGPT Search вас процитировать. Это две разные двери, и большинство сайтов закрывает обе, собираясь закрыть одну.

    Вывод третий: краулеры разведывают гораздо больше, чем читают

    Из 904 запросов ассистентских краулеров 305, то есть 34 процента, пришлись всего на два файла: robots.txt и sitemap.xml. Самая запрашиваемая контентная страница, главная, взята 17 раз за пятнадцать дней. Любая другая по три до четырёх. Они обходят весь сайт, и обходят его неглубоко.

    Это меняет предмет оптимизации. Если треть внимания краулера уходит в robots.txt и карту сайта, то эти два файла не гигиена, а интерфейс. Карта, в которой нет страницы, или мягкая 404, отдающая 200 на любой неверный адрес, тратят ровно ту часть бюджета, которую краулер действительно расходует.

    Вывод четвёртый: пустить краулера не значит призвать его

    PerplexityBot, Google-Extended, CCBot, Applebot-Extended и Bingbot не пришли ни разу, хотя robots.txt явно пускает их всех. Доступ это необходимое условие, но не достаточное. Краулер должен ещё узнать, что сайт существует, а это происходит через карты сайта, через индексы вроде Bing по протоколу IndexNow и через упоминание там, куда он уже ходит.

    Почему это другая работа, а не SEO

    Пересечение между позицией в Google и цитированием у ассистента куда тоньше, чем кажется. Опубликованные разборы дают 83 процента цитат в AI Overviews со страниц вне первой десятки органики, а 28,3 процента страниц, которые ChatGPT цитирует чаще всего, в Google по тому же запросу не видны вообще. Меньше одного источника из десяти, которые цитируют ChatGPT, Gemini и Copilot, стоят в топ-10 Google по этому же запросу.

    В одну сторону это читается уныло: хорошая позиция в Google туда не переносится. В другую это и есть всё окно возможностей, потому что ассистент может процитировать вас раньше, чем вы начнёте ранжироваться. Работа при поддержке Принстона оценивает прирост от методов GEO до 40 процентов, а приём с самым прямым измеренным эффектом это ссылки на источники внутри собственных утверждений, до 115 процентов для страниц на пятом месте выдачи.

    Что здесь вообще измеримо и как

    Неудобство этого поля в том, что самая ценная видимость визита не даёт вовсе. Ассистент пересказывает ответ своими словами, человек читает и приходит через неделю, набрав ваше имя напрямую. Аналитика запишет это как прямой заход. Поэтому одной цифры не хватает никогда, мерить надо тремя независимыми способами.

    • Логи сервера. Какие AI-краулеры приходят, как часто и какие страницы берут. Это единственный полностью объективный сигнал, он не требует инструментов, и из него взяты все цифры этой статьи. Смотреть надо на долю контентных страниц и долю поискового краулера, а не на общее число.
    • Контрольные промпты. Фиксированный список вопросов, заданных в чистой сессии нескольким ассистентам, по фиксированному расписанию раз в неделю, с записью в журнал. Записывать не только, назвали ли вас, но и кого назвали вместо: этот список конкурентов взять больше неоткуда.
    • Форма. Одно поле «откуда вы обо мне узнали» с явным вариантом про AI-ассистента, рядом с техническим реферером. Эти два расходятся ровно в интересном случае, и само расхождение и есть измерение.

    Чего в этой статье сознательно нет: результатов. Это базовые цифры, снятые до того, как изменения, с которыми их будут сравнивать, успели подействовать. Публиковать эффект, который ещё не измерен, было бы ровно той нечестностью, против которой написан этот текст. Повторный замер через месяц, на том же сайте, тем же способом.

    Источники

    1. OpenAI: crawlers and how to control them (GPTBot, OAI-SearchBot, ChatGPT-User)
    2. Perplexity: crawler documentation
    3. Meta: external agent crawler
    4. llms.txt: the original proposal (Answer.AI)
    5. llmstxt.org: the specification
    6. llms.txt: what it does and does not do
    7. Generative Engine Optimization: 2026 statistics, 60+ data points
    8. Princeton-backed GEO playbook
    9. Ten shifts in AI search, 2026
    10. How to track AI search referrals
    11. AI search metrics
    12. IndexNow protocol

    Мы используем только необходимые cookies для работы сайта. Без трекинга и рекламы. Политика cookies