Усі матеріали

    Сирі логи сервера, 18 липня до 1 серпня 2026

    Що AI-кравлери насправді роблять на сайті

    Майже все, що пишуть про видимість в AI, сперечається на рівні специфікації: що llms.txt має робити, який кравлер що зобов'язаний читати. Свої логи публікує майже ніхто. Ось наші, без правок: 1425 запитів AI-кравлерів за 15 днів на невеликому багатомовному сайті. Жоден з них не запитав llms.txt.

    · джерел: 12

    Хто приходив насправді

    Один рядок лога це один запит. У таблиці нижче рахується одне співпадіння на рядок, і це важливіше, ніж здається: User-Agent кравлера зазвичай містить його ім'я двічі, один раз як назву і один раз усередині контактного URL. Тому підрахунок входжень замість рядків завищує будь-яку цифру приблизно вдвічі. Помилка легка, ми самі її і припустилися на першому проході.

    КравлерЗапитівЧий і що живить
    meta-externalagent521Meta. Не живить жодного асистента, якого ми міряємо
    ClaudeBot485Anthropic
    GPTBot353OpenAI, навчання
    OAI-SearchBot52OpenAI, індекс, що стоїть за ChatGPT Search
    ChatGPT-User14OpenAI, захід за питанням користувача
    PerplexityBot, Google-Extended, CCBot, Applebot-Extended, Bingbot0Не приходили жодного разу, хоча robots.txt їх пускає
    Один сайт, 18 липня до 1 серпня 2026, з access-лога nginx, відфільтрованого за картою User-Agent. Усього 1425 запитів.

    Висновок перший: llms.txt не запитали жодного разу

    Не рідко. Нуль з 1425 запитів за п'ятнадцять днів на сайті, де файл існує, валідний, на нього стоїть посилання і він оголошений. Це збігається з тим, що показало велике дослідження приблизно на 300 000 доменів: значущого зв'язку між наявністю llms.txt і частотою цитування в AI немає. Наш лог цього не доводить, один сайт нічого довести не може, але це точка з поля, а не зі специфікації, і дивиться вона в той самий бік.

    Це не привід видалити файл. Він нічого не коштує, читається людиною, і частина агентів може його прочитати, коли захоче подивитися. Це привід не продавати його і не купувати як те, через що вас почнуть цитувати.

    Висновок другий: кравлер, який живить ChatGPT Search, у явній меншості

    Приберемо Meta, чий кравлер живить Meta і жодного асистента, до якого люди реально звертаються, залишиться 904 запити. З них на OAI-SearchBot припадає 52, тобто 5,8 відсотка. Решта це ClaudeBot і GPTBot, а GPTBot у OpenAI відповідає за навчання, а не за пошук. OpenAI документує їх як різні агенти, які й керуються в robots.txt окремо.

    Звідси часта і дорога помилка: заблокувати GPTBot, щоб відмовитися від навчання, відчувається як блокування ChatGPT, але це не той кравлер, який вирішує, чи зможе ChatGPT Search вас процитувати. Це двоє різних дверей, і більшість сайтів зачиняє обоє, збираючись зачинити одні.

    Висновок третій: кравлери розвідують значно більше, ніж читають

    З 904 запитів асистентських кравлерів 305, тобто 34 відсотки, припали лише на два файли: robots.txt і sitemap.xml. Найбільш запитувана контентна сторінка, головна, взята 17 разів за п'ятнадцять днів. Будь-яка інша по три до чотирьох. Вони обходять увесь сайт, і обходять його неглибоко.

    Це змінює предмет оптимізації. Якщо третина уваги кравлера йде в robots.txt і карту сайту, то ці два файли не гігієна, а інтерфейс. Карта, в якій немає сторінки, або м'яка 404, що віддає 200 на будь-яку невірну адресу, витрачають саме ту частину бюджету, яку кравлер справді витрачає.

    Висновок четвертий: пустити кравлера не означає покликати його

    PerplexityBot, Google-Extended, CCBot, Applebot-Extended і Bingbot не прийшли жодного разу, хоча robots.txt явно пускає їх усіх. Доступ це необхідна умова, але не достатня. Кравлер має ще дізнатися, що сайт існує, а це відбувається через карти сайту, через індекси на кшталт Bing за протоколом IndexNow і через згадку там, куди він уже ходить.

    Чому це інша робота, а не SEO

    Перетин між позицією в Google і цитуванням у асистента набагато тонший, ніж здається. Опубліковані розбори дають 83 відсотки цитат в AI Overviews зі сторінок поза першою десяткою органіки, а 28,3 відсотка сторінок, які ChatGPT цитує найчастіше, у Google за тим самим запитом не видно взагалі. Менше одного джерела з десяти, які цитують ChatGPT, Gemini і Copilot, стоять у топ-10 Google за цим самим запитом.

    В один бік це читається сумно: гарна позиція в Google туди не переноситься. В інший це і є все вікно можливостей, тому що асистент може процитувати вас раніше, ніж ви почнете ранжуватися. Робота за підтримки Принстона оцінює приріст від методів GEO до 40 відсотків, а прийом із найпрямішим виміряним ефектом це посилання на джерела всередині власних тверджень, до 115 відсотків для сторінок на п'ятому місці видачі.

    Що тут узагалі вимірюване і як

    Незручність цього поля в тому, що найцінніша видимість візиту не дає зовсім. Асистент переказує відповідь своїми словами, людина читає і приходить через тиждень, набравши ваше ім'я напряму. Аналітика запише це як прямий захід. Тому однієї цифри не вистачає ніколи, міряти треба трьома незалежними способами.

    • Логи сервера. Які AI-кравлери приходять, як часто і які сторінки беруть. Це єдиний повністю об'єктивний сигнал, він не потребує інструментів, і з нього взяті всі цифри цієї статті. Дивитися треба на частку контентних сторінок і частку пошукового кравлера, а не на загальне число.
    • Контрольні промпти. Фіксований список питань, заданих у чистій сесії кільком асистентам, за фіксованим розкладом раз на тиждень, із записом у журнал. Записувати не лише, чи назвали вас, а й кого назвали натомість: цей список конкурентів узяти більше ніде.
    • Форма. Одне поле «звідки ви про мене дізналися» з явним варіантом про AI-асистента, поруч із технічним реферером. Ці два розходяться саме в цікавому випадку, і саме розходження і є вимірюванням.

    Чого в цій статті свідомо немає: результатів. Це базові цифри, зняті до того, як зміни, з якими їх порівнюватимуть, встигли подіяти. Публікувати ефект, який ще не виміряний, було б саме тією нечесністю, проти якої написаний цей текст. Повторний замір за місяць, на тому самому сайті, тим самим способом.

    Джерела

    1. OpenAI: crawlers and how to control them (GPTBot, OAI-SearchBot, ChatGPT-User)
    2. Perplexity: crawler documentation
    3. Meta: external agent crawler
    4. llms.txt: the original proposal (Answer.AI)
    5. llmstxt.org: the specification
    6. llms.txt: what it does and does not do
    7. Generative Engine Optimization: 2026 statistics, 60+ data points
    8. Princeton-backed GEO playbook
    9. Ten shifts in AI search, 2026
    10. How to track AI search referrals
    11. AI search metrics
    12. IndexNow protocol

    Ми використовуємо лише необхідні cookies для роботи сайту. Без трекінгу та реклами. Політика cookies