Сирі логи сервера, 18 липня до 1 серпня 2026
Що AI-кравлери насправді роблять на сайті
Майже все, що пишуть про видимість в AI, сперечається на рівні специфікації: що llms.txt має робити, який кравлер що зобов'язаний читати. Свої логи публікує майже ніхто. Ось наші, без правок: 1425 запитів AI-кравлерів за 15 днів на невеликому багатомовному сайті. Жоден з них не запитав llms.txt.
· джерел: 12
Хто приходив насправді
Один рядок лога це один запит. У таблиці нижче рахується одне співпадіння на рядок, і це важливіше, ніж здається: User-Agent кравлера зазвичай містить його ім'я двічі, один раз як назву і один раз усередині контактного URL. Тому підрахунок входжень замість рядків завищує будь-яку цифру приблизно вдвічі. Помилка легка, ми самі її і припустилися на першому проході.
| Кравлер | Запитів | Чий і що живить |
|---|---|---|
| meta-externalagent | 521 | Meta. Не живить жодного асистента, якого ми міряємо |
| ClaudeBot | 485 | Anthropic |
| GPTBot | 353 | OpenAI, навчання |
| OAI-SearchBot | 52 | OpenAI, індекс, що стоїть за ChatGPT Search |
| ChatGPT-User | 14 | OpenAI, захід за питанням користувача |
| PerplexityBot, Google-Extended, CCBot, Applebot-Extended, Bingbot | 0 | Не приходили жодного разу, хоча robots.txt їх пускає |
Висновок перший: llms.txt не запитали жодного разу
Не рідко. Нуль з 1425 запитів за п'ятнадцять днів на сайті, де файл існує, валідний, на нього стоїть посилання і він оголошений. Це збігається з тим, що показало велике дослідження приблизно на 300 000 доменів: значущого зв'язку між наявністю llms.txt і частотою цитування в AI немає. Наш лог цього не доводить, один сайт нічого довести не може, але це точка з поля, а не зі специфікації, і дивиться вона в той самий бік.
Це не привід видалити файл. Він нічого не коштує, читається людиною, і частина агентів може його прочитати, коли захоче подивитися. Це привід не продавати його і не купувати як те, через що вас почнуть цитувати.
Висновок другий: кравлер, який живить ChatGPT Search, у явній меншості
Приберемо Meta, чий кравлер живить Meta і жодного асистента, до якого люди реально звертаються, залишиться 904 запити. З них на OAI-SearchBot припадає 52, тобто 5,8 відсотка. Решта це ClaudeBot і GPTBot, а GPTBot у OpenAI відповідає за навчання, а не за пошук. OpenAI документує їх як різні агенти, які й керуються в robots.txt окремо.
Звідси часта і дорога помилка: заблокувати GPTBot, щоб відмовитися від навчання, відчувається як блокування ChatGPT, але це не той кравлер, який вирішує, чи зможе ChatGPT Search вас процитувати. Це двоє різних дверей, і більшість сайтів зачиняє обоє, збираючись зачинити одні.
Висновок третій: кравлери розвідують значно більше, ніж читають
З 904 запитів асистентських кравлерів 305, тобто 34 відсотки, припали лише на два файли: robots.txt і sitemap.xml. Найбільш запитувана контентна сторінка, головна, взята 17 разів за п'ятнадцять днів. Будь-яка інша по три до чотирьох. Вони обходять увесь сайт, і обходять його неглибоко.
Це змінює предмет оптимізації. Якщо третина уваги кравлера йде в robots.txt і карту сайту, то ці два файли не гігієна, а інтерфейс. Карта, в якій немає сторінки, або м'яка 404, що віддає 200 на будь-яку невірну адресу, витрачають саме ту частину бюджету, яку кравлер справді витрачає.
Висновок четвертий: пустити кравлера не означає покликати його
PerplexityBot, Google-Extended, CCBot, Applebot-Extended і Bingbot не прийшли жодного разу, хоча robots.txt явно пускає їх усіх. Доступ це необхідна умова, але не достатня. Кравлер має ще дізнатися, що сайт існує, а це відбувається через карти сайту, через індекси на кшталт Bing за протоколом IndexNow і через згадку там, куди він уже ходить.
Чому це інша робота, а не SEO
Перетин між позицією в Google і цитуванням у асистента набагато тонший, ніж здається. Опубліковані розбори дають 83 відсотки цитат в AI Overviews зі сторінок поза першою десяткою органіки, а 28,3 відсотка сторінок, які ChatGPT цитує найчастіше, у Google за тим самим запитом не видно взагалі. Менше одного джерела з десяти, які цитують ChatGPT, Gemini і Copilot, стоять у топ-10 Google за цим самим запитом.
В один бік це читається сумно: гарна позиція в Google туди не переноситься. В інший це і є все вікно можливостей, тому що асистент може процитувати вас раніше, ніж ви почнете ранжуватися. Робота за підтримки Принстона оцінює приріст від методів GEO до 40 відсотків, а прийом із найпрямішим виміряним ефектом це посилання на джерела всередині власних тверджень, до 115 відсотків для сторінок на п'ятому місці видачі.
Що тут узагалі вимірюване і як
Незручність цього поля в тому, що найцінніша видимість візиту не дає зовсім. Асистент переказує відповідь своїми словами, людина читає і приходить через тиждень, набравши ваше ім'я напряму. Аналітика запише це як прямий захід. Тому однієї цифри не вистачає ніколи, міряти треба трьома незалежними способами.
- Логи сервера. Які AI-кравлери приходять, як часто і які сторінки беруть. Це єдиний повністю об'єктивний сигнал, він не потребує інструментів, і з нього взяті всі цифри цієї статті. Дивитися треба на частку контентних сторінок і частку пошукового кравлера, а не на загальне число.
- Контрольні промпти. Фіксований список питань, заданих у чистій сесії кільком асистентам, за фіксованим розкладом раз на тиждень, із записом у журнал. Записувати не лише, чи назвали вас, а й кого назвали натомість: цей список конкурентів узяти більше ніде.
- Форма. Одне поле «звідки ви про мене дізналися» з явним варіантом про AI-асистента, поруч із технічним реферером. Ці два розходяться саме в цікавому випадку, і саме розходження і є вимірюванням.
Чого в цій статті свідомо немає: результатів. Це базові цифри, зняті до того, як зміни, з якими їх порівнюватимуть, встигли подіяти. Публікувати ефект, який ще не виміряний, було б саме тією нечесністю, проти якої написаний цей текст. Повторний замір за місяць, на тому самому сайті, тим самим способом.
Джерела
- OpenAI: crawlers and how to control them (GPTBot, OAI-SearchBot, ChatGPT-User)
- Perplexity: crawler documentation
- Meta: external agent crawler
- llms.txt: the original proposal (Answer.AI)
- llmstxt.org: the specification
- llms.txt: what it does and does not do
- Generative Engine Optimization: 2026 statistics, 60+ data points
- Princeton-backed GEO playbook
- Ten shifts in AI search, 2026
- How to track AI search referrals
- AI search metrics
- IndexNow protocol
