ШІ-краулер — автоматизований бот, який отримує веб-контент від імені ШІ-продукту — для grounding результатів пошуку, real-time відповідей або навчання моделей. Кожна велика ШІ-компанія має один або кілька named crawlers, ідентифікованих user-agent.
Простими словами
Crawler tokens можуть слугувати різним цілям: search indexing, live user-initiated retrieval, grounding, збір dataset або model training.
Заблокований краулер не може використати цей crawl-шлях, але пов’язаний продукт може все одно знати сторінку через окремий search index, попереднє навчання, licensed data або інший задокументований retrieval-механізм.
Політику краулерів слід будувати на поточній документації кожного провайдера, а не на припущенні, що один token контролює кожен продукт компанії.
Чому це важливо
Знання задокументованого призначення бота допомагає власнику сайту відокремити search indexing, live retrieval, grounding і policy навчання.
Доступ краулера — частина eligibility і policy, а не доказ того, що продукт отримав, проіндексував або процитував сайт.