robots.txt — стандартний файл crawl-access, де сайт може дозволяти або забороняти URL-шляхи для named user-agent tokens. Він контролює compliant-доступ краулерів, а не кожне downstream-використання контенту, і блокування одного AI-related token не автоматично прибирає сторінку з кожної ШІ-поверхні.
Простими словами
GPTBot, ChatGPT-User, ClaudeBot, PerplexityBot, Google-Extended, Googlebot і Bingbot мають різних операторів і призначення; їх не слід трактувати як один взаємозамінний ШІ-краулер.
Google AI Overviews і AI Mode — функції Search. Google заявляє, що придатність Search керується індексацією Googlebot і контролями snippet, тоді як Google-Extended контролює навчання та grounding у деяких інших системах Google.
Allow-правила тримають crawl-шлях відкритим для compliant-ботів. Вони не гарантують індексацію, retrieval, згадування чи цитування.
Чому це важливо
Правила краулерів можуть відкривати або закривати конкретні retrieval-шляхи, тому випадкову блокування варто виявляти.
Правильна політика потребує зіставлення кожного token з його задокументованим призначенням; blanket allow або block може мати інші наслідки, ніж задумав власник сайту.