3 октября 2026 года мы запросили /robots.txt у 3742 доменов стоматологий США в 49 штатах и разобрали 2503 файлов, которые вернулись. Коротко: клиники не блокируют AI-сканеров — запрещают их лишь 1.5% файлов, а 10.3% разрешают явно. Настоящий ущерб в другом: 3.6% закрывают весь сайт от всех сканеров, а 10.4% доменов не пускают незнакомых сканеров на уровне сервера, где никакая строка в robots.txt уже не поможет.
Что мы спрашивали и чего не делали
Основа выборки та же, что в исследовании 832 сайтов стоматологий США: стоматологии с указанным сайтом в OpenStreetMap. Здесь мы забирали по одному файлу с домена — только /robots.txt — и разбирали его по правилам RFC 9309, считая сканер запрещённым, если его собственная группа закрывает корень сайта. Мы не оценивали, правильно ли блокировать AI, — мы измерили, что написано в файлах. Ни одна клиника не названа.
Что ответили домены
| Ответ | Доля доменов |
|---|---|
| Отдали файл robots.txt | 66.9% |
| Сервер отказал незнакомому сканеру (401/403) | 10.4% |
| Хост недоступен, ошибка DNS или TLS | 16.2% |
| Файла robots.txt нет (404) | 3.3% |
| Другой ответ (цепочка редиректов, 202, 405) | 3.1% |
По одному HTTPS-запросу на домен, больше ничего не запрашивали.
AI-сканеров почти никто не запрещает
Из 2503 файлов чаще всего закрывают вовсе не ассистентов: Bytespider — 1.2%, Common Crawl — 1.1%, оба попадают в типовые списки блокировок. GPTBot запрещают 0.4%, ClaudeBot — 0.5%. При этом Google-Extended упомянут в 10.1% файлов, а GPTBot — в 7.4%, и почти всегда чтобы разрешить. Если вам говорили, что стоматологии закрываются от AI, файлы говорят обратное.
Кого упоминают и кого запрещают
| Сканер | Упомянут в файле | Запрещён |
|---|---|---|
| GPTBot (обучение OpenAI) | 7.4% | 0.4% |
| OAI-SearchBot (поиск ChatGPT) | 5.2% | 0.0% |
| ChatGPT-User (заход по ссылке) | 4.6% | 0.1% |
| ClaudeBot (Anthropic) | 7.5% | 0.5% |
| PerplexityBot | 2.7% | 0.1% |
| Perplexity-User (заход по ссылке) | 4.1% | 0.0% |
| Google-Extended (Gemini) | 10.1% | 0.3% |
| Applebot-Extended | 5.8% | 0.4% |
| CCBot (Common Crawl) | 6.7% | 1.1% |
| Bytespider (ByteDance) | 5.9% | 1.2% |
| Meta-ExternalAgent | 5.8% | 0.5% |
| Googlebot (поиск) | 6.1% | 0.0% |
«Упомянут» значит, что для сканера вообще есть группа правил — в большинстве случаев она его разрешает.
Две настройки, которые реально стоят видимости
3.6% файлов запрещают весь сайт всем сканерам. Это одна строка — Disallow: / под User-agent: *, — обычно оставшаяся от тестовой версии, которую выкатили в прод. Она убирает клинику из Google ровно так же, как из ChatGPT. 10.4% доменов отказали нам на сервере кодом 401 или 403 ещё до чтения robots.txt. Это антибот-защита: она обычно пропускает проверенного Googlebot и отсекает сканеров, которых не узнаёт, включая те, которыми ассистенты читают страницу в момент вопроса о вашей клинике. Ни одна из этих настроек не видна в обычном SEO-отчёте, пока кто-то не проверит руками.
Что внутри файлов
| Что нашли | Доля файлов |
|---|---|
| Объявлен sitemap | 80.1% |
| Упомянут хотя бы один AI-сканер | 10.9% |
| Явно разрешён хотя бы один AI-сканер | 10.3% |
| Запрещён хотя бы один AI-сканер | 1.5% |
| Весь сайт закрыт для всех сканеров | 3.6% |
| Правил нет вообще | 6.2% |
Медианный размер файла — 177 байт: чаще всего это заготовка, которую написала тема или плагин.
Обучающий сканер, поисковый и живой заход — три разных решения
Имена в таблице не взаимозаменяемы, и именно поэтому большинство файлов говорят не то, что хотел их владелец. GPTBot и Google-Extended собирают тексты для обучения модели. OAI-SearchBot и PerplexityBot строят индекс, по которому ассистент ищет. ChatGPT-User, Claude-User и Perplexity-User заходят на вашу страницу в тот момент, когда человек спрашивает про вашу клинику. Клиника может отказаться от обучения и при этом хотеть, чтобы её находили: разрешить поисковых и «живых», запретить обучающих. Почти ни один из прочитанных файлов этого различия не делает — одна группа, одно решение, обычно написанное плагином с двухлетним списком блокировок.
Как выглядит рабочий robots.txt для клиники
- Одна группа для всех — User-agent: * и Allow: /, — а запрещено только то, что индексировать нельзя: корзина, вход для персонала, результаты внутреннего поиска.
- Строка Sitemap: с реальным адресом карты сайта: её пропускают 19.9% файлов, и сканеры ищут страницы вручную.
- Осознанная строка про AI: назовите обучающих сканеров, если не хотите их пускать, и оставьте разрешёнными поисковых и «живых», если хотите попадать в ответы ассистентов.
- Больше ничего. Медианный файл в нашей выборке — 177 байт, и вредят обычно не длинные.
Что проверить на своём сайте на этой неделе
- Откройте вашдомен.com/robots.txt в браузере. Если видите Disallow: / под User-agent: * — это авария, а не нюанс.
- Убедитесь, что в файле объявлен ваш sitemap: у каждого пятого его нет.
- Решите про AI-сканеров осознанно: разрешайте, если хотите, чтобы вас цитировали ассистенты, запрещайте, если не хотите, — но решением, а не настройкой плагина по умолчанию.
- Спросите тех, кто ведёт ваш фаервол или CDN, кому отдаётся 403. Именно там происходит большая часть невидимых блокировок.
- Перепроверяйте после каждого редизайна и переезда: тестовое правило уезжает в прод именно тогда.
Пустить сканеров — только первый шаг, дальше нужна цитируемость
Доступ лишь приводит ассистента на страницу. Цитирует он понятный ответ, цифру с источником и FAQ, который можно поднять целиком, — об этом оптимизация под AI-поиск для клиник, и это же лежит в основе нашей услуги по видимости в поиске и AI для стоматологий.
Методика, ограничения и сырые данные
Дата замера — 3 октября 2026 года. Основа: стоматологии с сайтом в OpenStreetMap по континентальным США; запрошено 3742 доменов, разобрано 2503 файлов, представлены 49 штатов. Ограничения, о которых честно сказать: домены, отказавшие на сервере, в разобранную выборку не попали, поэтому доли по файлам описывают более открытую половину рынка; robots.txt — это просьба, а не защита, и сканер может её проигнорировать; серверная защита может закрыть сканера, которого файл разрешает, и наоборот; выборка OpenStreetMap смещена к клиникам, которые кто-то внёс на карту. Скачать агрегаты: CSV или JSON, лицензия CC BY 4.0 — берите любую цифру со ссылкой на эту страницу и указывайте источник «Tepexa, Do dental websites block AI crawlers? 2026».