3 октября 2026 года мы запросили /robots.txt у 3742 доменов стоматологий США в 49 штатах и разобрали 2503 файлов, которые вернулись. Коротко: клиники не блокируют AI-сканеров — запрещают их лишь 1.5% файлов, а 10.3% разрешают явно. Настоящий ущерб в другом: 3.6% закрывают весь сайт от всех сканеров, а 10.4% доменов не пускают незнакомых сканеров на уровне сервера, где никакая строка в robots.txt уже не поможет.

Что мы спрашивали и чего не делали

Основа выборки та же, что в исследовании 832 сайтов стоматологий США: стоматологии с указанным сайтом в OpenStreetMap. Здесь мы забирали по одному файлу с домена — только /robots.txt — и разбирали его по правилам RFC 9309, считая сканер запрещённым, если его собственная группа закрывает корень сайта. Мы не оценивали, правильно ли блокировать AI, — мы измерили, что написано в файлах. Ни одна клиника не названа.

Что ответили домены

Что ответили 3742 доменов стоматологий США на запрос /robots.txt
ОтветДоля доменов
Отдали файл robots.txt66.9%
Сервер отказал незнакомому сканеру (401/403)10.4%
Хост недоступен, ошибка DNS или TLS16.2%
Файла robots.txt нет (404)3.3%
Другой ответ (цепочка редиректов, 202, 405)3.1%

По одному HTTPS-запросу на домен, больше ничего не запрашивали.

AI-сканеров почти никто не запрещает

Из 2503 файлов чаще всего закрывают вовсе не ассистентов: Bytespider — 1.2%, Common Crawl — 1.1%, оба попадают в типовые списки блокировок. GPTBot запрещают 0.4%, ClaudeBot — 0.5%. При этом Google-Extended упомянут в 10.1% файлов, а GPTBot — в 7.4%, и почти всегда чтобы разрешить. Если вам говорили, что стоматологии закрываются от AI, файлы говорят обратное.

Кого упоминают и кого запрещают

Как 2503 файлов robots.txt относятся к каждому сканеру
СканерУпомянут в файлеЗапрещён
GPTBot (обучение OpenAI)7.4%0.4%
OAI-SearchBot (поиск ChatGPT)5.2%0.0%
ChatGPT-User (заход по ссылке)4.6%0.1%
ClaudeBot (Anthropic)7.5%0.5%
PerplexityBot2.7%0.1%
Perplexity-User (заход по ссылке)4.1%0.0%
Google-Extended (Gemini)10.1%0.3%
Applebot-Extended5.8%0.4%
CCBot (Common Crawl)6.7%1.1%
Bytespider (ByteDance)5.9%1.2%
Meta-ExternalAgent5.8%0.5%
Googlebot (поиск)6.1%0.0%

«Упомянут» значит, что для сканера вообще есть группа правил — в большинстве случаев она его разрешает.

Две настройки, которые реально стоят видимости

3.6% файлов запрещают весь сайт всем сканерам. Это одна строка — Disallow: / под User-agent: *, — обычно оставшаяся от тестовой версии, которую выкатили в прод. Она убирает клинику из Google ровно так же, как из ChatGPT. 10.4% доменов отказали нам на сервере кодом 401 или 403 ещё до чтения robots.txt. Это антибот-защита: она обычно пропускает проверенного Googlebot и отсекает сканеров, которых не узнаёт, включая те, которыми ассистенты читают страницу в момент вопроса о вашей клинике. Ни одна из этих настроек не видна в обычном SEO-отчёте, пока кто-то не проверит руками.

Что внутри файлов

Что внутри 2503 файлов
Что нашлиДоля файлов
Объявлен sitemap80.1%
Упомянут хотя бы один AI-сканер10.9%
Явно разрешён хотя бы один AI-сканер10.3%
Запрещён хотя бы один AI-сканер1.5%
Весь сайт закрыт для всех сканеров3.6%
Правил нет вообще6.2%

Медианный размер файла — 177 байт: чаще всего это заготовка, которую написала тема или плагин.

Обучающий сканер, поисковый и живой заход — три разных решения

Имена в таблице не взаимозаменяемы, и именно поэтому большинство файлов говорят не то, что хотел их владелец. GPTBot и Google-Extended собирают тексты для обучения модели. OAI-SearchBot и PerplexityBot строят индекс, по которому ассистент ищет. ChatGPT-User, Claude-User и Perplexity-User заходят на вашу страницу в тот момент, когда человек спрашивает про вашу клинику. Клиника может отказаться от обучения и при этом хотеть, чтобы её находили: разрешить поисковых и «живых», запретить обучающих. Почти ни один из прочитанных файлов этого различия не делает — одна группа, одно решение, обычно написанное плагином с двухлетним списком блокировок.

Как выглядит рабочий robots.txt для клиники

  • Одна группа для всех — User-agent: * и Allow: /, — а запрещено только то, что индексировать нельзя: корзина, вход для персонала, результаты внутреннего поиска.
  • Строка Sitemap: с реальным адресом карты сайта: её пропускают 19.9% файлов, и сканеры ищут страницы вручную.
  • Осознанная строка про AI: назовите обучающих сканеров, если не хотите их пускать, и оставьте разрешёнными поисковых и «живых», если хотите попадать в ответы ассистентов.
  • Больше ничего. Медианный файл в нашей выборке — 177 байт, и вредят обычно не длинные.
Наш файл открыт по адресу tepexa.com/robots.txt: все AI-сканеры разрешены сознательно, потому что лучше быть процитированными, чем невидимыми. Когда сканер зашёл, следующий вопрос — можно ли вашу страницу процитировать: это проверяет бесплатный аудит вместе с разметкой, скоростью и записью.

Что проверить на своём сайте на этой неделе

  1. Откройте вашдомен.com/robots.txt в браузере. Если видите Disallow: / под User-agent: * — это авария, а не нюанс.
  2. Убедитесь, что в файле объявлен ваш sitemap: у каждого пятого его нет.
  3. Решите про AI-сканеров осознанно: разрешайте, если хотите, чтобы вас цитировали ассистенты, запрещайте, если не хотите, — но решением, а не настройкой плагина по умолчанию.
  4. Спросите тех, кто ведёт ваш фаервол или CDN, кому отдаётся 403. Именно там происходит большая часть невидимых блокировок.
  5. Перепроверяйте после каждого редизайна и переезда: тестовое правило уезжает в прод именно тогда.

Пустить сканеров — только первый шаг, дальше нужна цитируемость

Доступ лишь приводит ассистента на страницу. Цитирует он понятный ответ, цифру с источником и FAQ, который можно поднять целиком, — об этом оптимизация под AI-поиск для клиник, и это же лежит в основе нашей услуги по видимости в поиске и AI для стоматологий.

Методика, ограничения и сырые данные

Дата замера — 3 октября 2026 года. Основа: стоматологии с сайтом в OpenStreetMap по континентальным США; запрошено 3742 доменов, разобрано 2503 файлов, представлены 49 штатов. Ограничения, о которых честно сказать: домены, отказавшие на сервере, в разобранную выборку не попали, поэтому доли по файлам описывают более открытую половину рынка; robots.txt — это просьба, а не защита, и сканер может её проигнорировать; серверная защита может закрыть сканера, которого файл разрешает, и наоборот; выборка OpenStreetMap смещена к клиникам, которые кто-то внёс на карту. Скачать агрегаты: CSV или JSON, лицензия CC BY 4.0 — берите любую цифру со ссылкой на эту страницу и указывайте источник «Tepexa, Do dental websites block AI crawlers? 2026».