Блокировка URL фильтров через robots.txt вредит индексации
Ключевые факты
- 1 robots.txt блокирует сканирование, но не индексацию, что может привести к мусорным страницам в индексе.
- 2 Внешние ссылки на URL, заблокированные robots.txt, могут привести к их индексации без возможности увидеть noindex.
- 3 Директива noindex, follow предотвращает индексацию, сохраняя передачу ссылочного веса.
- 4 Канонические ссылки — это подсказки для Google, а не строгие директивы.
- 5 Пустые результаты фильтров, возвращающие HTTP 200, создают soft 404 ошибки.
- 6 Необходимо различать фасеты (с поисковым спросом) и фильтры (для удобства) и управлять их индексацией по-разному.
- 7 Для пустых результатов фильтров следует отдавать HTTP 404 или динамически прописывать noindex.
Распространенная ошибка в SEO — попытка управлять раздутой фасетной навигацией с помощью директивы Disallow в robots.txt. Это решение создает более серьезную проблему: robots.txt блокирует сканирование страниц, но не их индексацию. Если на URL фильтра существует внешняя ссылка, Google может проиндексировать эту страницу, используя анкорный текст, но не сможет просканировать ее содержимое и, следовательно, не увидит директиву noindex. В результате в индекс попадают нежелательные страницы фильтров, которые невозможно отслеживать в Search Console или удалить. Для эффективного управления индексацией важно подбирать правильные инструменты. Некликабельная разметка (например, кнопки вместо <a href>) предотвращает обнаружение ссылок. robots.txt блокирует сканирование. Директива noindex, follow предотвращает индексацию, позволяя при этом передавать ссылочный вес (хотя со временем Google может перестать переходить по ссылкам с таких страниц). Канонические ссылки служат подсказками для Google, а не строгими директивами, консолидируя сигналы ранжирования. Рекомендуется жесткое разделение фасетов и фильтров. Фасеты, которые имеют самостоятельный поисковый спрос (например, бренд, цвет), должны иметь чистые, открытые для сканирования URL с самореферентными каноническими ссылками. Фильтры, предназначенные только для удобства (например, диапазон цен, порядок сортировки), не должны изменять URL или должны генерировать параметрические URL, закрытые от индексации. Классификация зависит от специфики сайта: то, что является фильтром для одного, может быть фасетом для другого. Практический подход заключается в том, чтобы по умолчанию переводить все комбинации фильтров на URL с параметрами, которые либо каноникализированы, либо заблокированы от индексации. Затем следует мониторить логи внутреннего поиска и показы в Search Console для выявления реального спроса и только доказанные комбинации переносить на чистые URL-пути (например, с 301-м редиректом). Также важно избегать пустых результатов фильтров, которые возвращают HTTP 200 с сообщением "товары не найдены", так как это приводит к массовым soft 404 ошибкам. В таких случаях следует отдавать честный HTTP 404 код или динамически прописывать noindex, если количество товаров падает ниже определенного порога.