Индексация4 мин чтения1 просмотр

robots.txt и sitemap: как случайно закрыть сайт от поиска

robots.txt и sitemap.xml управляют тем, что поисковик видит и обходит. Ошибка в одну строку способна закрыть от индексации весь сайт — и вы заметите это только по обвалу трафика.

Индексация
1 строка
Disallow: / в robots.txt закрывает от индексации весь сайт целиком. Такое случается после переноса с тестового сервера.

Как работает robots.txt

Файл говорит роботам, какие разделы обходить, а какие пропускать. Частая беда — забытый с разработки запрет Disallow: /, который остаётся на боевом сайте и убирает его из поиска. Вторая по частоте — правило, написанное для одного робота и не действующее для остальных: секции User-agent не складываются, робот читает только свою, а если её нет — общую.

Зачем нужен sitemap.xml

Карта сайта подсказывает поисковику список страниц и частоту их обновления. Устаревший sitemap с удалёнными адресами или без новых страниц замедляет индексацию свежего материала. Даты изменения в нём стоит ставить настоящие: карта, где у всех страниц вчерашняя дата, перестаёт быть подсказкой и начинает быть шумом.

Что проверить в первую очередь

Убедитесь, что важные разделы не закрыты в robots.txt, а карта сайта отдаёт актуальный список страниц и указана в robots.txt. Проверку стоит повторять после каждого переезда или крупного обновления.

Как выглядит рабочий файл

Минимальный robots.txt разрешает обход и указывает карту сайта. Закрывать стоит служебные разделы — корзину, личный кабинет, страницы поиска по сайту: в выдаче они не нужны и тратят время робота.

User-agent: *
Allow: /
Disallow: /cart
Disallow: /search
Sitemap: https://example.ru/sitemap.xml

Чем robots.txt не является

Это не запрет индексации, а просьба не обходить. Страница, закрытая в robots.txt, всё равно может попасть в выдачу — без описания, по внешним ссылкам. Хуже того: если на ней стоит noindex, робот его не прочитает, потому что не зайдёт на страницу. Чтобы страницы точно не было в поиске, её нужно оставить открытой для обхода и поставить noindex. Остальные причины пропажи из выдачи собраны в разборе «сайта нет в поиске».

Как проверить файл до того, как он уедет на сайт

Ошибка в robots.txt дорога тем, что действует сразу и на весь сайт. Риск снижают три привычки. Первая — проверять файл инструментом в панели вебмастера: он показывает, какие адреса под правило попадают, и это надёжнее чтения глазами. Вторая — держать файл в системе контроля версий вместе с сайтом, а не править прямо на сервере: видно, кто и когда добавил строку, и откат занимает минуту. Третья — после каждого переезда открыть файл на боевом адресе и прочитать целиком: типовая беда переезда в том, что вместе с сайтом приезжает тестовый robots.txt, закрывавший всё.

Что сделать прямо сейчас
Проверьте robots.txt на случайный Disallow: /
Убедитесь, что sitemap.xml содержит актуальные URL
Укажите ссылку на sitemap в robots.txt
Перепроверяйте оба файла после переноса сайта — и проверьте переадресации
Не закрывайте в robots.txt страницы, на которых стоит noindex
Переслать статью
А что покажет ваш сайт?
110 проверок за 1–3 минуты. Балл, разбивка по направлениям и две самые весомые находки — бесплатно.
Проверить сайт на SEO — бесплатно
Похожие материалы
ИндексацияСайта нет в поиске: пять причин, которые видно за минутуЧитать →КанонизацияДубли страниц: поиск показывает не тот адресЧитать →МобильныеБольше половины посетителей с телефона: что ломается чаще всегоЧитать →
Читать дальше
БезопасностьSSL и security-заголовки: чек-лист технической гигиены
Тема:ИндексацияВсе материалы ленты «SEO, скорость и техника сайта»

Материал носит информационный характер и не является юридической консультацией. Актуальность требований проверяйте на момент чтения.