METABYTE
К списку статей

Amazonbot наконец-то научился читать robots.txt. Поздравляем, теперь он просто хам, а не вор

Amazonbot перестал игнорировать запреты и начал уважать robots.txt — маленькая победа вебмастеров над корпоративным скрепером.

14 мая 20262 мин чтения
Amazonbot наконец-то научился читать robots.txt. Поздравляем, теперь он просто хам, а не вор

Долгая сага о том, как Amazonbot игнорировал файл robots.txt, наконец завершилась. Спустя годы возмущений и жалоб, Amazon заявила, что их краулер теперь будет соблюдать правила, прописанные в этом священном граале SEO-оптимизаторов.

Раньше Amazonbot вёл себя как тот родственник, который приходит в гости без звонка, заглядывает во все шкафы и ещё и чай не предлагает. Он игнорировал директивы Disallow, выкачивая контент для обучения своих моделей и индексации товаров. Многие вебмастера жаловались, что их серверы захлёбывались от запросов, а Amazon даже не удосуживалась отвечать на письма.

Теперь же, по словам Amazon, их краулер будет уважать robots.txt. Правда, остаётся вопрос: а что насчёт уже украденных данных? Но это уже детали. Главное — теперь можно вздохнуть спокойно, хотя бы на время. Пока Amazon не решит, что robots.txt — это просто рекомендация, а не закон.

Для разработчиков это означает, что можно перестать писать костыли вроде блокировки по User-Agent на уровне .htaccess или nginx. Но не расслабляйтесь: другие краулеры, например, GPTBot, всё ещё могут вести себя как слоны в посудной лавке.

Комментарий студии METABYTE: Мы рады, что Amazon наконец-то услышал голос разума. Теперь осталось дождаться, когда и другие гиганты поймут, что robots.txt — это не просто декорация, а важный инструмент веб-стандартов. Если вам нужна помощь в настройке правильного парсинга или защите контента — мы знаем, как сделать так, чтобы ваш сайт был видим только тем, кому нужно.

СЛЕДУЮЩИЙ ШАГ

Понравилось как мыслим?

Применяем те же принципы в клиентских проектах: AI, автоматизации, продукты, которые не умирают после релиза.