Command Palette

Search for a command to run...

Роботы.txt Генератор: создайте, проверяйте и тестируйте правила сканирования без деиндексирования вашего сайта

Роботы.txt Генератор: создайте, проверяйте и тестируйте правила сканирования без деиндексирования вашего сайта

T
Toolz Team
|Jul 19, 2026|21 Мин. читать

Часть коллекции SEO инструменты

Самые дорогие четыре персонажа, которых я когда-либо видел, были отправлены Disallow: /, йо- Команда вывела промежуточного робота.txt к продакшену во время выпуска, никто не заметил, и в течение следующих десяти дней Google тихонько сбросил большую часть страниц сайта. Движение не зависло, чтобы включить сигнализацию, а она истощена. К тому времени, когда кто-то подумал проверить /robots.txt, восстановление было месяцем повторного сканирования. Файл, который вызвал его, был длиной в четыре строки.

Роботы.txt обманчиво прост. это простой текст, он имеет, может быть, шесть директив стоит знать, и синтаксис подходит на учетной карточке. эта простота именно поэтому он идет не так: нет ни шага сборки, ни линтера в вашем CI, ни системы типов, и никакого сообщения об ошибке. если вы пишете правило, что сканер не может анализировать, сканер молча игнорирует эту строку и продолжает. ваш файл выглядит нормально, ваш сайт выглядит нормально, и что-то, что вы думали, что было заблокировано, сканируется - или что-то, что вам нужно сканировать, не является.

я строю Toolz.dev И я постоянно пишу файлы robots.txt для промежуточных сред, сайтов клиентов и своих проектов, поэтому я построил Роботы.txt Генератор чтобы сделать режимы отказа видимыми. Он строит файл из структурированной формы, поэтому синтаксис правильный по конструкции. Он заклеивает то, что вы написали, и называет ножки с номерами строк. И он проверяет URL-адрес ваших правил, используя тот же самый длинный приоритет, который использует реальные гусеничные роботы, поэтому вы можете доказать, что страница доступна до развертывания, а не после того, как Search Console вам не скажет, что это не так.

TL;DR: Robots.txt сообщает сканерам, что они могут получить. Он не удаляет страницы из результатов поиска и не защищает ничего частного - файл общедоступен, а соблюдение требований является добровольным. Правила применяются только внутри a User-agent: группа, пути должны начинаться с /, * соответствует чему угодно, трейлингу $ Якорь закрепляет конец, и когда совпадают два правила, самый длинный шаблон выигрывает с разрешающим ничью. выше Роботы.txt Генератор Создает, линты и тестирует все это в вашем браузере.

Что на самом деле контролирует robots.txt

Robots.txt — это директива обхода, а не директива индекса. Это единственное различие объясняет большую часть путаницы вокруг него.

Когда искатель хочет получить URL-адрес на вашем хосте, он сначала извлекает https://yourhost/robots.txt и проверяет, разрешен ли URL-адрес. если бы Disallow Правила совпадают, хорошо воспитанный гусенок не запрашивает страницу. Вот и весь механизм. Он управляет HTTP-запросом и ничего больше.

Что он не делает, так это удаляет URL-адрес из индекса поиска. Google может и делает индексные URL-адреса, которые он никогда не извлекал, используя только якорный текст и контекст ссылок, указывающих на них. Если вы заблокируете /pricing В robots.txt и пятьдесят сайтов ссылка на /pricingGoogle все еще может показать, что URL-адрес в результатах - обычно без описания, потому что он никогда не читает страницу. Блокировка URL-адреса, который вы хотите удалить из поиска, активно работает против вас: the noindex Тег, который удалил бы его, находится внутри страницы, и искателю, которому не разрешено извлекать страницу, она никогда не сможет ее увидеть. Правильная последовательность - разрешить ползание, служить <meta name="robots" content="noindex"> или X-Robots-Tag: noindex Заголовок, подождите, пока страница не выйдет, и только затем заблокируйте ее, если хотите сохранить бюджет обхода.

Оно тоже ничего не защищает. Роботы.txt обслуживаются публично по известному пути; любой, включая каждого злоумышленника в Интернете, может читать ваши в браузере. равняется Disallow: /internal-admin-v2/ линия - это указатель, указывающий на то, что вы хотели скрыть. Вредоносные скребки полностью игнорируют файл - соблюдение этого соглашения является добровольным соглашением, а не механизмом обеспечения соблюдения. Все, что должно быть частным, требует аутентификации или списка разрешений IP. Robots.txt - это вежливо сделанный запрос к сканерам, которые решают слушать.

Основные характеристики генератора robots.txt

Редактор структурированного группового

Грамматика файла — это группы: одна или несколько User-agent: строки, за которыми следуют правила, которые к ним относятся. Написание этого вручную влечет за собой самую распространенную структурную ошибку, которая является правилом, плавающим над первым User-agent: линия, где она применима ни к кому. Генератор строит группы как объекты первого класса, поэтому каждое добавленное правило обязательно принадлежит группе.

Валидатор, который сообщает о реальных ножах

Linter работает на каждом нажатии клавиш и сообщает об ошибках, предупреждениях и заметках с номерами строк. Он помечает правила за пределами любой группы, пути, отсутствующие в ведущей слеше, голые Disallow: без значения (что означает «разрешить все» и почти никогда не то, что имел в виду автор), URL-адреса карты сайта, которые не являются абсолютными, $ используется где угодно, кроме конца шаблона, неизвестных директив, дублирующих групп пользователь-агент и - громко - a Disallow: / сидящий под User-agent: *, йо-

Реальный тестер URL

Введите путь и пользователь-агент и отчеты инструмента Разрешено или Запрещено, плюс точное правило, которое решило это Логика приоритета является реальной из RFC 9309: самый длинный шаблон пути сопоставления выигрывает независимо от правил порядка, появляющихся в файле, и если два шаблона имеют одинаковую длину, Разрешить биты Запретить. это та часть, которую люди чаще всего ошибаются от интуиции, потому что она не ведет себя как брандмауэр&#39;s правила первого матча выигрывает.

Предустановки одним щелчком мыши

Разрешить все, блокировать все, WordPress, Shopify, Next.js и блокировать поисковики AI, каждый заполняет всю форму правильной, разумной отправной точкой. Блоки пресетов WordPress /wp-admin/ Во время вырезания /wp-admin/admin-ajax.php, о котором многие рукописные файлы забывают и тем самым ломают интерфейсную функциональность, которую Google нужно для рендеринга страницы.

Управление гусеничным ИИ

Один клик добавляет группы отказа для GPTBOT, ClaudeBot, PerplexityBot, CCBot, Google-Extended, ByTespider и Anthropic-AI, оставляя GoogleBot и BingBot свободными для сканирования. Таблица известных ползунков объясняет, что на самом деле делает каждый бот, поэтому вы делаете осознанный выбор, а не вставляете список из сообщения в блоге.

Анализирует существующий файл

Вставьте роботы.txt вы уже служите и инструмент считывает его обратно в редактируемые группы. большинство роботов.txt работы не является greenfield - это аудит и ремонт что-то написанное три года назад кем-то, кто ушел - и начиная с того, что на самом деле жить является единственным разумным способом сделать это.

Все остается в вашем браузере

Файл генерируется, линован и полностью протестирован в клиентском JavaScript. Ничего не загружается, поэтому вы можете безопасно разрабатывать правила для промежуточного хоста или необъявленного раздела сайта, а инструмент работает в автономном режиме после загрузки.

Как использовать генератор robots.txt

Шаг 1: Начните с пресета или импортируйте то, что у вас уже есть

Если вы начинаете заново, выберите пресет, ближайший к вашему стеку. Если вы уже обслуживаете robots.txt, возьмите его из https://yoursite.com/robots.txt, вставьте его в поле «Импорт» и нажмите «Разбор по группам». Инструмент реконструирует структуру группы, и валидатор сразу же сообщает вам, что не так с файлом, который вы запускаете в процессе производства.

Шаг 2: Создайте свои группы агентов

Каждая группа нацелена на один или несколько сканеров. Добавляйте сканеры из списка известных ботов или вводите токен напрямую - токены сопоставляются без учета регистра, так что googlebot а Googlebot эквивалентны. группа с * это цепочка-все: относится к любому гусенице, у которого нет более конкретной группы.

Здесь важно усвоить то, что кролики подчиняются ровно одной группе. Googlebot читает Googlebot группа, если она существует и игнорирует * группировать целиком - не сливает их Если создать Googlebot Группу Чтобы добавить одно правило, вы должны повторить все правила из * Группируйте внутри него, или Googlebot молча перестанет все подчиняться им. Это удивляет практически всех с первого раза.

Шаг 3: Добавьте правила, карты сайта и прочитайте валидатор

Добавьте пути запрещения для того, что вы хотите, чтобы сканеры пропускали, и Разрешите пути для вырезов внутри них. Добавьте задержку сканирования только в том случае, если вы нацелены на движок, который соответствует одному. Добавьте URL-адреса вашей карты сайта - они должны быть абсолютными, включая схему и хост, и они будут находиться за пределами любой группы, применимы ко всем.

Затем читайте валидатор. Ошибки — это вещи, которые не будут работать. Предупреждения — это вещи, которые, вероятно, не означают то, что вы думаете. Заметки - это возможности. Исправьте все красное, прежде чем идти дальше.

Шаг 4: Проверьте URL, которые вам действительно небезразличны

Это шаг люди пропускают и не должны. Возьмите три или четыре пути, чей статус сканирования действительно имеет значение - ваши страницы продукта, ваш блог, маршрут администратора вы думаете, что вы заблокированы, файл CSS Google должен отобразить ваш макет - и протестируйте каждый из них против Googlebot. инструмент говорит вам Разрешено или запрещено и называет правило ответственный. Если результат удивляет вас, ваши правила не говорят то, что вы думаете, они говорят, и это гораздо дешевле узнать сейчас.

Шаг 5: Скопируйте или загрузите и разверните в корне

Скопируйте файл или скачайте robots.txt, затем подавайте его точно https://yourhost/robots.txt с 200 статус и text/plain Тип содержимого. больше нигде не работает. /blog/robots.txt никто не читает.

Протокол исключения роботов, подробно

это наконец стандарт

В течение двадцати пяти лет robots.txt был соглашением, описанным в посте списка рассылки 1994 года, и кролики по-своему интерпретировали двусмысленность. В 2022 году он был опубликован как RFC 9309, который кодифицирует правила синтаксического анализа, семантику сопоставления и порядок приоритета, на котором сошлись Google, Bing и большинство серьезных сканеров. Когда в этом руководстве написано & quot; правило X & quot; это означает, что в RFC 9309 написано X - не то, что это утверждается в сообщении в блоге.

группы, и почему гусеницы подчиняются только одному

запись состоит из одного или нескольких последовательных User-agent: строки, за которыми следуют строки правил, которые к ним относятся Сканер идентифицирует себя с токеном продукта - Googlebot, Bingbot, GPTBot- и ищет группу, чей жетон наиболее конкретно совпадает. Он подчиняется той группе и никакой другой. The * Группа — это запасной вариант, используемый только тогда, когда ничего более конкретного не совпадает.

Практическое следствие — повторение, потому что оно наносит такой большой ущерб: группы не наследуют. файл, который читает

User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: Googlebot
Disallow: /internal/

означает, что Googlebot может сканировать /admin/ а /cart Свободно. Нашла свою группу, поэтому * группа невидима для него. Если вы хотите, чтобы GoogleBot был заблокирован из всех трех, все три правила должны появиться внутри Googlebot группа

Самый длинный приоритет

Когда два или более правил в соответствующей группе соответствуют URL-адресу, выигрывает тот, который Самый длинный шаблон пути, измеряется символами. Порядок в файле не имеет значения. Если самое длительное совпадение позволяет и самое длинное недопустимое значение имеет одинаковую длину, разрешите победы.

User-agent: *
Disallow: /admin
Allow: /admin/public

В соответствии с этими правилами /admin/public/logo.png есть допустимый- шаблон "Разрешить" состоит из 13 символов против "Запретить" и #39;s 6 - пока /admin/secret есть недопустимый, потому что только шаблон запрета соответствует ему. Это механизм, лежащий в основе каждого "заблокировать каталог, разрешить один файл внутри него", включая WordPress. admin-ajax.php Вырезание. Именно поэтому написание правил сверху вниз, например, конфигурация брандмауэра, дает неправильные интуиции: нет побед в первом матче, нет провалов и порядка.

Подстановочные знаки и конечная якорь

В шаблонах пути поддерживаются два специальных символа.

* Соответствует любой последовательности символов, включая none. Disallow: /*?sessionid= Блокирует любой URL, содержащий этот параметр запроса в любом месте.

$ Привязка к концу URL-адреса и означает только то, что это окончательный символ шаблона. Disallow: /*.pdf$ крупный кусок /whitepaper.pdf но не /whitepaper.pdf?download=1, потому что этот URL не заканчивается .pdf, йо- бросить $ и вы блокируете и то, и другое, а также все, что просто содержит путь .pdf, йо-

без $, совпадение префикс, который постоянно сбивает людей с толку. Disallow: /admin крупный кусок /admin, /admin/, /admin/users, а также /administrator а /admin-tools, потому что все они начинаются со строки /admin, йо- Если вы имели в виду только каталог, напишите /admin/, йо-

Задержка сканирования не всегда исполняется

Crawl-delay: 10 Просит искатель ждать десять секунд между запросами. Бинг, Яндекс и различные меньшие гусеничные чести. Googlebot полностью игнорирует это- Google регулирует скорость сканирования в зависимости от времени ответа сервера и настройки в консоли поиска, а не от директивы в вашем файле. Установка большой задержки сканирования на большом сайте - это замедленная работа: при 10 секундах на запрос 100 000-страничному сайту требуется почти двенадцать дней, чтобы просканировать один раз, и на практике большая часть его вообще никогда не сканируется. Если сканирование действительно вредит вашему серверу, исправьте сервер или кэшируйте страницы; регулирование сканера в основном просто делает вас невидимым.

Блокировка ИИ-грабителей

Сканеры ИИ разделились на две категории, которые люди обычно смешивают.Тренировочные сканеры - GPTBot, ClaudeBot, CCBot, Bytespider, Google-Extended - собирают контент, используемый для обучения моделей. сканеры-ответчики, ярчайшим примером которых является PerplexityBot, получают страницы, чтобы их можно было цитировать в сгенерированных ответах, которые могут отправить вам реферальный трафик. Блокировка первой категории защищает ваш контент от поглощения моделью; блокировка второй удаляет вас с поверхности, где в противном случае вы могли бы быть процитированы.

Google-Extended Заслуживает особой ноты, потому что его имена вводят в заблуждение. Это не гусеница. Это токен, который контролирует, может ли контент, уже полученный Googlebot, использовать для обучения Gemini и Vertex AI. запретить это имеет никакого эффекта В Google Поиске, индексировании или рейтинге. Вы можете отказаться от использования обучающего технологического интеллекта Google и сохранить свое присутствие в поиске полностью нетронутым.

И предостережение, которое относится ко всем им: соблюдение добровольно. Блокировка GPTBot останавливает объявленный поисковик OpenAI, потому что OpenAI решает соблюдать файл. Он ничего не делает со скребком, который лежит на его пользовательском агенте, и нет директивы robots.txt, которая могла бы.

ссылка на директив

директива предел определенный почитаемый
User-agent: Открывает группу Названия именов, к которым относятся следующие правила. * это ловушка. все
Disallow: Внутри группы Просит искатель не извлекать URL-адреса, соответствующие пути. голый Disallow: Без значения - разрешить все&quot;. все
Allow: Внутри группы вырезает исключение из более широкого Disallow, йо- Выигрывает ничья с самым длинным матчем. Google, Bing, большинство современных гусенок
Crawl-delay: Внутри группы Минимальная секунда между запросами. Бинг, Яндекс, другие - Не гуглбот
Sitemap: всеобъем Абсолютный URL карты сайта или индекса сайта. Применяется ко всем кроулам независимо от места размещения. Google, Bing, большинство гусеничных
Host: всеобъем Предпочтительное зеркало/домен. Яндекс-расширение. только яндекс
Noindex: -- не работает. Google отказался от поддержки в 2019 году. использовать noindex метатег или X-Robots-Tag заголовок. никто
# где-нибудь замечание Все после него на линии игнорируется. все

Общие варианты использования

Не допускайте попадания в индекс не блокируя что-либо важное

Задача хлеба с маслом: блокировать URL-адреса фасетированного поиска, строки запроса идентификатора сеанса, внутренние результаты поиска и страницы кассы или кассы, чтобы абоненты тратили свой бюджет на страницы, которые действительно могут ранжироваться. Ловушка переблокирует. такое правило, как Disallow: /*? Блокирует каждый URL-адрес строкой запроса, которая на многих сайтах включает страницы с разделителями категорий, которые вы очень хотите, чтобы просканировать. Перед отправкой проверьте шаблоны.

Снимаем промежуточный сайт в темноте

User-agent: * плюс Disallow: / является правильным вызовом для среды постановки или предварительного просмотра, и Блок все предустановленное производит его. Но относиться к этому как гигиена, а не безопасность: среды постановки также должны быть позади HTTP auth или IP разрешенный список, потому что robots.txt не скрывает хост и не останавливает кого-либо от его просмотра. И файл никогда, никогда не должен быть повышен до производства - поместите его в конвейер развертывания и #39;s diff обзор, потому что эта точная ошибка является единственным наиболее распространенным способом, как сайты исчезают из Google.

Исправление сайта, который выбыл из поиска

Когда органические движения падают со скалы, /robots.txt Это первое, что нужно проверить, прежде чем обновится алгоритм и проверка обратных ссылок. Вставьте Live-файл в генератор и прочитайте вывод валидатора. заблудший Disallow: /, правило, блокирующее CSS и JavaScript GoogleBot, необходимо отобразить страницу или Googlebot группа, которая случайно переопределяет тщательно написанное * Группа появится сразу.

Решение, что могут сделать с вашим контентом инициалисты ИИ

Издатели, сайты документации, и любой, чей контент продукт теперь имеет реальное решение, чтобы сделать о тренировке сканеров.Block AI сканеры предустановка дает вам защищенный дефолт - поисковые системы приветствуются, обучение сканеры отказались - и таблица сканера объясняет каждый из них, так что вы можете делать исключения намеренно, например, держать PerplexityBot разрешен для реферального трафика, отказываясь при этом от чистых тренировок ботов.

Аудит наследуемого сайта

Вы берете на себя сайт, и никто не знает, почему /resources/ не проиндексирован. Импортируйте Live Robots.txt, запустите тестер по указанным путям, и инструмент именует точное правило, делающее это. Это займет минуту и заменяет день гадала.

Зачем генерировать robots.txt в браузере

выше Роботы.txt Генератор работает полностью на стороне клиента. ваши пути, имена хостов и правила никогда не покидают машину, что имеет большее значение, чем может показаться - структура каталогов неизданного продукта, URL-адрес промежуточного хоста и внутренние маршруты, которые вы пытаетесь сохранить в тайне, - все это то, что не стоит вставлять в журналы сервера &#39;s. После загрузки страницы она работает в автономном режиме, и на выходе получается обычный текстовый файл, которым вы владеете.

Robots.txt находится рядом с несколькими соседними вакансиями. выше Генератор метатегов производит noindex и канонические теги, которые выполняют работу robots.txt, не могут. выше Открыть предварительный просмотр графика Показывает, как ваши ссылки будут отображаться, как только те исследователи, которые вы разрешили, прийти и получить их. и тот генератор пуль Создает чистые пути, с которыми ваши правила будут сопоставляться.

часто задаваемые вопросы

Куда поставить файл robots.txt?

его нужно подавать точно /robots.txt на хосте это относится - например https://example.com/robots.txt, йо- Гусенки нигде больше не смотрят. файл на /blog/robots.txt полностью игнорируется, и файл на example.com не управляет shop.example.com; каждому хосту нужно свое. подавать его со статусом 200 и text/plain Тип содержимого.

Отключить ли удаление страницы из Google?

Нет, и это самое важное недопонимание в формате. Отключить запрет Google не позволяет Google получить страницу, он не удаляет URL из индекса. Если другие сайты ссылаются на заблокированный URL, Google все равно может перечислять его, обычно без описания, потому что он никогда не читает страницу. Чтобы не было результатов поиска, разрешите сканирование и обслуживайте noindex метатег роботов или X-Robots-Tag заголовок. Если вы заблокируете URL, искатель никогда не сможет увидеть добавленный вами Noindex.

Является ли robots.txt способом скрыть частные страницы?

Нет. Это общедоступный файл, который может прочитать каждый, и его соблюдение является добровольным - вредоносные скребки полностью игнорируют его. Листинг /internal-admin/ В ваших правилах Disallow подскажите каждому злоумышленнику, где именно искать. Все, что должно оставаться в частном порядке, нуждается в аутентификации, в списке разрешений по IP или вообще не должно быть в общедоступном Интернете.

Как разрешать и запрещать взаимодействовать, когда оба соответствуют URL?

Выигрывает наиболее конкретное правило, где специфичность означает длину шаблона пути. определенный Disallow: /admin а Allow: /admin/public, URL /admin/public разрешено, потому что шаблон разрешить длиннее, в то время как /admin/secret заблокирован. Если два паттерна имеют одинаковую длину, разрешите выигрыши. Правила заказа появляются в файле не имеют значения, что удивляет людей, которые ожидают поведения первого матча в стиле брандмауэра.

Что делают подстановочные знаки * и $?

Звездочка соответствует любому ряду символов, поэтому Disallow: /*?sessionid= Блокирует любой URL-адрес, содержащий этот параметр. Знак доллара закрепляет конец URL-адреса, поэтому Disallow: /*.pdf$ крупный кусок /report.pdf но не /report.pdf?download=1, йо- без $, сопоставление является префиксом: Disallow: /admin крупный кусок /admin, /admin/users, а также /administrator, потому что все они начинаются с этой строки.

Как заблокировать поисковиков ИИ, таких как GPTBOT и ClaudeBot?

Дайте каждому свою группу с Disallow: /, йо- Пресет для сканеров Block AI делает это для GPTBOT, ClaudeBot, PerplexityBot, CCBOT, Google-Extended, ByTespider и Anthropic-AI одним щелчком мыши, оставляя Googlebot и BingBot свободными для сканирования. Обратите внимание, что расширение Google контролирует использование обучающих устройств для Gemini и Vertex AI и не влияет на поиск в Google. Соблюдение добровольных действий , так что это останавливает кооперативные гусеничные, не определенные скребки.

Действительно ли работает обход задержки?

Это зависит от сканера. Googlebot полностью игнорирует это - скорость сканирования регулируется с консоли поиска и с вашего сервера и время ответа #39;s. Bing, Яндекс и несколько небольших сканеров соблюдают это, рассматривая значение как минимальное количество секунд между запросами. Установка большой задержки на большом сайте может означать, что большинство страниц вообще никогда не будут сканироваться, поэтому сохраняйте значения небольшими и вместо этого фиксируйте емкость сервера, если сканирование действительно является проблемой.

Что произойдет, если у моего robots.txt будет синтаксическая ошибка?

Гусенки молча отбрасывают линии, которые не могут разобрать и продолжить с остальными, поэтому сломанное правило тихо не выходит из строя, а не громко. неизвестная директива, путь, отсутствующий на ведущей косой черте, или правило, расположенное выше первого User-agent: Линия просто ничего не делает, и вы не узнаете, пока ваш трафик не движется. Именно для этого и предназначен валидатор: он сообщает о каждом из них с номером строки перед развертыванием.

Frequently Asked Questions

It must be served at exactly /robots.txt on the host it applies to — for example https://example.com/robots.txt. Crawlers look nowhere else. A file at /blog/robots.txt is ignored entirely, and the file on example.com does not govern shop.example.com; each host needs its own. Serve it with a 200 status and a text/plain content type.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!