Command Palette

Search for a command to run...

Robots.txt 생성기: 사이트 색인 제거 없이 크롤링 규칙을 빌드,검증 및 테스트합니다

Robots.txt 생성기: 사이트 색인 제거 없이 크롤링 규칙을 빌드,검증 및 테스트합니다

T
Toolz Team
|Jul 19, 2026|21 최소 읽기

SEO 도구 모음의 일부

내가 본 것 중 가장 비싼 네 캐릭터는 배송되었습니다 Disallow: /. 팀은 방출 도중 생산에 연출 robots.txt 를 밀었습니다,아무도 주의하지 않았습니다,그리고 그 후에 10 일 동안 Google 은 site's 페이지의 대부분을 조용히 떨어뜨렸습니다. 교통은 경보를 발령하는 방법에 있는 충돌하지 않았습니다; 그것은 배수했습니다. 누군가가 검사하는 것을 생각될 때까지 /robots.txt을, 복구는 다시 크롤링의 달이었다. 그것을 일으키는 파일 네 줄이었다.

Robots.txt 는 기만적으로 간단합니다. 일반 텍스트이며,알 가치가있는 6 개의 지시어가있을 수 있으며,구문은 인덱스 카드에 적합합니다. 그 단순함이 정확히 잘못되는 이유입니다: 빌드 단계,CI 에 린터,유형 시스템 및 오류 메시지가 없습니다. 크롤러가 구문 분석 할 수없는 규칙을 작성하면 크롤러는 조용히 그 줄을 무시하고 계속합니다. 파일이 잘 보이고 사이트가 잘 보이며 차단되었다고 생각했던 것이 크롤링되고 있습니다 - 또는 크롤링이 필요하지 않은 것입니다.

나는 짓는다 Toolz.dev 그리고 저는 준비 환경, 클라이언트 사이트 및 내 프로젝트를 위한 robots.txt 파일을 지속적으로 작성하여 구축했습니다 robots.txt 생성기 실패 모드를 보이게 하려면. 구조화된 형태로 파일을 빌드하므로 구문은 구성별로 올바릅니다. 작성한 내용을 연결하고 줄 번호가 있는 풋건을 호출합니다. 그리고 실제 크롤러가 사용하는 것과 동일한 최장 일치 우선순위를 사용하여 규칙에 대해 URL 을 테스트하므로 Search Console 이 도달 가능하지 않다고 말한 후가 아니라 배포하기 전에 페이지에 도달할 수 있음을 증명할 수 있습니다.

TL;DR: Robots.txt 는 크롤러에게 무엇을 가져올 수 있는지 알려줍니다. 검색 결과에서 페이지를 제거하지 않으며 비공개적인 것은 보호하지 않습니다. - 파일은 공개되어 있으며 규정 준수는 자발적입니다. 규칙은 a 내부에만 적용됩니다 User-agent: 그룹, 경로는 다음으로 시작해야 합니다 /, * 무엇이든 일치합니다 $ 끝을 고정하고,두 규칙이 일치하면 가장 긴 패턴이 Allow breaking ties 로 승리합니다. The robots.txt 생성기 브라우저에서 이 모든 것을 빌드하고, 린트하고, 테스트합니다.

robots.txt 가 실제로 제어하는 것

Robots.txt 는 인덱스 지시어가 아닌 크롤링 지시어입니다. 그 단일 구별은 주변의 혼란의 대부분을 설명합니다.

크롤러가 호스트에서 URL을 가져오려고 하면 먼저 가져옵니다 https://yourhost/robots.txt 그리고 URL 이 허용되는지 확인합니다. 만약 a Disallow 규칙이 일치하면,잘 동작하는 크롤러는 페이지를 요청하지 않습니다. 그것이 전체 메커니즘입니다. HTTP 요청을 지배하며,다른 것은 없습니다.

하지 않는 것은 검색 색인에서 URL 을 제거하는 것입니다. Google 은 가져 오지 않은 URL 을 앵커 텍스트와 해당 항목을 가리키는 링크의 컨텍스트 만 사용하여 인덱스 할 수 있고 수행합니다. 차단하는 경우 /pricing robots.txt 및 50개 사이트에서 연결됩니다 /pricing구글은 여전히 결과에 그 URL 을 표시 할 수 있습니다 - 일반적으로 설명없이,그것은 페이지를 읽지 않기 때문에. 검색 밖으로 원하는 URL 을 차단하는 것은 적극적으로 당신에 대해 작동: 그만큼 noindex 그것을 제거할 태그는 페이지 안에 살고, 페이지를 가져오는 것이 허용되지 않는 크롤러는 결코 그것을 볼 수 없습니다. 올바른 순서는 크롤링을 허용하고, 봉사하는 것입니다 <meta name="robots" content="noindex"> 또는 an X-Robots-Tag: noindex 헤더, 페이지가 드롭아웃될 때까지 기다렸다가 크롤링 예산을 절약하려는 경우에만 차단합니다.

또한 아무것도 보호하지 않습니다. Robots.txt 는 잘 알려진 경로에서 공개적으로 제공됩니다; 인터넷상의 모든 공격자를 포함하여 누구나 브라우저에서 사용자를 읽을 수 있습니다. A Disallow: /internal-admin-v2/ line 은 숨기고 싶었던 것을 가리키는 이정표입니다. 악의적 인 스크레이퍼는 파일을 완전히 무시합니다 - 그것을 존중하는 것은 집행 메커니즘이 아니라 자발적인 협약입니다. 개인적이어야하는 모든 것은 인증이나 IP 허용 목록을 필요로합니다. Robots.txt 는 듣기를 선택한 크롤러에게 정중하게 요청 한 것입니다.

Robots.txt Generator 의 주요 기능

구조화된 그룹 편집기

file&#39;s 문법은 groups: 하나 또는 그 이상입니다 User-agent: 선 다음에 그들에게 적용되는 규칙이 옵니다. 손으로 그것을 쓰면 가장 일반적인 단일 구조 버그가 초대되는데,이는 첫 번째 위에 떠 있는 규칙입니다 User-agent: 아무에게도 적용되지 않는 선. 생성기는 그룹을 일류 객체로 구축하므로 추가하는 모든 규칙은 반드시 그룹에 속합니다.

실제 발총을 보고하는 검증기입니다

린터는 모든 키 입력에서 실행되며 오류, 경고 및 줄 번호가 있는 메모를 보고합니다. 이는 모든 그룹 외부의 규칙, 선행 슬래시가 누락된 경로, 베어를 표시합니다 Disallow: 아무 값 (이는 의미 &quot;allow everything&quot; 그리고 거의 결코 저자가 의미), 절대 되지 않는 사이트맵 URL, $ 패턴의 끝, 알 수 없는 지시문, 중복된 사용자 에이전트 그룹 및 큰 소리로 a를 제외한 모든 곳에서 사용됩니다 Disallow: / 아래에 앉아 User-agent: *.

실제 URL 테스터

경로와 사용자 에이전트를 입력하고 도구 보고서에 허용 또는 허용되지 않음과 이를 결정한 정확한 규칙을 입력합니다. 우선순위 논리는 실제 논리입니다 RFC 9309: 파일에 나타나는 순서 규칙에 관계없이 가장 긴 일치 경로 패턴이 승리하고,두 패턴의 길이가 같으면 허용 비트가 허용되지 않습니다. 이것은 사람들이 직관에서 가장 자주 잘못되는 부분입니다. 왜냐하면 방화벽처럼 동작하지 않기 때문입니다&#39;s first-match-wins rules.

원클릭 사전설정

모든 것을 허용하고,모든 것을 차단하고,WordPress, Shopify,Next.js,Block AI 크롤러는 각각 전체 양식을 정확하고 합리적인 시작점으로 채웁니다. WordPress 사전 설정 블록 /wp-admin/ 조각하면서 /wp-admin/admin-ajax.php많은 손으로 쓴 파일이 잊어버리고 Google이 페이지를 렌더링하는 데 필요한 프런트엔드 기능을 깨뜨리는 것입니다.

AI 크롤러 제어

한 번의 클릭으로 GPTBot,ClaudeBot, PerplexityBot,CCBot, Google-Extended,Bytespider, and anthropic-ai 에 대한 거부 그룹이 추가되는 한편 Googlebot 과 Bingbot 은 자유롭게 크롤링할 수 있습니다. 알려진 크롤러 테이블은 각 봇이 실제로 수행하는 작업을 설명하므로 블로그 게시물에서 목록을 붙여 넣기보다는 정보에 입각한 선택을 하고 있습니다.

기존 파일을 구문 분석합니다

이미 봉사하는 robots.txt 를 붙여 넣으면 도구가 편집 가능한 그룹으로 다시 읽습니다. 대부분의 robots.txt 작업은 그린 필드가 아닙니다 - 떠난 사람이 3 년 전에 작성한 것을 감사하고 수리하는 것입니다 - 그리고 실제로 살아있는 것부터 시작하는 것이 유일한 제정신입니다.

모든 것이 브라우저에 유지됩니다

파일은 클라이언트 측 JavaScript 에서 완전히 생성,린트 및 테스트됩니다. 아무 것도 업로드되지 않으므로 스테이징 호스트 또는 사이트의 예고되지 않은 섹션에 대한 규칙을 안전하게 작성할 수 있으며 도구는 로드되면 오프라인으로 작동합니다.

Robots.txt Generator 를 사용하는 방법

1 단계: 사전 설정에서 시작하거나 이미 가지고 있는 것을 가져옵니다

새로 시작하는 경우 스택에 가장 가까운 사전 설정을 선택합니다.If you already service a robots.txt,fetch it from https://yoursite.com/robots.txt을 붙여넣고 가져오기 상자에 붙여넣은 다음 그룹으로 구문 분석을 클릭합니다. 도구는 그룹 구조를 재구성하고 유효성 검사기는 프로덕션에서 실행 중인 파일의 문제점을 즉시 알려줍니다.

2 단계: 사용자-에이전트 그룹을 구축합니다

각 그룹은 하나 이상의 크롤러를 대상으로 합니다. 알려진 봇 목록에서 크롤러를 추가하거나 토큰을 직접 입력하십시오. 토큰은 대소문자를 구분하지 않고 일치하므로 googlebot 그리고 Googlebot 동등하다. 와 그룹 * 포괄입니다: 이는 자체 그룹을 더 구체적으로 포함하지 않는 모든 크롤러에 적용됩니다.

여기서 내부화하는 데 중요한 것은 크롤러가 정확히 하나의 그룹에 복종한다는 것입니다. Googlebot은 다음을 읽습니다 Googlebot 그룹이 존재하고 무시하면 그룹화합니다 * 그룹 전체 - 그들을 병합하지 않습니다. a 를 만들면 Googlebot 하나의 규칙을 추가하려면 그룹의 모든 규칙을 반복해야 합니다 * 그 안에 그룹,또는 Googlebot 은 조용히 그들 모두에 순종 중지합니다. 이것은 거의 모든 사람을 놀라게 처음으로.

3 단계: 규칙, 사이트맵을 추가하고 유효성 검사기를 읽습니다

크롤러가 건너뛰기를 원하는 항목에 대해 경로 허용 안 함을 추가하고 그 안에 있는 분할 항목에 대한 경로를 허용합니다. 크롤링 지연을 추가하는 것은 해당 엔진을 존중하는 엔진을 대상으로 하는 경우에만 가능합니다. 사이트맵 URL을 추가하세요. 이는 구성표와 호스트를 포함하여 절대적이어야 하며 모든 그룹 외부에 위치하여 모든 사람에게 적용됩니다.

그런 다음 유효성 검사기를 읽으십시오. 오류는 작동하지 않는 것입니다. 경고는 아마도 당신이 생각하는 것을 의미하지 않는 것입니다. 메모는 기회입니다. 더 나아가기 전에 모든 것을 빨간색으로 고치십시오.

4 단계: 실제로 관심있는 URL을 테스트하십시오

이것은 사람들이 건너 뛰고해서는 안되는 단계입니다. 크롤링 상태가 진정으로 중요한 서너 가지 경로 - 제품 페이지,블로그, 차단했다고 생각하는 관리자 경로,Google 이 레이아웃을 렌더링해야하는 CSS 파일 - 을 가져 와서 Googlebot 에 대해 각각 테스트하십시오. 이 도구는 허용 또는 허용되지 않음을 알려주고 책임있는 규칙을 지정합니다. 결과가 당신을 놀라게한다면 규칙은 당신이 생각하는 것을 말하지 않으며,지금 그것을 배우는 것이 훨씬 저렴합니다.

5 단계: 루트에 복사 또는 다운로드하여 배포

파일을 복사하거나 다운로드합니다 robots.txt~하고 정확히 서빙하세요 https://yourhost/robots.txt a와 함께 200 상태 및 a text/plain 콘텐츠 유형. 다른 곳에서는 작동하지 않습니다. /blog/robots.txt 는 누구에게도 읽히지 않는다.

로봇 배제 프로토콜에 대해 자세히 설명합니다

드디어 기준이 되는 것이다

25년 동안 robots.txt는 1994년 메일링 리스트 게시물에 설명된 규칙이었으며 크롤러는 각각 모호함을 자신만의 방식으로 해석했습니다. 2022년에 다음과 같이 출판되었습니다 RFC 9309구문 분석 규칙, 일치하는 의미 및 Google, Bing 및 대부분의 심각한 크롤러가 수렴했던 우선 순위 순서를 코드화하는 것입니다. 이 가이드에서 &quot;the rule is X&quot;라고 말하면 RFC 9309가 X를 의미하지만 블로그 게시물이 주장하는 것은 아닙니다.

그룹, 그리고 크롤러가 그룹에만 복종하는 이유

레코드는 하나 이상의 연속으로 구성됩니다 User-agent: 라인에 적용되는 규칙 라인이 뒤따릅니다. 크롤러는 제품 토큰으로 자신을 식별합니다 - Googlebot, Bingbot, GPTBot- 그리고 토큰이 가장 구체적으로 일치하는 그룹을 찾습니다. 그것은 그 한 그룹에 순종하고 다른 그룹에는 복종하지 않습니다. 그만큼 * 그룹은 더 구체적으로 일치하는 것이 없을 때만 사용되는 대체입니다.

실제 결과는 너무 많은 피해를 입히기 때문에 반복됩니다: 그룹은 상속되지 않습니다. 읽는 파일

User-agent: *
Disallow: /admin/
Disallow: /cart

User-agent: Googlebot
Disallow: /internal/

googlebot이 크롤링할 수 있음을 의미합니다 /admin/ 그리고 /cart 자유롭게. 그것은 자신의 그룹을 발견,그래서 the * group 은 그것에 보이지 않습니다. 만약 당신이 Googlebot 이 세 가지 모두에서 차단되기를 원한다면,세 가지 규칙이 모두 내부에 나타나야 합니다 Googlebot 그룹.

최장 경기 우선 순위

해당 그룹의 두 개 이상의 규칙이 URL과 일치하면 해당 규칙이 있는 사람이 승자가 됩니다 가장 긴 경로 패턴는,문자로 측정됩니다. 파일의 순서는 무관합니다. 가장 긴 일치 허용과 가장 긴 일치 불허가 길이가 같으면 허용이 승리합니다.

User-agent: *
Disallow: /admin
Allow: /admin/public

이러한 규칙에 따라, /admin/public/logo.png 이다 허용된- 허용 패턴은 Disallow&#39;s 6 에 대해 13 문자입니다 - while /admin/secret 이다 허용되지 않습니다는,만 허용 안 함 패턴이 일치하기 때문에. 이것은 모든 &quot;디렉토리를 차단 뒤에 메커니즘입니다,그 안에 하나의 파일을 허용&quot; 패턴,WordPress&#39;s 포함 admin-ajax.php carve-out. 방화벽 구성처럼 하향식 규칙을 작성하면 잘못된 직관이 생성되는 이유이기도 합니다: 첫 번째 매치 승리도 없고, 폴스루도 없고, 순서도 없습니다.

와일드카드와 엔드 앵커

경로 패턴에서는 두 개의 특수 문자가 지원됩니다.

* 없음 을 포함하여 모든 문자 시퀀스와 일치합니다. Disallow: /*?sessionid= 어디서나 해당 쿼리 매개변수가 포함된 모든 URL을 차단합니다.

$ URL의 끝을 고정하며 패턴의 최종 문자일 때만 이를 의미합니다. Disallow: /*.pdf$ 블록 /whitepaper.pdf 하지만 아닙니다 /whitepaper.pdf?download=1해당 URL은 에서 끝나지 않기 때문입니다 .pdf. 떨어뜨리다 $ 그리고 당신은 경로가 단지 포함된 다른 모든 것과 함께 두 가지를 모두 차단합니다 .pdf.

없이 a $, 매칭은 a입니다 접두사 일치끊임없이 사람들을 여행합니다. Disallow: /admin 블록 /admin, /admin/, /admin/users, 그리고 또한 /administrator 그리고 /admin-tools, 왜냐하면 그들 모두는 문자열로 시작하기 때문입니다 /admin. 디렉토리만 의미했다면 쓰세요 /admin/.

크롤링 지연은 보편적으로 존중되지 않습니다

Crawl-delay: 10 크롤러에게 요청 사이에 10초를 기다리라고 요청합니다. Bing, Yandex 및 다양한 소형 크롤러가 이를 존중합니다. 구글봇은 완전히 무시한다- Google 은 파일의 지시어가 아닌 서버 응답 시간과 Search Console 의 설정에 따라 크롤링 속도를 조정합니다. 큰 사이트에서 크롤링 지연을 크게 설정하는 것은 슬로우 모션 풋건입니다: 요청 당 10 초에서 100,000 페이지 사이트는 한 번 크롤링하는 데 거의 12 일이 걸리며 실제로 많은 부분이 전혀 크롤링되지 않습니다. 크롤링이 진정으로 서버를 해치는 경우 서버를 수정하거나 페이지를 캐시하십시오; 크롤러를 조절하면 대부분 보이지 않게됩니다.

AI 크롤러 차단

AI 크롤러는 사람들이 일상적으로 융합하는 두 가지 범주로 나뉩니다. 훈련 크롤러 - GPTBot,ClaudeBot, CCBot,Bytespider, Google-Extended - 모델 훈련에 사용되는 콘텐츠를 수집합니다. PerplexityBot 이 가장 명확한 예인 Answer-engine 크롤러는 생성된 답변에서 인용할 수 있도록 페이지를 가져와 추천 트래픽을 보낼 수 있습니다. 첫 번째 범주를 차단하면 콘텐츠가 모델에 흡수되지 않도록 보호됩니다; 두 번째 범주를 차단하면 다른 방법으로 인용될 수 있는 표면에서 사용자를 제거합니다.

Google-Extended 그것의 이름 지정이 오도하기 때문에 특정 메모를받을 가치가있다. 그것은 크롤러가 아니다. 그것은 Googlebot 에 의해 이미 가져온 콘텐츠가 쌍둥이자리와 정점 AI 교육에 사용될 수 있는지 여부를 제어하는 토큰입니다. 그것을 허용하지 아무런 효과도 없습니다 google 검색 크롤링,인덱싱 또는 순위 지정에서. Google&#39;s AI 교육 사용을 거부하고 검색 존재를 완전히 그대로 유지할 수 있습니다.

그리고 그들 모두에 적용되는주의 사항: 준수는 자발적입니다. GPTBot 차단은 OpenAI&#39;s 가 크롤러를 선언 한 것을 중지합니다. OpenAI 가 파일을 존중하기로 선택했기 때문입니다. 사용자 에이전트에 대해 거짓말을하는 스크레이퍼에 대해서는 아무 것도하지 않으며,할 수있는 robots.txt 지시어도 없습니다.

지침 참조

지시 범위 목적 에 의해 명예를 얻었습니다
User-agent: 그룹을 엽니다 다음 규칙이 적용되는 크롤러 (들) 의 이름을 지정합니다. * 는 캐치-올. 모두
Disallow: 그룹 내부 크롤러에게 경로와 일치하는 URL 을 가져오지 말라고 요청합니다. A bare Disallow: 값이 없으면 &quot;allow everything&quot;을 의미합니다. 모두
Allow: 그룹 내부 더 넓은 범위에서 예외를 조각합니다 Disallow. 가장 긴 경기로 동점을 이긴다. Google, Bing, 대부분의 최신 크롤러
Crawl-delay: 그룹 내부 요청 사이의 최소 초. 빙, 얀덱스, 기타 - 구글봇이 아닙니다
Sitemap: 글로벌 사이트맵 또는 사이트맵 인덱스의 절대 URL. 배치에 관계없이 모든 크롤러에 적용됩니다. 구글, 빙, 대부분의 크롤러
Host: 글로벌 선호하는 미러/도메인. Yandex 확장. 얀덱스만
Noindex: - 작동하지 않습니다. Google 은 2019 년에 지원을 중단했습니다. a 를 사용하십시오 noindex 메타 태그 또는 X-Robots-Tag 헤더. 아무도
# 어디든 댓글. 줄에 그 이후의 모든 무시됩니다. 모두

일반적인 사용 사례

중요한 것을 차단하지 않고 정크를 인덱스에서 제외합니다

빵과 버터 작업: 패싯 검색 URL,세션 ID 쿼리 문자열,내부 검색 결과,카트 또는 체크아웃 페이지를 차단하여 크롤러가 실제로 순위를 매길 수 있는 페이지에 예산을 지출하도록 합니다. 트랩은 오버 블로킹과 같은 규칙입니다 Disallow: /*? 많은 사이트에서 크롤링하고 싶은 페이지가 매겨진 카테고리 페이지를 포함하는 쿼리 문자열로 모든 URL 을 차단합니다. 발송하기 전에 패턴을 테스트합니다.

준비 장소를 어둡게 만듭니다

User-agent: * 플러스 Disallow: / 는 스테이징 또는 미리보기 환경에 대한 올바른 호출이며 Block everything preset 이 이를 생성합니다. 그러나 이것을 보안이 아닌 위생으로 취급하십시오: 스테이징 환경도 HTTP auth 또는 IP allowlist 뒤에 있어야 합니다. robots.txt 가 호스트를 숨기지 않고 누구도 탐색하지 못하도록 막지 않기 때문입니다. 그리고 파일은 절대로,절대 프로덕션으로 승격되어서는 안 됩니다. 배포 파이프라인에 넣으십시오&#39;s diff 검토,이 정확한 실수는 사이트가 Google 에서 사라지는 가장 일반적인 단일 방법이기 때문입니다.

검색이 중단된 사이트를 수정합니다

유기적 교통이 절벽에서 떨어지면, /robots.txt 는 알고리즘 업데이트 및 백링크 감사 전에 가장 먼저 확인해야 할 사항입니다. 라이브 파일을 생성기에 붙여넣고 유효성 검사기 출력을 읽습니다. 길 잃은 Disallow: /CSS 및 JavaScript를 차단하는 규칙 Googlebot은 페이지를 렌더링해야 합니다 Googlebot 실수로 신중하게 작성된 그룹을 재정의하는 그룹입니다 * 그룹이 즉시 나타납니다.

AI 크롤러가 귀하의 콘텐츠로 무엇을 할 수 있는지 결정합니다

게시자, 문서 사이트 및 콘텐츠가 제품인 사람은 이제 크롤러 교육에 대해 실제로 결정을 내릴 수 있습니다. 블록 AI 크롤러 사전 설정은 방어 가능한 기본값 - 검색 엔진 환영, 교육 크롤러 거부 -을 제공하며 크롤러 테이블은 각 크롤러를 설명하므로 순수 교육 봇을 거부하면서 PerplexityBot을 추천 트래픽에 허용하도록 유지하는 등 의도적으로 예외를 만들 수 있습니다.

상속된 사이트를 감사합니다

사이트를 인수했는데 그 이유를 아무도 모릅니다 /resources/ 는 인덱싱되지 않습니다. 라이브 robots.txt 를 가져와 문제의 경로에 대해 테스터를 실행하고 도구는 이를 수행하는 정확한 규칙의 이름을 지정합니다. 이는 1 분 정도 걸리며 오후 추측을 대체합니다.

브라우저에서 robots.txt 를 생성하는 이유

X-1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X 1000 X robots.txt 생성기 전적으로 클라이언트 측에서 실행됩니다. 경로,호스트 이름 및 규칙은 기계를 떠나지 않으며 이는 보이는 것보다 더 중요합니다. 출시되지 않은 제품의 디렉토리 구조,스테이징 호스트의 URL 및 조용히 유지하려는 내부 경로는 모두 다른 사람에게 붙여 넣지 않을 가치가 있습니다 & # 39;s 서버 로그. 페이지가로드되면 오프라인으로 작동하며 출력은 소유 한 일반 텍스트 파일입니다.

Robots.txt 는 몇 개의 이웃 작업 옆에 앉아 있습니다. The 메타 태그 생성기 을 생산합니다 noindex 그리고 작업을 수행하는 표준 태그 robots.txt 는 할 수 없습니다. The 그래프 미리보기 열기 허용한 크롤러가 와서 가져오면 링크가 어떻게 렌더링되는지 보여줍니다. 그리고 슬러그 생성기 규칙이 일치하게 될 깨끗한 경로를 구축합니다.

자주 묻는 질문

robots.txt 파일은 어디에 두나요?

정확히 제공되어야 합니다 /robots.txt 호스트에서 그것은에 적용 - 예를 들어 https://example.com/robots.txt. 크롤러는 다른 곳을 보지 않습니다. 에 있는 파일 /blog/robots.txt 완전히 무시되고 파일이 켜져 있습니다 example.com 통치하지 않습니다 shop.example.com; 각 호스트는 자신의 필요. 200 상태와 a로 그것을 제공 text/plain 콘텐츠 유형.

Google에서 페이지를 삭제하지 않으시겠습니까?

아니요,그리고 이것은 형식에 대한 가장 결과적인 오해입니다. Disallow 는 Google 이 페이지를 가져오는 것을 중지합니다; 인덱스에서 URL 을 제거하지 않습니다. 다른 사이트가 차단된 URL 에 링크하는 경우 Google 은 페이지를 읽지 않기 때문에 일반적으로 설명 없이 여전히 목록을 작성할 수 있습니다. 검색 결과에서 페이지를 계속 유지하려면 크롤링을 허용하고 a 를 제공합니다 noindex 로봇 메타 태그 또는 X-Robots-Tag 헤더. URL 을 차단하면 크롤러는 추가한 noindex 를 절대 볼 수 없습니다.

robots.txt는 개인 페이지를 숨기는 방법입니까?

아니요. 누구나 읽을 수 있는 공개 파일이며 이를 존중하는 것은 자발적인 것입니다. 악의적인 스크레이퍼는 이를 완전히 무시합니다. 나열 /internal-admin/ in your Disallow rules tells every attacker exactly where to look.private 을 유지해야 하는 모든 것은 인증,IP allowlist 가 필요하거나 공용 인터넷에 전혀 있지 않아야 합니다.

URL과 일치할 때 허용과 허용 안 함은 어떻게 상호 작용합니까?

가장 구체적인 규칙이 승리하며,여기서 특이성은 경로 패턴의 길이를 의미합니다. 주어진 Disallow: /admin 그리고 Allow: /admin/public, URL /admin/public 는 허용 패턴이 더 길기 때문에 허용되지만 /admin/secret 차단됩니다. 두 패턴의 길이가 정확히 같으면 승리 허용. 파일에 나타나는 순서 규칙은 중요하지 않으므로 방화벽 스타일의 첫 번째 매치 승리 동작을 기대하는 사람들을 놀라게 합니다.

* 및 $ 와일드카드는 무엇을 합니까?

별표는 모든 문자 실행과 일치합니다 Disallow: /*?sessionid= 해당 매개 변수가 포함된 모든 URL 을 차단합니다. 달러 기호는 URL 의 끝을 고정합니다. 그래서 Disallow: /*.pdf$ 블록 /report.pdf 하지만 아닙니다 /report.pdf?download=1. 없이 $, 매칭은 접두사 매칭입니다: Disallow: /admin 블록 /admin, /admin/users, 그리고 또한 /administrator, 왜냐하면 그들 모두는 그 끈으로 시작하기 때문입니다.

GPTBot 및 Claudebot과 같은 AI 크롤러를 어떻게 차단합니까?

각자에게 자신만의 그룹을 제공하세요 Disallow: /. 사전 설정된 Block AI 크롤러는 GPTBot,ClaudeBot, PerplexityBot,CCBot, Google-Extended,Bytespider, anthropic-ai 에 대해 한 번의 클릭으로 이 작업을 수행하는 동시에 Googlebot 과 Bingbot 은 자유롭게 크롤링할 수 있습니다. Google-Extended 는 Gemini 및 Vertex AI 에 대한 교육 사용만 제어하며 Google 검색에는 아무런 영향을 미치지 않습니다. 규정 준수는 자발적이므로 결정된 스크레이퍼가 아닌 협력 크롤러를 중지합니다.

크롤링 지연이 실제로 작동합니까?

크롤러에 따라 다릅니다. Googlebot은 이를 완전히 무시합니다. 크롤링 속도는 Search Console과 server&#39;s 응답 시간에서 조정됩니다. Bing, Yandex 및 여러 개의 작은 크롤러는 이를 존중하여 값을 요청 사이의 최소 초 수로 처리합니다. 큰 사이트에 큰 지연을 설정하면 대부분의 페이지가 전혀 크롤링되지 않을 수 있으므로 크롤링이 실제로 문제가 되는 경우 값을 작게 유지하고 대신 서버 용량을 수정하십시오.

내 robots.txt에 구문 오류가 있으면 어떻게 됩니까?

크롤러는 구문 분석할 수 없는 줄을 묵묵히 버리고 나머지 줄과 함께 계속 진행하므로,깨진 규칙은 큰 소리로 실패하기보다는 조용히 실패합니다. 알 수 없는 지시어,앞의 슬래시가 없는 경로 또는 첫 번째 슬래시 위에 놓인 규칙 User-agent: line 은 단순히 아무 것도 하지 않으며,트래픽이 움직일 때까지는 알아내지 못할 것입니다. 그것이 바로 validator 의 목적입니다: 배포하기 전에 line 번호로 이들 각각을 보고합니다.

Frequently Asked Questions

It must be served at exactly /robots.txt on the host it applies to — for example https://example.com/robots.txt. Crawlers look nowhere else. A file at /blog/robots.txt is ignored entirely, and the file on example.com does not govern shop.example.com; each host needs its own. Serve it with a 200 status and a text/plain content type.

Comments

0 comments

0/2000 characters

No comments yet. Be the first to share your thoughts!