← 모든 기록
robots.txt vs noindex: 차이점과 올바른 사용법 대표 이미지
SEO와 분석

robots.txt vs noindex: 차이점과 올바른 사용법

robots.txt와 noindex의 차이점과 각각의 올바른 사용법, 그리고 색인 차단 확인 및 해결 방법을 단계별로 안내합니다.

검색엔진에 페이지가 나타나지 않을 때 robots 파일과 noindex 설정 차이를 이해해야 합니다. 두 방법은 서로 다른 목적으로 사용되며, 문제 진단과 해결에는 두 가지를 모두 점검하는 접근이 필요합니다. 이 글에서는 실제 사례를 바탕으로 확인 절차와 해결 순서를 안내합니다.

robots.txt와 noindex의 기본 개념 및 차이점

robots.txt는 웹사이트 루트 디렉터리에 위치한 파일로, 검색엔진 크롤러에게 사이트 내 특정 경로나 페이지에 대한 접근 허용 여부를 알립니다. robots.txt 차단 규칙은 User-agent, Disallow, Allow로 구성됩니다. User-agent는 규칙이 적용될 크롤러를 지정하고, Disallow는 크롤링을 금지할 경로를, Allow는 예외적으로 허용할 경로를 정의합니다. 반면 noindex는 HTML 문서의 <head> 영역에 <meta name="robots" content="noindex"> 형태로 삽입하거나 HTTP 응답 헤더 X-Robots-Tag: noindex로 전송하여, 크롤러가 페이지를 수집한 뒤에도 검색 결과에 색인하지 말라고 요청합니다.

핵심 차이는 robots.txt 차단은 크롤링을 막고, noindex는 색인을 막습니다. 많은 실무자가 robots.txt 차단이 곧 검색 결과 제외라고 오해하지만, 실제로는 robots.txt로 차단해도 다른 방법으로 색인이 생성될 수 있습니다. 예를 들어 외부 사이트에 링크가 존재하면 구글은 페이지 내용을 알지 못한 채 URL만을 색인에 포함할 수 있기 때문입니다. 따라서 검색 노출을 원천적으로 막으려면 noindex가 필수적입니다.

robots.txt로 크롤링 차단 확인 방법

브라우저에서 직접 robots.txt 파일 확인

사이트의 robots.txt 파일은 https://웹사이트주소/robots.txt로 접속하여 누구나 열람할 수 있습니다. <Disallow: /private/>와 같은 규칙이 페이지 경로를 포함한다면 해당 경로의 크롤링이 차단된 상태입니다. 반대로 Allow 지시어로 특정 경로만 허용할 수도 있습니다.

Google Search Console URL 검사 도구 활용

Search Console에 등록된 사이트라면 URL 검사 도구에 점검할 페이지 URL을 입력하세요. 결과 화면에 ‘URL이 robots.txt에 의해 차단됨’ 상태가 표시되면, URL이 robots.txt에 의해 차단됨 상태는 구글이 페이지를 크롤링하지 못했음을 의미합니다. 이는 robots.txt 파일의 규칙과 URL이 일치하기 때문에 발생하며, 검색에 노출되어야 할 페이지가 robots.txt에 의해 차단된 경우 조치가 필요합니다. 반대로 의도적으로 크롤링을 막은 것이라면 문제가 아닙니다.

noindex 메타 태그로 색인 차단 확인 방법

페이지 소스에서 noindex 태그 직접 확인

브라우저에서 페이지를 연 후 마우스 오른쪽 버튼을 클릭해 ‘페이지 소스 보기’를 선택합니다. <head> 영역 안에 <meta name="robots" content="noindex"> 태그가 존재하는지 확인하세요. content 속성에 noindex가 포함되어 있다면 구글은 해당 페이지를 색인하지 않으려고 시도합니다. 태그가 없거나 index만 있다면 색인 차단 지시가 없는 상태입니다.

Search Console 색인 상태 보고서 확인

Search Console의 ‘페이지’ 보고서에서 ‘noindex 태그에 의해 제외됨’ 항목을 찾거나, URL 검사 도구 결과에서 ‘noindex 태그가 감지됨’ 메시지를 확인하면 noindex가 정상 적용된 것입니다. 이 상태라면 구글이 페이지를 크롤링했고 색인 제외 지시를 인식했으므로 검색 결과에 나타나지 않을 확률이 높습니다. 다만 외부 링크가 많거나 다른 시그널이 강하면 색인이 생성될 가능성이 희박하게 남아 있으므로, 실제 검색으로 최종 점검하는 것이 좋습니다.

두 방법을 함께 사용해야 하는 이유와 올바른 조합 순서

robots.txt 차단만으로는 색인을 확실히 막을 수 없기 때문에 두 방법을 올바르게 조합해야 합니다. 검색결과에서 확실히 제외하려면 robots.txt 차단을 풀고 noindex를 사용해야 합니다. robots.txt로 차단된 페이지도 외부 링크가 있다면 URL 자체가 색인에 포함될 수 있고, ‘이 페이지에 대한 설명을 사용할 수 없습니다’ 같은 형태로 검색 결과에 노출될 수 있습니다.

robots.txt 차단에도 불구하고 페이지가 인덱싱되는 문제의 해결책은 robots.txt를 일시적으로 차단 해제하고 noindex 태그를 추가한 후, 디인덱싱되면 다시 차단하는 것입니다. 구체적인 순서는 다음과 같습니다. 먼저 robots.txt에서 문제의 URL 경로에 해당하는 Disallow 규칙을 제거합니다. 그런 다음 페이지 <head>에 <meta name="robots" content="noindex">를 추가하고 HTTP 응답 헤더로도 X-Robots-Tag: noindex를 전송할 수 있습니다. 그 후 Search Console의 URL 검사 도구에서 ‘실제 URL 테스트’를 클릭해 크롤링을 요청합니다. 구글은 페이지를 수집하고 noindex 태그를 발견한 후 색인에서 점차 제외시킵니다. 수일에서 수주 후 색인 상태가 ‘제외됨’으로 변경된 것을 확인하면 필요 시 robots.txt 차단을 다시 적용해도 무방합니다.

내부 링크에 nofollow를 추가하는 것은 robots.txt 차단 페이지의 인덱싱을 막는 효과적인 해결책이 아닙니다. nofollow는 특정 링크를 발견 용도로 사용하지 말라는 신호일 뿐, 대상 페이지 자체의 크롤링이나 색인을 통제하지 않기 때문입니다. 따라서 링크에 의존하기보다 noindex를 직접 적용하는 접근이 필요합니다.

실전 해결: ‘URL이 robots.txt에 의해 차단됨’ 오류 처리

Search Console의 ‘페이지’ 보고서나 URL 검사 도구에서 ‘URL이 robots.txt에 의해 차단됨’ 경고가 여러 페이지에 걸쳐 나타날 수 있습니다. 아래 단계별로 원인을 진단하고 조치하세요.

1. 의도된 차단 여부 판단

먼저 해당 URL이 관리자 페이지, 내부 검색 결과, 테스트 페이지 등 의도적으로 차단했어야 하는 지 확인합니다. 의도적으로 차단한 URL은 조치가 필요 없습니다. 이런 페이지는 검색 노출이 바람직하지 않으므로 robots.txt 차단을 유지해도 좋습니다.

2. 실수로 차단된 경우 robots.txt 수정

중요 콘텐츠를 실수로 차단했다면 robots.txt 파일을 열어 문제의 경로와 일치하는 Disallow 규칙을 찾아 수정하거나 삭제합니다. robots.txt 차단 규칙은 User-agent 블록 단위로 적용되므로, 모든 규칙을 점검해 충돌이 없는지 확인해야 합니다. 예를 들어 User-agent: * 아래에 Disallow: /private/가 있다면 User-agent: Googlebot 아래에 Allow: /private/로 예외를 둘 수 있습니다. 파일 수정 후 robots.txt 파일을 업데이트하면 Google 크롤러가 자동으로 새 파일을 사용합니다. 빠른 반영을 위해 Search Console robots.txt 테스터로 검증한 뒤 URL 검사 도구에서 재크롤링을 요청할 수 있습니다.

3. 차단된 페이지가 이미 색인에 있는 경우

robots.txt로 차단했는데도 검색 결과에 페이지가 남아 있다면, 앞서 설명한 noindex 조합 전략을 구사해야 합니다. 즉 robots.txt 차단을 해제하고 noindex 태그를 추가한 후, Search Console URL 검사 도구로 크롤링을 요청합니다. 색인에서 삭제된 뒤 필요에 따라 robots.txt 차단을 복원합니다. 이 과정은 며칠에서 몇 주가 걸릴 수 있으므로 인내심을 갖고 모니터링해야 합니다.

요약 및 의사 결정 기준

다음 표를 참고하여 상황에 맞는 최적의 조치를 선택하세요.

상황권장 조치
검색 노출을 원하지 않는 페이지robots.txt 차단 해제 → noindex 추가 → 색인 제거 확인 후 선택적으로 robots.txt 재차단
크롤링 낭비를 줄이고 싶은 페이지 (예: 관리자)robots.txt로 차단. 단, 색인도 막으려면 noindex 병행 후 재차단
실수로 robots.txt에 차단되어 중요한 페이지가 색인 제외됨robots.txt에서 해당 Disallow 규칙 제거. 필요 시 재크롤링 요청
이미 색인된 페이지를 검색 결과에서 완전히 삭제하고 싶음robots.txt 차단 해제 + noindex 태그 적용 후 색인 제거까지 대기

함께 보기

참고 자료