🤖

robots.txt 생성기 crawler

allow, disallow 규칙과 crawl-delay, sitemap 위치를 조합해 robots.txt를 만듭니다.

preset
sitemap
user-agent crawl-delay 0이면 출력하지 않습니다
INPUTdisallow (한 줄에 하나)
1
INPUTallow (한 줄에 하나)
1
OUTPUTrobots.txt
0 lines 0 chars
1
사이트 루트에 두어야 인식됩니다
도구 설명

이 도구가 하는 일

robots.txt는 사이트 루트에 두는 텍스트 파일로, 검색엔진 크롤러에게 어떤 경로를 수집해도 되는지 알려 줍니다. 크롤러는 사이트를 방문하면 가장 먼저 이 파일을 확인합니다.

문법은 단순합니다. User-agent로 대상 크롤러를 지정하고, Disallow로 접근하지 않을 경로를, Allow로 예외를 지정합니다. 마지막에 Sitemap 줄을 넣어 사이트맵 위치를 알려주면 크롤러가 페이지 목록을 더 빨리 찾습니다.

이 도구는 자주 쓰는 구성을 프리셋으로 제공하고, 차단할 경로와 허용할 경로를 각각 입력하면 규칙을 조합해 파일 내용을 만들어 줍니다. Disallow: / 처럼 사이트 전체를 막는 설정이 들어가면 경고를 표시합니다.

언제 사용하나요

새 사이트를 공개하면서 관리자 경로나 테스트 페이지를 색인에서 제외할 때, 개발 서버 전체를 크롤링에서 막을 때, 사이트맵 위치를 크롤러에 알릴 때, 특정 크롤러만 다르게 대우해야 할 때 사용합니다.

입력과 출력 예시

입력 disallow에 /admin/ 과 /api/ 입력
출력 User-agent: * Disallow: /admin/ Disallow: /api/ Sitemap: https://example.com/sitemap.xml

가장 일반적인 형태입니다.

입력 전체 차단 프리셋
출력 User-agent: * Disallow: /

개발 서버 전용입니다. 운영에 배포되면 검색에서 사라집니다.

주의사항

robots.txt는 접근 제어 수단이 아닙니다. 크롤러에게 보내는 요청일 뿐이라 이를 무시하는 크롤러도 있고, 파일 자체가 공개되어 있어 오히려 숨기고 싶은 경로를 광고하는 셈이 됩니다. 민감한 경로는 인증으로 보호해야 합니다. 또한 Disallow는 색인 제외를 보장하지 않습니다. 다른 사이트에서 링크된 페이지는 내용을 읽지 않은 채 주소만 검색 결과에 나타날 수 있습니다. 확실히 제외하려면 페이지에 noindex 메타 태그를 넣어야 하는데, 이때 robots.txt로 크롤링을 막으면 크롤러가 그 태그를 읽지 못해 오히려 역효과가 납니다. 개발 서버에서 쓰던 전체 차단 설정을 운영에 그대로 배포하는 사고가 흔하므로 배포 전 반드시 확인하십시오.

자주 묻는 질문

robots.txt로 페이지를 확실히 숨길 수 있나요?

없습니다. 크롤링을 요청하는 파일일 뿐이며 공개되어 있습니다. 민감한 경로는 인증으로 보호해야 합니다.

Disallow 했는데 검색 결과에 나옵니다.

다른 사이트의 링크를 통해 주소만 알려진 경우입니다. 확실히 제외하려면 noindex 메타 태그를 사용하되, 그 페이지의 크롤링은 막지 말아야 합니다.

파일은 어디에 두나요?

반드시 도메인 루트에 두어야 합니다. https://example.com/robots.txt 위치가 아니면 인식되지 않습니다.

Copied