robots.txt 작성법: 크롤러 제어의 기본
약 5분
robots.txt는 사이트 루트에 두는 텍스트 파일로, 크롤러에게 ‘어디를 크롤링해도 되는지’와 ‘사이트맵은 여기 있다’를 알려줍니다.
robots.txt란 무엇인가요?
검색엔진·AI 크롤러는 사이트를 방문할 때 가장 먼저 /robots.txt를 확인합니다. 여기에 적힌 규칙에 따라 어떤 경로를 수집할지 정합니다.
어떻게 작성하나요?
User-agent: *
Allow: /
Disallow: /admin/
Disallow: /cart/
Sitemap: https://example.com/sitemap.xmlUser-agent— 규칙을 적용할 크롤러(*는 전체)Allow/Disallow— 허용·차단할 경로Sitemap— 사이트맵 위치 안내
가장 흔한 실수는 무엇인가요?
User-agent: * / Disallow: /는 사이트 전체를 모든 크롤러로부터 차단합니다. 개발 중 실수로 남겨두면 검색·AI 노출이 통째로 사라집니다. 배포 전 반드시 확인하세요.AI 크롤러를 선택적으로 제어하려면 AI 크롤러 허용·차단 가이드를, 사이트맵 작성은 sitemap.xml 가이드를 참고하세요.
자주 묻는 질문
robots.txt로 특정 페이지를 검색결과에서 숨길 수 있나요?
확실하지 않습니다. Disallow는 크롤링을 막을 뿐이고, 다른 곳에서 링크되면 색인될 수 있습니다. 확실히 숨기려면 noindex 메타태그를 쓰세요.
robots.txt는 어디에 둬야 하나요?
반드시 사이트 루트(example.com/robots.txt)에 둬야 합니다. 하위 경로에 있으면 인식되지 않습니다.
robots.txt가 없으면 어떻게 되나요?
모든 크롤러가 전체를 크롤링할 수 있는 것으로 간주됩니다. 없다고 불이익은 없지만, 사이트맵 안내 같은 기회를 놓칩니다.