GEO / 생성형 엔진 최적화
AI 크롤러를 robots.txt에서 다 막으면 GEO에 유리할까?
아닙니다. 학습용 크롤러를 막는 것과 인용용 크롤러를 막는 것은 결과가 정반대입니다. GPTBot을 막는다고 ChatGPT 답변에서 빠지는 것이 아니고, 반대로 검색·인용용 크롤러까지 같이 막으면 AI 답변에 등장할 기회 자체가 사라집니다. robots.txt를 한 줄로 뭉뚱그려 쓰면 이 구분이 안 됩니다.
AI 크롤러는 왜 종류별로 다르게 다뤄야 하나?
오픈AI는 GPTBot과 OAI-SearchBot을 서로 다른 User-agent로 분리해 각각 robots.txt에서 독립적으로 제어할 수 있게 해뒀습니다. GPTBot은 모델 학습에 콘텐츠를 쓰겠다는 크롤러이고, OAI-SearchBot은 ChatGPT가 답변 중 실시간으로 웹을 인용할 때 쓰는 크롤러입니다. 앤트로픽도 같은 방식으로 ClaudeBot(학습)과 Claude-SearchBot(인용)을 나눠 운영하고, 퍼플렉시티의 PerplexityBot은 인용 목적이 중심입니다. 한 줄로 User-agent: *를 막으면 이 구분 없이 전부 잠깁니다.
실제로 얼마나 많은 사이트가 AI 크롤러를 막고 있나?
프레스 가제트(Press Gazette)가 미국·영국 주요 뉴스 사이트 약 100곳을 조사한 결과, 79%가 GPTBot·ClaudeBot·CCBot 등 학습용 크롤러 중 최소 하나를 차단하고 있었고, 71%는 실시간 검색·인용용 크롤러까지 차단하고 있었습니다. GPTBot 차단률은 미국 사이트가 58%로, 영국 사이트 29%보다 뚜렷하게 높았습니다. 언론사처럼 저작권 민감도가 높은 업종일수록 학습용 크롤러 차단이 앞서 있다는 뜻이지만, 인용용 크롤러까지 같이 막힌 71%는 AI 답변 인용 기회도 함께 포기한 것입니다.
robots.txt는 어떻게 나눠서 설정해야 하나?
목표가 AI 답변에 브랜드가 인용되는 것이라면 접근을 완전히 막기보다 역할별로 나누는 편이 유리합니다.
| 크롤러 | 주 용도 | 막으면 생기는 일 |
|---|---|---|
| GPTBot, ClaudeBot, CCBot | 모델 학습 | AI 답변 노출과는 무관, 학습 데이터 제공만 거부됨 |
| OAI-SearchBot, Claude-SearchBot, PerplexityBot | 실시간 검색·인용 | 해당 AI 답변에서 인용 후보에서 제외됨 |
Disallow로 막고, 검색·인용용 크롤러는 Allow로 열어두는 것이 GEO 관점에서는 손해가 가장 적은 조합입니다.robots.txt만 손보면 충분한가?
robots.txt는 접근을 허용할지 말지만 결정합니다. 접근이 열린 크롤러에게 사이트의 어느 페이지가 핵심인지 요약해 안내하는 것은 별도 파일인 llms.txt의 역할입니다. 앤트로픽과 퍼플렉시티는 llms.txt 지원을 공식적으로 밝혔고, 오픈AI의 크롤러도 이를 인식하는 것으로 알려져 있습니다. robots.txt로 문을 열어둔 다음 llms.txt로 우선순위를 알려주는 순서로 접근하면 됩니다.
정리하면, AI 크롤러를 대하는 기준은 '막을지 말지'가 아니라 '학습용인지 인용용인지'입니다. 학습 데이터 제공을 거부하면서도 AI 답변 인용 기회는 지키는 것이 가능하며, 두 가지를 구분하지 않고 한 줄로 처리하는 것이 가장 흔한 손실 원인입니다.
Q & A
자주 묻는 질문
robots.txt에서 GPTBot만 막으면 ChatGPT 답변에서 완전히 빠지나요?
회사 콘텐츠가 AI 학습에 쓰이는 게 싫으면 크롤러를 전부 막아야 하나요?
llms.txt는 robots.txt를 대신하나요?
크롤러 허용 여부를 얼마나 자주 점검해야 하나요?
Read next