GEO / 생성형 엔진 최적화

AI 크롤러를 robots.txt에서 다 막으면 GEO에 유리할까?

읽는 데 7분 INSIGHTX
AI 크롤러를 robots.txt에서 다 막으면 GEO에 유리할까?

아닙니다. 학습용 크롤러를 막는 것과 인용용 크롤러를 막는 것은 결과가 정반대입니다. GPTBot을 막는다고 ChatGPT 답변에서 빠지는 것이 아니고, 반대로 검색·인용용 크롤러까지 같이 막으면 AI 답변에 등장할 기회 자체가 사라집니다. robots.txt를 한 줄로 뭉뚱그려 쓰면 이 구분이 안 됩니다.

AI 크롤러는 왜 종류별로 다르게 다뤄야 하나?

오픈AI는 GPTBot과 OAI-SearchBot을 서로 다른 User-agent로 분리해 각각 robots.txt에서 독립적으로 제어할 수 있게 해뒀습니다. GPTBot은 모델 학습에 콘텐츠를 쓰겠다는 크롤러이고, OAI-SearchBot은 ChatGPT가 답변 중 실시간으로 웹을 인용할 때 쓰는 크롤러입니다. 앤트로픽도 같은 방식으로 ClaudeBot(학습)과 Claude-SearchBot(인용)을 나눠 운영하고, 퍼플렉시티의 PerplexityBot은 인용 목적이 중심입니다. 한 줄로 User-agent: *를 막으면 이 구분 없이 전부 잠깁니다.

실제로 얼마나 많은 사이트가 AI 크롤러를 막고 있나?

프레스 가제트(Press Gazette)가 미국·영국 주요 뉴스 사이트 약 100곳을 조사한 결과, 79%가 GPTBot·ClaudeBot·CCBot 등 학습용 크롤러 중 최소 하나를 차단하고 있었고, 71%는 실시간 검색·인용용 크롤러까지 차단하고 있었습니다. GPTBot 차단률은 미국 사이트가 58%로, 영국 사이트 29%보다 뚜렷하게 높았습니다. 언론사처럼 저작권 민감도가 높은 업종일수록 학습용 크롤러 차단이 앞서 있다는 뜻이지만, 인용용 크롤러까지 같이 막힌 71%는 AI 답변 인용 기회도 함께 포기한 것입니다.

robots.txt는 어떻게 나눠서 설정해야 하나?

목표가 AI 답변에 브랜드가 인용되는 것이라면 접근을 완전히 막기보다 역할별로 나누는 편이 유리합니다.

크롤러주 용도막으면 생기는 일
GPTBot, ClaudeBot, CCBot모델 학습AI 답변 노출과는 무관, 학습 데이터 제공만 거부됨
OAI-SearchBot, Claude-SearchBot, PerplexityBot실시간 검색·인용해당 AI 답변에서 인용 후보에서 제외됨
학습 데이터 제공이 부담스럽다면 학습용 크롤러만 Disallow로 막고, 검색·인용용 크롤러는 Allow로 열어두는 것이 GEO 관점에서는 손해가 가장 적은 조합입니다.

robots.txt만 손보면 충분한가?

robots.txt는 접근을 허용할지 말지만 결정합니다. 접근이 열린 크롤러에게 사이트의 어느 페이지가 핵심인지 요약해 안내하는 것은 별도 파일인 llms.txt의 역할입니다. 앤트로픽과 퍼플렉시티는 llms.txt 지원을 공식적으로 밝혔고, 오픈AI의 크롤러도 이를 인식하는 것으로 알려져 있습니다. robots.txt로 문을 열어둔 다음 llms.txt로 우선순위를 알려주는 순서로 접근하면 됩니다.

정리하면, AI 크롤러를 대하는 기준은 '막을지 말지'가 아니라 '학습용인지 인용용인지'입니다. 학습 데이터 제공을 거부하면서도 AI 답변 인용 기회는 지키는 것이 가능하며, 두 가지를 구분하지 않고 한 줄로 처리하는 것이 가장 흔한 손실 원인입니다.

Q & A

자주 묻는 질문

robots.txt에서 GPTBot만 막으면 ChatGPT 답변에서 완전히 빠지나요?
아닙니다. GPTBot은 모델 학습용 크롤러이고, ChatGPT가 답변 중 실시간으로 웹을 인용할 때는 OAI-SearchBot을 따로 씁니다. GPTBot을 막아도 OAI-SearchBot을 허용해두면 답변 인용 대상에는 계속 남을 수 있습니다. 두 봇은 robots.txt에서 각각 다른 User-agent 줄로 독립적으로 제어됩니다.
회사 콘텐츠가 AI 학습에 쓰이는 게 싫으면 크롤러를 전부 막아야 하나요?
학습을 막는 것과 인용을 막는 것은 분리해서 결정할 수 있습니다. GPTBot·ClaudeBot·CCBot 같은 학습용 크롤러만 Disallow로 막고, OAI-SearchBot·PerplexityBot·Claude-SearchBot 같은 검색·인용용 크롤러는 열어두면 학습 데이터 제공은 거부하면서 AI 답변 인용 기회는 유지할 수 있습니다.
llms.txt는 robots.txt를 대신하나요?
아닙니다. robots.txt는 접근 허용·차단을 결정하고, llms.txt는 이미 접근이 허용된 크롤러에게 사이트의 핵심 페이지와 정보를 요약해 안내하는 별도 파일입니다. 앤트로픽과 퍼플렉시티가 공식적으로 지원을 밝혔고, 오픈AI의 크롤러도 이를 인식합니다. robots.txt로 문을 열어둔 다음 llms.txt로 무엇을 먼저 보라고 알려주는 순서입니다.
크롤러 허용 여부를 얼마나 자주 점검해야 하나요?
새 크롤러가 계속 등장하고 있어 분기에 한 번은 robots.txt를 다시 확인하는 것이 안전합니다. 특히 사이트 개편이나 서버 이전 직후에는 robots.txt가 초기화되거나 새 규칙이 덮어써지는 경우가 흔해, 배포 직후 점검을 별도 체크리스트에 넣어두는 것을 권합니다.

Read next

← 저널 목록으로