GEO / 생성형 엔진 최적화

ChatGPT 에이전트, robots.txt 막아도 절반은 뚫었다

읽는 데 7분 INSIGHTX
ChatGPT 에이전트, robots.txt 막아도 절반은 뚫었다

아닙니다. 웹 데이터 라이선싱 업체 톨빗(TollBit)이 2026년 상반기 유럽 사이트를 대상으로 조사한 결과, ChatGPT-User·바이트스파이더·유봇은 robots.txt로 이들을 명시적으로 차단한 사이트의 거의 절반에서도 그대로 접근했습니다. OpenAI 역시 자사 문서에서 이용자가 요청해 방문하는 트래픽에는 robots.txt가 적용되지 않을 수 있다고 밝혔습니다. robots.txt를 선언하는 것과 실제로 접근이 통제되는 것은 별개의 문제라는 뜻입니다.

TollBit 조사, 정확히 뭘 발견했나?

TollBit의 「State of the Bots」 2026년 상반기 보고서는 유럽 사이트들의 서버 로그를 분석해, 식별된 AI 페이지 페처(fetcher)의 약 15%가 사이트가 명시적으로 차단한 URL에 접근했다고 밝혔습니다. 특히 ChatGPT-User·바이트스파이더·유봇 세 봇은 자신을 robots.txt로 지정해 막은 사이트들 중 거의 절반에서 차단된 페이지를 그대로 가져갔습니다. ChatGPT의 페이지 페칭 봇은 다른 어떤 AI 봇보다 많은 사이트에서 차단 대상으로 지정돼 있으면서도, 동시에 차단된 페이지에 가장 많이 접근한 봇이었습니다.

OpenAI는 왜 robots.txt가 안 통할 수 있다고 했나?

OpenAI는 크롤러를 용도별로 나눠 운영합니다. 학습용 GPTBot과 검색 인용용 OAI-SearchBot은 robots.txt 차단이 그대로 적용됩니다. 반면 이용자가 대화 중 특정 URL을 요청해 그 자리에서 가져오는 ChatGPT-User는 다릅니다. OpenAI 고객지원 문서는 이런 방문이 이용자의 직접 지시라 robots.txt가 적용되지 않을 수 있다고 안내합니다. 퍼플렉시티도 Perplexity-User가 일반적으로 robots.txt 규칙을 따르지 않는다고 밝혀, 같은 논리가 업계 전반에 퍼져 있습니다.

크롤러용도robots.txt 적용
GPTBot모델 학습적용됨
OAI-SearchBot검색·인용 색인적용됨
ChatGPT-User이용자 요청 실시간 방문적용 안 될 수 있음

에이전트형 브라우저는 왜 더 막기 어려운가?

퍼플렉시티 코멧, 클로드 포 크롬, 오페라 네온처럼 실제 브라우저 세션을 그대로 구동하는 에이전트형 브라우저는 별도 식별 문자열 없이 그 브라우저 고유의 User-Agent로 트래픽을 보냅니다. robots.txt의 User-Agent 규칙으로는 이 트래픽만 따로 걸러낼 방법이 마땅치 않습니다. OpenAI는 독자 브라우저 아틀라스를 2025년 10월 21일 출시 후 약 10개월 만인 2026년 8월 9일 종료하고 같은 기능을 챗GPT 본체로 옮겼습니다. 브라우저가 사라진다고 에이전트 방식 웹 접근 자체가 줄어드는 것은 아닙니다.

그럼 사이트는 뭘 준비해야 하나?

  1. robots.txt에서 학습용 봇(GPTBot 등)과 검색·인용용 봇(OAI-SearchBot 등)을 분리해, 학습은 거부하되 인용 대상에서는 빠지지 않게 규칙을 나눈다.
  2. 서버 로그에서 ChatGPT-User·PerplexityBot 등 AI 관련 User-Agent 트래픽이 차단 규칙과 다르게 움직이는지 주기적으로 확인한다.
  3. robots.txt로 모든 접근을 통제할 수 있다는 전제를 버리고, 민감한 페이지는 로그인·요금 정책 같은 별도 수단으로 보호한다.

정리하면, robots.txt는 크롤러 접근 방침을 밝히는 출발점일 뿐 그 자체로 통제 수단은 아닙니다. TollBit 조사에서 ChatGPT-User 등은 차단 사이트의 절반가량에서도 접근했고, OpenAI·퍼플렉시티 모두 이용자 요청형 트래픽에는 robots.txt가 적용되지 않을 수 있다고 밝혔습니다. 에이전트형 브라우저까지 늘어나는 지금은 학습·인용·실시간 접근을 구분해 규칙을 나누고 실제 로그로 확인하는 작업이 먼저입니다.

Q & A

자주 묻는 질문

robots.txt로 AI 봇을 막으면 확실히 차단되나요?
아닙니다. robots.txt는 법적 강제력이 없는 자율 규범이라 봇이 이를 지킬지는 운영사 방침에 달려 있습니다. TollBit의 2026년 상반기 조사에서 ChatGPT-User·바이트스파이더·유봇은 이들을 명시적으로 차단한 유럽 사이트 중 절반가량에서도 그대로 페이지에 접근했습니다. 사이트가 규칙을 선언해도 실제 접근을 막는 것은 별개의 문제입니다.
GPTBot과 ChatGPT-User는 뭐가 다른가요?
GPTBot은 모델 학습용 크롤러로 robots.txt 차단이 그대로 적용됩니다. 반면 ChatGPT-User는 이용자가 채팅 중 특정 URL을 요청해 그 자리에서 방문하는 트래픽으로, OpenAI는 이런 요청은 이용자가 직접 지시한 것이라 robots.txt가 적용되지 않을 수 있다고 안내합니다. 학습 차단과 실시간 접근 차단은 같은 robots.txt 안에서도 성격이 다르게 취급됩니다.
에이전트형 브라우저는 왜 더 막기 어렵나요?
퍼플렉시티 코멧, 클로드 포 크롬처럼 실제 브라우저 세션을 그대로 구동하는 에이전트는 트래픽이 그 브라우저 고유의 User-Agent로 나갑니다. 별도의 식별 문자열이 없어 robots.txt의 User-Agent 규칙으로 이 트래픽만 따로 걸러낼 방법이 마땅치 않습니다. OpenAI도 자체 브라우저 아틀라스를 2026년 8월 9일 종료하고 같은 기능을 챗GPT 본체 안으로 옮겼는데, 접근 방식 자체가 사라지는 것이 아니라는 뜻입니다.
그럼 지금 사이트는 뭐부터 확인해야 하나요?
robots.txt에서 학습용 봇(GPTBot 등)과 검색 인용용 봇(OAI-SearchBot 등)을 분리해 원하는 것만 허용하고, 서버 로그에서 실제 AI 관련 User-Agent 트래픽이 차단 규칙과 다르게 움직이는지부터 확인하는 편이 먼저입니다. robots.txt 하나로 모든 접근을 통제할 수 있다는 전제 자체를 재점검해야 합니다.

← 저널 목록으로