GEO / 생성형 엔진 최적화
ChatGPT 에이전트, robots.txt 막아도 절반은 뚫었다
아닙니다. 웹 데이터 라이선싱 업체 톨빗(TollBit)이 2026년 상반기 유럽 사이트를 대상으로 조사한 결과, ChatGPT-User·바이트스파이더·유봇은 robots.txt로 이들을 명시적으로 차단한 사이트의 거의 절반에서도 그대로 접근했습니다. OpenAI 역시 자사 문서에서 이용자가 요청해 방문하는 트래픽에는 robots.txt가 적용되지 않을 수 있다고 밝혔습니다. robots.txt를 선언하는 것과 실제로 접근이 통제되는 것은 별개의 문제라는 뜻입니다.
TollBit 조사, 정확히 뭘 발견했나?
TollBit의 「State of the Bots」 2026년 상반기 보고서는 유럽 사이트들의 서버 로그를 분석해, 식별된 AI 페이지 페처(fetcher)의 약 15%가 사이트가 명시적으로 차단한 URL에 접근했다고 밝혔습니다. 특히 ChatGPT-User·바이트스파이더·유봇 세 봇은 자신을 robots.txt로 지정해 막은 사이트들 중 거의 절반에서 차단된 페이지를 그대로 가져갔습니다. ChatGPT의 페이지 페칭 봇은 다른 어떤 AI 봇보다 많은 사이트에서 차단 대상으로 지정돼 있으면서도, 동시에 차단된 페이지에 가장 많이 접근한 봇이었습니다.
OpenAI는 왜 robots.txt가 안 통할 수 있다고 했나?
OpenAI는 크롤러를 용도별로 나눠 운영합니다. 학습용 GPTBot과 검색 인용용 OAI-SearchBot은 robots.txt 차단이 그대로 적용됩니다. 반면 이용자가 대화 중 특정 URL을 요청해 그 자리에서 가져오는 ChatGPT-User는 다릅니다. OpenAI 고객지원 문서는 이런 방문이 이용자의 직접 지시라 robots.txt가 적용되지 않을 수 있다고 안내합니다. 퍼플렉시티도 Perplexity-User가 일반적으로 robots.txt 규칙을 따르지 않는다고 밝혀, 같은 논리가 업계 전반에 퍼져 있습니다.
| 크롤러 | 용도 | robots.txt 적용 |
|---|---|---|
| GPTBot | 모델 학습 | 적용됨 |
| OAI-SearchBot | 검색·인용 색인 | 적용됨 |
| ChatGPT-User | 이용자 요청 실시간 방문 | 적용 안 될 수 있음 |
에이전트형 브라우저는 왜 더 막기 어려운가?
퍼플렉시티 코멧, 클로드 포 크롬, 오페라 네온처럼 실제 브라우저 세션을 그대로 구동하는 에이전트형 브라우저는 별도 식별 문자열 없이 그 브라우저 고유의 User-Agent로 트래픽을 보냅니다. robots.txt의 User-Agent 규칙으로는 이 트래픽만 따로 걸러낼 방법이 마땅치 않습니다. OpenAI는 독자 브라우저 아틀라스를 2025년 10월 21일 출시 후 약 10개월 만인 2026년 8월 9일 종료하고 같은 기능을 챗GPT 본체로 옮겼습니다. 브라우저가 사라진다고 에이전트 방식 웹 접근 자체가 줄어드는 것은 아닙니다.
그럼 사이트는 뭘 준비해야 하나?
- robots.txt에서 학습용 봇(GPTBot 등)과 검색·인용용 봇(OAI-SearchBot 등)을 분리해, 학습은 거부하되 인용 대상에서는 빠지지 않게 규칙을 나눈다.
- 서버 로그에서 ChatGPT-User·PerplexityBot 등 AI 관련 User-Agent 트래픽이 차단 규칙과 다르게 움직이는지 주기적으로 확인한다.
- robots.txt로 모든 접근을 통제할 수 있다는 전제를 버리고, 민감한 페이지는 로그인·요금 정책 같은 별도 수단으로 보호한다.
정리하면, robots.txt는 크롤러 접근 방침을 밝히는 출발점일 뿐 그 자체로 통제 수단은 아닙니다. TollBit 조사에서 ChatGPT-User 등은 차단 사이트의 절반가량에서도 접근했고, OpenAI·퍼플렉시티 모두 이용자 요청형 트래픽에는 robots.txt가 적용되지 않을 수 있다고 밝혔습니다. 에이전트형 브라우저까지 늘어나는 지금은 학습·인용·실시간 접근을 구분해 규칙을 나누고 실제 로그로 확인하는 작업이 먼저입니다.
Q & A