GEO / AI검색·GEO

AI 크롤러 방문 확인, 서버 로그에서 어떻게 직접 세어보나요?

읽는 데 6분 INSIGHTX
AI 크롤러 방문 확인, 서버 로그에서 어떻게 직접 세어보나요?

AI 크롤러 방문 확인은 검색창에 물어볼 일이 아니라 서버 접속 로그를 열어 GPTBot·PerplexityBot·ClaudeBot 같은 User-Agent 문자열을 직접 찾아보는 작업입니다. 로그에 그 문자열이 몇 번 찍혔는지 세어보면 어떤 AI가 이미 우리 사이트를 읽고 있는지, 그리고 그 방문이 진짜인지까지 가늠할 수 있습니다.

AI 크롤러 방문 확인을 왜 검색 순위 확인과 따로 해야 하나요?

네이버·구글 검색 노출은 검색 콘솔에서 순위와 클릭수로 바로 보이지만, ChatGPT나 퍼플렉시티 같은 AI 답변에 우리 콘텐츠가 인용됐는지는 그런 대시보드에 뜨지 않습니다. AI 서비스가 답변을 만들기 전에 먼저 그 크롤러가 사이트에 들어와 페이지를 읽어갔는지가 인용의 전제 조건이라, 이 단계를 확인하지 않으면 콘텐츠를 아무리 고쳐도 AI가 애초에 읽어갔는지조차 모른 채 짐작만 하게 됩니다. 접속 로그는 이 전제 조건을 확인할 수 있는 유일한 1차 자료입니다.

로그에서 어떤 User-Agent 문자열을 찾아야 하나요?

OpenAI는 학습용 수집 크롤러를 GPTBot으로, 답변 생성 중 실시간으로 페이지를 불러오는 크롤러를 OAI-SearchBot과 ChatGPT-User로 나눠 각각 다른 문자열을 씁니다. 퍼플렉시티는 PerplexityBot, 앤스로픽은 ClaudeBot이라는 토큰을 User-Agent 안에 넣어 자신을 밝힙니다. 구글은 검색 노출용 Googlebot과 별개로 제미나이 학습에 쓰는 Google-Extended라는 이름을 따로 씁니다. 로그 파일에서 이 여섯 개 문자열만 검색해도 어떤 AI가 어떤 목적으로 다녀갔는지 대략 구분이 됩니다.

User-Agent 문자열만 보고 그대로 믿어도 되나요?

그럴 수 없습니다. 클라우드플레어는 2025년 8월 보고서에서 퍼플렉시티가 robots.txt로 명시적으로 차단한 도메인에서도 PerplexityBot이라는 이름을 쓰지 않고 크롬 브라우저인 것처럼 User-Agent를 바꾸고 여러 IP 대역을 옮겨 다니며 콘텐츠를 계속 가져갔다고 밝히며 퍼플렉시티의 인증 봇 등록을 취소했습니다. 즉 로그에 PerplexityBot이 안 찍힌다고 해서 퍼플렉시티가 그 페이지를 안 읽어갔다고 단정할 수 없다는 뜻입니다. 반대로 로그에 정상적인 이름으로 찍힌 요청이라도 실제로는 그 문자열만 흉내 낸 다른 프로그램일 수 있어, 접속이 잦은 IP는 해당 회사가 공개한 IP 대역과 대조해 보는 편이 안전합니다.

로그 파일이 없거나 열 줄 모르면 어떻게 세어보나요?

자체 서버를 운영한다면 접속 로그에서 위 문자열을 필터링하는 것만으로 충분하지만, 대행 호스팅이나 쇼핑몰 솔루션을 쓰는 경우가 많은 국내 중소 사이트는 원본 로그를 직접 열 권한이 없는 경우가 흔합니다. 이럴 때는 호스팅사 관리자 화면의 접속 로그 다운로드 기능이나 CDN·보안 서비스의 봇 트래픽 리포트를 먼저 확인하는 편이 빠릅니다. 로그 자체에 접근할 방법이 전혀 없다면, ChatGPT나 퍼플렉시티에 자사 브랜드명이나 서비스명을 직접 물어보고 답변에 우리 페이지가 인용되는지를 대신 확인하는 간접적인 방법으로 우회할 수 있습니다.

회사User-Agent 토큰목적
OpenAIGPTBot모델 학습용 수집
OpenAIOAI-SearchBot / ChatGPT-User답변 생성 중 실시간 열람
PerplexityPerplexityBot답변 생성용 수집·열람
AnthropicClaudeBot모델 학습·열람용 수집
GoogleGoogle-Extended제미나이 학습용 수집(Googlebot과 별개)

robots.txt로 막아두면 이 크롤러들이 실제로 줄어드나요?

GPTBot·PerplexityBot·ClaudeBot은 각자 이름으로 robots.txt의 개별 규칙을 인식하도록 설계돼 있어, 정상적으로 동작하는 한 이름을 지정해 차단하면 그 이름으로는 더 이상 들어오지 않습니다. 문제는 위에서 다룬 것처럼 일부 크롤러가 차단 이후 다른 이름으로 위장해 다시 들어오는 사례가 이미 보고됐다는 점입니다. robots.txt 설정은 정상적으로 신원을 밝히는 크롤러를 걸러내는 최소한의 장치이지, 모든 접근을 막아주는 장치는 아니라고 보고 접근을 허용할지 차단할지는 로그로 실제 방문 패턴을 본 뒤에 정하는 편이 낫습니다.

지금 접속 로그나 관리자 화면에 접근할 수 있다면 GPTBot·PerplexityBot·ClaudeBot 세 문자열부터 검색해 보세요. 하나도 안 잡힌다면 로그 보관 기간이 짧아 이미 지워졌는지, 아니면 이 크롤러들이 아직 사이트를 찾지 못한 것인지부터 구분해야 다음 조치를 정할 수 있습니다.

정리하면, AI 크롤러 방문 확인은 접속 로그에서 GPTBot·PerplexityBot·ClaudeBot·Google-Extended 같은 User-Agent 문자열을 세어보는 데서 시작하되, 그 문자열만으로 방문 여부를 단정하지 않고 공개된 IP 대역이나 실제 인용 여부로 한 번 더 교차 확인해야 하는 작업입니다. 로그를 직접 볼 권한이 없거나 결과 해석이 애매하다면 AI 검색 최적화(GEO) 관점에서 로그와 인용 현황을 함께 짚어볼 수 있습니다. 크롤러가 이미 다녀갔다면 그 다음은 AEO와 SEO 우선순위를 정해 어떤 페이지부터 인용용 구조로 바꿀지 판단하는 단계입니다.

Q & A

자주 묻는 질문

로그에 GPTBot이 한 번도 안 찍히면 ChatGPT에 전혀 안 걸린다는 뜻인가요?
그렇게 단정할 수는 없습니다. GPTBot은 모델 학습을 위한 수집용 크롤러이고, 답변 생성 중 실시간으로 페이지를 불러오는 크롤러는 OAI-SearchBot과 ChatGPT-User라는 별도 이름을 씁니다. GPTBot만 찾아보고 없다고 결론 내리면 실시간 열람용 크롤러의 방문은 놓치게 되므로, 로그 보관 기간부터 확인하고 세 이름을 모두 검색해야 합니다.
PerplexityBot이라는 이름이 로그에 안 보이면 퍼플렉시티가 사이트를 안 읽어간 걸까요?
확신할 수 없습니다. 클라우드플레어는 2025년 8월 보고서에서 퍼플렉시티가 robots.txt로 차단된 도메인에서도 크롬 브라우저를 흉내 낸 User-Agent와 여러 IP 대역을 번갈아 쓰며 콘텐츠를 계속 가져간 사례를 확인했다고 밝혔고, 이를 근거로 퍼플렉시티의 인증 봇 등록을 취소했습니다. PerplexityBot이라는 이름이 안 보인다고 방문 자체가 없었다고 결론 내리기는 어렵습니다.
직접 서버 로그를 볼 권한이 없는 쇼핑몰 솔루션 사용자는 어떻게 확인하나요?
호스팅사나 쇼핑몰 솔루션의 관리자 화면에 접속 로그 다운로드나 봇 트래픽 리포트 기능이 있는지 먼저 확인하는 것이 가장 빠릅니다. 그런 기능이 전혀 없다면 ChatGPT나 퍼플렉시티에 자사 브랜드명·서비스명을 직접 검색해 답변에 자사 페이지가 인용되는지를 확인하는 간접적인 방법으로 크롤링 여부를 짐작할 수 있습니다.
GPTBot을 robots.txt로 막으면 완전히 차단되나요?
정상적으로 신원을 밝히고 규칙을 지키는 크롤러라면 이름을 지정해 차단했을 때 더 이상 접근하지 않습니다. 다만 클라우드플레어 보고서처럼 차단 이후 다른 이름으로 위장해 다시 접근한 사례가 이미 보고된 만큼, robots.txt 설정만으로 접근이 완전히 끊긴다고 단정하지 말고 로그로 실제 방문 패턴을 함께 확인하는 편이 안전합니다.

← 광고이슈 목록으로