GEO / AI검색·GEO
AI 크롤러 방문 확인, 서버 로그에서 어떻게 직접 세어보나요?
AI 크롤러 방문 확인은 검색창에 물어볼 일이 아니라 서버 접속 로그를 열어 GPTBot·PerplexityBot·ClaudeBot 같은 User-Agent 문자열을 직접 찾아보는 작업입니다. 로그에 그 문자열이 몇 번 찍혔는지 세어보면 어떤 AI가 이미 우리 사이트를 읽고 있는지, 그리고 그 방문이 진짜인지까지 가늠할 수 있습니다.
AI 크롤러 방문 확인을 왜 검색 순위 확인과 따로 해야 하나요?
네이버·구글 검색 노출은 검색 콘솔에서 순위와 클릭수로 바로 보이지만, ChatGPT나 퍼플렉시티 같은 AI 답변에 우리 콘텐츠가 인용됐는지는 그런 대시보드에 뜨지 않습니다. AI 서비스가 답변을 만들기 전에 먼저 그 크롤러가 사이트에 들어와 페이지를 읽어갔는지가 인용의 전제 조건이라, 이 단계를 확인하지 않으면 콘텐츠를 아무리 고쳐도 AI가 애초에 읽어갔는지조차 모른 채 짐작만 하게 됩니다. 접속 로그는 이 전제 조건을 확인할 수 있는 유일한 1차 자료입니다.
로그에서 어떤 User-Agent 문자열을 찾아야 하나요?
OpenAI는 학습용 수집 크롤러를 GPTBot으로, 답변 생성 중 실시간으로 페이지를 불러오는 크롤러를 OAI-SearchBot과 ChatGPT-User로 나눠 각각 다른 문자열을 씁니다. 퍼플렉시티는 PerplexityBot, 앤스로픽은 ClaudeBot이라는 토큰을 User-Agent 안에 넣어 자신을 밝힙니다. 구글은 검색 노출용 Googlebot과 별개로 제미나이 학습에 쓰는 Google-Extended라는 이름을 따로 씁니다. 로그 파일에서 이 여섯 개 문자열만 검색해도 어떤 AI가 어떤 목적으로 다녀갔는지 대략 구분이 됩니다.
User-Agent 문자열만 보고 그대로 믿어도 되나요?
그럴 수 없습니다. 클라우드플레어는 2025년 8월 보고서에서 퍼플렉시티가 robots.txt로 명시적으로 차단한 도메인에서도 PerplexityBot이라는 이름을 쓰지 않고 크롬 브라우저인 것처럼 User-Agent를 바꾸고 여러 IP 대역을 옮겨 다니며 콘텐츠를 계속 가져갔다고 밝히며 퍼플렉시티의 인증 봇 등록을 취소했습니다. 즉 로그에 PerplexityBot이 안 찍힌다고 해서 퍼플렉시티가 그 페이지를 안 읽어갔다고 단정할 수 없다는 뜻입니다. 반대로 로그에 정상적인 이름으로 찍힌 요청이라도 실제로는 그 문자열만 흉내 낸 다른 프로그램일 수 있어, 접속이 잦은 IP는 해당 회사가 공개한 IP 대역과 대조해 보는 편이 안전합니다.
로그 파일이 없거나 열 줄 모르면 어떻게 세어보나요?
자체 서버를 운영한다면 접속 로그에서 위 문자열을 필터링하는 것만으로 충분하지만, 대행 호스팅이나 쇼핑몰 솔루션을 쓰는 경우가 많은 국내 중소 사이트는 원본 로그를 직접 열 권한이 없는 경우가 흔합니다. 이럴 때는 호스팅사 관리자 화면의 접속 로그 다운로드 기능이나 CDN·보안 서비스의 봇 트래픽 리포트를 먼저 확인하는 편이 빠릅니다. 로그 자체에 접근할 방법이 전혀 없다면, ChatGPT나 퍼플렉시티에 자사 브랜드명이나 서비스명을 직접 물어보고 답변에 우리 페이지가 인용되는지를 대신 확인하는 간접적인 방법으로 우회할 수 있습니다.
| 회사 | User-Agent 토큰 | 목적 |
|---|---|---|
| OpenAI | GPTBot | 모델 학습용 수집 |
| OpenAI | OAI-SearchBot / ChatGPT-User | 답변 생성 중 실시간 열람 |
| Perplexity | PerplexityBot | 답변 생성용 수집·열람 |
| Anthropic | ClaudeBot | 모델 학습·열람용 수집 |
| Google-Extended | 제미나이 학습용 수집(Googlebot과 별개) |
robots.txt로 막아두면 이 크롤러들이 실제로 줄어드나요?
GPTBot·PerplexityBot·ClaudeBot은 각자 이름으로 robots.txt의 개별 규칙을 인식하도록 설계돼 있어, 정상적으로 동작하는 한 이름을 지정해 차단하면 그 이름으로는 더 이상 들어오지 않습니다. 문제는 위에서 다룬 것처럼 일부 크롤러가 차단 이후 다른 이름으로 위장해 다시 들어오는 사례가 이미 보고됐다는 점입니다. robots.txt 설정은 정상적으로 신원을 밝히는 크롤러를 걸러내는 최소한의 장치이지, 모든 접근을 막아주는 장치는 아니라고 보고 접근을 허용할지 차단할지는 로그로 실제 방문 패턴을 본 뒤에 정하는 편이 낫습니다.
정리하면, AI 크롤러 방문 확인은 접속 로그에서 GPTBot·PerplexityBot·ClaudeBot·Google-Extended 같은 User-Agent 문자열을 세어보는 데서 시작하되, 그 문자열만으로 방문 여부를 단정하지 않고 공개된 IP 대역이나 실제 인용 여부로 한 번 더 교차 확인해야 하는 작업입니다. 로그를 직접 볼 권한이 없거나 결과 해석이 애매하다면 AI 검색 최적화(GEO) 관점에서 로그와 인용 현황을 함께 짚어볼 수 있습니다. 크롤러가 이미 다녀갔다면 그 다음은 AEO와 SEO 우선순위를 정해 어떤 페이지부터 인용용 구조로 바꿀지 판단하는 단계입니다.
Q & A