AI 크롤러 허용하기 — robots.txt 에서 확인할 크롤러 7종 체크리스트

AI 검색에 인용되려면 먼저 AI 크롤러가 홈페이지에 들어올 수 있어야 합니다. robots.txt 에서 GPTBot, OAI-SearchBot, ClaudeBot, Google-Extended, PerplexityBot, Bingbot, Yeti 7종 중 하나라도 `Disallow: /` 로 막혀 있으면 그 서비스에서는 인용되지 않습니다. 랭킹AI는 이 7종이 모두 허용돼야 통과로 봅니다.

왜 크롤러 허용이 첫 번째인가요?

AI 검색은 네 단계(인지 → 노출 → 인용 → 추천)를 거치는데, 크롤러 허용은 그 첫 관문입니다. 여기서 막히면 구조화 데이터·FAQ·즉답 문장을 아무리 잘 만들어도 AI는 그 페이지를 본 적이 없으므로 인용할 수 없습니다. 그래서 랭킹AI는 이 항목이 fail 이면 다른 항목과 무관하게 총점 상한을 59점으로 둡니다.

어떤 크롤러 7종을 확인해야 하나요?

User-Agent 서비스 역할
GPTBot OpenAI ChatGPT 학습·검색용 수집
OAI-SearchBot OpenAI ChatGPT 검색 결과(링크 인용)용
ClaudeBot Anthropic Claude 웹 검색·수집
Google-Extended Google Gemini 학습·AI 기능 사용 허가 토큰 (일반 검색 순위와는 별개)
PerplexityBot Perplexity Perplexity 답변 인용용 수집
Bingbot Microsoft Bing 검색 + Copilot 답변
Yeti 네이버 네이버 검색 + AI 브리핑

7종 중 하나라도 Disallow: / 면 해당 서비스에서 인용되지 않습니다. 랭킹AI는 7종 전부 허용일 때 pass, 일부만 막혀 있으면 partial, 전부 또는 주요 크롤러가 막혀 있으면 fail 로 판정합니다.

내 robots.txt 는 어떻게 확인하나요?

  1. 브라우저에서 https://내도메인/robots.txt 를 엽니다.
  2. 아래처럼 생긴 블록이 있는지 찾습니다.
User-agent: GPTBot
Disallow: /
  1. User-agent: * 뒤에 Disallow: / 가 있으면 모든 크롤러를 막는 것입니다. 홈페이지 제작사가 개발 중 설정을 그대로 두고 납품한 경우에 자주 보입니다.

막혀 있다면 어떻게 고치나요?

가장 단순한 형태는 AI 크롤러 블록을 삭제하는 것입니다. 명시적으로 허용을 적고 싶다면 다음처럼 합니다.

User-agent: GPTBot
Allow: /

User-agent: ClaudeBot
Allow: /

User-agent: PerplexityBot
Allow: /

User-agent: *
Allow: /
Disallow: /wp-admin/

Sitemap: https://내도메인/sitemap.xml
  • Disallow 는 관리자·회원 전용 폴더에만 씁니다.
  • 마지막 줄의 Sitemap: 선언은 랭킹AI 의 "sitemap.xml 존재 + robots 선언" 항목에도 필요합니다.
  • 수정 후 반영까지 보통 몇 분이지만, CDN 캐시가 있으면 하루까지 걸릴 수 있습니다.

robots.txt 를 고쳤는데도 차단이면 무엇을 봐야 하나요?

robots.txt 는 "요청"이고, 실제 차단은 서버·방화벽이 합니다. 다음 세 곳을 순서대로 확인합니다.

  • Cloudflare 를 쓰는 경우 — Security → Bot Fight Mode 가 켜져 있으면 규칙과 무관하게 자동화 요청을 막습니다. 끄거나, Security rules 에서 크롤러 User-Agent 를 Skip 하는 규칙을 추가합니다.
  • 워드프레스 보안 플러그인 — Wordfence·iThemes 의 "가짜 봇 차단" 기능이 AI 크롤러를 가짜로 분류하기도 합니다. 허용 목록에 User-Agent 를 추가합니다.
  • 호스팅사 방화벽 — 일부 국내 호스팅은 해외 IP 를 통째로 막습니다. AI 크롤러는 대부분 해외에서 오므로 이 설정이면 전부 차단됩니다. 호스팅사에 "검색엔진·AI 크롤러 허용"을 요청해야 합니다.

랭킹AI 진단에서 "AI 크롤러 허용" 항목의 판정 사유에 어떤 크롤러가 막혀 있는지 이름이 표시되므로, 그 이름만 풀면 됩니다.

자주 묻는 질문

robots.txt 가 아예 없으면 어떻게 되나요?

파일이 없으면 모든 크롤러가 허용된 것으로 동작하므로 AI 크롤러 차단 문제는 없습니다. 다만 랭킹AI 의 "robots.txt 존재" 항목(3점)과 sitemap 선언 항목에서 점수를 잃습니다. 빈 규칙이라도 파일을 만들어 두는 편이 좋습니다.

워드프레스 보안 플러그인이 봇을 막고 있을 수도 있나요?

네. robots.txt 는 깨끗해도 Wordfence·Cloudflare Bot Fight Mode·호스팅사 방화벽이 AI 크롤러의 요청 자체를 403 으로 거부하는 경우가 많습니다. 이때는 robots.txt 수정만으로는 풀리지 않고, 해당 보안 설정에서 크롤러 User-Agent 를 허용 목록에 넣어야 합니다.

모든 AI 크롤러를 허용하면 저작권이나 트래픽 문제는 없나요?

크롤러는 공개된 페이지만 읽으며, 사업장 홈페이지는 원래 고객에게 공개하려고 만든 정보입니다. 트래픽은 일반 검색 크롤러와 비슷한 수준이고, 특정 폴더(관리자·회원 전용)는 Disallow 로 따로 막을 수 있습니다.

내 홈페이지는 이 기준으로 몇 점일까요? 10초, 무료, 회원가입 없음.

내 사이트 진단하기

함께 읽을 글