Guides스키마와 리치 스니펫

Robots.txt와 AI 구매자: AI 크롤러를 차단하고 있지 않은가

일부 쇼핑몰은 자신을 인용하는 AI 크롤러를 조용히 차단하고 있습니다. 모든 크롤러를 허용하지 않고도 robots.txt를 점검하는 방법을 정리합니다.

짧은 답: 스토어 URL에 /robots.txt를 입력해 파일을 열고, GPTBot, ClaudeBot, PerplexityBot, Google-Extended 같은 AI 크롤러 user-agent를 대상으로 한 Disallow 규칙이 있는지 확인하십시오. 답변 엔진은 이 크롤러를 통해 스토어 리뷰에 접근합니다. 일괄 차단 규칙 하나만으로도 스토어가 AI 답변 인용에서 조용히 제외될 수 있으며, 브랜드 이름을 직접 검색하지 않는 잠재 구매자에게는 보이지 않는 상태가 됩니다. user-agent 규칙 점검은 몇 분이면 완료되며, 실행 가능한 SEO 검사 항목 중 효과 대비 투입 시간이 가장 짧은 것에 속합니다. 차단이 존재한다면 대부분은 과거 플러그인이나 템플릿이 자동으로 추가한 것으로, 해당 줄을 삭제하는 것으로 수정이 끝납니다.

왜 robots.txt가 AI 크롤러를 차단하게 되는가

대부분은 의도한 결과가 아닙니다. 차단 규칙은 대개 상속을 통해 생겨납니다. 보안 플러그인, CDN 기본값, 호스팅 설정, 혹은 2023년 "내 콘텐츠를 AI 학습 데이터에서 제외하라"는 조언이 유행하던 시기에 복사된 템플릿이 AI 봇을 대상으로 Disallow 규칙을 추가했고, 그 규칙이 수정 없이 파일에 수년째 남아 있는 경우입니다.

당시 의도는 콘텐츠가 모델 학습에 사용되지 않도록 막는 것이었습니다. 그런데 지금의 부작용은, 동일한 규칙이 구매자가 구매 결정 과정에서 참고하는 AI 답변 엔진의 실시간 인용에서 스토어 리뷰를 제외시킨다는 점입니다. 학습 접근과 답변 인용 접근은 별개이지만, Disallow 규칙 한 줄이 두 가지를 모두 차단하는 경우가 많습니다.

확인해야 할 AI 크롤러 user-agent 목록

엔진마다 다른 봇을 사용하므로, 하나를 차단한다고 나머지가 함께 차단되지 않습니다. robots.txt를 열어 User-agent 항목에서 AI 크롤러 이름을 찾고, 각 블록에 연결된 Disallow 규칙을 읽으십시오.

특정 user-agent 아래 규칙은 해당 에이전트에만 적용됩니다. 따라서 Google 검색은 허용하면서 AI Overview를 구동하는 봇만 차단하는 파일 구성이 얼마든지 가능합니다.

  • GPTBot과 OAI-SearchBot: ChatGPT 검색을 뒷받침하는 OpenAI 크롤러
  • ClaudeBot과 Claude-User: Anthropic이 사용하는 크롤러
  • PerplexityBot: Perplexity가 인용하는 페이지를 가져오는 크롤러
  • Google-Extended: 일반 Googlebot과 별도로 Gemini와 AI Overview를 관할하는 크롤러

크롤러를 차단하면 인용이 실제로 사라지는가

대부분의 경우 그렇습니다. 답변 엔진은 자체 크롤러를 통해 실시간 페이지를 읽는 방식에 의존하며, robots.txt는 크롤러가 따르는 관문입니다. 관문이 닫혀 있으면 엔진이 스토어 리뷰를 읽을 수 없고, 브랜드 이름을 직접 검색하지 않는 구매자에 대한 AI 답변에서 제외됩니다.

단, 솔직한 단서를 덧붙이면, robots.txt는 요청이지 장벽이 아닙니다. 규정을 준수하는 크롤러는 이를 따르며, 주요 AI 봇은 일반적으로 따릅니다. 따라서 Disallow는 해당 봇과의 관계에서 신뢰할 수 있는 비용을 발생시킵니다. 파일을 무시하는 크롤러를 막을 수는 없고, 보안 통제 수단도 아닙니다. 핵심은 하나입니다. 인용받기를 원한다면 인용하는 봇을 차단하지 마십시오.

전체를 열지 않고 robots.txt를 점검하는 방법

선택지는 완전 차단과 완전 공개 둘뿐이 아닙니다. 점검의 목적은 구매자 대면 답변을 구동하는 소수 크롤러에 대한 우발적 차단을 제거하면서, 의도적으로 설정한 차단은 유지하는 것입니다.

순서대로 처리하고, 한 번에 하나씩 수정하여 각 변경이 어떤 효과를 내는지 확인하십시오.

  • 스토어 URL에 /robots.txt를 입력해 파일을 읽고, 모든 User-agent 블록과 Disallow 규칙을 목록으로 정리하십시오.
  • GPTBot, ClaudeBot, PerplexityBot, OAI-SearchBot, Google-Extended를 대상으로 하는 Disallow를 표시하십시오.
  • 봇별로 판단하십시오. 의도적으로 설정한 차단은 유지하고, 직접 선택하지 않은 상속된 차단은 제거하십시오.
  • 리뷰 페이지와 상품 URL이 광범위한 Disallow 경로에 걸리지 않는지 확인하십시오.

차단을 해제했는데 리뷰가 여전히 인용되지 않는 이유

접근 허용은 필요 조건이지 충분 조건이 아니기 때문입니다. 크롤러를 허용하는 것은 크롤러가 도착했을 때 읽을 수 있는 콘텐츠가 있을 때만 의미가 있습니다. 모든 AI 봇을 허용하면서도 인용받지 못하는 스토어가 있는 이유는, 리뷰가 크롤러에게는 빈 컨테이너로 보이는 JavaScript widget 안에 렌더링되기 때문입니다.

대부분의 리뷰 앱은 페이지를 보는 쇼퍼를 위해 만들어졌고 widget 수준에서 멈춥니다. 그 결과 방금 차단을 해제한 크롤러에게도 리뷰는 읽히지 않습니다. 기존 리뷰를 읽힐 수 있게 만들고, 검색과 AI에서 인용받도록 하는 격차를 좁히기 위해 BeyondReviews가 만들어졌습니다. Robots.txt는 문을 열고, 읽힐 수 있는 리뷰 HTML이 엔진이 실제로 가져가는 것입니다.

noindex 태그, llms.txt 파일과의 차이점

각각 다른 것을 제어합니다. Robots.txt는 크롤러가 페이지를 가져올 수 있는지 여부를 결정합니다. noindex 태그는 크롤러의 접근은 허용하되 색인 생성을 하지 말도록 요청하는 더 부드러운 신호이며, 접근이 허용된 뒤에야 읽힙니다. llms.txt 파일은 모델에게 선호 콘텐츠를 안내하는 별도의 제안으로, 누구의 접근도 차단할 수 없습니다.

AI 인용 측면에서 핵심은 robots.txt입니다. 크롤러를 차단하면 다운스트림의 모든 것이 무의미해집니다. 엔진이 페이지를 읽지 못하면 noindex 태그나 llms.txt 힌트를 고려할 기회조차 생기지 않습니다.

정리

Robots.txt 점검은 5분이면 충분하지만 그 효과는 큽니다. 상속된 Disallow 규칙 하나가 아무도 모르게 스토어를 AI 답변에서 제거할 수 있으며, 수정 방법은 대개 의도하지 않게 추가된 줄 하나를 삭제하는 것으로 끝납니다. AI 크롤러 user-agent를 점검하고, 의도한 차단은 유지하고, 상속된 차단은 제거한 다음, 크롤러가 문을 통과했을 때 뒤에 있는 리뷰가 실제로 읽힐 수 있는 상태인지 확인하십시오.

자주 묻는 질문

robots.txt 파일은 어디서 찾을 수 있습니까

도메인 루트에 있습니다. 브라우저에서 스토어 URL에 /robots.txt를 입력하면 됩니다. 페이지가 비어 있거나 404가 반환되면 설정된 규칙이 없는 것으로, AI 크롤러를 차단하지는 않지만 플랫폼 기본값에 전적으로 의존하는 상태입니다.

AI 크롤러 차단을 해제하면 콘텐츠가 모델 학습에 사용되는가

가능성이 있으며, 이는 실제로 고려해야 할 절충점입니다. 일부 크롤러는 실시간 답변을 위해 접근하고, 일부는 학습 목적이며, 두 가지 모두에 사용되는 user-agent도 있습니다. 학습 사용이 우려된다면, 모든 것을 차단하여 인용도 잃는 대신, 답변 제공용 봇(예: OAI-SearchBot, PerplexityBot)은 허용하면서 학습 목적 규칙은 유지하는 방식을 검토하십시오.

robots.txt는 크롤러를 실제로 막는가, 아니면 권고에 불과한가

규정을 준수하는 크롤러가 따르는 요청이며, 주요 AI 봇은 일반적으로 이를 따릅니다. 그러므로 누가 인용하는지를 관리하는 데 신뢰할 수 있는 수단이지만, 보안 경계는 아닙니다. 파일을 무시하는 크롤러는 여전히 페이지를 읽을 수 있으므로, robots.txt를 민감한 콘텐츠의 접근 통제 수단으로 취급해서는 안 됩니다.

크롤러를 허용하면 리뷰가 자동으로 인용되는가

그렇지 않습니다. 크롤러를 허용하는 것은 차단만 해제할 뿐이며, 엔진이 인용하려면 읽힐 수 있는 리뷰 텍스트가 필요합니다. 리뷰가 크롤러에게 빈 것으로 읽히는 JavaScript widget 안에서 렌더링된다면, 완전히 차단을 해제해도 인용받지 못할 수 있습니다. 접근 허용과 가독성 확보는 별개의 과제입니다.

All of Guides