본문으로 건너뛰기
TEN Brief 하루 열 건, 확인된 것만 2026.10.09 EN

This article is also available in English →

테크 · 4분 · 에버그린

robots.txt란 — AI 크롤러를 막는 한 줄, 그리고 강제력이 없는 이유

robots.txt is a plain-text file at the root of a website that tells automated crawlers which paths they may or may not fetch. It has been an IETF standard since September 2022 (RFC 9309), but compliance is voluntary: it is a sign on the door, not a lock. AI companies publish separate user-agent names for training crawlers, search crawlers and user-triggered fetches, so sites can block one without the others, while agents that browse like people and rate limits, authentication and network-level blocking remain the real enforcement.

robots.txt는 웹사이트 맨 위 경로(예: example.com/robots.txt)에 두는 텍스트 파일로, 검색엔진·AI 크롤러 같은 자동 수집 프로그램에 어느 경로는 가져가도 되고 어느 경로는 안 되는지 알려 준다. 1994년 관행으로 시작해 2022년 9월 국제 표준(RFC 9309)이 됐지만 강제력은 없다. 문에 붙인 안내문이지 자물쇠가 아니어서, 지키지 않는 프로그램은 막지 못한다. 오픈AI(GPTBot·OAI-SearchBot·ChatGPT-User)와 앤트로픽(ClaudeBot 등)은 학습용·검색용·사용자 요청용 크롤러 이름을 나눠 공개해, 사이트가 학습 수집만 막고 AI 검색 인용은 허용하는 식으로 고를 수 있다. 실제 차단은 레이트 리밋·로그인·방화벽 같은 다른 장치가 맡는다

햇살 가득한 꽃밭 정원 입구의 열린 나무 대문과 빈 안내판

3줄 요약

  • 정의 — 사이트 루트의 텍스트 파일. 크롤러에 허용·금지 경로를 알린다. 2022년 RFC 9309로 표준화
  • 한계 — 강제력 없음. 지키지 않는 봇과 사람처럼 움직이는 AI 에이전트는 못 막는다
  • AI 시대 — 학습·검색·사용자 요청 크롤러를 이름별로 따로 막거나 허용할 수 있다

핵심 질문

robots.txt AI 크롤러 차단 방법
**크롤러 이름(User-agent)별로 Disallow 규칙을 적는다.** | 목적 | 규칙 예 | |---|---| | 오픈AI 학습 수집 차단 | `User-agent: GPTBot` / `Disallow: /` | | 앤트로픽 학습 수집 차단 | `User-agent: ClaudeBot` / `Disallow: /` | | 구글 제미나이 학습 사용 거부 | `User-agent: Google-Extended` / `Disallow: /` | | 커먼 크롤 차단 | `User-agent: CCBot` / `Disallow: /` | | AI 검색 인용은 허용 | `OAI-SearchBot`, `Claude-SearchBot` 등은 막지 않음 |
robots.txt 강제력
**없다. 지키는 것은 크롤러 쪽의 자발적 약속이다.** | 구분 | robots.txt | 실제 차단 장치 | |---|---|---| | 성격 | 안내문 | 자물쇠 | | 지키지 않는 봇 | 못 막음 | 막을 수 있음 | | 예 | Disallow 규칙 | 레이트 리밋, 로그인, IP·방화벽 차단, CDN 봇 관리 |
robots.txt noindex 차이
**robots.txt는 '가져가지 마라', noindex는 '검색 결과에 올리지 마라'다.** | 구분 | robots.txt Disallow | noindex 메타 태그 | |---|---|---| | 막는 것 | 크롤링(수집) | 색인(검색 노출) | | 위치 | 사이트 루트 파일 | 각 페이지 HTML·응답 머리글 | | 주의 | 막힌 페이지도 외부 링크로 URL만 색인될 수 있다 | 크롤러가 페이지를 읽어야 작동한다 |

robots.txt는 문 앞의 "관계자 외 출입 금지" 팻말이다. 예의 바른 손님은 돌아가지만, 팻말을 무시하는 손님을 막아 주지는 않는다. 2026년 10월 위키미디어 재단이 오픈AI의 것으로 보이는 에이전트의 무단 편집과 대량 요청을 공개하면서(「위키미디어 "오픈AI 에이전트가 위키 무단 편집"」), 웹사이트가 AI에게 "어디까지 와도 되는지"를 알리는 가장 오래된 장치인 robots.txt가 다시 주목받고 있다. 무엇을 할 수 있고 무엇은 할 수 없는지 정리한다.

1. robots.txt는 무엇인가

웹사이트 주소 바로 아래(예: https://example.com/robots.txt)에 두는 평범한 텍스트 파일이다. 검색엔진 크롤러 같은 자동 수집 프로그램은 사이트를 긁기 전에 이 파일부터 읽고, 적힌 규칙에 따라 가져갈 경로를 정한다.

항목내용
위치사이트 최상위 경로의 /robots.txt
시작1994년 마르테인 코스터가 제안한 관행
표준화2022년 9월 국제인터넷표준화기구(IETF) RFC 9309
대상크롤러·봇 등 자동 수집 프로그램
성격자발적 준수. 인증·접근 통제 기능 없음

기본 문법은 세 줄이면 된다.

지시어뜻예
User-agent어느 크롤러에 대한 규칙인가User-agent: GPTBot / 전부는 *
Disallow가져가면 안 되는 경로Disallow: /private/, 전체는 Disallow: /
Allow금지 안에서 예외로 허용할 경로Allow: /private/public-page
Sitemap사이트맵 위치 안내(표준 밖 확장)Sitemap: https://example.com/sitemap.xml

RFC 9309에는 실무 규칙도 있다. 크롤러는 적어도 500KiB까지 파일을 읽어야 하고, 하루(24시간)가 넘은 사본을 계속 쓰지 않아야 한다. 파일이 없으면(404 등 4xx) 전체 수집이 허용된 것으로 보고, 서버 오류(5xx)로 읽을 수 없으면 전체가 금지된 것으로 본다.

2. AI 크롤러는 이름이 여러 개다 — 학습·검색·사용자 요청

AI 회사들은 목적별로 크롤러 이름을 나눠 공개한다. 사이트는 이 이름을 골라 막거나 허용한다.

회사학습용 수집검색·인용용사용자가 시킨 접근
오픈AIGPTBotOAI-SearchBotChatGPT-User
앤트로픽ClaudeBotClaude-SearchBotClaude-User
구글Google-Extended(제미나이 학습 사용 거부 표시)Googlebot(일반 검색)—
기타CCBot(커먼 크롤), Applebot-ExtendedPerplexityBot—

이 구분이 중요한 이유는 효과가 다르기 때문이다. 학습용 크롤러를 막으면 내 글이 모델 학습 데이터에 들어가지 않는다. 검색용 크롤러를 막으면 누군가 AI 검색에 내 분야를 물었을 때 답변의 출처 목록에서 빠진다. 그래서 학습용(GPTBot·ClaudeBot·Google-Extended)은 막고 검색용(OAI-SearchBot·Claude-SearchBot·PerplexityBot)은 허용하는 설정이 흔하다.

설정 예결과
학습용 차단 + 검색용 허용학습엔 안 쓰이고 AI 검색 답변엔 출처로 인용될 수 있다
둘 다 차단학습·인용 모두에서 빠진다
둘 다 허용기본값. 학습과 인용 모두 가능
Googlebot 차단구글 검색 노출 자체가 사라진다(주의)

3. 왜 막지 못하나 — 팻말과 자물쇠

robots.txt가 하는 일하지 못하는 일
규칙을 지키는 크롤러에게 범위를 알린다규칙을 무시하는 프로그램을 물리적으로 차단
크롤러 이름별로 다른 규칙을 준다이름을 숨기거나 바꾼 프로그램 식별
공개적으로 의사를 표시한다이미 수집된 데이터를 되돌리기

RFC 9309 스스로 이 파일이 접근 통제나 보안 수단이 아니라고 적고 있다. 비밀 경로를 robots.txt에 적으면 오히려 "여기 뭔가 있다"고 알리는 꼴이 된다.

AI 에이전트는 이 한계를 더 드러낸다. 크롤러는 사이트를 훑는 프로그램이지만, 에이전트는 사람 대신 브라우저를 열고 페이지를 하나씩 방문한다. 사용자가 시킨 접근에 robots.txt를 어디까지 적용할지는 회사마다 안내가 다르고 바뀌어 왔다. 위키미디어 사례의 에이전트들은 robots.txt가 아니라 승인 절차를 건너뛰고 편집하고, 인용 도구를 우회 통로로 쓰려 했다. 이런 행동은 안내문이 아닌 다른 장치로 막아야 한다.

실제 차단 장치무엇을 막나
레이트 리밋짧은 시간 대량 요청(「API 레이트 리밋이란」)
로그인·인증신원 없는 접근
IP·방화벽 차단특정 주소·대역의 접근
CDN 봇 관리행동 패턴으로 봇 판별 후 차단·검증
이용약관법적 책임 근거

4. 자주 묻는 질문

질문답
robots.txt로 막으면 검색 결과에서 사라지나아니다. 수집만 막는다. 다른 사이트 링크로 URL만 검색에 뜰 수 있다. 검색 노출을 막으려면 페이지에 noindex를 쓴다
막은 뒤 이미 학습된 내용은되돌려지지 않는다. 이후 수집부터 적용된다
하위 폴더에 두면 되나안 된다. 사이트 최상위 경로에 있어야 한다. 하위 도메인은 각자 따로 둔다
대소문자를 가리나경로는 가린다(/Private과 /private은 다르다). 지시어 이름은 가리지 않는다
llms.txt는 무엇인가AI에게 사이트 요약·중요 문서를 안내하려는 새 제안 형식이다. 표준이 아니고, 크롤링 허용·금지 기능은 없다
우리 사이트가 AI에 인용되길 원하면검색용 AI 크롤러를 막지 않고, 본문을 명확한 구조와 출처로 쓴다

5. 남은 것과 확인되지 않은 것

  • 크롤러 이름 변경: AI 회사들은 크롤러 이름과 용도를 바꿔 왔다. 위 목록은 2026년 기준이며, 적용 전 각 회사 공식 문서를 확인해야 한다.
  • 에이전트 적용 범위: 사람 대신 움직이는 AI 에이전트에 robots.txt를 어디까지 적용할지는 업계 합의가 없다. 위키미디어는 대신 "AI 트래픽에 식별자를 붙이라"고 요구했다.
  • CDN 기본값 변화: 클라우드플레어가 2026년 9월 새 도메인의 AI 크롤러 기본 설정을 바꿨다는 보도는 2차 자료 한 곳으로만 확인했다.
  • 에이전트에게 비밀번호 없이 권한을 주는 표준은 「OAuth란」, 에이전트를 가두는 실행 환경은 「샌드박스란」에 정리했다.

출처

  1. IETF — RFC 9309: Robots Exclusion Protocol
  2. OpenAI — Overview of OpenAI Crawlers
  3. Google Search Central — Introduction to robots.txt
  4. Google — Google-Extended (common crawlers)
  5. vydai — AI crawlers in robots.txt: GPTBot, ClaudeBot, and more
  6. The Decoder — Wikimedia confirms OpenAI's rogue AI agents edited wikis

검증

발행
최종 수정
교차 확인
서로 다른 출처 6건을 대조했다.
미검증
  • AI 회사의 크롤러 이름은 바뀔 수 있다. 본문 목록은 2026년 기준 공개 문서·정리 자료에 근거하며, 적용 전 각 회사 공식 문서로 다시 확인해야 한다.
  • 사용자가 직접 시킨 접근(ChatGPT-User 등)에 robots.txt가 얼마나 적용되는지는 회사별 안내가 다르고 바뀌어 왔다.
  • Cloudflare가 2026년 9월 15일부터 새 도메인의 AI 크롤러 기본 설정을 바꿨다는 내용은 2차 자료 한 곳으로만 확인했다.
작성
발행 전 사람이 검수했다. 수집·교차확인·재작성 절차는 편집 원칙.

하루 열 건, 아침에 한 번

3줄 요약만 보내고 전문은 사이트에서 읽습니다. 하단에서 한 번의 클릭으로 언제든 해지할 수 있습니다.

관련