본문으로 건너뛰기
TEN Brief 하루 열 건, 확인된 것만 2026.10.09 EN

This article is also available in English →

테크 · 4분 · 검색 의도

토크나이저란 — 같은 문장인데 모델마다 토큰 수가 30%씩 다른 이유

A tokenizer is the part of a language model that cuts text into tokens, the pieces the model actually reads and the unit it is billed by. Each model family learns its own vocabulary, usually with byte-pair encoding, so the same sentence can come out as different numbers of tokens. That is why Claude Haiku 5.5's new tokenizer, which produces about 30% more tokens than Haiku 4.5 for the same text, turns a 90% price cut into a 75% average saving, and why languages such as Korean have historically cost more per sentence than English.

토크나이저는 AI 언어모델이 글을 읽기 전에 문장을 '토큰'이라는 조각으로 자르는 장치다. 모델은 글자가 아니라 토큰 번호를 읽고, API 요금도 토큰 수로 매긴다. 토큰 사전은 모델 회사마다 학습 데이터로 따로 만들기 때문에 같은 문장도 모델에 따라 토큰 수가 달라진다. 2026년 10월 앤트로픽의 클로드 하이쿠 5.5는 새 토크나이저가 같은 글을 하이쿠 4.5보다 약 30% 많은 토큰으로 쪼개, 토큰 단가는 90% 내렸지만 평균 비용 절감은 약 75%에 그쳤다. 한국어처럼 학습 데이터에서 비중이 작은 언어는 사전에 통째로 들어간 단어가 적어 같은 뜻을 전할 때 영어보다 토큰이 더 드는 경향이 있다

햇살 드는 책상 위에서 크기가 다른 색색의 나무 조각을 줄 맞춰 분류하는 손

3줄 요약

  • 정의 — 글을 모델이 읽는 단위(토큰)로 자르는 장치. 요금과 컨텍스트 한도가 모두 토큰 기준
  • 차이 — 모델마다 토큰 사전이 달라 같은 문장도 토큰 수가 다르다. 하이쿠 5.5는 4.5보다 약 30% 많다
  • 한국어 — 사전 비중이 작아 영어보다 토큰이 더 드는 경향. GPT-4o 세대에 1.7배 개선

핵심 질문

토크나이저란
**문장을 모델이 읽을 수 있는 번호 조각으로 바꾸는 장치다.** | 단계 | 하는 일 | 예(영어) | |---|---|---| | 1. 자르기 | 문장을 사전에 있는 조각으로 분할 | unbelievable → un / believ / able | | 2. 번호 매기기 | 조각마다 사전 번호 부여 | 403 / 21893 / 481 (예시) | | 3. 모델 입력 | 번호 열을 모델이 읽음 | — | | 4. 출력 복원 | 모델이 낸 번호를 다시 글로 | 디코딩 |
토큰 수 계산 한국어 영어
**영어는 대략 1토큰 ≈ 4글자 ≈ 0.75단어(오픈AI 안내). 한국어는 모델마다 차이가 크다.** | 항목 | 영어 | 한국어 | |---|---|---| | 어림 기준 | 1토큰 ≈ 4글자 | 고정 비율 없음, 모델별로 측정 필요 | | 경향 | 흔한 단어는 1토큰 | 음절·형태소 단위로 잘게 쪼개지는 경우가 많음 | | 개선 사례 | — | GPT-4o 토크나이저: 같은 문장 토큰 72개 → 41개(1.7배 감소) |
토크나이저 바뀌면 요금
**토큰 단가가 내려도 토큰 수가 늘면 실제 비용은 덜 내려간다.** | 예 | 이전 모델 | 새 모델 | |---|---|---| | 같은 글의 토큰 | 100 | 130(+30%) | | 100만 토큰당 단가 | 1.00달러 | 0.10달러 | | 상대 비용 | 100 | 13 | 하이쿠 5.5의 경우 긴 요청 구간까지 섞여 평균 절감이 약 75%다.

AI는 글자를 읽지 않는다. 토크나이저가 잘라 준 조각의 번호를 읽는다. 그래서 같은 질문도 모델을 바꾸면 요금이 달라진다. 2026년 10월 7일 앤트로픽이 클로드 하이쿠 5.5를 내놓으며 토큰 단가를 90% 내렸지만, 스스로 밝힌 평균 절감폭은 75%였다. 새 토크나이저가 같은 글을 약 30% 더 많은 토큰으로 자르기 때문이다(「클로드 하이쿠 5.5 가격」). 토큰이 무엇인지는 「AI 토큰이란」에서 다뤘다. 이 글은 그 토큰을 만드는 장치, 토크나이저를 설명한다.

1. 토크나이저는 무엇을 하나

언어모델은 숫자만 다룬다. 그래서 글을 넣기 전에 문장을 미리 정해 둔 '조각 사전'의 항목으로 자르고, 각 조각에 번호를 매긴다. 이 일을 하는 것이 토크나이저다. 모델이 답을 낼 때는 거꾸로 번호를 다시 글로 되돌린다.

단계하는 일설명
사전 만들기대량의 글에서 자주 함께 나오는 글자 조합을 모아 사전 구성모델 학습 전에 한 번
자르기(인코딩)입력 문장을 사전 조각으로 분할"unbelievable" → "un" + "believ" + "able"(예시)
번호 매기기조각마다 사전 번호 부여모델은 이 번호 열을 읽는다
되돌리기(디코딩)모델이 낸 번호를 글로 복원답변 출력

왜 글자 하나하나나 단어 통째로 자르지 않을까. 글자 단위면 문장이 너무 길어져 계산이 비싸지고, 단어 단위면 사전이 끝없이 커지고 처음 보는 단어를 처리하지 못한다. 그 중간인 '하위 단어(subword)' 단위가 표준이 됐다.

2. 사전은 어떻게 만드나 — BPE

가장 널리 쓰이는 방식은 바이트 쌍 인코딩(BPE)이다. 2016년 센리히 등이 기계번역에 도입했고, GPT 계열을 비롯한 대부분의 언어모델이 변형을 쓴다.

단계BPE가 하는 일
① 시작모든 글을 가장 작은 단위(글자 또는 바이트)로 쪼갠다
② 세기나란히 붙은 두 조각 중 가장 자주 나오는 쌍을 찾는다
③ 합치기그 쌍을 새 조각 하나로 사전에 추가한다
④ 반복사전이 목표 크기(예: 10만, 20만 개)가 될 때까지 ②~③ 반복

결과적으로 학습 데이터에 자주 나온 말일수록 한 조각으로 묶인다. 영어의 "the", "ing" 같은 조각은 일찍 합쳐지고, 드문 말은 잘게 쪼개진 채 남는다. 구글의 센텐스피스(SentencePiece)처럼 띄어쓰기 없이 원문을 그대로 다루는 도구도 쓰인다.

토크나이저(예)사전 크기쓰인 모델
GPT-2 바이트 BPE약 5만GPT-2
cl100k_base약 10만GPT-3.5·GPT-4
o200k_base약 20만GPT-4o 이후
센텐스피스3만2천(라마 2 기준)라마 2 등

사전이 다르면 같은 문장도 다르게 잘린다. 사전이 크면 한 조각에 더 많은 글이 들어가 토큰 수가 줄지만, 모델이 기억해야 할 항목이 늘어난다. 회사마다 이 균형을 다르게 잡는다.

3. 토크나이저가 바뀌면 무엇이 바뀌나 — 요금, 한도, 언어

영향내용실제 사례
요금API는 토큰 수로 과금. 토큰이 늘면 단가 인하 효과가 줄어든다하이쿠 5.5: 단가 −90%, 평균 비용 −75%
컨텍스트 한도"100만 토큰"이 담는 글의 양이 모델마다 다르다같은 책도 토큰이 30% 많으면 한도에 더 빨리 찬다
언어별 비용학습 데이터 비중이 작은 언어는 잘게 쪼개져 토큰이 더 든다GPT-4o: 한국어 예문 토큰 72개 → 41개
비교의 함정모델 간 "100만 토큰당 가격"을 그대로 비교하면 틀릴 수 있다토큰 수가 다르면 같은 일의 비용이 다르다

계산으로 보면 이렇다. 같은 글이 이전 모델에서 100토큰, 새 모델에서 130토큰이라고 하자. 단가가 1달러에서 0.10달러로 내렸다면 비용은 100에서 13으로 87% 줄어든다. 90%가 아니다. 앤트로픽은 하이쿠 5.5에서 여기에 10만 토큰을 넘는 요청의 5배 요금까지 섞여 평균 약 75%가 된다고 설명했다.

한국어는 오랫동안 이 구조의 손해를 봤다. 영어 중심 데이터로 만든 사전에는 한국어 단어가 통째로 들어간 경우가 적어, 한 단어가 음절이나 바이트 단위로 쪼개지곤 했다. 오픈AI는 2024년 GPT-4o를 내놓으며 사전을 약 20만 개로 늘렸고, 예시 한국어 문장의 토큰이 72개에서 41개로 1.7배 줄었다고 밝혔다. 같은 일을 한국어로 시키면 더 비싸던 구조가 줄었지만, 사라지지는 않았다.

토크나이저를 아예 없애려는 연구도 있다. 모델이 바이트를 직접 읽게 하면 언어 간 차이와 철자 오류에 강해지지만, 문장이 길어져 계산이 늘어난다. 2026년 10월에는 기존 하위 단어 모델을 바이트 단위로 바꾸는 '바이트화' 기법이 네이처에 실렸다는 보도가 나왔다.

4. 자주 묻는 질문

질문답
내 글이 몇 토큰인지 어떻게 아나오픈AI는 tiktoken 라이브러리와 웹 계산기를, 앤트로픽은 토큰 계산 API를 제공한다. 모델마다 따로 재야 한다
띄어쓰기·줄바꿈도 토큰인가그렇다. 공백·줄바꿈·특수문자도 조각으로 잘려 토큰을 차지한다
이모지는여러 바이트로 이뤄져 1개가 여러 토큰이 되는 경우가 많다
토크나이저를 바꾸면 모델 성능도 바뀌나그렇다. 사전이 바뀌면 모델을 처음부터 다시 학습해야 해서, 보통 새 세대 모델과 함께 바뀐다
토큰 수가 많으면 답이 더 좋은가아니다. 토큰 수는 글을 자르는 방식일 뿐 품질과 무관하다

5. 남은 것과 확인되지 않은 것

  • 하이쿠 5.5의 한국어 토큰 수: 새 토크나이저가 한국어를 얼마나 더 또는 덜 쪼개는지는 공개되지 않았다. 30%는 영어 위주 측정이다. 한국어 서비스라면 자기 데이터로 이전·새 모델의 토큰 수를 직접 재는 것이 가장 정확하다.
  • 회사별 수치 차이: 하이쿠 5.5의 증가율은 30%(DataCamp)와 25%(36Kr)로 측정마다 다르다.
  • 바이트화 연구: 네이처 논문 보도는 요약 매체로만 확인했다.
  • 관련 글: 토큰 가격의 기본 구조는 「AI 토큰 가격이란」, 긴 입력의 한계는 「컨텍스트 윈도우란」에 있다.

출처

  1. Sennrich et al. — Neural Machine Translation of Rare Words with Subword Units (ACL 2016)
  2. OpenAI — tiktoken (GitHub)
  3. OpenAI — Hello GPT-4o (language tokenization)
  4. OpenAI Help — What are tokens and how to count them?
  5. Hugging Face — Summary of the tokenizers
  6. DataCamp — Claude Haiku 5.5: Features, Benchmarks, and Pricing
  7. 36Kr — Claude Haiku 5.5 Cuts Prices to Rock-Bottom Levels

검증

발행
최종 수정
교차 확인
서로 다른 출처 7건을 대조했다.
미검증
  • 하이쿠 5.5 새 토크나이저의 토큰 증가율은 약 30%(DataCamp)와 약 25%(36Kr)로 갈리며, 한국어 기준 수치는 공개되지 않았다.
  • GPT-4o의 한국어 토큰 1.7배 감소(72→41)는 오픈AI가 예시 문장 하나로 측정한 수치다. 글 종류에 따라 달라진다.
  • 토큰화 없이 바이트를 직접 읽게 바꾸는 '바이트화(byteification)' 연구(사전학습 예산의 1% 미만, 약 490억 토큰)는 해외 요약 매체로만 확인했다.
  • 본문의 토큰 분할 예시(un / believ / able 등)와 번호는 설명용이며 특정 모델의 실제 결과가 아니다.
작성
발행 전 사람이 검수했다. 수집·교차확인·재작성 절차는 편집 원칙.

하루 열 건, 아침에 한 번

3줄 요약만 보내고 전문은 사이트에서 읽습니다. 하단에서 한 번의 클릭으로 언제든 해지할 수 있습니다.

관련