본문으로 건너뛰기
TEN Brief 하루 열 건, 확인된 것만 2026.09.26 EN

This article is also available in English →

테크 · 3분 · 에버그린

모델 증류란 — 큰 AI가 작은 AI를 가르쳐 값을 몇 분의 1로 낮추는 방법

Model distillation, or knowledge distillation, trains a small student model to imitate a large teacher model, learning not only the teacher's final answers but the probabilities it assigns to every alternative. The technique, formalised by Geoffrey Hinton, Oriol Vinyals and Jeff Dean in 2015, is why cheaper models can approach flagship quality: DistilBERT kept about 97 percent of BERT's language understanding while being 40 percent smaller and 60 percent faster. It also sits behind disputes over using a rival's outputs to train a competing model.

모델 증류는 크고 비싼 선생 모델의 답을 작고 싼 학생 모델이 흉내 내도록 학습시키는 기법이다. 학생은 선생의 최종 정답만이 아니라 선생이 각 보기에 매긴 확률 분포까지 배운다. 그래서 정답만 보고 배울 때보다 적은 데이터와 작은 크기로 선생에 가까운 성능을 낸다. 2015년 제프리 힌턴·오리올 비냘스·제프 딘이 논문으로 정리했다. 대표 사례인 디스틸버트는 원본 버트의 언어 이해 성능 약 97%를 유지하면서 크기는 40% 작고 속도는 60% 빨랐다. 상위 모델 성능을 싼 모델로 옮기는 흐름의 바탕이 되는 기법이며, 경쟁사 모델의 출력으로 자기 모델을 학습시키는 문제를 둘러싼 분쟁의 중심에도 있다

햇빛 드는 부엌에서 어른이 아이에게 큰 유리 주전자의 물을 작은 병에 옮겨 담는 법을 보여주는 뒷모습

3줄 요약

  • 정의 — 큰 선생 모델의 출력을 작은 학생 모델이 흉내 내며 배우는 학습법. 정답뿐 아니라 확률 분포까지 배운다
  • 효과 — 디스틸버트는 버트 성능 약 97% 유지, 크기 40%↓, 속도 60%↑. 싼 모델이 비싼 모델을 따라잡는 경로다
  • 분쟁 — 경쟁사 모델 출력으로 학습하면 약관 위반 논란. 2025년 오픈AI가 딥시크를 두고 제기한 문제가 대표적이다

핵심 질문

모델 증류가 무슨 뜻인가
**큰 모델이 선생, 작은 모델이 학생이 되는 학습 방식이다.** 이름은 술을 증류해 핵심만 뽑는 데서 왔다. | 구분 | 일반 학습 | 증류 학습 | |---|---|---| | 배우는 대상 | 사람이 붙인 정답 | **선생 모델의 출력** | | 정답의 모양 | '고양이' 하나 | 고양이 90%, 호랑이 7%, 개 3% | | 학생이 얻는 것 | 무엇이 맞는지 | **무엇이 얼마나 비슷한지까지** | | 필요한 데이터 | 많다 | 상대적으로 적다 | **핵심은 두 번째 줄이다.** 사진을 보고 '고양이'라는 정답만 배우면 호랑이와 개가 똑같이 틀린 답이다. 선생 모델의 확률을 배우면 **'호랑이가 개보다 고양이에 더 가깝다'** 는 정보까지 얻는다. 힌턴은 이것을 **"어두운 지식(dark knowledge)"** 이라고 불렀다.
증류하면 얼마나 작고 싸지나
**대표 사례들의 수치다.** | 사례 | 선생 | 학생 | 결과 | |---|---|---|---| | 디스틸버트(2019) | 버트 | 디스틸버트 | 성능 약 **97%** 유지, 크기 **40%↓**, 속도 **60%↑** | | 딥시크-R1 증류판(2025) | 딥시크-R1 | 큐원·라마 기반 소형 모델 | 추론 능력을 소형 모델로 이전 | | 2026년 9월 가격 경쟁 | 각 사 상위 모델 | 중·경량 모델 | 상위 모델급 성능을 낮은 값에 제공한다는 주장 | **마지막 줄은 주의해서 읽어야 한다.** 앤트로픽은 오퍼스 5.5가 대부분의 작업에서 상위 모델 페이블 5.1과 같은 성능을 낸다고 했고, 오픈AI는 GPT-6 솔·루나를 상위 모델 아스트라에서 갈라져 나온 모델로 소개했다. **두 회사 모두 증류를 썼는지는 밝히지 않았다.** 다만 '상위 모델 성능을 싼 모델로 옮긴다'는 목표 자체가 증류가 풀려는 문제와 같다(「클로드 오퍼스 5.5와 GPT-6 솔 가격」).
증류는 왜 분쟁이 되나
**남의 모델을 선생으로 쓸 수 있기 때문이다.** 증류에는 선생 모델의 내부가 필요 없다. 질문을 던지고 답만 모으면 된다. API로 팔리는 모델은 누구나 질문할 수 있다. | 쟁점 | 내용 | |---|---| | 약관 | 주요 AI 회사들은 자사 모델 출력으로 **경쟁 모델을 학습시키는 것을 약관으로 금지**한다 | | 2025년 1월 | 오픈AI는 딥시크가 자사 모델 출력을 증류에 썼을 가능성을 조사한다고 밝혔다 | | 반론 | 오픈AI 자신도 인터넷의 타인 저작물로 학습했다는 지적 | | 기술적 방어 | 출력 패턴 감시, 대량 질의 계정 차단 | **증류는 싼 모델을 만드는 가장 효율적인 길이자, 가장 베끼기 쉬운 길이다.** 같은 기법이 자기 회사 안에서 쓰이면 비용 절감이고, 경쟁사 모델에 쓰이면 약관 위반 논란이 된다(「AI 학습 데이터 공정이용이란」).
증류한 작은 모델은 무엇이 약한가
**선생이 가르친 범위 밖에서 약하다.** | 약점 | 이유 | |---|---| | 드문 질문 | 선생에게 물어본 적 없는 영역은 배우지 못했다 | | 긴 추론 | 여러 단계를 이어가는 능력은 크기의 영향을 크게 받는다 | | 선생의 오류 | 선생이 틀린 것도 그대로 배운다 | | 안전 성질 | 선생의 거절·안전 행동이 온전히 옮겨지는지 별도 확인 필요 | **그래서 회사들은 용도에 따라 모델을 나눈다.** 대량·단순 작업은 싼 모델, 복잡한 추론은 상위 모델. 2026년 9월 오픈AI가 솔(개발 작업)과 루나(대량 요약)를 나눠 내놓은 것도 이 구분이다. 가격표를 볼 때 **'같은 성능'이 어떤 작업에서의 같음인지**를 확인해야 하는 이유다.

싼 AI 모델이 비싼 모델을 따라잡는 가장 흔한 방법은, 비싼 모델에게 배우는 것이다. 이 학습법을 모델 증류라고 부른다.

1. 정의 — 선생과 학생

모델 증류(knowledge distillation) 는 크고 성능 좋은 선생 모델의 출력을 작고 가벼운 학생 모델이 흉내 내도록 학습시키는 기법이다. 2015년 제프리 힌턴, 오리올 비냘스, 제프 딘이 논문 「신경망의 지식 증류」로 정리했다.

역할특징비용
선생 모델크고 정확하다운영비가 비싸다
학생 모델작고 빠르다운영비가 싸다
증류선생의 판단을 학생에게 옮긴다학습 때 한 번

증류의 비용은 학습할 때 한 번 들고, 이득은 학생 모델을 쓰는 동안 계속 난다.

2. 원리 — 정답이 아니라 확률을 배운다

학습 방식학생이 보는 것얻는 정보
정답 학습'고양이'맞다/틀리다
증류 학습고양이 90% · 호랑이 7% · 개 3%무엇이 무엇과 얼마나 비슷한가

힌턴은 이 확률 속 정보를 "어두운 지식" 이라고 불렀다. 정답 레이블에는 없지만 선생 모델이 이미 알고 있는 것이다. 논문은 온도(temperature) 라는 값으로 확률 분포를 부드럽게 펴서 작은 확률 차이까지 학생이 배우게 했다.

대형 언어 모델에서는 형태가 조금 다르다. 선생에게 질문을 대량으로 던져 답과 추론 과정을 모으고, 그것으로 학생을 학습시키는 방식이 많이 쓰인다.

3. 사례

연도사례결과
2015힌턴 외 논문기법 정립
2019디스틸버트버트 성능 약 97%, 크기 40%↓, 속도 60%↑
2025딥시크-R1 증류판추론 모델의 능력을 큐원·라마 기반 소형 모델로 이전
2026중·경량 모델 가격 경쟁상위 모델급 성능을 낮은 값에 제공한다는 주장(증류 사용 여부 미공개)

2026년 9월 22일의 가격표가 이 흐름 위에 있다. 앤트로픽은 오퍼스 5.5가 상위 모델 페이블 5.1과 대부분 같은 성능을 낸다고 했고, 오픈AI의 솔·루나는 상위 모델 아스트라에서 갈라져 나왔다. 증류를 썼는지는 밝히지 않았지만, 상위 모델의 능력을 싼 모델로 옮긴다는 목표는 같다(「클로드 오퍼스 5.5와 GPT-6 솔 가격」).

4. 분쟁 — 남의 모델을 선생으로

증류에는 선생 모델의 내부 구조가 필요 없다. 질문을 던지고 답만 모으면 된다. 그래서 API로 공개된 모델은 누구의 선생도 될 수 있다.

쟁점내용
약관주요 AI 회사들은 출력으로 경쟁 모델을 학습시키는 것을 금지
2025년 1월오픈AI, 딥시크의 자사 출력 증류 가능성을 조사한다고 밝힘
반론원본 모델도 인터넷의 타인 저작물로 학습했다는 지적
방어 수단대량 질의 탐지, 계정 차단, 출력 패턴 감시

같은 기법이 회사 안에서는 효율, 회사 밖에서는 복제가 된다.

5. 한계

한계설명
범위선생에게 묻지 않은 영역은 배우지 못한다
깊이긴 다단계 추론은 모델 크기의 영향을 크게 받는다
오류 상속선생의 틀린 답도 그대로 배운다
안전선생의 안전 행동이 온전히 옮겨지는지 별도로 시험해야 한다

그래서 '같은 성능'이라는 말을 볼 때는 '어떤 작업에서'를 함께 확인해야 한다.

6. 자주 묻는 것

Q. 증류와 파인튜닝은 같은 것인가? 다르다. 파인튜닝은 이미 있는 모델을 특정 데이터로 추가 학습시키는 것이고, 증류는 다른 모델의 출력을 정답 삼아 학습시키는 것이다. 증류는 파인튜닝의 한 방식으로 구현되기도 한다(「파인튜닝이란」).

Q. 증류 모델은 오픈소스로 많이 나오나? 그렇다. 큰 모델을 개인 컴퓨터에서 돌리기 어렵기 때문에, 공개 모델 진영에서 증류판이 활발히 나온다(「오픈소스 AI 모델이란」·「온디바이스 AI란」).

7. 남은 것과 확인되지 않은 것

  • 2026년 9월 출시된 중·경량 모델의 증류 사용 여부는 공개되지 않았다.
  • 딥시크 증류 의혹의 결론은 이 기사에서 확인하지 않았다.
  • 증류 모델의 안전 성질 이전에 대한 체계적 측정은 다루지 않았다.

출처

  1. arXiv — Hinton, Vinyals, Dean, Distilling the Knowledge in a Neural Network (2015)
  2. arXiv — Sanh et al., DistilBERT, a distilled version of BERT (2019)
  3. arXiv — DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning (2025)
  4. Wikipedia — Knowledge distillation
  5. Fortune — What slowdown? OpenAI, Anthropic release dueling models as AI price wars heat up

검증

발행
최종 수정
교차 확인
서로 다른 출처 5건을 대조했다.
미검증
  • 앤트로픽의 오퍼스 5.5와 오픈AI의 GPT-6 솔·루나가 증류로 만들어졌는지는 두 회사가 밝히지 않았다. 이 기사는 목표의 유사성만 설명한다.
  • 딥시크의 오픈AI 출력 사용 여부는 오픈AI가 조사 중이라고 밝힌 사안이며, 결론은 이 기사에서 확인하지 않았다.
  • 증류 모델의 안전 성질 이전에 관한 체계적 측정 결과는 이 기사에서 다루지 않았다.
작성
발행 전 사람이 검수했다. 수집·교차확인·재작성 절차는 편집 원칙.

하루 열 건, 아침에 한 번

3줄 요약만 보내고 전문은 사이트에서 읽습니다. 하단에서 한 번의 클릭으로 언제든 해지할 수 있습니다.

관련