MoE(전문가 혼합)란 — 1250억 파라미터 AI가 게임용 GPU 한 장에서 도는 이유
Mixture of experts (MoE) is a way of building an AI model out of many smaller sub-networks, called experts, and a router that sends each token to only a few of them. The model can hold a very large total number of parameters while using only a small active share for each token, so it is cheaper to run than a dense model of the same size. Mixtral 8x7B used 2 of 8 experts per token, DeepSeek-V3 activated about 37 billion of 671 billion parameters, and most frontier open-weight models now use MoE. The trade-off is memory: every expert must be stored somewhere. In October 2026 the open-source Strata engine ran a 125-billion-parameter MoE model on a 12GB consumer GPU by keeping frequently used experts on the GPU and the rest in system RAM.
MoE(Mixture of Experts·전문가 혼합)는 AI 모델을 여러 개의 작은 하위 신경망('전문가')과 이들 중 몇 개만 골라 쓰는 '라우터'로 만드는 구조다. 글자 조각(토큰) 하나를 처리할 때 전체 매개변수 중 일부만 켜지므로, 같은 크기의 일반(밀집) 모델보다 계산이 훨씬 적다. 미스트랄의 믹스트랄 8x7B는 전문가 8개 중 2개를, 딥시크-V3는 6,710억 개 매개변수 중 약 370억 개만 토큰마다 썼다. 대가는 메모리다 — 쓰지 않는 전문가도 어딘가에 저장해야 한다. 2026년 10월 오픈소스 엔진 스트라타는 자주 쓰는 전문가만 GPU에, 나머지는 PC 메모리에 두는 방식으로 1,250억 매개변수 MoE 모델을 12GB 게임용 GPU 한 장에서 돌렸다
3줄 요약
- 구조 — 작은 '전문가' 여럿 + 토큰마다 몇 개만 고르는 라우터. 전체는 크게, 계산은 작게
- 실례 — 믹스트랄 8개 중 2개, 딥시크-V3 6,710억 중 370억만 사용. 최상위 공개 모델 대부분이 MoE
- 대가와 응용 — 계산은 줄지만 메모리는 그대로. 스트라타는 전문가를 GPU·RAM·SSD에 나눠 125B를 12GB GPU에서 실행
핵심 질문
- MoE란
- **모델 안에 '전문가' 여럿을 두고 토큰마다 몇 개만 골라 쓰는 AI 구조다.** | 구성 | 역할 | |---|---| | 전문가(expert) | 작은 신경망. 모델 안에 수 개~수만 개 | | 라우터(게이트) | 토큰마다 어느 전문가를 쓸지 고름 | | 활성 매개변수 | 토큰 하나에 실제로 계산되는 몫 | | 전체 매개변수 | 저장된 모든 전문가의 합 | 전문가가 '수학 담당·언어 담당'처럼 사람이 정한 분야를 맡는 것은 아니다. 학습 과정에서 라우터가 알아서 나눈다.
- MoE 밀집 모델 차이
- **같은 크기라면 MoE가 계산은 적고 메모리는 같다.** | 항목 | 밀집(dense) 모델 | MoE 모델 | |---|---|---| | 토큰당 계산 | 전체 매개변수 | 고른 전문가만 | | 속도·비용 | 크기에 비례 | 활성 몫에 비례 | | 메모리 | 전체 | **전체** (쉬는 전문가도 저장) | | 학습 | 상대적으로 안정 | 전문가 쏠림 관리 필요 | 그래서 MoE는 '서버 비용'을 줄이지만 '메모리 용량'은 줄이지 못한다.
- MoE 모델 예시
- **최근 최상위 공개 모델 대부분이 MoE다.** | 모델 | 전체 매개변수 | 토큰당 활성 | |---|---|---| | 믹스트랄 8x7B (2023년 12월) | 약 467억 | 약 129억 (8개 중 2개) | | 딥시크-V3 (2024년 12월) | 6,710억 | 약 370억 | | 큐웬3.8-플래시-넥스트 (2026) | 1,250억 | 전문가 24,576개 중 10개 | 활성 비율이 낮을수록 같은 크기에서 더 싸게 돌릴 수 있다.
AI 모델의 '크기'와 '실행 비용'을 떼어 놓은 설계가 MoE다. 1,250억 개 매개변수를 가진 모델이 게임용 그래픽카드 한 장에서 돈다는 소식이 2026년 10월 개발자들 사이에 퍼졌다. 오픈소스 추론 엔진 '스트라타'가 MoE 구조의 큐웬3.8-플래시-넥스트를 12GB GPU와 32GB 메모리 PC에서 실행한 것이다. 이게 가능한 이유가 MoE의 원리 그 자체다.
1. MoE란 — 모두가 일하지 않는 모델
일반 AI 모델(밀집 모델)은 글자 조각(토큰) 하나를 처리할 때 모든 매개변수를 계산한다. 700억 매개변수 모델이면 매 토큰 700억 번 가까운 곱셈·덧셈 묶음이 돈다.
MoE는 모델을 여러 '전문가(expert)'로 쪼개고, 앞에 라우터를 둔다. 라우터는 토큰마다 "이번엔 이 전문가 두 명"처럼 몇 개만 고른다. 나머지 전문가는 그 토큰에서 쉰다.
| 비유로 보면 | 밀집 모델 | MoE 모델 |
|---|---|---|
| 회사 | 직원 100명이 모든 안건 회의에 참석 | 안건마다 담당자 2~8명만 회의 |
| 회사 규모(지식) | 100명 | 100명 |
| 회의 비용(계산) | 100명분 | 몇 명분 |
| 사무실 크기(메모리) | 100명분 | 여전히 100명분 |
아이디어 자체는 오래됐다. 1991년 제프리 힌턴 등이 '지역 전문가의 적응형 혼합'을 제안했고, 2017년 구글 연구진(노엄 샤지어 등)이 이를 대형 신경망에 붙여 '드문드문 켜지는(sparse) MoE 층'을 만들었다. 대중적으로 알려진 것은 2023년 12월 미스트랄의 믹스트랄 8x7B가 나오면서다.
2. 숫자로 보는 MoE — 전체와 활성의 차이
| 모델 | 공개 | 전체 매개변수 | 토큰당 활성 | 활성 비율 |
|---|---|---|---|---|
| 믹스트랄 8x7B | 2023년 12월 | 약 467억 | 약 129억 (전문가 8개 중 2개) | 약 28% |
| 딥시크-V3 | 2024년 12월 | 6,710억 | 약 370억 | 약 5.5% |
| 큐웬3.8-플래시-넥스트 | 2026년 | 1,250억 | 전문가 24,576개 중 10개 | 매우 낮음 |
활성 비율이 낮아질수록 같은 '지식 크기'를 훨씬 싸게 돌린다. 딥시크가 낮은 가격으로 미국 모델과 경쟁할 수 있었던 핵심도 이 구조다. 최근 미중 최상위 모델의 성능 격차가 3%까지 좁혀졌다는 블룸버그 집계에서도, 중국 쪽 선두는 효율을 앞세운 모델이었다(「딥시크 V4.1 플래시 라이브벤치 81.1점」). 큰 모델이 작은 모델을 가르치는 증류와 함께, MoE는 AI 값을 끌어내리는 두 축이다(「모델 증류란」).
| 장점 | 단점 |
|---|---|
| 같은 크기 대비 계산·전력 적음 | 쉬는 전문가도 메모리에 올려야 함 |
| 지식(매개변수)을 크게 키우기 쉬움 | 라우터가 일부 전문가에게 쏠리면 성능 저하 |
| 서버 비용 → API 가격 인하 | 여러 GPU에 나눌 때 통신 비용 |
3. 스트라타는 무엇을 했나 — 전문가를 주방과 창고에 나눴다
MoE의 약점은 메모리다. 1,250억 매개변수를 GPU 메모리에 다 올리려면 보통 데이터센터용 GPU 여러 장이 필요하다. 스트라타는 여기서 MoE의 성질을 거꾸로 이용했다. 어차피 토큰마다 일부 전문가만 쓰니, 자주 쓰는 전문가만 GPU에 두면 된다.
| 위치 | 두는 것 | 속도 |
|---|---|---|
| GPU 메모리(12GB) | 자주 불리는 '뜨거운' 전문가 | 가장 빠름 |
| PC 메모리(32GB) | 전문가 24,576개 전부 | 중간 |
| SSD | 조회용 표 | 느림 |
| 작은 초안 모델 | 다음 토큰 미리 추측 → 큰 모델이 한꺼번에 검증 | 처리량 1.6~1.8배(개발자 주장) |
개발자들은 이를 "늘 쓰는 건 조리대에, 나머지는 찬장에"라고 설명했다. MIT 라이선스로 공개됐고, 엔비디아·AMD의 12GB 이상 그래픽카드를 지원하며, 오픈AI·앤트로픽 호환 API를 PC 안에서 열어 준다. 보도된 속도는 초당 60~140토큰으로 측정 조건마다 다르다.
이것이 의미하는 바는 인터넷 없이 내 PC에서 도는 AI의 문턱이 또 낮아졌다는 것이다(「온디바이스 AI란」). 다만 데이터센터 모델과 같은 품질을 보장한다는 뜻은 아니다.
4. 남은 것과 확인되지 않은 것
- 스트라타의 속도 수치는 측정 조건이 공개되지 않아 범위로만 적었다.
- 큐웬3.8-플래시-넥스트의 토큰당 활성 매개변수 총량은 확인하지 못했다.
- 오픈AI·앤트로픽·구글의 비공개 최상위 모델이 MoE인지는 공식 발표가 없다. 공개 모델의 MoE 구조는 「오픈소스 AI 모델이란」에서도 다뤘다.
출처
- Shazeer et al. — Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer (2017)
- Mistral AI — Mixtral of Experts
- DeepSeek-AI — DeepSeek-V3 Technical Report
- Startup Fortune — Strata lets a 125 billion parameter model run on a gaming GPU
- AI Weekly — Strata Runs 125B Qwen3.8-Flash-Next on a 12GB Gaming GPU