본문으로 건너뛰기
TEN Brief 하루 열 건, 확인된 것만 2026.10.06 EN

This article is also available in English →

테크 · 3분 · 에버그린

MoE(전문가 혼합)란 — 1250억 파라미터 AI가 게임용 GPU 한 장에서 도는 이유

Mixture of experts (MoE) is a way of building an AI model out of many smaller sub-networks, called experts, and a router that sends each token to only a few of them. The model can hold a very large total number of parameters while using only a small active share for each token, so it is cheaper to run than a dense model of the same size. Mixtral 8x7B used 2 of 8 experts per token, DeepSeek-V3 activated about 37 billion of 671 billion parameters, and most frontier open-weight models now use MoE. The trade-off is memory: every expert must be stored somewhere. In October 2026 the open-source Strata engine ran a 125-billion-parameter MoE model on a 12GB consumer GPU by keeping frequently used experts on the GPU and the rest in system RAM.

MoE(Mixture of Experts·전문가 혼합)는 AI 모델을 여러 개의 작은 하위 신경망('전문가')과 이들 중 몇 개만 골라 쓰는 '라우터'로 만드는 구조다. 글자 조각(토큰) 하나를 처리할 때 전체 매개변수 중 일부만 켜지므로, 같은 크기의 일반(밀집) 모델보다 계산이 훨씬 적다. 미스트랄의 믹스트랄 8x7B는 전문가 8개 중 2개를, 딥시크-V3는 6,710억 개 매개변수 중 약 370억 개만 토큰마다 썼다. 대가는 메모리다 — 쓰지 않는 전문가도 어딘가에 저장해야 한다. 2026년 10월 오픈소스 엔진 스트라타는 자주 쓰는 전문가만 GPU에, 나머지는 PC 메모리에 두는 방식으로 1,250억 매개변수 MoE 모델을 12GB 게임용 GPU 한 장에서 돌렸다

작업대가 여럿 놓인 밝은 공방에서 두 곳에만 햇살이 비치고 장인이 일하는 모습

3줄 요약

  • 구조 — 작은 '전문가' 여럿 + 토큰마다 몇 개만 고르는 라우터. 전체는 크게, 계산은 작게
  • 실례 — 믹스트랄 8개 중 2개, 딥시크-V3 6,710억 중 370억만 사용. 최상위 공개 모델 대부분이 MoE
  • 대가와 응용 — 계산은 줄지만 메모리는 그대로. 스트라타는 전문가를 GPU·RAM·SSD에 나눠 125B를 12GB GPU에서 실행

핵심 질문

MoE란
**모델 안에 '전문가' 여럿을 두고 토큰마다 몇 개만 골라 쓰는 AI 구조다.** | 구성 | 역할 | |---|---| | 전문가(expert) | 작은 신경망. 모델 안에 수 개~수만 개 | | 라우터(게이트) | 토큰마다 어느 전문가를 쓸지 고름 | | 활성 매개변수 | 토큰 하나에 실제로 계산되는 몫 | | 전체 매개변수 | 저장된 모든 전문가의 합 | 전문가가 '수학 담당·언어 담당'처럼 사람이 정한 분야를 맡는 것은 아니다. 학습 과정에서 라우터가 알아서 나눈다.
MoE 밀집 모델 차이
**같은 크기라면 MoE가 계산은 적고 메모리는 같다.** | 항목 | 밀집(dense) 모델 | MoE 모델 | |---|---|---| | 토큰당 계산 | 전체 매개변수 | 고른 전문가만 | | 속도·비용 | 크기에 비례 | 활성 몫에 비례 | | 메모리 | 전체 | **전체** (쉬는 전문가도 저장) | | 학습 | 상대적으로 안정 | 전문가 쏠림 관리 필요 | 그래서 MoE는 '서버 비용'을 줄이지만 '메모리 용량'은 줄이지 못한다.
MoE 모델 예시
**최근 최상위 공개 모델 대부분이 MoE다.** | 모델 | 전체 매개변수 | 토큰당 활성 | |---|---|---| | 믹스트랄 8x7B (2023년 12월) | 약 467억 | 약 129억 (8개 중 2개) | | 딥시크-V3 (2024년 12월) | 6,710억 | 약 370억 | | 큐웬3.8-플래시-넥스트 (2026) | 1,250억 | 전문가 24,576개 중 10개 | 활성 비율이 낮을수록 같은 크기에서 더 싸게 돌릴 수 있다.

AI 모델의 '크기'와 '실행 비용'을 떼어 놓은 설계가 MoE다. 1,250억 개 매개변수를 가진 모델이 게임용 그래픽카드 한 장에서 돈다는 소식이 2026년 10월 개발자들 사이에 퍼졌다. 오픈소스 추론 엔진 '스트라타'가 MoE 구조의 큐웬3.8-플래시-넥스트를 12GB GPU와 32GB 메모리 PC에서 실행한 것이다. 이게 가능한 이유가 MoE의 원리 그 자체다.

1. MoE란 — 모두가 일하지 않는 모델

일반 AI 모델(밀집 모델)은 글자 조각(토큰) 하나를 처리할 때 모든 매개변수를 계산한다. 700억 매개변수 모델이면 매 토큰 700억 번 가까운 곱셈·덧셈 묶음이 돈다.

MoE는 모델을 여러 '전문가(expert)'로 쪼개고, 앞에 라우터를 둔다. 라우터는 토큰마다 "이번엔 이 전문가 두 명"처럼 몇 개만 고른다. 나머지 전문가는 그 토큰에서 쉰다.

비유로 보면밀집 모델MoE 모델
회사직원 100명이 모든 안건 회의에 참석안건마다 담당자 2~8명만 회의
회사 규모(지식)100명100명
회의 비용(계산)100명분몇 명분
사무실 크기(메모리)100명분여전히 100명분

아이디어 자체는 오래됐다. 1991년 제프리 힌턴 등이 '지역 전문가의 적응형 혼합'을 제안했고, 2017년 구글 연구진(노엄 샤지어 등)이 이를 대형 신경망에 붙여 '드문드문 켜지는(sparse) MoE 층'을 만들었다. 대중적으로 알려진 것은 2023년 12월 미스트랄의 믹스트랄 8x7B가 나오면서다.

2. 숫자로 보는 MoE — 전체와 활성의 차이

모델공개전체 매개변수토큰당 활성활성 비율
믹스트랄 8x7B2023년 12월약 467억약 129억 (전문가 8개 중 2개)약 28%
딥시크-V32024년 12월6,710억약 370억약 5.5%
큐웬3.8-플래시-넥스트2026년1,250억전문가 24,576개 중 10개매우 낮음

활성 비율이 낮아질수록 같은 '지식 크기'를 훨씬 싸게 돌린다. 딥시크가 낮은 가격으로 미국 모델과 경쟁할 수 있었던 핵심도 이 구조다. 최근 미중 최상위 모델의 성능 격차가 3%까지 좁혀졌다는 블룸버그 집계에서도, 중국 쪽 선두는 효율을 앞세운 모델이었다(「딥시크 V4.1 플래시 라이브벤치 81.1점」). 큰 모델이 작은 모델을 가르치는 증류와 함께, MoE는 AI 값을 끌어내리는 두 축이다(「모델 증류란」).

장점단점
같은 크기 대비 계산·전력 적음쉬는 전문가도 메모리에 올려야 함
지식(매개변수)을 크게 키우기 쉬움라우터가 일부 전문가에게 쏠리면 성능 저하
서버 비용 → API 가격 인하여러 GPU에 나눌 때 통신 비용

3. 스트라타는 무엇을 했나 — 전문가를 주방과 창고에 나눴다

MoE의 약점은 메모리다. 1,250억 매개변수를 GPU 메모리에 다 올리려면 보통 데이터센터용 GPU 여러 장이 필요하다. 스트라타는 여기서 MoE의 성질을 거꾸로 이용했다. 어차피 토큰마다 일부 전문가만 쓰니, 자주 쓰는 전문가만 GPU에 두면 된다.

위치두는 것속도
GPU 메모리(12GB)자주 불리는 '뜨거운' 전문가가장 빠름
PC 메모리(32GB)전문가 24,576개 전부중간
SSD조회용 표느림
작은 초안 모델다음 토큰 미리 추측 → 큰 모델이 한꺼번에 검증처리량 1.6~1.8배(개발자 주장)

개발자들은 이를 "늘 쓰는 건 조리대에, 나머지는 찬장에"라고 설명했다. MIT 라이선스로 공개됐고, 엔비디아·AMD의 12GB 이상 그래픽카드를 지원하며, 오픈AI·앤트로픽 호환 API를 PC 안에서 열어 준다. 보도된 속도는 초당 60~140토큰으로 측정 조건마다 다르다.

이것이 의미하는 바는 인터넷 없이 내 PC에서 도는 AI의 문턱이 또 낮아졌다는 것이다(「온디바이스 AI란」). 다만 데이터센터 모델과 같은 품질을 보장한다는 뜻은 아니다.

4. 남은 것과 확인되지 않은 것

  • 스트라타의 속도 수치는 측정 조건이 공개되지 않아 범위로만 적었다.
  • 큐웬3.8-플래시-넥스트의 토큰당 활성 매개변수 총량은 확인하지 못했다.
  • 오픈AI·앤트로픽·구글의 비공개 최상위 모델이 MoE인지는 공식 발표가 없다. 공개 모델의 MoE 구조는 「오픈소스 AI 모델이란」에서도 다뤘다.

출처

  1. Shazeer et al. — Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer (2017)
  2. Mistral AI — Mixtral of Experts
  3. DeepSeek-AI — DeepSeek-V3 Technical Report
  4. Startup Fortune — Strata lets a 125 billion parameter model run on a gaming GPU
  5. AI Weekly — Strata Runs 125B Qwen3.8-Flash-Next on a 12GB Gaming GPU

검증

발행
최종 수정
교차 확인
서로 다른 출처 5건을 대조했다.
미검증
  • 스트라타의 속도는 보도마다 다르다(초당 60~95토큰, RTX 3090에서 100~140토큰). 측정 조건이 공개되지 않아 이 기사는 범위로만 적었다.
  • 큐웬3.8-플래시-넥스트의 토큰당 활성 매개변수 총량은 확인하지 못했다(전문가 24,576개 중 10개 사용만 확인).
  • 오픈AI·앤트로픽·구글의 비공개 최상위 모델이 MoE인지는 공식 발표가 없다.
작성
발행 전 사람이 검수했다. 수집·교차확인·재작성 절차는 편집 원칙.

하루 열 건, 아침에 한 번

3줄 요약만 보내고 전문은 사이트에서 읽습니다. 하단에서 한 번의 클릭으로 언제든 해지할 수 있습니다.

관련