딥시크 V4.1 플래시 라이브벤치 81.1점 — 미중 AI 격차 3%, 코딩은 오히려 앞섰다
DeepSeek V4.1 Flash, released in September 2026, scored 81.1 on the LiveBench leaderboard against 83.4 for Anthropic's Claude Fable 5.1, a 2.3-point gap that Bloomberg Intelligence calls the smallest yet between the top US and Chinese models. The gap was about 15% early in 2026 and about 9% in May. On LiveBench's agentic coding category DeepSeek scored 77.3 against Claude's 66.1. Analyst Robert Lea links the catch-up to efficiency work and domestic hardware, but only three of the top 15 LiveBench entries are Chinese and he expects China's AI industry to stay unprofitable until 2030.
중국 딥시크가 2026년 9월 내놓은 V4.1 플래시가 AI 성능 순위표 라이브벤치에서 81.1점을 받았다. 미국 최상위인 앤트로픽 클로드 페이블 5.1(83.4점)과 2.3점, 약 3% 차이다. 블룸버그 인텔리전스는 이것이 지금까지 집계한 미중 최상위 모델 격차 중 가장 작다고 밝혔다. 격차는 2026년 초 약 15%, 5월 약 9%였다. 에이전트 코딩 항목에서는 딥시크가 77.3점으로 클로드(66.1점)를 앞섰다. 다만 라이브벤치 상위 15개 중 중국 모델은 3개뿐이어서, 추격은 맨 앞 몇 개 모델에 몰려 있다
3줄 요약
- 점수 — 라이브벤치 딥시크 V4.1 플래시 81.1, 클로드 페이블 5.1 83.4. 차이 2.3점(약 3%)
- 추세 — 미중 최상위 격차 2026년 초 15% → 5월 9% → 10월 3%. 에이전트 코딩은 딥시크 77.3 대 66.1로 역전
- 한계 — 상위 15개 중 중국 3개뿐. 블룸버그는 중국 AI 산업이 2030년까지 적자일 수 있다고 전망
핵심 질문
- 딥시크 V4.1 플래시 성능
- **라이브벤치 종합 81.1점으로, 미국 1위 모델과 2.3점 차이다.** | 모델 | 종합 | 에이전트 코딩 | |---|---|---| | 클로드 페이블 5.1 (최대 추론) | **83.4** | 66.1 | | 딥시크 V4.1 플래시 (최대 추론) | 81.1 | **77.3** | | 차이 | 2.3점 (약 3%) | 딥시크 11.2점 앞섬 | 10월 4일 기준 라이브벤치 순위표 수치다.
- 미중 AI 격차
- **블룸버그 인텔리전스 집계로 2026년 들어 15%에서 3%로 줄었다.** | 시점 | 미중 최상위 모델 격차 | |---|---| | 2026년 초 | 약 15% | | 2026년 5월 | 약 9% | | 2026년 10월 | **약 3%** (역대 최소) | 분석을 맡은 로버트 리 선임 애널리스트는 중국 연구소의 효율 개선과 자국 하드웨어 최적화를 원인으로 꼽았다.
- 라이브벤치란
- **문제를 계속 새로 바꿔 '답을 외운 모델'을 걸러내려는 AI 성능 시험이다.** | 특징 | 내용 | |---|---| | 문제 출처 | 최근 수학 대회·논문·뉴스 등에서 새로 만듦 | | 갱신 | 주기적으로 문제 교체 | | 채점 | 정답이 정해진 문제를 자동 채점 | | 목적 | 학습 데이터 오염(문제 유출) 줄이기 | 같은 모델도 시험마다 점수가 크게 다르다(「코딩 벤치마크란」).
미국과 중국 최상위 AI 모델의 거리가 한 걸음까지 좁혀졌다. 블룸버그 인텔리전스에 따르면 딥시크가 9월에 내놓은 V4.1 플래시는 AI 성능 순위표 라이브벤치에서 81.1점을 받아, 미국 1위인 앤트로픽 클로드 페이블 5.1(83.4점)과 2.3점 차이로 붙었다. 블룸버그가 집계한 미중 최상위 모델 격차 가운데 가장 작다.
1. 무엇이 달라졌나 — 아홉 달 만에 15%에서 3%로
블룸버그 인텔리전스 로버트 리 선임 애널리스트의 집계를 시간순으로 놓으면 추격 속도가 보인다.
| 시점 | 미중 최상위 격차 | 비고 |
|---|---|---|
| 2026년 초 | 약 15% | — |
| 2026년 5월 | 약 9% | — |
| 2026년 9월 | — | 딥시크 V4.1 플래시 출시 |
| 2026년 10월 4일 | 약 3% | 81.1 대 83.4 |
항목별로 보면 더 극적이다. 에이전트 코딩에서 딥시크는 77.3점으로 클로드(66.1점)보다 11점 넘게 앞섰다. AI가 스스로 코드를 고치고 실행하며 과제를 끝내는 능력이다. 미국 회사들이 가장 공을 들이는 분야에서 중국 모델이 앞선 셈이다.
이름에 '플래시'가 붙은 것도 눈여겨볼 대목이다. 딥시크가 공개한 논문 제목은 'KV 캐시 압축의 한계 밀어붙이기'다. 대화를 기억하는 데 쓰는 메모리(KV 캐시)를 줄이고 매개변수 일부만 쓰는 방식으로, 큰 모델이 아니라 빠르고 가벼운 모델로 격차를 좁혔다.
2. 왜 좁혀졌나 — 효율과 자국 칩
리 애널리스트는 두 가지를 원인으로 꼽았다. 중국 연구소들의 기술 개선, 그리고 미국산 GPU 대신 자국 하드웨어에 맞춘 최적화다. 그는 이것이 미국 칩 수출통제의 효과에 의문을 던진다고 했다(「AI 반도체 수출통제란」).
같은 흐름은 사용량에서도 이미 보였다. 9월 말 AI 모델 중개소 오픈라우터에서 중국 모델 점유율이 57~67%까지 올라갔다(「중국 AI 모델 점유율 57~67%」). 그때의 이유가 '가격'이었다면, 이번 수치는 '성능'에서도 거의 따라붙었다는 신호다.
3. 과장하지 말아야 할 것
| 신호 | 해석 |
|---|---|
| 상위 15개 중 중국 모델 3개 | 추격이 맨 앞 몇 모델에 몰려 있다 |
| 벤치마크 점수 | 국가 AI 경쟁력 자체를 증명하지는 않는다 |
| 기업 업무 | 오픈라우터 같은 집계는 대기업 사용량을 덜 잡는다 — 대기업에선 미국 모델이 여전히 우세 |
| 수익성 | 리 애널리스트는 중국 AI 산업이 2030년까지 적자일 수 있다고 전망 — 1,100개 넘는 대형 언어모델이 가격 경쟁 중 |
즉 '중국이 따라잡았다'보다는 '최상위 한두 모델의 시험 점수가 거의 같아졌다'가 정확한 표현이다.
4. 남은 것과 확인되지 않은 것
- 다른 순위표(LMArena 등)에서도 격차가 같은 폭인지는 확인하지 못했다.
- 오픈AI가 9월 29일 내놓은 GPT-6.1 솔의 라이브벤치 점수는 확인하지 못했다(「GPT-6.1 솔 가격」 기사 참조).
- 한국 기업이 딥시크 모델을 쓸 때의 데이터 정책 문제는 이번 수치와 별개로 남아 있다.