ASAPAGI Soon As Possible · 다가올 AGI를 가장 깊게 읽습니다
Article

딥시크 V4-Flash 정식판 공개: 자사 상위 모델 V4-Pro 프리뷰를 9개 벤치마크 전부에서 앞섰고 오푸스 4.8에는 평균 5.7점 뒤졌다

2026-08-01 · 8분 읽기

딥시크는 2026년 7월 31일 에이전트 능력을 대폭 강화한 DeepSeek-V4-Flash-0731을 MIT 라이선스로 허깅페이스에 공개했다. 공식 모델 카드가 함께 실은 9개 벤치마크 표에서 이 모델은 상위 등급인 DeepSeek-V4-Pro 프리뷰를 9개 항목 전부에서 앞섰고, 평균 격차는 20.3점포인트다(ASAP이 카드 표에서 산출). 같은 표에 나란히 놓인 클로드 오푸스 4.8과 비교하면 9개 항목 모두에서 뒤지며 평균 격차는 5.7점포인트다. API 가격은 100만 토큰 기준 입력 캐시 미적중 0.14달러, 출력 0.28달러로 공식 문서에 적혀 있다. ASAP은 모델 카드와 API 문서를 1차 출처로 이 공개가 실제로 바꾸는 것과 바꾸지 않는 것을 구분한다.

하위 등급이 상위 등급을 9개 항목 전부에서 앞섰다

DeepSeek-V4-Flash-0731의 가장 뚜렷한 결과는 같은 회사의 상위 등급 모델을 전 항목에서 앞섰다는 점이다. 모델 카드의 9개 벤치마크에서 Flash-0731과 V4-Pro 프리뷰를 항목별로 비교하면 Terminal Bench 2.1이 82.7점 대 72.1점, NL2Repo가 54.2점 대 38.5점, 사이버짐이 76.7점 대 52.7점, DeepSWE가 54.4점 대 12.8점, Toolathlon-Verified가 70.3점 대 55.9점이다. 나머지 4개 항목도 같은 방향이며 9개 평균 격차는 20.3점포인트다. 딥시크는 카드 본문에서 활성 파라미터 수가 훨씬 적은데도 V4-Pro 프리뷰를 앞선다고 직접 밝혔다.

전 세대와의 격차는 더 크다. 같은 표에서 Flash 프리뷰와 비교하면 9개 평균이 25.6점포인트 올랐고, 가장 큰 폭은 DeepSWE의 7.3점에서 54.4점으로 7.5배 상승이다. 사이버짐도 38.7점에서 76.7점으로 두 배 가까이 올랐다. 상승폭이 가장 작은 항목은 Agents' Last Exam의 9.4점포인트인데, 이 항목은 절대 점수 자체가 25.2점으로 표에서 가장 낮은 축에 속한다.

주의할 것은 비교 대상의 성격이다. V4-Pro는 카드 표 기준으로 프리뷰 판본이며, 딥시크 API 문서는 정식 V4-Pro에 대한 Responses API 지원을 2026년 8월 초에 추가하겠다고 적고 있다. 즉 이 표는 정식 Flash와 프리뷰 Pro를 견주고 있다. 등급 역전이 확정되려면 정식 Pro가 나온 뒤 같은 표를 다시 그려야 한다.

오푸스 4.8과의 격차는 0.5점포인트에서 15.5점포인트까지 벌어진다

Flash-0731과 클로드 오푸스 4.8의 격차는 단일한 값이 아니라 0.5점포인트에서 15.5점포인트까지 벌어지는 분포다. 딥시크가 카드에 함께 실은 오푸스 4.8 수치를 기준으로 항목별 차이를 계산하면 Agents' Last Exam이 25.2점 대 25.7점으로 0.5점포인트, AutomationBench Public이 25.1점 대 27.2점으로 2.1점포인트, Terminal Bench 2.1이 82.7점 대 85.0점으로 2.3점포인트다. 반대편 끝에는 NL2Repo의 54.2점 대 69.7점(15.5점포인트)과 DSBench-Hard의 59.6점 대 71.7점(12.1점포인트)이 있다.

이 분포의 모양이 실무 판단의 핵심이다. 격차가 좁은 항목은 도구를 순서대로 호출하며 정해진 절차를 밟는 유형의 과제이고, 격차가 넓은 항목은 자연어 요구사항에서 저장소 단위 코드를 만들어내는 NL2Repo와 난이도 높은 코딩 에이전트 문제인 DSBench-Hard다. 즉 이 모델이 따라잡은 영역은 실행이고, 아직 벌어져 있는 영역은 큰 단위의 설계와 어려운 문제 해결이다.

이 구분은 도입 결정을 두 갈래로 나눈다. 정형화된 도구 호출과 터미널 조작이 대부분인 파이프라인이라면 이 표는 Flash-0731을 상위 모델의 대체재로 놓을 근거가 된다. 반대로 요구사항에서 코드베이스를 만들어내는 작업이 중심이라면 15.5점포인트라는 격차는 가격으로 상쇄되지 않는다. 하나의 모델을 전면 교체하는 대신 과제 유형별로 라우팅하는 구성이 이 표에서 도출되는 결론이다.

GLM-5.2와의 비교도 함께 봐야 한다. 카드에서 두 모델을 비교할 수 있는 항목은 사이버짐을 제외한 8개이고, Flash-0731은 8개 전부에서 앞서며 평균 6.4점포인트 우위다. 가장 큰 차이는 AutomationBench Public의 25.1점 대 12.9점이고 가장 작은 차이는 Agents' Last Exam의 1.4점포인트다. 오픈웨이트 진영 안에서의 순위 다툼이 이미 소수점 단위가 아니라 항목별 성격 차이로 갈리는 단계에 들어섰다는 뜻이다.

캐시 적중가가 미적중가의 50분의 1이라는 가격 구조

딥시크 API 문서에 적힌 deepseek-v4-flash의 가격은 100만 토큰당 입력 캐시 적중 0.0028달러, 입력 캐시 미적중 0.14달러, 출력 0.28달러다. 같은 문서의 deepseek-v4-pro는 각각 0.003625달러, 0.435달러, 0.87달러로 Flash의 정확히 3.1배다. 캐시 적중가와 미적중가의 비율은 50배이며, 이는 같은 접두 문맥을 반복해서 넣는 사용 패턴과 한 번만 쓰는 패턴 사이에 50배의 비용 차이가 난다는 뜻이다.

이 구조가 중요한 이유는 컨텍스트 길이와 맞물리기 때문이다. 문서에 명시된 컨텍스트는 100만 토큰이고 최대 출력은 384K 토큰이다. 100만 토큰짜리 문맥을 캐시 미적중으로 매번 새로 넣으면 호출 한 번의 입력 비용만 0.14달러지만, 같은 문맥을 캐시로 재사용하면 0.0028달러가 된다. 긴 문서나 대형 코드베이스를 고정 문맥으로 두고 질의만 바꾸는 에이전트 설계에서 이 차이는 운영비의 자릿수를 바꾼다. 반대로 매 호출마다 문맥이 통째로 달라지는 설계라면 표시 가격이 그대로 청구액이 된다.

가격표에서 함께 읽어야 할 조건이 하나 더 있다. 딥시크 API 문서는 곧 피크와 오프피크 가격제를 도입해 베이징 시간 기준 오전 9시부터 12시, 오후 2시부터 6시 구간에 가격이 두 배가 된다고 예고했다. 한국 시간은 베이징보다 한 시간 빠르므로 이 구간은 국내 기준 오전 10시부터 오후 1시, 오후 3시부터 7시에 해당한다. 국내 업무 시간과 정확히 겹치는 시간대이며, 사내 업무용 에이전트를 이 API로 돌리는 조직은 표시 가격이 아니라 두 배 가격을 기준으로 예산을 잡아야 한다는 뜻이다. 배치 작업을 야간으로 옮길 수 있는지가 실제 단가를 가른다.

카드에서 확인되는 구조와 확인되지 않는 수치

Flash-0731의 공개 설정 파일에서 확인되는 구조는 43개 층, 은닉 차원 4,096, 라우팅 전문가 256개와 공유 전문가 1개, 토큰당 활성 전문가 6개다. 최대 위치 임베딩은 1,048,576으로 API 문서의 100만 토큰 컨텍스트와 일치하고, 가중치는 FP8 E4M3 형식으로 배포되며 어휘 크기는 129,280이다. 모델 카드는 이 모델이 DeepSeek-V4-Flash-DSpark와 동일한 구조이며 추측 디코딩(speculative decoding) 모듈이 붙어 있다고 적었다.

반대로 카드에서 확인되지 않는 것이 총 파라미터와 활성 파라미터의 정확한 수치다. 딥시크는 활성 파라미터가 V4-Pro보다 훨씬 적다고만 서술했을 뿐 숫자를 적지 않았다. 제3자 평가 기관 아티피셜 애널리시스는 이 모델을 총 2,840억 개, 활성 130억 개로 집계했으나 이는 공식 카드의 서술이 아니므로 인용할 때 출처를 구분해야 한다. 같은 기관은 자체 지능 지수에서 이 모델에 50점을 부여했고 이전 판본 대비 10점 상승이라고 밝혔다.

운영 조건도 카드에 구체적으로 적혀 있다. 추론 노력 수준은 low, high, max의 세 단계이며, high와 max에서는 최대 출력 길이를 384K 토큰으로 두기를 권장한다. vLLM에서는 dspark 방식의 추측 디코딩을 플래그 하나로 켜고 추측 토큰 수는 7이 예시로 제시됐으며, 카드가 든 서빙 예시는 GB300 4장 한 노드 구성이다. 이 모델은 Jinja 형식 채팅 템플릿을 포함하지 않으며 별도 인코딩 스크립트로 메시지를 문자열로 변환해야 한다.

이 표를 그대로 인용하기 어렵게 만드는 조건 세 가지

첫째 조건은 자체 보고라는 점이다. 표의 9개 항목은 모두 딥시크가 자사 카드에 실은 수치이며, 비교 대상인 GLM-5.2와 오푸스 4.8의 점수도 딥시크가 측정한 값이다. 경쟁 모델의 점수를 공개하는 쪽이 직접 측정하는 구조에서는 설정 선택이 결과에 미치는 영향을 외부에서 검증할 수 없다.

둘째 조건은 벤치마크의 성격이다. 9개 중 DSBench-FullStack과 DSBench-Hard의 2개는 카드 각주가 밝히듯 딥시크 내부 시험 세트다. 외부 연구자가 접근할 수 없는 평가에서 나온 점수가 전체의 22%를 차지하며, 두 항목 모두 오푸스 4.8과의 격차가 큰 축에 속한다. 공개 벤치마크만으로 표를 다시 그리면 결론의 강도가 달라질 수 있다.

셋째 조건은 평가 설정이다. 카드는 코드 에이전트 과제를 딥시크 하네스의 최소 모드로 평가했다고 밝히면서 이 하네스가 아직 공개되지 않았다고 적었다(to be released). 평가에 쓰인 도구가 공개되지 않은 상태에서는 제3자가 같은 조건을 재현할 수 없다. 여기에 평가가 max 추론 노력 수준에서 이뤄졌다는 점도 함께 봐야 한다. 추론 노력을 최대로 올리면 출력 토큰이 늘어나므로, 표의 점수는 가장 비싼 설정에서 나온 값이고 저비용 설정의 성능은 이 표에 없다. 0.28달러라는 출력 단가와 표의 점수를 곧바로 곱해 비용 대비 성능을 계산하면 실제보다 낙관적인 값이 나온다.

MIT 라이선스와 100만 토큰 컨텍스트가 국내 조직에 여는 것

이번 공개에서 국내 조직에 실질적인 조건은 MIT 라이선스다. 가중치와 저장소가 MIT로 배포되므로 상업적 이용과 파생 모델 배포, 재배포에 별도 협의가 필요 없다. 아파치 2.0보다도 조건이 단순해 특허 조항이나 고지 의무를 검토할 부담이 적다. 데이터를 외부로 내보낼 수 없는 금융과 공공, 의료 영역에서 자체 구축형 에이전트를 검토할 때 라이선스가 걸림돌이 되지 않는다는 뜻이다.

다만 자체 구축의 문턱은 라이선스가 아니라 하드웨어다. 카드가 든 서빙 예시는 GB300 4장으로 구성된 한 노드이며, FP8 가중치와 100만 토큰 컨텍스트를 감당하려면 KV 캐시까지 포함한 메모리 설계가 필요하다. 국내에서 이 구성을 갖춘 조직은 소수이므로, 대다수에게 현실적인 선택지는 API 이용이거나 파생된 소형 모델을 기다리는 쪽이다. 여기서 다시 앞의 가격 조건이 개입한다. API를 쓰면 피크 시간대 두 배 가격과 데이터 국외 전송이라는 두 가지 문제가 함께 따라오고, 자체 구축을 하면 이 두 문제는 사라지지만 하드웨어 비용이 남는다.

100만 토큰 컨텍스트는 이 선택을 다시 흔드는 변수다. 사내 규정집과 계약서 묶음, 대형 저장소 전체를 한 번에 문맥으로 올리는 방식은 검색 증강 구조를 설계하고 유지하는 비용을 줄인다. 캐시 적중가가 미적중가의 50분의 1이라는 조건과 결합하면 고정 문맥을 캐시에 올려두고 질의만 바꾸는 구성이 경제적으로 성립한다. 국내 조직이 이 모델에서 먼저 시험해볼 지점은 벤치마크 순위가 아니라 이 구성이 자사 문서 규모에서 실제로 작동하는지다.

다음 확인 지점

이 공개에 대한 판정은 세 가지 지표에서 확정된다. 첫째는 제3자 재현이다. MIT 라이선스 오픈웨이트이므로 외부 연구자가 9개 표 중 공개 벤치마크 7개를 다시 그릴 수 있고, 딥시크 하네스가 공개되면 나머지 조건도 맞출 수 있다. 자체 보고와 독립 평가가 얼마나 벌어지는지가 이 표 전체의 신뢰도를 결정한다.

둘째는 정식 V4-Pro다. 딥시크 API 문서는 V4-Pro에 대한 Responses API 지원을 2026년 8월 초에 추가한다고 예고했다. 하위 등급이 상위 등급을 앞서는 현재의 표가 정식 Pro 공개 이후에도 유지되는지, 아니면 등급 구분이 다시 정리되는지가 딥시크 제품군의 구조를 결정한다. 가격이 3.1배 차이 나는 두 등급의 성능 관계가 지금은 역전돼 있는 상태다.

셋째는 피크 가격제의 실제 시행이다. 예고된 두 배 인상 구간이 국내 업무 시간과 겹치므로, 시행 시점과 적용 범위가 국내 도입 비용의 실제 값을 정한다. 표시 가격 0.14달러와 0.28달러는 오프피크 기준이라는 점을 전제로 비교표를 만들어야 왜곡이 생기지 않는다.

출처: 딥시크 공식 모델 카드 deepseek-ai/DeepSeek-V4-Flash-0731(허깅페이스, MIT 라이선스, 2026년 7월 31일)과 딥시크 API 공식 문서 가격표, 아티피셜 애널리시스 지능 지수 기반 ASAP 정리

ASAP — AGI Soon As Possible

AI·테크 이슈,
가장 깊게

단순 소식을 넘어, 맥락과 구조까지 파고듭니다

AGI Soon As Possible · asapai.co.kr

← 전체 글 보기