AGI Soon As Possible
Article

딥시크 V4-Pro 정식 공지가 배포 이틀 뒤 올라왔다: 벤치마크는 확정됐고 캐시 가격은 12배 오른다

2026-08-15 · 7분 읽기

딥시크는 2026년 8월 13일 API 변경 이력에 DeepSeek-V4-Pro 정식판 공지를 올리고 같은 날 허깅페이스에 MIT 라이선스로 가중치를 공개했다. 공지는 Terminal Bench 2.1 87.9점, DeepSWE 62.7점, Cybergym 83.3점을 포함한 열 개 벤치마크 수치를 딥시크 이름으로 확정했고, 동시에 2026년 8월 16일 16시(UTC)부터 피크와 비피크를 나누는 이중 가격제를 도입한다고 밝혔다. 새 가격표에서 deepseek-v4-pro의 캐시 적중 입력 단가는 100만 토큰당 0.003625달러에서 피크 0.044달러로 12.1배 오른다. ASAP은 공식 문서와 허깅페이스 저장소 원본에서 확인되는 수치만으로 이번 공지가 무엇을 확정했고 도입 판단의 어떤 전제를 무너뜨리는지 정리한다.

공지가 채운 빈칸은 릴리스 노트와 가중치와 점수 세 가지다

딥시크 API 변경 이력의 2026년 8월 13일 항목은 DeepSeek-V4-Pro 정식판이 앱과 웹과 API에 모두 배포됐다고 적었다. 호출 방식은 바뀌지 않았고 모델 이름을 deepseek-v4-pro로 지정하면 최신 판본이 호출된다. 같은 항목은 딥시크 API가 OpenAI Responses API 형식을 네이티브로 지원하며 Codex에 맞춰 별도 대응했다고 밝혔고, V4-Pro와 V4-Flash의 사고 모드가 low와 high와 max 세 단계의 사고 강도를 지원한다고 명시했다.

허깅페이스 deepseek-ai/DeepSeek-V4-Pro-0813 저장소는 2026년 8월 13일 3시 5분(UTC)에 생성돼 같은 날 16시 28분에 마지막으로 갱신됐다. 라이선스는 MIT이고 safetensors 파일은 66개, 합계 용량은 892.7기가바이트다. 모델 카드는 기술 보고서로 arXiv 2606.19348을 연결한다.

ASAP이 8월 13일 기사에서 인용을 보류했던 벤치마크 표는 이번 공지로 출처 등급이 바뀌었다. 당시 떠돌던 표의 Terminal Bench 2.1 87.9라는 값은 공식 변경 이력과 모델 카드에 적힌 값과 같다. 비공식 경로로 먼저 유통된 수치가 결과적으로 공식 수치와 일치한 사례이며, 확인 전까지 인용하지 않는다는 원칙과 그 수치가 결국 맞았다는 사실은 서로 충돌하지 않는다.

8월 16일 16시부터 가격표는 통째로 다시 쓰인다

딥시크 가격 문서는 새 요금이 2026년 8월 16일 16시(UTC)부터 적용되며 비피크 단가가 피크 단가의 절반이라고 적었다. 피크 시간대는 UTC 기준 01시부터 04시까지와 06시부터 10시까지이며 나머지 시간은 모두 비피크다. deepseek-v4-pro의 새 단가는 100만 토큰당 캐시 적중 입력이 비피크 0.022달러와 피크 0.044달러, 캐시 미적중 입력이 비피크 0.66달러와 피크 1.32달러, 출력이 비피크 1.98달러와 피크 3.96달러다. deepseek-v4-flash는 각각 0.007달러와 0.014달러, 0.22달러와 0.44달러, 0.66달러와 1.32달러다.

현재 단가와 비교하면 인상 폭은 항목마다 크게 다르다. Pro 기준으로 캐시 미적중 입력은 0.435달러에서 피크 1.32달러로 3.0배, 출력은 0.87달러에서 3.96달러로 4.6배, 캐시 적중 입력은 0.003625달러에서 0.044달러로 12.1배가 된다. 비피크만 놓고 보면 캐시 미적중은 1.5배로 완만하지만 캐시 적중은 6.1배다. Flash도 방향은 같아서 캐시 적중이 피크 기준 5.0배로 가장 크게 오르고 캐시 미적중은 3.1배에 그친다.

가장 크게 오르는 항목이 캐시 적중 입력이라는 사실

ASAP은 8월 13일 기사에서 인상 예고에 대한 방어 설계로 캐시 적중 비율을 높이는 구성을 제시했다. 실제로 공개된 표는 그 진단을 뒤집는다. 인상 배수가 가장 큰 항목이 바로 캐시 적중 입력이기 때문이다. 고정 문맥을 앞에 두고 질의만 바꾸는 구성은 인상 충격을 흡수하는 대신 12.1배라는 최대 배수를 정면으로 맞는다.

구조를 보면 이유가 드러난다. Pro 안에서 캐시 미적중가를 적중가로 나눈 값은 현재 120배지만 새 표에서는 30배로 줄어든다. 피크와 비피크 어느 쪽에서 계산해도 30배로 같다. 캐시 재사용의 할인 폭이 4분의 1로 좁아진 것이다. Flash에서도 이 비율은 50배에서 31.4배로 줄어든다. 캐싱은 여전히 30배 저렴한 선택이지만, 캐싱 하나로 청구액을 눌러 두던 여지는 확연히 줄었다.

등급 간 배수도 정돈됐다. 현재 표에서 Pro는 Flash 대비 캐시 미적중과 출력에서 3.1배지만 캐시 적중에서는 1.3배에 그쳐, 상위 등급을 캐시 위주로 쓰면 사실상 하위 등급 가격에 상위 모델을 쓰는 구간이 있었다. 새 표에서는 세 항목 모두 3.0배에서 3.14배로 수렴한다. 딥시크가 이번 개편에서 실제로 없앤 것은 등급 간 가격 역전 구간이며, 그 구간을 활용하던 설계가 가장 큰 인상을 맞는다.

피크 시간대는 한국 업무시간과 그대로 겹친다

UTC로 표기된 피크 시간대를 한국 표준시로 옮기면 01시부터 04시는 10시부터 13시, 06시부터 10시는 15시부터 19시가 된다. 하루 7시간의 피크가 한국 근무일의 오전 후반과 오후 대부분을 덮는다. 중국 표준시로는 09시부터 12시와 14시부터 18시로 중국 업무시간과 정확히 맞물린다. 시간대 설계의 기준이 본토 트래픽이고, 한국 이용자는 그 기준을 시차 없이 그대로 물려받는 위치에 있다.

비피크로 남는 한국 시간은 19시부터 다음 날 10시까지의 15시간과 13시부터 15시까지의 2시간이다. 사람이 화면 앞에서 기다리는 대화형 호출은 대부분 피크에 들어가고, 야간 배치와 정기 색인과 대량 평가처럼 시각을 옮길 수 있는 작업은 전부 절반 가격 구간으로 뺄 수 있다. 인상 이후 실효 단가를 결정하는 변수는 모델 선택보다 작업 스케줄 배치 쪽으로 넘어간다. 자정에 도는 배치를 오전 11시로 옮기는 사소한 운영 결정이 그 작업의 청구액을 두 배로 만든다.

점수 도약은 새 사전학습이 아니라 사후학습과 하네스에서 나왔다

모델 카드는 정식판이 DeepSeek-V4-Pro 프리뷰의 모델 구조 위에 DSpark 추측 디코딩 모듈을 붙여 만들어졌다고 적었다. 구조가 같다는 전제에서 프리뷰 대비 점수 변화를 보면 상승분이 어디에 몰렸는지 분명해진다. DeepSWE는 12.8점에서 62.7점으로 49.9점 올랐고 Cybergym은 52.7점에서 83.3점, NL2Repo는 38.5점에서 61.5점, Terminal Bench 2.1은 72.1점에서 87.9점이 됐다. 반면 도구 없이 푸는 HLE는 37.7점에서 42.7점으로 5.0점 오르는 데 그쳤다.

에이전트 과제에서 다섯 배 가까이 뛴 점수와 지식 과제에서 5점 오른 점수의 격차가 이번 판본의 성격을 말한다. 모델이 새로 알게 된 것은 거의 없고, 도구를 부르고 결과를 읽고 다음 수를 정하는 절차를 훈련한 결과가 대부분이라는 뜻이다. 모델 카드 주석은 코드 에이전트 과제를 DeepSeek Harness의 minimal 모드를 에이전트 프레임워크로 삼아 max 사고 강도와 temperature 1.0, top_p 0.95 조건에서 평가했다고 명시한다.

그 하네스는 같은 날 공개됐다. 깃허브 deepseek-ai/deepseek-harness 저장소는 2026년 8월 13일 11시 56분(UTC)에 생성됐고 MIT 라이선스이며 2026년 8월 15일 기준 별 9만 5천여 개를 받았다. 7월 31일 V4-Flash 공지가 같은 하네스를 두고 곧 공개 예정이라고 적었던 것과 비교하면, 딥시크는 모델과 실행 환경을 같은 날 함께 여는 쪽으로 순서를 맞췄다. 점수의 상당 부분이 하네스와 짝을 이룰 때 나오는 값이므로, 다른 에이전트 프레임워크에 올린 재현치는 이 표와 다르게 나올 여지가 남는다.

893기가바이트와 4×GB300이 공개 가중치의 실제 문턱이다

MIT 라이선스는 재배포와 상업적 이용을 막지 않는다. 문턱은 라이선스가 아니라 물량이다. 허깅페이스 텐서 인덱스가 집계한 파라미터 총수는 1조 6,505억 개이고 파일 용량은 892.7기가바이트다. 두 값을 나누면 파라미터당 평균 0.54바이트로, 가중치 대부분이 8비트 미만 저정밀로 저장돼 이미 한 번 압축된 상태로 배포된다는 뜻이다. 그럼에도 내려받아야 할 실물은 893기가바이트다.

모델 카드가 제시한 vLLM 예시 명령은 GB300 4장으로 구성된 단일 노드에서 서빙하는 구성이며 KV 캐시를 fp8로, 블록 크기를 256으로 두고 DSpark 추측 디코딩을 켠다. SGLang에서도 별도 초안 모델 경로를 지정하지 않고 같은 체크포인트에서 초안 가중치를 함께 쓴다. 자체 호스팅을 검토하는 조직이 실제로 마주하는 숫자는 벤치마크 점수가 아니라 이 하드웨어 사양이다.

이번 판본에는 Jinja 형식 채팅 템플릿이 들어 있지 않다. 대신 encoding 폴더에 OpenAI 호환 메시지를 모델 입력 문자열로 바꾸고 출력 문자열을 다시 파싱하는 파이썬 스크립트와 테스트 케이스가 들어 있다. 표준 템플릿을 읽어 자동 처리하던 도구 사슬은 이 모델에서 한 단계를 직접 구현해야 한다. 공개 가중치를 실제 서비스에 붙이는 비용에는 이런 통합 작업이 포함된다.

공식 표에서도 1위 자리는 비어 있지 않다

모델 카드의 비교표는 정식판이 모든 항목에서 앞선다고 주장하지 않는다. Kimi K3는 Terminal Bench 2.1에서 88.3점으로 87.9점을 앞서고 DeepSWE 67.5점, Toolathlon-Verified 76.5점, Agents' Last Exam 27.6점에서도 위에 있다. Opus-4.8은 NL2Repo 69.7점, DSBench-Hard 71.7점, 도구 없는 HLE 49.8점에서 앞선다. 대체 경로를 쓴 Fable-5는 여러 항목에서 표의 최고값을 가져간다. 정식판이 표에서 선두인 항목은 Cybergym 83.3점과 AutomationBench 31.8점이다.

표의 모든 숫자는 딥시크가 자사 하네스로 직접 돌린 값이며 제3자 검증치가 아니다. 경쟁 모델 값을 어떤 조건에서 측정했는지도 카드에 상세히 적혀 있지 않다. 정식판의 위치를 정확히 말하면, 공개 가중치 모델로서 폐쇄형 최상위권과 같은 표에 오를 수준이며 몇몇 항목에서 앞서지만 종합 1위는 아니다.

여기에 가격 개편이 겹치면 남는 질문이 분명해진다. 딥시크 계열의 도입 논거는 오랫동안 성능 대비 가격이었고, 8월 16일 이후 Pro의 피크 출력 단가는 100만 토큰당 3.96달러로 지금의 4.6배가 된다. 성능이 최상위권 근처까지 올라온 대가로 가격 우위의 폭이 줄어드는 교환이며, 이 교환이 유리한지는 각자의 트래픽이 피크와 비피크 중 어디에 몰려 있는지와 캐시 재사용 비중이 얼마나 되는지에 따라 정반대로 갈린다. 8월 16일 이후의 실제 청구서가 나오기 전까지 이 질문에 일반해는 없다.

출처: 딥시크 API 변경 이력 2026년 8월 13일 항목, 딥시크 API 모델 및 가격 문서, 허깅페이스 deepseek-ai/DeepSeek-V4-Pro-0813 모델 카드와 저장소 메타데이터, 깃허브 deepseek-ai/deepseek-harness 저장소

ASAP — AGI Soon As Possible

AI·테크 이슈,
가장 깊게

단순 소식을 넘어, 맥락과 구조까지 파고듭니다

AGI Soon As Possible · asapai.co.kr

← 전체 글 보기