AGI Soon As Possible
Article

Grok 4.6 평가표를 한 줄씩 뜯어보면: 코딩은 앞서고 터미널 작업은 26%에 그쳤다

2026-08-13 · 8분 읽기

SpaceXAI는 2026년 8월 12일 Grok 4.6을 공개하면서 아홉 개 벤치마크를 합성한 Artificial Analysis Intelligence Index에서 61점으로 GPT-5.6 Sol과 동률을 기록했다고 밝혔다. 가격은 100만 토큰당 입력 2달러 출력 6달러이고 빠른 변형은 두 배이며, Cursor와 Grok Build와 API에서 발표 당일부터 쓸 수 있다. 그런데 같은 발표문의 평가표를 한 줄씩 내려가 보면 CursorBench v3.2는 69.9%로 GPT-5.6 Sol Max의 67.2%를 앞서는 반면 Terminal-Bench v3.0은 26%로 GPT-5.6 Sol Max의 34.6%에 크게 못 미친다. ASAP은 SpaceXAI 공식 발표문을 1차 출처로 이 모델이 어느 항목에서 이기고 어느 항목에서 지는지를 나눠 정리한다.

표를 한 줄씩 보면 우열이 벤치마크마다 갈린다

SpaceXAI가 공개한 평가표는 열 개 항목에서 Grok 4.6 High를 Grok 4.5 High, GPT-5.6 Sol Max, Fable 5 Max와 나란히 놓았고 승패는 항목마다 갈린다. 세대 간 개선폭과 경쟁 모델 대비 위치를 따로 읽어야 표가 제대로 보인다.

세대 간 비교에서는 열 개 항목 전부가 올랐다. Artificial Analysis Intelligence Index는 56에서 61로, GDPVal-AA v2는 1526에서 1753으로, CursorBench v3.2는 66.7%에서 69.9%로 상승했다. 폭이 가장 큰 항목은 DeepSWE v1.1로 54%에서 65.9%로 11.9%포인트 올랐고, Terminal-Bench v3.0도 15.7%에서 26%로 10.3%포인트 뛰었다. AA-Briefcase는 1313에서 1577로, APEX-Agents는 47.1%에서 57.5%로 올랐다.

경쟁 모델과의 비교로 넘어가면 그림이 달라진다. GPT-5.6 Sol Max와 Fable 5 Max를 모두 제친 항목은 세 개로, GDPVal-AA v2(1753 대 1728 대 1741), AA-Briefcase(1577 대 1502 대 1574), Harvey LAB(15.8% 대 2.5% 대 11.3%)이다. CursorBench v3.2는 69.9%로 GPT-5.6 Sol Max의 67.2%는 앞서지만 Fable 5 Max의 70.5%에는 0.6%포인트 못 미치고, Artificial Analysis Intelligence Index는 61로 GPT-5.6 Sol Max와 같으나 Fable 5 Max의 62보다 한 점 낮다.

반대로 뒤진 항목도 분명하다. DeepSWE v1.1은 65.9%로 GPT-5.6 Sol Max의 73%와 Fable 5 Max의 70%에 모두 뒤졌고, Terminal-Bench v3.0은 26%로 34.6%와 34.1%에 큰 폭으로 밀렸다. FrontierCode v1.1 확장판은 61.3%로 GPT-5.6 Sol Max의 60.6%보다는 높지만 Fable 5 Max의 63.6%보다 낮고, APEX-Agents는 57.5%로 Fable 5 Max의 59.2%에 못 미친다. APEX-SWE는 56.4%로 Fable 5 Max의 58.8%보다 낮으며 GPT-5.6 Sol Max 칸은 비어 있다.

Grok 4.5가 Grok 4.6의 교사 역할을 했다

SpaceXAI는 Grok 4.5로 SFT 궤적을 다시 생성해 Grok 4.6의 지도학습 단계에 썼다고 발표문에 적었다. 이전 세대가 다음 세대의 학습 데이터를 만드는 구조다.

발표문이 밝힌 순서는 세 단계다. 먼저 Grok 4.5보다 긴 보충 훈련을 돌렸고, 여기에는 추론과 고급 기술 개념을 위해 선별한 모델 생성 데이터, 고품질 엔지니어링 데이터, 개선된 옵티마이저와 훈련 레시피가 들어갔다. 그다음 Grok 4.5를 써서 추론 강도와 에이전트 하네스와 도메인을 가로질러 SFT 궤적을 재생성했고, 문제가 있는 궤적은 모델 기반 검사로 걸러냈다. 마지막으로 지식 노동, 일반 코딩, 커널 최적화와 웹 개발과 컴퓨터 지원 설계 같은 도메인별 환경을 포함한 광범위한 에이전트 RL 과제로 훈련했다.

발표문은 긴 작업 구간에서 관찰된 행동 변화도 함께 적었다. 모델이 다음 단계로 넘어가기 전에 자기 작업을 점검하는 자체 테스트와 검증이 이전보다 자주 나타났다는 서술이다. 시각적이고 상호작용적인 프로젝트에서는 구체적인 제품 아이디어를 받으면 한 번의 패스로 애플리케이션의 구조와 시각 언어를 세울 수 있었다고 밝혔다.

'롱러닝 에이전트'를 앞세운 모델이 터미널 벤치마크에서 26%에 그친 대목을 어떻게 읽을까

Terminal-Bench v3.0 점수 26%는 이 발표에서 가장 설명이 필요한 숫자이며, 발표문이 내세운 장기 실행 에이전트라는 목표와 정면으로 어긋나 보인다. 다만 이 어긋남은 벤치마크가 재는 대상을 나눠 보면 다르게 읽힌다.

발표문이 강조한 강점은 "넓은 제품 아이디어를 작동하는 첫 버전으로 바꾸는 일"이다. 낯선 도메인을 조사하고 애플리케이션을 구조화하고 핵심 상호작용을 구현한 뒤 피드백을 거치며 다듬는 흐름이다. 이 작업의 성패는 결과물이 사람이 보기에 그럴듯한가에 달려 있고, CursorBench와 AA-Briefcase와 Harvey LAB처럼 Grok 4.6이 앞선 항목들은 대체로 생성물의 품질을 평가하는 쪽에 가깝다.

반면 Terminal-Bench와 DeepSWE는 성격이 다르다. 환경이 정한 조건을 만족했는가를 기계가 판정하는 종류의 과제이며, 중간에 한 단계라도 어긋나면 최종 판정이 실패로 떨어진다. Grok 4.6이 크게 뒤진 두 항목이 모두 이 계열이라는 점은 우연으로 보기 어렵다. 첫 패스에서 좋은 결과물을 내는 능력과 정해진 검증을 끝까지 통과시키는 능력이 같은 축에 있지 않다는 뜻이다.

세대 개선폭을 함께 보면 방향은 맞다. Terminal-Bench는 15.7%에서 26%로 10.3%포인트 올랐고 이는 비율로 따지면 표에서 가장 큰 개선 축에 든다. 그러나 26%라는 절대 수준은 네 번 중 세 번은 완주하지 못한다는 뜻이기도 하다. 사람이 결과를 보고 다음 지시를 주는 대화형 사용에서는 이 격차가 잘 드러나지 않지만, 사람 없이 끝까지 돌려야 하는 자동화 파이프라인에서는 그대로 실패율이 된다.

표에서 굵게 표시되지 않은 칸이 더 많다는 사실

SpaceXAI 발표문은 평가별 최고 점수를 굵게 표시했다고 밝혔고, 열 개 항목 가운데 Grok 4.6이 최고인 칸은 세 개다. 발표문이 앞세운 한 문장과 표 전체가 말하는 바가 같지 않다.

발표문의 요약 문장은 "여러 에이전트 코딩과 지식 노동 벤치마크에서 프런티어 지능을 달성했다"와 "아홉 개 벤치마크 합성 점수인 Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 동률"이다. 두 문장 모두 사실이다. 다만 동률의 상대는 GPT-5.6 Sol이고, 같은 지수에서 Fable 5 Max는 62로 한 점 높다. 요약 문장이 고른 비교 대상이 표에서 1위인 모델은 아니다.

이 구조는 모델 발표문을 읽을 때 반복해서 확인해야 할 지점을 보여준다. 합성 지수는 아홉 개 벤치마크를 하나로 압축한 값이므로 항목별 편차를 지운다. Grok 4.6처럼 어떤 계열에서는 앞서고 어떤 계열에서는 크게 뒤지는 프로파일은 합성 지수 한 줄로 요약될 때 실제 사용 경험과 가장 멀어진다. 국내 요약 보도가 이 발표를 코딩과 터미널 성능 모두에서 앞섰다는 취지로 전한 사례가 있었지만, 발표문 자신의 표에서 Terminal-Bench v3.0은 26% 대 34.6%로 뒤진 항목이다.

평가 조건에 붙은 단서도 함께 봐야 한다. 발표문은 제3자 모델 점수가 자체 보고치나 공개된 결과 중 최고값이라고 밝혔다. 최고값을 채택했다는 것은 경쟁 모델에 유리한 조건을 적용했다는 뜻이므로 이 표에서 경쟁사 점수가 부풀려졌다고 보기는 어렵다. 다만 자사 모델의 High 설정이 무엇을 뜻하는지는 발표문에 정의돼 있지 않다.

100만 토큰당 입력 2달러라는 가격표가 놓인 자리

Grok 4.6의 가격은 100만 토큰당 입력 2달러 출력 6달러이고 빠른 변형은 그 두 배이며, 이 숫자는 성능표와 함께 읽어야 의미가 생긴다. 성능이 항목별로 갈리는 모델에서 가격은 선택을 가르는 실질 변수다.

가격 구조에서 눈에 띄는 것은 입력과 출력의 배율이 3배라는 점이다. 입력이 길고 출력이 짧은 작업, 즉 큰 코드베이스나 문서 묶음을 읽고 짧은 판단을 내놓는 작업에서 상대적으로 유리한 형태다. 반대로 긴 코드를 계속 생성하는 작업에서는 출력 단가가 비용을 지배한다. 발표문이 자랑한 "한 번의 패스로 애플리케이션 구조를 세우는" 사용법은 출력이 많은 쪽에 가깝다.

빠른 변형이 두 배 가격이라는 설정도 이 모델의 용도와 맞물린다. 장기 실행 에이전트는 단계가 많아 지연이 누적되므로 속도에 값을 매길 여지가 크다. 다만 Terminal-Bench 26%가 말하는 완주율을 감안하면, 실패한 실행에도 토큰 비용은 그대로 발생한다는 점을 예산에 반영해야 한다. 자동화 비용은 성공한 실행의 단가가 아니라 성공할 때까지의 총 단가로 계산된다.

첫 주 동안 Grok Build와 Cursor에서 포함 사용량을 두 배로 제공한다는 조건은 도입 검토 일정과 직결된다. 무료로 늘어나는 사용량이 있는 기간에 자사 과제로 시험해 보라는 신호이며, 이 기간이 지난 뒤의 실사용 비용은 별도로 추정해야 한다.

국내 팀이 Grok 4.6 도입을 검토한다면

국내 개발팀이 이 모델을 검토할 때 먼저 정해야 할 것은 대화형 사용인지 무인 자동화인지이며, 평가표가 두 용도에서 다른 답을 준다. 표를 그대로 옮기지 말고 자사 과제 유형에 대응하는 항목만 골라 보는 편이 낫다.

사람이 결과를 보고 다음 지시를 주는 방식이라면 CursorBench 69.9%와 AA-Briefcase 1577이 관련도가 높다. 초안의 완성도와 시각적 결과물의 품질이 곧 체감 성능이 되는 사용법이다. 반대로 CI에 붙여 사람 개입 없이 돌리는 방식이라면 Terminal-Bench 26%와 DeepSWE 65.9%가 기준선에 가깝고, 이 숫자대로라면 재시도 정책과 실패 처리 설계가 모델 선택보다 먼저 필요하다.

법률과 문서 계열 업무를 다루는 조직에는 Harvey LAB 15.8%라는 수치가 다르게 읽힌다. 절대값은 낮지만 GPT-5.6 Sol Max의 2.5%와 Fable 5 Max의 11.3%에 견주면 표에서 격차가 가장 큰 항목이다. 다만 이 벤치마크는 영어권 법률 업무를 대상으로 하므로 한국어 법률 문서에 그대로 옮겨 적용할 근거는 발표문에 없다. 국내 도입 판단에는 자체 과제 세트로 다시 재는 절차가 빠질 수 없다.

접근 경로는 넓은 편이다. Cursor와 Grok Build와 API에 더해 OpenRouter, Vercel, Cloudflare 같은 파트너를 통해서도 쓸 수 있다고 발표문은 밝혔다. 이미 이들 경로를 쓰는 팀이라면 별도 계약 없이 비교 실험을 붙여 볼 수 있다.

남는 질문: 컨텍스트 길이와 평가 설정

발표문에 없는 가장 큰 항목은 컨텍스트 길이이며, 장기 실행 에이전트를 앞세운 모델에서 이 값이 빠진 것은 그 자체로 의미가 있다. 단계가 많은 작업일수록 누적된 맥락을 어디까지 들고 갈 수 있는지가 성능을 좌우하는데, 공개된 발표문은 이 수치를 적지 않았다.

평가 설정도 열려 있다. 표의 모든 자사 점수는 Grok 4.6 High와 Grok 4.5 High로 표기됐지만 High가 어떤 추론 강도나 시간 예산을 뜻하는지는 정의돼 있지 않다. 훈련 설명에 추론 강도를 가로지르는 SFT 궤적 재생성이 언급된 것으로 보아 강도 설정이 여러 단계인 것으로 읽히지만, 표의 High가 그중 어디인지, 그리고 그 설정이 가격표의 어느 변형에 해당하는지는 발표문에서 확인되지 않는다.

세 번째 공백은 안전성 평가의 내용이다. 발표문은 사전 배포 테스트 스위트가 역대 가장 넓었고 배포 후 테스트와 제3자 테스트도 폭넓게 했다고 밝혔지만, 어떤 평가를 어떤 기준으로 통과했는지에 대한 수치나 항목은 제시하지 않았다. 취약점 패치와 엔지니어링 설계 주기 가속과 AI 연구 보조 같은 영역에서 유용하면서도 안전하도록 조정했다는 서술이 있을 뿐이다. 능력 확장을 근거로 안전장치를 함께 조정했다는 설명은 방향을 알려주지만 검증 가능한 형태는 아니다.

출처: SpaceXAI 공식 발표문 "Introducing Grok 4.6"(2026년 8월 12일) 기반 ASAP 정리

ASAP — AGI Soon As Possible

AI·테크 이슈,
가장 깊게

단순 소식을 넘어, 맥락과 구조까지 파고듭니다

AGI Soon As Possible · asapai.co.kr

← 전체 글 보기