xAI 그록 4.7이 터미널벤치 4.0을 20.3%에서 38.0%로 끌어올렸다: 더 큰 기반 모델과 더 긴 강화학습
xAI는 2026년 9월 21일 그록 4.7(Grok 4.7)을 공개하면서 터미널벤치 4.0(Terminal-Bench 4.0) 점수가 전작 그록 4.6의 20.3%에서 38.0%로 올랐다고 밝혔다. 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이고, 출력 속도를 두 배로 올린 패스트 변형은 가격도 두 배다. xAI는 이번 모델이 그록 4.6보다 큰 새 기반 모델을 쓰고 더 어려운 과제 조합으로 더 긴 강화학습을 돌린 결과라고 설명했다. ASAP은 xAI가 공개한 벤치마크 표를 그대로 옮긴 뒤, 이 숫자들이 말하는 것과 말하지 않는 것을 갈라 읽는다.
일곱 개 벤치마크 가운데 셋에서 1위를 가져갔다
xAI가 공개한 비교표는 그록 4.7을 그록 4.6, GPT-5.6 솔(GPT-5.6 Sol), 페이블 5.1(Fable 5.1)과 나란히 놓은 일곱 행으로 구성된다. 커서벤치 4.0에서 그록 4.7은 46.3%로 그록 4.6의 40.4%와 GPT-5.6 솔의 41.7%를 앞섰지만 페이블 5.1의 51.8%에는 미치지 못했다. 딥SWE v1.1은 71.0%인데 이 점수에는 별표가 붙어 있고, xAI는 이를 "높은 연산 노력(high effort)" 조건에서 얻은 값으로 표기했다. 같은 행에서 그록 4.6은 65.2%, GPT-5.6 솔은 72.7%, 페이블 5.1은 70.0%다.
그록 4.7이 표에서 1위를 차지한 항목은 세 개다. EE벤치(EEBench)에서 64.0%로 그록 4.6의 53.0%, GPT-5.6 솔의 39.4%, 페이블 5.1의 56.4%를 모두 앞섰다. AA 브리프케이스 v1.1은 1,657점으로 그록 4.6의 1,546점과 GPT-5.6 솔의 1,487점보다 높지만 페이블 5.1의 1,678점에는 못 미쳤다. 하비 법률 에이전트 벤치마크(Harvey Legal Agent Benchmark)에서는 19.6%를 기록해 그록 4.6의 15.8%, GPT-5.6 솔의 2.5%, 페이블 5.1의 6.7%와 큰 격차를 벌렸다. 반대로 헬스벤치 프로페셔널(HealthBench Professional)은 56.7%로 GPT-5.6 솔의 60.5%와 페이블 5.1의 62.1%에 밀렸다. 표에 없는 추가 수치로 xAI는 GDPval 1,695 일로(Elo)를 함께 제시했다.
터미널벤치 17.7%포인트 상승이 이번 발표에서 가장 큰 폭이다
일곱 행 가운데 전작 대비 상승폭이 가장 큰 항목은 터미널벤치 4.0으로 20.3%에서 38.0%로 17.7%포인트 올랐다. 그다음이 EE벤치 11.0%포인트, 헬스벤치 프로페셔널 8.2%포인트, 커서벤치 4.0 5.9%포인트, 딥SWE v1.1 5.8%포인트, 하비 법률 에이전트 3.8%포인트 순이다. 세대 교체에서 어느 축을 밀었는지는 이 순서가 그대로 보여준다.
xAI가 밝힌 학습 변경 내용은 이 분포와 맞물린다. 회사는 "여러 시간이 걸리는 문제 쪽으로 가중치를 둔 더 어려운 과제 조합으로 더 긴 강화학습을 돌렸다"고 했고, 그 결과로 "자기 작업을 검증하고 긴 문맥을 다루는 능력이 좋아졌다"고 설명했다. 터미널벤치와 EE벤치는 단발 응답 품질이 아니라 여러 단계를 이어가며 스스로 결과를 확인해야 하는 과제에 가깝고, 상승폭이 몰린 곳도 정확히 그쪽이다. 반면 헬스벤치 프로페셔널처럼 지식과 판단의 질을 묻는 항목에서는 8.2%포인트가 올랐는데도 두 경쟁 모델에 여전히 뒤졌다.
여기서 읽어야 할 것은 순위가 아니라 분업의 윤곽이다. 그록 4.7은 코딩 에디터 환경(커서벤치)과 소프트웨어 수리(딥SWE)에서는 1위를 내주고, 긴 시간이 걸리는 터미널 작업과 법률 에이전트 과제에서 자기 자리를 만들었다. 모델 한 종이 모든 열에서 이기는 구도가 아니라, 같은 가격대에서 어떤 열을 사려고 하는지가 선택 기준이 되는 국면이다.
하비 법률 19.6%는 1위지만 절대값으로는 낮다
그록 4.7의 하비 법률 에이전트 점수 19.6%는 표에서 가장 높지만, 다섯 번에 네 번은 과제를 완수하지 못한다는 뜻이기도 하다. 같은 표에서 GPT-5.6 솔은 2.5%, 페이블 5.1은 6.7%다. 세 모델의 격차가 크다는 사실과 세 모델 모두 이 과제를 대체로 실패한다는 사실이 동시에 성립한다.
상대 비교와 절대 수준을 섞어 읽으면 판단이 어긋난다. "경쟁 모델의 여덟 배"라는 서술은 19.6% 대 2.5%를 정확히 옮긴 것이지만, 이 벤치마크의 결과를 실무 도입 근거로 쓰려면 필요한 문장은 "다섯 번 중 한 번 성공한다"에 가깝다. 커서벤치 46.3%, 터미널벤치 38.0%도 마찬가지로 절반에 못 미치는 값이다. 벤치마크 표는 모델 간 서열을 재는 도구이지 과제 자동화 가능 여부를 판정하는 도구가 아니며, 이번 표에서 그 구분이 특히 크게 벌어진 행이 하비 법률이다.
딥SWE v1.1의 별표도 같은 종류의 주의를 요구한다. 71.0%가 "높은 연산 노력" 조건의 값이라면, 그 옆에 놓인 다른 모델의 72.7%와 70.0%가 어떤 연산 조건에서 측정됐는지가 명시되지 않는 한 세 숫자를 같은 선에 올려놓기 어렵다. xAI가 이 각주를 감추지 않고 표에 붙였다는 점은 평가할 만하지만, 각주가 붙은 값은 비교표의 다른 값과 성질이 다르다.
안전 지표를 능력 표와 같은 발표에 올린 것이 형식의 변화다
이번 발표에서 성능 표와 나란히 제시된 안전 지표는 두 개이며, 해커벤치 v0.3(HackerBench v0.3)의 위험 이중용도 프롬프트 통과율 3.3%와 래치바이오(LatchBio) 생물안전 벤치마크 62.4%다. xAI는 그록 4.7을 두고 "완전히 새로운 안전장치 스택으로 만들었다"며 "거부와 탈옥 저항에서 우리가 시험한 모델 가운데 가장 강하다"고 밝혔고, "사이버보안과 생물학 같은 이중용도 영역에서 정상 과제의 유용성과 위험 과제의 안전한 거부 양쪽을 선도한다"고 덧붙였다.
주목할 지점은 지표가 한 방향이 아니라 두 방향으로 설계됐다는 것이다. 해커벤치 3.3%는 위험한 요청을 얼마나 막았는지를 재는 값이고, xAI가 함께 붙인 설명은 "정당한 보안 작업을 거의 차단하지 않으면서"다. 거부율만 높이면 안전 점수는 쉽게 오르지만 보안 실무자에게는 쓸 수 없는 모델이 되고, 반대도 마찬가지다. 두 값을 한 지표 안에 묶어 보고하는 방식은 과잉 거부로 안전을 사는 경로를 차단한다.
다만 이 지표들은 모두 xAI의 자기 보고이며, 해커벤치와 래치바이오 벤치마크의 문항 구성이나 채점 기준이 이번 발표에 함께 공개되지는 않았다. 능력 점수는 경쟁사가 자체 재현으로 반박할 동기가 있지만, 안전 점수는 반박할 주체도 재현 경로도 불분명하다. 안전 수치를 발표에 포함하는 관행 자체는 진전이고, 그 수치의 검증 구조는 아직 비어 있다.
국내 팀이 지금 확인해야 할 것
가격 공개 범위와 미공개 항목을 먼저 구분하는 편이 실무에 안전하다. 확정된 것은 입력 100만 토큰 2달러, 출력 100만 토큰 6달러, 그리고 출력 속도 두 배에 가격 두 배인 패스트 변형이라는 세 가지다. 반대로 이번 발표에는 문맥 창 크기와 API 모델 식별자 문자열이 나오지 않았고, 온디바이스나 지역별 제공 조건에 관한 언급도 없다. 문맥 창은 xAI가 "긴 문맥 관리가 좋아졌다"고 명시한 개선 항목인데도 수치가 빠져 있어, 긴 문서를 다루는 국내 팀은 숫자가 나올 때까지 판단을 미루는 편이 낫다.
도입 경로는 비교적 넓게 열려 있다. xAI는 그록 4.7이 커서(Cursor)와 그록 빌드(Grok Build)에서 당일 제공되며 그록 API와 서드파티 코딩 하네스, 모델 라우터, 클라우드 플랫폼에서도 쓸 수 있다고 밝혔다. 이미 라우터를 끼워 여러 모델을 갈아 끼우는 구조를 갖춘 팀이라면 교체 비용은 사실상 설정 변경 수준이고, 그렇다면 판단해야 할 것은 도입 여부가 아니라 어떤 작업 종류를 이 모델로 옮길지다. 표가 가리키는 후보는 여러 시간이 걸리는 터미널 기반 작업과 문서 중심 에이전트 과제이며, 단발 코드 수정과 의료 지식 질의는 이번 표에서 다른 모델이 앞선 영역이다.
한 가지 더 언급할 것은 하네스 의존성이다. xAI는 그록 4.7을 "그록 봇 하네스를 기본으로 이해하도록 학습시켰다"고 밝혔는데, 이는 특정 실행 환경에 맞춘 최적화가 모델 안에 들어갔다는 뜻이다. 자체 하네스를 쓰는 조직에서 공개된 벤치마크 점수가 그대로 재현되지 않을 여지가 여기에 있고, 자체 과제 세트로 한 번 재보는 절차를 생략하지 않는 편이 좋다.
남는 질문
이번 발표가 답하지 않은 첫 번째 질문은 기반 모델의 규모이며, xAI는 "그록 4.6보다 큰 새 기반 모델"이라고만 밝히고 파라미터 수나 학습 토큰 규모를 공개하지 않았다. 규모가 없으면 17.7%포인트의 터미널벤치 상승이 기반 모델 확대에서 온 것인지 더 긴 강화학습에서 온 것인지 분리할 수 없고, xAI 자신도 두 변경을 함께 적용했다고 밝혔을 뿐 기여도를 나누지 않았다.
두 번째는 비용 대비 성능이다. 가격이 입력 2달러와 출력 6달러로 공개됐지만, 딥SWE 점수에 붙은 "높은 연산 노력" 각주가 시사하듯 같은 점수를 내는 데 필요한 토큰량은 모델마다 다르다. 표의 점수와 표의 가격을 곱해 비용을 추정하려면 과제당 평균 출력 토큰이 필요한데 그 값은 공개되지 않았다. 세 번째는 재현이다. 일곱 개 벤치마크 가운데 커서벤치와 터미널벤치처럼 외부에서 돌려볼 수 있는 항목의 독립 재현 결과가 며칠 안에 나올 것이고, 자기 보고 표와 외부 재현이 어긋나는지가 이번 발표의 실제 검증 시점이 된다.
출처: xAI 공식 발표 "Grok 4.7"(x.ai/news/grok-4-7, 2026년 9월 21일)의 벤치마크 비교표와 가격, 안전 지표, 학습 변경 서술을 1차 확인해 ASAP이 정리했다. 표의 모든 수치와 인용문은 해당 발표 문서에서 직접 대조했다.

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr