AGI Soon As Possible
AI 리더보드 · 마지막 갱신 2026-09-10 · 출처 Artificial Analysis
Terminal-Bench v4.0 Leaderboard (Korean)

AI 에이전트 터미널 작업 순위

코딩 에이전트가 실제로 일을 끝내는지 보는 벤치마크입니다. Terminal-Bench v4.0은 66개 작업을 터미널에서 스스로 해결하게 하고 성공 비율을 잽니다. 9월 10일 판부터 v2.1(89개 작업, 레거시)에서 v4.0으로 바꿨습니다. 지능 인덱스 v4.3도 이 판을 씁니다.
AI 에이전트 터미널 작업 순위 Top 10
GPT-6 Astra (xhigh)59.6Claude Fable 5.1 (xhigh wi…55.1Claude Opus 5 (max)49Claude Fable 5 (with fallb…42.4GLM-5.3 (max)41.9GPT-5.6 Sol (max)39.9GPT-5.6 Terra (max)35.4Muse Spark 1.3 (max)33.3GLM-5.3-Flash32.8Grok 4.6 (high)21.2

순위

지표: Terminal-Bench v4.0 해결률 (%)
1
GPT-6 Astra (xhigh)OpenAI
59.6

오픈AI GPT-6 아스트라가 1위입니다. xhigh 설정 59.6%, max 설정 59.1%로 설정과 무관하게 앞섭니다.

2
Claude Fable 5.1 (xhigh with fallback)Anthropic
55.1

앤트로픽 최신 모델입니다. xhigh 설정이 55.1%로 아스트라와 4.5%p 차이입니다.

3
Claude Opus 5 (max)Anthropic
49.0

v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.

4
Claude Fable 5 (with fallback)Anthropic
42.4

v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.

5
GLM-5.3 (max)Z AI
41.9

v4.0 판에 새로 들어왔습니다. 오픈웨이트(가중치 공개) 모델입니다.

6
GPT-5.6 Sol (max)OpenAI
39.9

v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.

7
GPT-5.6 Terra (max)OpenAI
35.4

v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.

8
Muse Spark 1.3 (max)Meta
33.3

v4.0 판에 새로 들어왔습니다.

9
GLM-5.3-FlashZ AI
32.8

v4.0 판에 새로 들어왔습니다. 오픈웨이트(가중치 공개) 모델입니다.

10
Grok 4.6 (high)SpaceXAI
21.2

v4.0 판에 새로 들어왔습니다.

오픈웨이트 주목

오픈웨이트(가중치 공개) 중 1위는 Z AI의 GLM-5.3 (max)로 41.9%, 전체 5위입니다.

더 깊이

오픈AI가 GPT-6 아스트라를 출시했다: 컴퓨터 사용은 1위인데 종합지능 지수는 4위다 클로드 페이블 5.1은 캐시 읽기 가격만 75% 내려 전체 비용을 최대 45% 줄였다 Claude Opus 5, 프론티어 근접 성능을 절반 가격에 내놨다: 100만 토큰당 입력 5달러·출력 25달러
출처 · Artificial Analysis
v4.0은 v2.1보다 어렵게 다시 만든 판이라 점수가 전반적으로 낮고, 8월 2일 판(v2.1)과 숫자를 비교할 수 없습니다. max·xhigh·high는 추론 강도 설정이고 모델마다 가장 높은 설정 하나만 실었습니다. 전체·최신값은 출처에서 확인하세요.