AI 리더보드 · 마지막 갱신 2026-09-10 · 출처 Artificial Analysis
Terminal-Bench v4.0 Leaderboard (Korean)
AI 에이전트 터미널 작업 순위
코딩 에이전트가 실제로 일을 끝내는지 보는 벤치마크입니다. Terminal-Bench v4.0은 66개 작업을 터미널에서 스스로 해결하게 하고 성공 비율을 잽니다. 9월 10일 판부터 v2.1(89개 작업, 레거시)에서 v4.0으로 바꿨습니다. 지능 인덱스 v4.3도 이 판을 씁니다.
AI 에이전트 터미널 작업 순위 Top 10
순위
지표: Terminal-Bench v4.0 해결률 (%)
1
GPT-6 Astra (xhigh)OpenAI
59.6
오픈AI GPT-6 아스트라가 1위입니다. xhigh 설정 59.6%, max 설정 59.1%로 설정과 무관하게 앞섭니다.
2
Claude Fable 5.1 (xhigh with fallback)Anthropic
55.1
앤트로픽 최신 모델입니다. xhigh 설정이 55.1%로 아스트라와 4.5%p 차이입니다.
3
Claude Opus 5 (max)Anthropic
49.0
v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.
4
Claude Fable 5 (with fallback)Anthropic
42.4
v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.
5
GLM-5.3 (max)Z AI
41.9
v4.0 판에 새로 들어왔습니다. 오픈웨이트(가중치 공개) 모델입니다.
6
GPT-5.6 Sol (max)OpenAI
39.9
v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.
7
GPT-5.6 Terra (max)OpenAI
35.4
v2.1 판에도 있던 모델입니다. 벤치가 바뀌어 점수는 비교하지 않습니다.
8
Muse Spark 1.3 (max)Meta
33.3
v4.0 판에 새로 들어왔습니다.
9
GLM-5.3-FlashZ AI
32.8
v4.0 판에 새로 들어왔습니다. 오픈웨이트(가중치 공개) 모델입니다.
10
Grok 4.6 (high)SpaceXAI
21.2
v4.0 판에 새로 들어왔습니다.
오픈웨이트 주목
오픈웨이트(가중치 공개) 중 1위는 Z AI의 GLM-5.3 (max)로 41.9%, 전체 5위입니다.
더 깊이
오픈AI가 GPT-6 아스트라를 출시했다: 컴퓨터 사용은 1위인데 종합지능 지수는 4위다 →클로드 페이블 5.1은 캐시 읽기 가격만 75% 내려 전체 비용을 최대 45% 줄였다 →Claude Opus 5, 프론티어 근접 성능을 절반 가격에 내놨다: 100만 토큰당 입력 5달러·출력 25달러 →
출처 · Artificial Analysis
v4.0은 v2.1보다 어렵게 다시 만든 판이라 점수가 전반적으로 낮고, 8월 2일 판(v2.1)과 숫자를 비교할 수 없습니다. max·xhigh·high는 추론 강도 설정이고 모델마다 가장 높은 설정 하나만 실었습니다. 전체·최신값은 출처에서 확인하세요.
v4.0은 v2.1보다 어렵게 다시 만든 판이라 점수가 전반적으로 낮고, 8월 2일 판(v2.1)과 숫자를 비교할 수 없습니다. max·xhigh·high는 추론 강도 설정이고 모델마다 가장 높은 설정 하나만 실었습니다. 전체·최신값은 출처에서 확인하세요.