AGI Soon As Possible
AI 리더보드 · 마지막 갱신 2026-08-02 · 출처 Artificial Analysis · Terminal-Bench v2.1
Agentic Terminal Coding Leaderboard (Korean)

코딩 에이전트 순위

코딩 에이전트가 실제로 일을 끝내는가. Terminal-Bench v2.1은 소프트웨어 개발과 시스템 관리, 데이터 처리, 모델 학습, 보안에 걸친 89개 과제를 터미널 환경에서 직접 수행시키고 성공률을 잽니다. 문제를 맞히는 시험이 아니라 끝까지 해내는지를 봅니다.
코딩 에이전트 순위 Top 10
GPT-5.6 Sol (xhigh)89.5Claude Opus 5 (max)89.1GPT-5.6 Terra (max)88GPT-5.6 Sol (max)88Claude Opus 5 (xhigh)88Kimi K3 (max)85Claude Fable 5 (with fallb…84.6Claude Opus 4.8 (max)84.6Grok 4.5 (high)81.6GPT-5.6 Luna (max)80.9막대는 76부터 (0 아님)

순위

지표: Terminal-Bench v2.1 해결률
1
GPT-5.6 Sol (xhigh)OpenAI
89.5

89.5%로 1위. 89개 터미널 과제 중 여든 개 가까이를 스스로 끝냈습니다.

2
Claude Opus 5 (max)Anthropic
89.1

89.1%로 0.4%p 차 2위. 상위권은 사실상 동률 구간입니다.

3
GPT-5.6 Terra (max)OpenAI
88.0

88.0%. 중간 등급 모델이 최상위와 1.5%p 안쪽으로 붙었습니다.

4
GPT-5.6 Sol (max)OpenAI
88.0

88.0%. 같은 모델도 추론 강도 설정에 따라 점수가 갈립니다.

5
Claude Opus 5 (xhigh)Anthropic
88.0

88.0%. 3위부터 5위까지 동점입니다.

6
Kimi K3 (max)문샷 AI
85.0

85.0%. 오픈웨이트 모델 중 가장 높습니다.

7
Claude Fable 5 (with fallback)Anthropic
84.6

84.6%. 폴백 구성을 포함한 점수입니다.

8
Claude Opus 4.8 (max)Anthropic
84.6

84.6%. 이전 세대인데 현행 상위권과 붙습니다.

9
Grok 4.5 (high)xAI
81.6

81.6%.

10
GPT-5.6 Luna (max)OpenAI
80.9

80.9%. 가장 저렴한 등급이 80%를 넘겼습니다.

출처 · Artificial Analysis · Terminal-Bench v2.1 (Elo는 블라인드 비교 투표 기반)
과제 89개는 Laude Institute와 스탠퍼드 연구진, 오픈소스 커뮤니티가 만들었고 평가는 Artificial Analysis가 독립적으로 수행합니다. 제조사 자체 발표 수치가 아닙니다. max·high·xhigh는 추론 강도 설정이라 같은 모델도 설정에 따라 점수가 달라집니다. 전체 27개 모델과 최신값은 출처에서 확인하세요.