KO / EN

오픈AI GPT-6 솔·루나 공개: API 가격을 절반으로 내리고 경쟁 모델과 과제당 비용으로 맞붙었다

오픈AI는 2026년 9월 22일 GPT-6 솔(GPT-6 Sol)과 GPT-6 루나(GPT-6 Luna)를 공개하고 API 가격을 GPT-5.6 프로모션 가격 대비 50% 낮췄다고 밝혔다. 솔은 100만 토큰당 입력 4달러에서 2달러로, 출력 20달러에서 10달러로 내려갔고, 루나는 입력 0.20달러에서 0.10달러로, 출력 1.20달러에서 0.50달러로 내려갔다. 두 모델은 이달 초 나온 GPT-6 아스트라와 비슷한 방법으로 학습됐으며, 오픈AI는 업무 자동화 벤치마크 AutomationBench에서 솔이 클로드 오퍼스 5(Claude Opus 5) 최대 노력 설정보다 높은 점수를 과제당 비용 9%로 냈다고 적었다. ASAP은 오픈AI 공식 발표문을 1차 출처로 가격표와 벤치마크를 옮기고, 이번 발표가 무엇을 비교했고 무엇을 비교하지 않았는지 따로 읽는다.

가격표 두 줄이 이번 발표의 본론이다

GPT-6 솔과 루나는 새 최고 성능 모델이 아니라 GPT-6 아스트라의 학습 방법을 더 싼 등급으로 내려보낸 모델이라고 오픈AI가 직접 규정했다. 발표문은 "가장 까다롭고 중요한 프로젝트는 여전히 아스트라의 깊이가 필요하다"고 적은 뒤, 솔과 루나가 "비용 효율의 최전선을 넓힌다"고 설명했다. 가격 인하의 근거로는 캐싱과 추론 인프라 개선으로 서빙 비용이 내려갔고 그 절감분을 그대로 넘긴다는 설명을 붙였다.

모델입력(100만 토큰)출력(100만 토큰)오픈AI 표기
GPT-5.6 솔 → GPT-6 솔4달러 → 2달러20달러 → 10달러50% 인하
GPT-5.6 루나 → GPT-6 루나0.20달러 → 0.10달러1.20달러 → 0.50달러50% 인하

이용 경로는 챗GPT 워크(ChatGPT Work)와 코덱스(Codex)이며 플러스, 프로, 비즈니스, 엔터프라이즈, 에듀 이용자에게 당일부터 순차 적용된다. 무료와 고(Go) 이용자는 데스크톱 앱에서 루나를 쓸 수 있고, 일반 채팅(Chat)에는 아직 들어가지 않았다. API 모델 이름은 gpt-6-sol과 gpt-6-luna다.

루나 출력 단가는 실제로 58% 넘게 내려갔다

오픈AI 표는 두 모델 모두 "50% 인하"로 묶었지만, 루나의 출력 단가는 1.20달러에서 0.50달러로 약 58.3% 내려가 표기보다 인하 폭이 크다. 에이전트 작업에서 비용을 끌어올리는 쪽은 대체로 입력보다 긴 출력과 추론 토큰이라서, 루나를 대량 호출하는 팀에게는 표의 "50%"보다 이 58%가 더 가까운 체감값이 될 수 있다. 입력 단가는 정확히 절반이다.

반대 방향의 단서도 표 안에 있다. 인하 기준은 GPT-5.6의 정가가 아니라 "프로모션 가격"이라고 발표문이 명시했다. 기존 GPT-5.6 계약을 프로모션이 아닌 조건으로 쓰던 조직이라면 체감 인하 폭이 표와 다를 수 있으므로, 자기 청구서의 단가를 기준선으로 다시 계산하는 편이 정확하다. 가격 발표에서 "몇 퍼센트 인하"라는 문구는 기준선이 무엇인지와 함께 읽어야 의미가 생긴다.

비교 단위를 토큰 단가에서 과제당 비용으로 바꿨다

이번 발표의 벤치마크 서술은 거의 모든 문장이 점수와 과제당 비용을 한 쌍으로 묶는다는 점에서 이전 모델 발표와 결이 다르다. AutomationBench 1.0.6에서 솔(xhigh 노력)은 33.2%를 과제당 0.27달러로 기록했고, 같은 표에서 아스트라(저노력)는 30.3%에 솔의 3.9배, 클로드 오퍼스 5(최대 노력)는 26.9%에 11.1배 비용이 들었다. 이 벤치마크는 영업, 마케팅, 운영, 고객지원, 재무, 인사에 걸친 47개 도구로 업무 흐름을 끝까지 수행하는지 잰다.

다른 항목도 같은 틀이다. 딥SWE v1.1에서 솔(최대 노력)은 68.8%로 클로드 페이블 5(Claude Fable 5)의 최고점 69.9%(xhigh)에 1.1%포인트 못 미치지만 과제당 비용은 약 80% 낮다고 적혔다. 루나(최대 노력)는 같은 벤치마크에서 66.6%로 오퍼스 5와 페이블 5의 중간 노력 점수에 견줄 만하며, 과제당 비용은 오퍼스 5보다 93%, 페이블 5보다 96% 낮다. OSWorld 2.0 오프라인 세트에서는 솔(xhigh)이 60.5%, 오퍼스 5(중간 노력)가 60.3%로 비슷한데 솔의 과제당 비용이 약 80% 낮다. Agents' Last Exam에서는 솔(최대 노력)이 56.4%로 오퍼스 5의 최고점을 넘으면서 과제당 비용이 60% 낮다고 밝혔다.

과제당 비용이라는 단위는 토큰 단가보다 실무에 가깝다. 토큰 단가가 싸도 한 과제에 토큰을 몇 배 쓰면 결과적으로 비싸지고, 반대도 성립한다. 오픈AI가 이 단위를 전면에 둔 것은 가격 경쟁의 축이 "100만 토큰에 얼마"에서 "일 하나 끝내는 데 얼마"로 옮겨가고 있다는 신호로 읽힌다. 다만 과제당 비용은 벤치마크 과제의 길이와 형태에 크게 좌우되므로, 자기 업무의 과제 분포로 다시 재지 않으면 그대로 옮겨 쓸 수 없다.

노력 설정이 서로 다른 칸끼리 맞붙인 비교가 많다

발표문의 비교 쌍을 모아 보면 솔과 루나는 대개 높은 노력(xhigh, max)으로, 경쟁 모델은 중간 노력이나 특정 설정으로 놓인 경우가 여러 번 나온다. OSWorld 2.0에서는 솔 xhigh 대 오퍼스 5 중간 노력이고, 딥SWE에서는 루나 최대 노력 대 오퍼스 5와 페이블 5의 중간 노력이다. 이런 짝짓기는 "같은 점수를 내는 데 누가 싸냐"는 질문에는 적절하지만, "같은 노력에서 누가 더 잘하냐"는 질문에는 답하지 않는다.

비교 조건에 관한 각주도 발표문에 그대로 적혀 있다. 경쟁 모델 수치는 공개 보고서에서 가져왔고, 페이블 5.1 점수가 없을 때는 페이블 5 점수를 썼다. AutomationBench의 "페이블 5.1 + 오퍼스 5 폴백" 행은 약 40% 과제에서 오퍼스 5로 넘어간 폴백 비용을 뺀 값이라 실제 비용을 과소평가한다고 오픈AI가 직접 적었고, 그래서 해당 칸은 "8.9배 초과"로만 표시됐다. 자사 모델은 연구 환경이나 API로 평가해 실제 챗GPT 출력과 조금 다를 수 있다는 단서도 붙었다. 이런 각주를 숨기지 않은 점은 평가할 만하지만, 표의 여러 칸이 서로 다른 측정 조건에서 나왔다는 사실은 달라지지 않는다.

캐시 90% 할인이 에이전트 비용의 실제 변수다

오픈AI는 가격 인하와 함께 GPT-6의 프롬프트 캐싱을 개선해 기본 캐시 적중률을 높였고, 캐시된 입력 토큰 읽기에 90% 할인을 적용한다고 밝혔다. 새로 추가된 기능은 캐시 현황을 보여주는 프롬프트 캐싱 대시보드와 놓친 캐시 기회를 설명하는 진단 도구, 그리고 추론 노력과 도구 목록을 바꿔도 앞선 문맥의 캐시가 깨지지 않게 한 변경, 캐시할 접두부의 끝을 개발자가 직접 지정하는 명시적 중단점이다. 깃허브(GitHub)는 지난 몇 달간 이 개선으로 새로 처리해야 하는 프롬프트 토큰 비중이 수십억 건의 요청 전반에서 50% 넘게 줄었다고 오픈AI에 전했다.

이 항목이 가격표보다 덜 눈에 띄지만 에이전트 운영비에는 더 크게 작용할 수 있다. 에이전트는 같은 시스템 프롬프트와 도구 정의, 누적 대화를 매 호출마다 다시 보내는 구조라 입력의 상당 부분이 반복된다. 특히 "추론 노력을 바꾸면 캐시가 깨지던" 문제가 풀렸다는 점은 쉬운 후속 질문엔 노력을 낮추고 어려운 단계엔 올리는 라우팅을 비용 손해 없이 할 수 있게 만든다. 솔과 루나를 도입하는 팀이 먼저 볼 지표는 토큰 단가보다 자기 워크로드의 캐시 적중률이다.

국내 팀이 지금 판단할 수 있는 것과 없는 것

국내 개발 조직이 이번 발표로 바로 결정할 수 있는 것은 GPT-5.6 솔과 루나를 쓰던 파이프라인의 교체이며, 모델 이름만 gpt-6-sol과 gpt-6-luna로 바꾸면 단가가 절반 이하로 내려간다. 오픈AI는 같은 등급 안에서 솔의 사실 오류가 전작의 약 절반이고, 루나가 높은 노력 설정에서 GPT-5.6 솔 수준의 사실 정확도를 약 100분의 1 비용으로 낸다고 밝혔다. 단 이 사실성 평가는 이용자가 오류를 신고한 비식별 대화로 만든 내부 평가라서 일반 사용에서의 오류율을 뜻하지 않는다고 발표문이 적었다.

판단을 미뤄야 할 부분도 있다. 이번 발표의 벤치마크는 전부 영어 기준이고, 한국어 문서 처리나 한국어 사실성에 대한 수치는 없다. 또 경쟁사 모델과의 비교가 노력 설정이 엇갈린 칸으로 구성돼 있어, 클로드 계열을 쓰던 팀이 "솔로 바꾸면 같은 품질을 싸게 얻는다"고 결론 내리려면 자기 과제로 같은 조건의 재측정이 필요하다. 오픈AI 내부 연구자의 하루 토큰 사용액이 API 가격 기준 중앙값 600달러, 상위 10% 7,000달러를 넘었다는 발표문의 수치는 코딩 에이전트 비용이 이미 인건비와 비교되는 규모라는 점을 보여주며, 국내 팀도 모델 선택을 성능표가 아니라 월 비용 시뮬레이션으로 하는 편이 맞는 시점이다.

남는 질문

첫 번째 질문은 아스트라와 솔 사이의 간격이다. 오픈AI는 AutomationBench에서 솔 xhigh가 아스트라 저노력을 앞섰다고 밝혔는데, 이는 같은 가족 안에서도 작은 모델의 높은 노력이 큰 모델의 낮은 노력을 이길 수 있다는 뜻이다. 그렇다면 아스트라를 고르는 기준은 "최고 성능이 필요할 때"라는 발표문의 설명보다 더 좁을 수 있고, 어떤 과제에서 아스트라 저노력보다 솔 고노력이 유리한지에 대한 지도가 아직 없다.

두 번째는 정렬 수치의 공개 범위다. 발표문은 솔과 루나가 코딩 작업에 대한 오해 소지 있는 주장 비율 등에서 GPT-5.6 대비 개선됐다고 밝혔지만 구체 수치는 시스템 카드로 넘겼다. 세 번째는 독립 재현이다. 과제당 비용은 측정 환경과 하네스에 민감한 값이라, 외부 평가 기관이 같은 벤치마크를 같은 노력 설정으로 돌렸을 때 80%, 93% 같은 비용 격차가 유지되는지가 이번 발표의 실제 검증 지점이 된다.

출처: 오픈AI 공식 발표 "Introducing GPT-6 Sol and Luna"(openai.com/index/introducing-gpt-6-sol-and-luna, 2026년 9월 22일)의 가격표, 벤치마크 서술, 캐싱·가용성 안내를 1차 확인해 ASAP이 정리했다. 모든 수치와 인용은 해당 발표문에서 직접 대조했다.

광고
ASAP — AGI Soon As Possible

AI 인사이트·이슈·오픈소스 아카이브
다가올 AGI를 가장 깊게 읽습니다

AGI Soon As Possible · asapai.co.kr

← 전체 글 보기