Gander: 100번 모두 제때 말하고 끼어듦을 8.0%까지 줄였지만 과제 정확도는 표에서 가장 낮았다
텐센트 Hunyuan Speech Team과 저장대·상하이교통대·홍콩중문대·난양공대 연구진이 2026년 9월 8일 arXiv 2609.08977로 공개한 Gander는 사용자의 말을 들으면서 동시에 말하는 전이중(full-duplex) 상호작용 모델이다. MiniCPM-o 4.5를 기반으로 만든 9B 상호작용 모델이며, Full-Duplex-Bench v3의 100개 시나리오 전부에서 적절한 시점에 발화를 시작했고 사용자가 말을 끝내기 전에 끼어든 비율은 8.0%로 GPT-Realtime의 13.5%보다 낮았다. 반면 도구 선택 F1은 0.759로 표에 오른 일곱 시스템 가운데 가장 낮았다. ASAP은 이 논문을 대화의 타이밍과 과제 정확도가 맞바꿔지는 지점을 중심으로 정리한다.
소뇌와 뇌를 나눠 붙인 구조다
Gander의 설계 핵심은 실시간 응답과 복잡한 추론을 서로 다른 구성요소에 맡긴 분업이다. 논문이 Cerebellum-Brain 협력 프레임워크라 부르는 구조에서 소뇌는 실시간 상호작용을 담당하고, 뇌는 복잡한 추론과 긴 호흡의 에이전트 과제를 담당한다. 두 구성요소는 도구 호출과 에이전트 오케스트레이션 런타임을 통해 계속 주고받는다. 소뇌는 스트리밍 Thinker-Talker 구조 위에 세워졌고, 사용자 입력과 모델 출력이 청크 단위로 하나의 순서 있는 토큰 흐름에 평탄화된다. 각 청크 안에서 모델은 들을지 말할지를 명시적으로 예측하며 자신의 상호작용 상태를 스스로 제어한다.
왜 굳이 둘로 나눴는지에 대한 논문의 설명은 요구사항의 차이다. 일상 대화는 즉각적인 반응과 맥락의 연속적 적응을 요구하는 반면, 복잡한 워크플로는 긴 호흡의 추론과 반복적 계획과 도구 사용을 요구한다. 하나의 단일 모델로 둘을 동시에 감당하면 문제가 생긴다는 것이 저자들의 출발점이다. 오케스트레이션 런타임이 관리하는 단위도 이 분업을 반영해 프로젝트, 과제, 실행, 워커 이벤트, 전달이라는 다섯 개체로 정의돼 있다.
평가 구성에서 반드시 확인해야 할 대목이 여기 있다. 벤치마크에서 뇌가 참여하는 경우, 뇌는 3절의 Codex 워커 제공자를 통해 학습 없이 투입되며 GPT-5.6이 이를 구동한다. 즉 논문이 공개한 9B 모델은 소뇌 쪽이고, 표에 나온 도구 사용 성적 가운데 뇌가 관여한 부분은 외부 상용 모델의 성능을 포함한다. 연구진은 벤치마크의 시스템 프롬프트가 외부 에이전트인 뇌에는 전달되지 않는 비대칭을 발견하고, 같은 요구사항을 담은 계약 파일을 뇌의 작업 디렉터리에 놓아 양쪽 조건을 맞췄다고 밝혔다.
끼어들지 않으면서 제때 말하는 문제를 풀었다
타이밍 지표에서 Gander는 표 전체에서 가장 좋은 성적을 냈다. Full-Duplex-Bench v3는 자연스러운 말더듬이 섞인 도구 사용 서비스 시나리오 100개에서, 적절한 시점에 발화를 시작한 비율(Take-turn)과 사용자가 말을 끝내기 전에 시작한 비율(Interrupt), 그리고 대화적 채움말로 발화를 시작한 비율(Filler)을 잰다. Gander는 100개 시나리오 모두에서 발화 시점을 맞췄고 끼어든 비율은 8.0%였다. GPT-Realtime은 각각 96.0%와 13.5%, Gemini Live 3.1은 78.0%와 19.2%, Whisper와 GPT-4o와 TTS를 잇댄 파이프라인은 100.0%와 33.0%였다.
두 지표를 함께 읽어야 하는 이유를 논문이 직접 설명한다. 한 시스템이 더 오래 기다리기만 하면 끼어듦은 손쉽게 억제되지만 그 대가로 자기 차례를 놓치게 된다. 표 안에 두 실패 방식이 모두 보인다. Gemini Live 3.1은 끼어듦을 19.2%로 눌렀지만 시나리오의 78.0%에서만 응답했고, 잇댄 파이프라인은 100.0% 응답하면서 끼어듦이 33.0%까지 올라갔다. 두 지표를 동시에 최상단에 올린 것은 Gander뿐이다.
측정 조건이 느슨하지 않다는 점도 짚어둘 만하다. 연구진은 공개된 채점 스크립트를 수정 없이 돌렸고 기준 프로토콜이 쓰는 GPT-4o 판정자를 그대로 썼으며, 배포 상태의 전체 스택을 끝에서 끝까지 평가했다. 오디오가 Thinker로 들어가고 Talker와 음성 디코더가 답을 합성하면 채점은 그 오디오의 ASR 전사를 읽는다. 따라서 보고된 수치에는 실제 음성 합성과 인식 오류가 모두 포함돼 있다. 텍스트 수준에서만 평가한 숫자와 같은 줄에 놓고 보면 안 되는 이유이자, 이 논문의 숫자가 실제 사용 조건에 더 가까운 이유다.
대신 내준 것은 과제 정확도와 채움말이다
정확도 지표로 넘어가면 순서가 뒤집힌다. Gander의 도구 선택 F1은 0.759, 인자 정확도는 0.503, 응답 품질은 0.490, 도구 묶음과 모든 인자가 정확해야 통과하는 Pass@1은 0.400이다. 표의 최상단인 GPT-Realtime은 각각 0.876, 0.680, 0.792, 0.600이고, 가장 약한 기준선인 Ultravox v0.7조차 0.794, 0.513, 0.510, 0.410으로 Gander보다 높다. 논문은 이 격차가 표 하단에서는 좁다고 적었고 실제로 Pass@1 차이는 0.010에 그치지만, 네 지표 모두에서 최하위라는 사실 자체는 바뀌지 않는다.
Filler 수치는 따로 봐야 한다. Gander는 51.6%로 Ultravox v0.7의 88.0%에 이어 두 번째로 높고, Gemini Live 2.5의 8.9%나 GPT-Realtime의 16.9%와는 격차가 크다. 이 지표는 끼어들지 않고 차례를 가져간 91개 시나리오에 대해 정의된다. 즉 제때 말을 시작한 그 발화들 가운데 절반 이상이 대화적 채움말로 시작했다는 뜻이다.
세 숫자를 겹쳐 놓으면 하나의 그림이 나온다. 적절한 시점 100.0%, 끼어듦 8.0%, 채움말 51.6%는 사람이 대화에서 쓰는 전략과 같은 모양이다. 말을 끊지 않고 기다렸다가 자기 차례가 오면 일단 소리를 내며 시작하고 내용은 뒤따라 붙이는 방식이다. 상대가 말을 마쳤는지 판단하는 문제와 할 말을 준비하는 문제가 분리돼 있다는 뜻이며, 이 구조에서 타이밍 점수와 내용 점수가 동시에 높아지지 않는 것은 자연스럽다. 다만 논문이 이 인과를 직접 주장하지는 않았고, 위 해석은 세 지표를 나란히 놓았을 때 보이는 패턴에 대한 ASAP의 읽기다.
음성 경로가 깎아 먹는 몫이 표에 찍혔다
이 논문에서 가장 많은 것을 말해 주는 줄은 마지막 줄이다. 연구진은 소뇌와 오디오 경로를 통째로 건너뛰고 사용자 발화의 전사만으로 같은 에이전트와 도구 서버를 구동한 뇌 단독 조건을 따로 보고했다. 그 조건의 도구 선택 F1은 0.934로 표 전체에서 가장 높고, 인자 정확도 0.590, 응답 품질 0.740, Pass@1 0.520이다. 전체 스택의 0.759·0.503·0.490·0.400과 비교하면 차이는 분명하다.
이 대비를 과장하지 않으려면 논문의 단서를 함께 읽어야 한다. 연구진은 이 줄이 텍스트 기반이므로 전이중 시스템들이 아니라 잇댄 파이프라인과 비교되는 조건이며, 오디오 타임라인이 없으므로 세 상호작용 지표는 측정 자체가 불가능하다고 명시했다. 따라서 0.934에서 0.759로의 하락을 소뇌가 뇌를 방해한 양이라고 단정할 수는 없고, 실시간 음성이라는 조건 전체가 부과하는 비용으로 읽는 것이 정확하다. 그 비용에는 음성 합성과 인식 오류, 청크 단위로 흐르는 입력에서 의도를 확정해야 하는 제약, 말하면서 동시에 판단해야 하는 부담이 모두 섞여 있다.
읽는 방향을 바꾸면 이 줄은 아키텍처 주장의 근거이기도 하다. 뇌 자리에 GPT-5.6을 학습 없이 꽂아 0.934를 낸 뒤 같은 구성을 음성 경로에 물렸다는 것은, 뇌가 교체 가능한 부품으로 설계됐다는 주장이 작동함을 보여준다. 추론 능력을 올리고 싶으면 뇌를 바꾸면 되고, 상호작용 품질을 올리고 싶으면 소뇌를 학습시키면 된다. 문제는 두 층을 이었을 때 상단의 실력이 그대로 전달되지 않는다는 점이며, 저자들이 남긴 한계 목록에도 소뇌에서 뇌로 가는 효과적인 피드백이 과제로 올라 있다.
전이중으로 바꾸는 값은 이해력에서도 나갔다
기반 모델과의 비교는 적응의 대가를 보여준다. Gander의 기반인 MiniCPM-o 4.5는 WorldSense에서 55.70%, Daily-Omni에서 80.20%를 기록했는데, Gander는 같은 두 벤치마크에서 49.62%와 78.53%로 내려갔다. WorldSense 기준 6.08%포인트 하락이다. 전이중 상호작용을 위해 청크 단위 스트리밍과 말할지 들을지의 판단을 얹는 과정에서 순수한 멀티모달 이해 성능이 일부 깎였다고 읽을 수 있다. 참고로 같은 표의 Gemini 2.5 Flash는 52.60%와 79.30%, Qwen3-Omni는 54.00%와 70.70%다.
반대로 두 흐름을 함께 쥐고 있는 것의 값도 측정됐다. 표 6은 같은 질문 집합을 오디오와 영상을 모두 준 조건, 영상만 준 조건, 오디오만 준 조건으로 나눠 총 13,107회 추론을 돌린 결과다. WorldSense에서 두 흐름을 다 주면 49.62%이고 영상만은 44.61%, 오디오만은 43.32%여서 융합 이득이 5.01%포인트다. Daily-Omni에서는 78.53% 대 59.40% 대 57.81%로 융합 이득이 19.13%포인트까지 벌어지고, 전체 평균으로는 8.88%포인트다. 한쪽 흐름만으로는 답할 수 없는 질문이 상당수라는 뜻이며, 상호작용 모델 안에 두 스트림을 모두 유지할 이유가 여기서 나온다.
음성 질의응답 성적은 집단에 따라 갈린다. 전이중 스트리밍 모델 집단에서 Gander는 9B로 Llama Questions 75.60%와 Web Questions 59.30%를 기록해 Moshi의 62.20%·26.30%와 Audio-Interaction 3B의 67.31%·54.34%를 앞선다. 그러나 VoiceBench의 AlpacaEval은 5점 만점에 3.96으로 Audio-Interaction의 4.28보다 낮고, SD-QA도 46.84%로 52.14%에 못 미친다. 턴 기반 모델까지 넓히면 Qwen2.5-Omni 7B가 Web Questions 62.80%와 SD-QA 55.71%로 더 높다. 전이중 구조가 음성 이해 자체를 끌어올리지는 않는다는 점이 이 표의 요지다.
실시간 음성 에이전트를 검토하는 팀이 볼 지점
국내 조직 관점에서 이 논문의 가장 큰 실용적 차이는 공개 범위다. 표 상단의 GPT-Realtime과 Gemini Live는 API로만 접근할 수 있는 상용 서비스인 반면, 연구진은 Gander를 모델과 코드와 데이터까지 함께 공개한다고 밝혔다. 실시간 음성 상호작용을 자체 인프라에서 돌려야 하는 조건, 예를 들어 통화 데이터가 외부로 나가면 안 되는 업무에서는 성능표의 순위보다 이 조건이 먼저 걸린다. 9B라는 크기도 소뇌만 자체 운영하고 뇌는 필요할 때만 외부 모델에 맡기는 구성을 현실적으로 만든다.
분업 구조가 주는 두 번째 이점은 교체 가능성이다. 뇌가 도구 호출로만 연결된다면 그 자리에 어떤 추론 모델을 놓을지는 운영하는 쪽의 선택이 되고, 국내 규제나 비용 조건에 맞춰 바꿔 끼울 여지가 생긴다. 반대로 상용 실시간 음성 API는 대화 제어와 추론이 한 덩어리로 묶여 있어 한쪽만 바꾸는 선택지가 없다. 다만 앞서 본 0.934와 0.759의 간극이 보여주듯, 좋은 뇌를 꽂는 것만으로 최종 품질이 결정되지는 않는다.
한국어 적용을 검토한다면 확인해야 할 공백이 하나 있다. 논문이 공개한 270만 건 학습 데이터 구성표는 음성 상호작용 37%, 오디오·영상 상호작용 41%, 에이전트 상호작용 13%, 강건성과 부정 데이터 9%라는 범주별 비율까지 밝히지만 언어 구성은 보고하지 않는다. 동시 통역 항목이 이중 언어라고만 적혀 있을 뿐이다. 한국어 대화에서 말끝을 판단하는 능력, 즉 이 논문이 가장 잘한다고 내세운 바로 그 능력이 한국어에서도 유지되는지는 표로 확인할 수 없고 직접 돌려 봐야 안다. 끼어듦 판단은 언어의 운율과 종결 어미에 강하게 의존하는 과제이므로, 다른 능력보다 언어 전이가 덜 될 위험이 크다.
저자들이 남긴 다섯 가지 한계와 그 바깥의 질문
arXiv 2609.08977의 결론 절은 Gander의 한계이자 후속 연구 방향으로 다섯 가지를 명시했고, 그 목록이 이 구조의 미완성 지점을 그대로 드러낸다. 첫째는 데이터와 모델 규모로, 에이전트 호출과 대화 행동이 학습 데이터 분포에 민감하게 남아 있으며 특히 복잡한 멀티모달 상황에서 그렇다는 진단이다. 둘째는 사후 학습의 안정화로, 현재 모델은 온폴리시 증류나 강화학습으로 충분히 최적화되지 않았다. 셋째는 소뇌에서 뇌로 가는 피드백을 포함한 협력 구조의 추가 탐색이고, 넷째는 긴 멀티모달 이력과 도구 호출과 변해 가는 과제 상태를 다루는 메모리·장문맥 관리다.
다섯째가 이 논문 전체를 다시 보게 만든다. 기존 벤치마크들이 멀티모달 이해와 전이중 상호작용과 에이전트 실행을 각각 따로 평가할 뿐, 셋을 합친 통합 설정은 충분히 평가되지 않았다는 지적이다. 저자들 스스로 밝히듯 기존 벤치마크는 소뇌와 뇌 사이의 통신과 조율도 제대로 포착하지 못한다. 이 논문의 핵심 주장이 두 층의 협력인데 그 협력을 직접 재는 자가 아직 없다는 뜻이고, 표 3의 마지막 줄을 따로 만들어 보고할 수밖에 없었던 이유도 여기에 있다.
여기에 한 가지를 덧붙일 만하다. 평가 대상이 100개 시나리오라는 점이다. 적절한 발화 시점 100.0%와 끼어듦 8.0%는 100개 시나리오에서 나온 수치이고, 채움말 지표는 그중 91개에 대해 정의된다. 실시간 대화 시스템의 타이밍은 사용자의 말버릇과 배경 소음과 통신 지연에 따라 크게 흔들리는 성질을 갖는데, 100개 시나리오의 완벽한 점수가 실사용 환경에서 얼마나 유지될지는 이 표만으로 알 수 없다. 연구진이 배경 소음과 다자 대화와 맞장구 상황을 지원한다고 밝히면서도 그 조건들의 정량 결과를 같은 표에 넣지 않은 것도 같은 맥락에서 읽힌다.
출처: arXiv 2609.08977 "Multimodal Duplex Interaction Agent"(2026년 9월 8일 제출, 9월 12일 v3, 텐센트 Hunyuan Speech Team 외) 초록과 본문 5절, 표 2·표 3·표 4·표 5·표 6 및 결론의 한계 목록 기반 ASAP 정리. 코드는 github.com/Omni-Interaction-Gander/Omni-Interaction-Agent에 공개돼 있다.

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr