KO / EN

딥서치 에이전트는 기록을 쌓지 말고 요약을 고쳐 써야 한다: 저장대·텐센트 IterSynth는 8B로 평균 50.7점을 냈다

저장대학교(Zhejiang University)와 텐센트(Tencent) 연구진은 2026년 9월 24일 아카이브(arXiv)에 논문 "IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis"(arXiv 2609.29444)를 올리고, 하나의 모델이 계획자(Planner)와 종합자(Synthesizer) 두 역할을 번갈아 맡으며 검색 기록 대신 계속 고쳐 쓰는 요약을 기억으로 삼는 딥서치 에이전트 구조를 제안했다. Qwen3-8B를 바탕으로 학습한 IterSynth-8B는 브라우즈컴프(BrowseComp) 등 다섯 개 장기 탐색 벤치마크에서 평균 50.7점을 기록해, 기존 8B 이하 최고인 MiroThinker-v1.0-8B(46.5점)보다 4.2점 높았다. 학습 없이 프롬프트 구조만 바꿔도 클로드 4.5 오퍼스(Claude-4.5-Opus)의 평균 점수가 60.6점에서 66.1점으로 올랐다. ASAP은 논문 원문을 1차 출처로 구조와 결과를 정리하고, 이 설계가 에이전트를 만드는 팀에게 무엇을 뜻하는지 따로 읽는다.

ReAct 에이전트는 64K 문맥에서도 절반 넘게 끝을 못 봤다

IterSynth가 겨냥한 문제는 오픈소스 딥서치 에이전트 대부분이 따르는 ReAct 방식의 두 가지 약점이다. 하나는 역할 결합으로, 한 정책이 계획 세우기, 검색어 만들기, 증거 거르기, 모순 정리, 최종 답 종합을 모두 떠안는다. 다른 하나는 문맥 누적으로, 검색 결과와 중간 생각과 부분 결론이 한 문맥에 계속 쌓이면서 쓸모 있는 증거가 묻히고 초반 실수가 뒤까지 번진다.

논문이 부록에서 제시한 수치가 이 문제의 크기를 보여준다. 64K 문맥을 줘도 브라우즈컴프에서 ReAct 궤적의 59% 이상이 문맥이 바닥나기 전에 답을 내지 못했다. 궤적 통계 표에서 ReAct는 평균 12회 이상 검색 라운드와 질문당 15회 이상 검색 호출을 쓰고도 문맥 소진율이 59%였고, IterSynth는 7~8회 라운드와 8~10회 검색 호출로 소진율을 5%에 묶었다. 딥서치 에이전트가 틀리는 이유의 상당 부분이 추론 능력 부족이 아니라 "기억을 관리하지 못해서"라는 진단이다.

한 모델이 두 역할을 번갈아 맡고 요약이 곧 기억이 된다

IterSynth의 한 회차는 계획자 단계와 종합자 단계 두 개로 이뤄진다. 계획자는 원래 질문과 현재 전역 요약만 보고, 다음 검색어를 낼지 최종 답을 낼지 정한다. 이전 검색어, 검색 원문, 추론 기록 전체는 보지 않는다. 계획자가 검색을 고르면 검색 결과가 돌아오고, 종합자가 그 증거를 읽어 쓸모없는 구절을 거르고 발견을 뽑고 모순을 정리해 요약을 새로 쓴다. 종합자는 기억만 고칠 수 있고 검색어를 내거나 답을 낼 수 없다.

핵심은 두 역할이 별도 모델이 아니라는 점이다. 같은 파라미터를 가진 한 모델이 역할별 프롬프트와 허용 행동만 바꿔 두 역할을 수행한다. 매 회차 문맥은 질문과 요약으로 다시 짜이므로 길이가 32K 안에 묶인다. 논문은 이를 두고 다중 에이전트의 전문화 이점과 요약형 에이전트의 문맥 통제 이점을 모델 하나로 얻는다고 설명했다. 비교 실험도 있다. 역할마다 따로 파인튜닝한 8B 모델 두 개를 쓴 변형은 SFT 기준 평균 40.6점으로 공유 모델(44.1점)보다 3.5점 낮았고, 같은 GPU 8장에서 두 모델을 4장씩 나눠 띄우면 추론 시간이 13~15% 더 걸렸다.

보상도 역할별로 나눠 매겼다: RDPO

학습은 두 단계다. 먼저 Qwen3.5-397B-A17B가 실제 검색 환경에서 계획자와 종합자 루프를 돌린 궤적을 만들고, 도구 호출 오류를 고치고 정답으로 끝난 궤적만 남겨 Qwen3-8B를 전체 파라미터로 SFT했다. 이어 강화학습 단계에서 연구진은 역할 분리 정책 최적화(Role-Decoupled Policy Optimization, RDPO)를 도입했다. 최종 정답 여부 보상을 모든 회차에 똑같이 나눠주고, 여기에 LLM 심사관이 회차마다 계획자와 종합자 출력을 각각 다섯 항목 루브릭으로 채점한 보상을 더한다. 루브릭은 성공 궤적과 실패 궤적 쌍을 클로드 4.6 소넷(Claude-4.6-Sonnet)이 비교해 뽑아냈고, 학습 중 채점은 제미나이 2.5 플래시 라이트(Gemini-2.5-flash-lite)가 맡았다.

RDPO의 요점은 이점(advantage)을 계산할 때 계획자 표본과 종합자 표본을 한 통에 섞지 않고 역할별로 따로 정규화한다는 것이다. 절제 실험이 이 선택의 무게를 보여준다. SFT만 한 모델은 평균 44.1점, 정답 보상만 쓴 GRPO는 48.9점, RDPO는 50.7점이었다. 같은 복합 보상을 쓰되 역할을 섞어 정규화한 변형은 47.2점으로 GRPO보다도 낮았다. 촘촘한 종합자 보상과 드문 계획자 보상이 한 기준선을 공유하면 신호가 엉킨다는 것이 논문의 해석이다. 논문은 심사관 호출 비용을 전체 RDPO 단계에 약 192달러로 추산했다.

8B 순위표는 어디서 이기고 어디서 지는지까지 봐야 한다

평균 50.7점이라는 숫자는 벤치마크별로 뜯어 읽어야 정확하다. IterSynth-8B가 가장 크게 앞선 곳은 중국어 탐색 벤치마크 브라우즈컴프-ZH로 55.4점을 기록해 MiroThinker-v1.0-8B(40.2점)를 15.2점 앞섰다. xBench-DS-2510에서도 46.0점으로 8B 이하 최고였다. 반면 영어 브라우즈컴프는 30.9점으로 MiroThinker-v1.0-8B(31.1점)에 조금 못 미쳤고, GAIA 텍스트 전용은 55.3점으로 MiroThinker-v1.0-8B(66.4점)와 40억 파라미터 AgentCPM-Explore-4B(63.9점)보다 낮았다. 평균 우위의 상당 부분이 중국어 벤치마크 한 곳에서 나왔다는 뜻이다.

학습 데이터 구성을 보면 이 편차에 짐작 가는 구석이 있다. 논문은 영어 질문이 주로 공개 데이터셋에서, 중국어 질문이 REDSearcher와 연구진이 합성한 실제형 질문에서 왔다고 밝혔다. 텐센트가 참여한 연구에서 중국어 성적이 두드러진 것은 이상하지 않지만, 한국어처럼 학습에 없던 언어로 옮겨질지는 별도 검증이 필요하다.

체급 비교도 신중히 읽을 부분이 있다. 논문은 IterSynth-8B가 ReSum-30B, AgentFold-30B-A3B, OpenSeeker-30B-SFT보다 평균이 높다고 강조했지만, 같은 표에서 Tongyi-DR-30B는 58.2점, MiroThinker-v1.7-mini는 69.4점이다. 연구진도 Tongyi-DR-30B와 비교해 정확도는 그 수준에 못 미치지만 같은 하드웨어에서 브라우즈컴프-ZH 추론 시간이 312.5분 대 204.7분으로 짧다고 정리했다. "30B를 이겼다"보다 "비용 대비 정확도가 좋다"가 정확한 읽기다.

구조의 효과는 학습 없는 프롬프트 실험에서 가장 깨끗하게 보인다

이 논문에서 가장 실무에 가까운 결과는 파라미터를 전혀 건드리지 않은 프롬프트 실험이다. 클로드 4.5 오퍼스에 IterSynth 방식의 두 역할 프롬프트만 적용했더니 네 벤치마크 평균이 ReAct 60.6점에서 66.1점으로 5.5점 올랐고, 브라우즈컴프-ZH에서는 60.2점에서 70.2점으로 10점 뛰었다. 딥시크 V3.1도 43.4점에서 47.9점으로 올랐다. 요약 기반으로 문맥을 다시 짜는 선행 연구 IterResearch보다도 두 모델 모두 평균이 높았다.

이 결과가 중요한 이유는 학습 데이터 품질이라는 교란 변수를 걷어내기 때문이다. 연구진은 같은 질문, 같은 교사 모델, 같은 학습 파이프라인으로 ReAct 궤적을 만들어 비교한 통제 실험도 실었는데, SFT 단계에서 ReAct 32.6점 대 IterSynth 44.1점, 강화학습 뒤 38.1점 대 50.7점이었다. 구조 자체가 성능의 큰 몫을 만든다는 증거가 두 방향에서 나온 셈이다.

다만 프롬프트 실험에도 예외가 있다. 클로드 4.5 오퍼스의 GAIA에서는 IterResearch가 66.0점으로 IterSynth(61.2점)보다 높았다. 여러 사실을 잇는 추론이 많은 과제에서는 요약을 반복해 고쳐 쓰는 방식이 손해를 볼 수 있다는 신호이고, 이는 아래 실패 분석과 이어진다.

요약이 기억이 되면 요약의 실수도 기억이 된다

연구진이 직접 밝힌 실패 유형 두 가지는 이 구조의 약점을 정확히 짚는다. 첫째는 요약 정보 손실이다. GAIA에서 종합자가 두 사실을 각각 올바르게 기록하면서도 둘을 잇는 관계를 빠뜨려, 필요한 사실을 다 찾고도 오답을 내는 경우가 있었다. 둘째는 잘못된 증거 확정이다. 브라우즈컴프에서 검색 결과가 엇갈릴 때 종합자가 권위 있어 보이는 틀린 출처를 요약에 넣으면, 이후 회차가 그 주장을 뒷받침하는 증거만 찾는 확증 편향이 나타났다.

ReAct는 원문을 전부 끌고 다니기 때문에 적어도 이론상 나중에 다시 볼 수 있다. IterSynth는 원문을 버리고 요약만 남기므로 요약이 틀리면 되돌릴 근거가 사라진다. 역할 교체 실험에서 계획자를 학습 전 Qwen3-8B로 바꾸면 세 벤치마크 평균이 58.9점에서 17.8점으로, 종합자를 바꾸면 41.5점으로 떨어졌다. 계획이 더 어려운 역할이라는 해석과 함께, 요약 품질이 무너지면 전체가 무너진다는 구조적 취약성도 읽힌다. 연구진은 종합자 단계에 모순 탐지를 넣는 방향을 과제로 제시했다.

에이전트를 만드는 한국 팀이 가져갈 설계 원칙

한국에서 RAG 챗봇이나 사내 리서치 에이전트를 만드는 팀에게 이 논문의 가장 큰 쓸모는 모델 학습이 아니라 설계 원칙이다. 프롬프트만으로 효과가 확인됐기 때문에, 이미 쓰고 있는 상용 모델 위에서 "검색할 곳을 정하는 호출"과 "새 증거를 요약에 반영하는 호출"을 분리하고, 매 회차 문맥을 질문과 요약으로 다시 짜는 방식은 바로 시험해 볼 수 있다. 코드는 깃허브(Tencent/IterSynth)에 공개됐다.

도입할 때 챙길 점도 논문이 알려준다. 요약만 남기는 구조라면 요약에 들어간 주장마다 출처 URL을 붙여 두고, 서로 엇갈리는 증거를 만나면 덮어쓰지 말고 충돌로 기록하게 하는 규칙이 필요하다. 사실 사이의 관계를 따로 적는 구조화된 요약도 연구진이 제안한 개선 방향이다. 연구진은 공개 산출물이 연구용이며 추가 안전성과 품질 검증 없이 서비스에 쓰는 것은 권하지 않는다고 밝혔고, 이 논문은 아직 동료 심사 전 사전 공개 원고다.

출처: Xingyu Wu, Yuchen Yan, Zhengxi Lu, Siqi Chen, Xin Zhang, Aiting Liu, Chao Deng, Jie Liu, Jin Ma, Jian Shao, Jun Xiao, Yongliang Shen 외, "IterSynth: Rethinking Deep Search Agents via Role-Decoupled Iterative Synthesis", arXiv 2609.29444v1(2026년 9월 24일, 저장대학교·텐센트). ASAP이 논문 초록과 본문(방법, 주요 결과 표, 절제 실험, 부록의 통제 비교·효율·실패 분석)을 1차 확인해 정리했다.

광고
ASAP — AGI Soon As Possible

AI 인사이트·이슈·오픈소스 아카이브
다가올 AGI를 가장 깊게 읽습니다

AGI Soon As Possible · asapai.co.kr

← 전체 글 보기