마이크로소프트 레트로키메라가 네이처에 실렸고, 기준 분자 10개 중 9개에서 전문가가 전부 수용한 합성 경로를 냈다
마이크로소프트 리서치는 2026년 9월 21일 역합성 모델 RetroChimera를 다룬 논문 "Chemist-aligned retrosynthesis by ensembling diverse inductive bias models"를 네이처에 게재했다. 기준 분자 10개를 놓고 전문가가 평가한 결과 RetroChimera는 9개에서 전부 수용된 반응 경로를 내놨고, 비교 대상 모델들은 2개에서 5개에 그쳤다. 박사급 유기화학자 9명이 참여한 선호 비교에서는 문헌에 기록된 기존 합성법 대신 RetroChimera의 최상위 제안을 약 64퍼센트의 경우에 택했다. 연구는 GSK와 노바티스가 함께 참여했고 코드와 체크포인트는 MIT 라이선스로 공개됐으며, ASAP은 이 결과가 기존 역합성 AI와 무엇이 다른지와 깃허브 문서가 스스로 적어 둔 한계까지 정리한다.
역합성은 목표 분자에서 거꾸로 내려가 시판 원료에 닿는 경로를 찾는 문제다
역합성 계획은 만들고 싶은 분자에서 출발해 그것을 더 단순한 조각으로 쪼개는 일을 반복해 결국 시중에서 살 수 있는 출발 물질에 도달하는 절차다. 마이크로소프트는 이 문제를 체스나 바둑 같은 전략 게임에 견주면서도 결정 공간이 훨씬 넓고 복잡하다고 설명한다. 한 단계마다 가능한 분해 방식이 여럿이고 그 각각이 다시 여러 갈래로 뻗기 때문에, 경우의 수가 폭발하는 성질 때문에 수십 년 동안 신뢰할 만한 자동화가 이뤄지지 않았다.
기존 시스템의 문제로 마이크로소프트가 지목한 것은 두 가지다. 하나는 자주 등장하지는 않지만 전략적으로 중요한 반응을 잘 반영하지 못한다는 점이고, 다른 하나는 부정확한 예측을 내놓는 경향이다. 두 문제가 겹치면 복잡한 분자에 대한 합성 계획 자동화가 실무에서 쓸 수 없는 수준으로 남는다.
RetroChimera가 택한 접근은 단일 모델을 키우는 방향이 아니다. 공식 설명은 "서로 보완적인 강점을 지닌 여러 모델의 예측을 결합한다"는 것이며, 깃허브 저장소는 이를 "서로 다른 귀납 편향을 가진 두 개의 새로운 구성 요소를 앙상블한 것"으로 더 정확히 적었다. 여기에 탐색 알고리즘을 붙여 유망한 합성 경로를 제안한다.
평가는 벤치마크 정확도가 아니라 화학자의 수용 여부로 설계됐다
이번 연구가 제시한 두 수치는 모두 사람이 매긴 값이다. 첫째, 기준 분자 10개에 대해 전문 화학자들이 제안된 경로를 평가했을 때 RetroChimera는 9개 분자에서 완전히 수용된 반응 시퀀스를 만들어 냈고 비교 모델들은 2개에서 5개 사이였다. 둘째, 마이크로소프트와 주요 제약사 소속 박사급 유기화학자 9명이 참여한 비교에서 이들은 문헌으로 기록된 기존 합성법보다 RetroChimera의 최상위 제안을 약 64퍼센트의 경우에 선호했다.
두 번째 수치의 비교 대상이 무엇인지가 중요하다. 다른 모델의 출력이 아니라 모델이 학습한 실제 반응 데이터가 상대였다. 깃허브 저장소는 이를 "블라인드 테스트에서 산업계 유기화학자들이 학습에 쓰인 반응보다 RetroChimera의 예측을 선호했다"고 적었다. arXiv에 올라간 사전 인쇄본도 같은 결론을 "높은 수준의 정렬을 드러낸다"는 표현으로 요약했다.
산업 적용 가능성은 GSK 자료로 확인됐다. 사전 학습된 RetroChimera가 GSK의 내부 및 독점 화학 데이터에 그대로 적응한다는 점을 연구가 보여 줬다는 것이 마이크로소프트의 설명이며, 공개 벤치마크에만 통하는 모델이 아니라는 근거로 제시됐다. 네이처 게재본의 저자는 26명이며 제1 저자는 Krzysztof Maziarz, 마지막 저자는 Marwin H. S. Segler다. 사전 인쇄본은 2024년 12월 6일 arXiv 2412.05269로 처음 공개된 뒤 2025년 8월 12일 개정을 거쳤고, 저자 11명이던 그 판에서 26명으로 늘어난 차이가 제약사 공동 연구가 붙은 구간을 드러낸다.
두 모델을 섞은 이유는 앙상블이 아니라 귀납 편향의 다양성에 있다
여기서부터는 ASAP의 해석이다. 논문 제목에 들어간 단어가 ensembling이 아니라 ensembling diverse inductive bias models라는 점이 설계의 핵심을 드러낸다. 같은 종류의 모델을 여러 개 돌려 평균을 내는 통상적인 앙상블과 다르게, 이 구성은 분자를 보는 방식이 애초에 다른 두 모델을 묶는다. 저장소가 밝힌 대로 한쪽은 분자를 SMILES 문자열로 읽는 서브모델이고, USPTO-50K 체크포인트용으로는 그래프 구조를 직접 다루는 Graphium 기반 구성이 선택지로 제공된다.
문자열로 읽는 모델과 그래프로 읽는 모델은 틀리는 방식이 다르다. 문자열 모델은 토큰 수준의 패턴을 잘 잡지만 화학적으로 불가능한 구조를 문법적으로 그럴듯하게 써 낼 수 있고, 그래프 모델은 연결 관계를 지키는 대신 드문 반응 유형의 일반화에서 약할 수 있다. 서로 다른 방향으로 틀리는 모델을 합치면 한쪽의 실패가 다른 쪽의 신뢰도로 걸러진다. 마이크로소프트가 지목한 "드물지만 전략적으로 중요한 반응"의 누락 문제가 정확히 이 구조로 겨냥된다.
같은 설계 사상은 저장소가 권장하는 운용 방식에도 이어진다. 문서는 반응 실현 가능성 모델을 함께 붙여 쓰고 컨센서스 모드를 켜라고 권한다. 예측 하나를 그대로 신뢰하는 대신 서로 다른 관점의 판단을 교차시키는 구성이 모델 내부에서 한 번, 운용 단계에서 다시 한 번 반복되는 셈이다.
화학자 정렬이라는 표현이 top-k 정확도와 다른 지표인 이유
역합성 모델의 관행적 평가 지표는 top-k 정확도다. 데이터셋에 기록된 정답 반응을 모델이 상위 k개 안에 재현했는지를 세는 방식이며, 계산이 쉽고 재현 가능하다는 장점이 있다. 문제는 이 지표가 "기록된 그 반응과 같은가"만 묻는다는 데 있다. 화학자가 실험실에서 실제로 택할 만한 경로인지, 수율이나 시약 접근성이 합리적인지는 묻지 않는다.
이번 연구가 화학자의 수용률과 선호율을 전면에 내세운 것은 그 간극을 인정한 선택으로 읽힌다. 특히 학습 데이터에 기록된 반응 자체를 비교 대상으로 삼아 64퍼센트를 얻었다는 대목은 top-k 정확도로는 원리적으로 표현할 수 없는 결과다. top-k 기준에서 학습 데이터와 다른 답은 오답으로 셈되기 때문이며, 사람이 그 답을 더 낫다고 판단한 사례가 전체의 3분의 2에 가깝다는 뜻이기 때문이다.
다만 평가 설계를 바꾸면 검증 부담이 함께 옮겨 온다. 기준 분자 10개와 평가자 9명은 통계적으로 넉넉한 표본이 아니다. 어떤 분자를 기준으로 골랐는지, 블라인드가 어느 단계까지 유지됐는지, 평가자들이 소속 기관의 관행에 얼마나 영향을 받았는지에 따라 값이 움직일 여지가 있다. 자동 지표에서 사람 평가로 옮겨 간 것은 방향이 맞지만, 그 대가로 재현은 어려워졌다.
깃허브 문서가 스스로 적어 둔 다섯 가지 제한이 가장 실무적인 부분이다
공개 저장소의 경고문은 이번 공개에서 가장 실무적인 문서다. 문서는 RetroChimera 1이 연구와 실험 목적으로 공개됐다고 못 박으면서 "다른 모든 기계학습 모델과 마찬가지로 오류에서 자유롭지 않으며 환각을 일으킬 수 있다"고 적었고, 학습 분포 밖의 입력에서 특히 그렇다고 덧붙였다. 실제 환경에서 예측을 쓰기 전에 화학 전문가의 독립적 위험 평가와 검증을 반드시 거치라는 문장도 함께 있다.
순위와 환각의 관계를 명시한 대목이 특히 눈에 띈다. 문서는 출력 목록에서 순위가 낮은 반응일수록 환각일 가능성이 커진다고 적고, 엄격한 필터를 함께 쓰지 않는 한 입력 하나당 반응 5개에서 10개를 넘겨 요청하지 말라고 권한다. 모델이 내놓는 후보 수를 사용자가 마음대로 늘릴 수 있는 구조에서, 신뢰 구간을 개발자가 숫자로 적어 둔 사례다.
Pistachio 체크포인트에 붙은 네 가지 단서도 그대로 옮길 가치가 있다. 첫째, 학습에 쓰인 반응 데이터는 2023년까지이므로 그 이후의 화학은 반영되지 않는다. 둘째, Pistachio 데이터셋에 잡음이 있으므로 예측은 관련 문헌으로 뒷받침하고 독립적으로 검증해야 한다. 셋째, 학습 분포와 크게 다른 화학, 특히 특수한 학술 화학과 천연물 화학에서는 성능이 떨어질 수 있다. 넷째, 도메인별 적용에는 해당 분야의 전자 실험 노트와 문헌 반응으로 체크포인트를 미세조정하라고 권한다.
한국 연구팀이 지금 확인할 수 있는 것은 설치부터 체크포인트 선택까지다
접근 조건은 MIT 라이선스와 PyPI 배포로 정리된다. 저장소는 conda 환경 파일로 의존성을 만든 뒤 pip install retrochimera로 설치하고, RetroChimeraModel에 체크포인트 디렉터리를 지정해 분자 하나를 넣으면 확률이 붙은 예측 목록을 받는 예제를 제공한다. USPTO-50K 체크포인트를 쓰려면 graphium 추가 의존성을 함께 설치해야 한다. 모델은 마이크로소프트의 역합성 도구 모음 Syntheseus 위에 얹혀 있다.
체크포인트 선택이 첫 갈림길이다. 가장 강력한 체크포인트는 Pistachio로 학습됐고, 벤치마크용으로 USPTO-50K와 USPTO-FULL 체크포인트가 더 약한 판으로 함께 제공된다. 논문의 USPTO 계열 결과를 정확히 재현하려면 확장 데이터 표 3과 4에 적힌 추론 하이퍼파라미터를 써야 하며, 기본값은 Pistachio 체크포인트에 맞춰져 있다. 같은 코드로 다른 수치가 나오는 흔한 원인이 여기에 있으므로 재현을 목표로 한다면 이 설정부터 확인하는 편이 낫다. RetroChimera의 SMILES 기반 서브모델과 같은 구조로 Pistachio에서 학습한 정방향 예측 모델 체크포인트도 별도로 공개돼 있어, 제안된 역합성 경로를 정방향으로 되짚어 검증하는 구성을 붙일 수 있다.
국내 제약과 소재 쪽에서 이 공개가 갖는 의미는 도구 자체보다 미세조정 경로에 있다. GSK 사례가 보여 준 것은 사전 학습 모델이 회사 내부의 독점 반응 데이터에 적응한다는 점이며, 저장소도 같은 방법을 도메인 적용의 권장 절차로 적었다. 국내 기업이 쌓아 둔 전자 실험 노트 데이터가 학습 자산으로 쓰일 수 있다는 뜻이고, 동시에 그 데이터가 정리되지 않은 조직에서는 공개 체크포인트를 그대로 쓰는 수준에 머문다는 뜻이기도 하다.
네이처 게재와 실험실 검증 사이에는 아직 단계가 남아 있다
남은 검증 과제는 연구진 자신이 밝힌 다음 단계와 정확히 겹친다. 마이크로소프트는 벤치마크 시험을 넘어 실제 신약 개발 과정 안에서 모델이 어떻게 작동하는지 평가할 계획이라고 밝혔다. 바꿔 말하면 지금까지 확인된 것은 화학자가 제안서를 보고 수용한다는 사실이고, 제안된 경로가 실험실에서 의도한 수율로 작동한다는 사실은 아직 공개된 범위 밖이다.
읽을 때 주의할 지점도 남는다. 비교 모델이 2개에서 5개였다는 서술에서 그 모델들이 구체적으로 무엇이었는지, 각 모델이 동일한 탐색 예산과 후보 수 조건에서 평가됐는지는 공개 요약만으로는 확인되지 않는다. 사전 인쇄본 초록은 "모든 주요 모델을 큰 격차로 앞선다"고 적었을 뿐 항목별 수치를 제시하지 않으며, 상세 표는 네이처 본문과 확장 데이터에 있다.
그래서 이번 발표의 위치는 이렇게 정리된다. RetroChimera는 역합성 AI의 평가 기준을 데이터셋 재현율에서 화학자의 수용 여부로 옮겼고, 그 새 기준에서 학습 데이터 자체를 이겼으며, 코드와 체크포인트를 MIT로 풀면서 환각 가능성과 데이터 시점과 분포 밖 성능 저하를 스스로 문서에 적었다. 능력을 공개한 문서와 한계를 적은 문서가 같은 파일이라는 점이 이번 공개에서 가장 드문 대목이다.
출처: 마이크로소프트 뉴스룸 2026년 9월 21일 기사, 네이처 논문 "Chemist-aligned retrosynthesis by ensembling diverse inductive bias models"(DOI 10.1038/s41586-026-11160-9), 깃허브 microsoft/retrochimera 저장소 문서, arXiv 2412.05269 사전 인쇄본

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr