ComPO: 선호 손실을 미분하지 않고 비교 신호만으로 정렬해 파라미터 0.02%만 갱신했다
UC 버클리·뉴욕대·알리바바 DAMO 아카데미·컬럼비아대 연구진이 2026년 9월 16일 arXiv 2609.19144로 공개한 ComPO는 미분 가능한 선호 손실을 계산하지 않고 비교 오라클의 한 비트 신호만으로 LLM을 정렬한다. 갱신 대상은 출력층 항목 가운데 약 1%뿐이며 Mistral-7B 기준으로 약 150만 개, 전체 7B 파라미터의 0.02%에 해당한다. Llama-3-8B-Instruct에서 AlpacaEval 2 길이 보정 승률은 DPO의 32.59%에서 35.79%로 올랐고, SimPO 체크포인트에 그대로 얹은 Gemma-2-9B-it에서도 60.36%에서 62.42%로 올랐다. ASAP은 이 논문을 "기울기를 포기했을 때 무엇을 얻고 무엇을 잃는가"라는 축으로 정리한다.
미분을 포기하고 예·아니오 한 비트를 택했다
ComPO의 출발점은 기울기 계산의 제거다. 연구진이 제안한 Comparison-based Preference Optimization은 현재 정책을 무작위 방향으로 흔들어 본 뒤, 그 섭동이 선호 응답의 로그 확률을 올리고 비선호 응답의 로그 확률을 내리는지만 판정한다. 판정 결과는 예 또는 아니오라는 한 비트이고, 여러 섭동에서 모은 한 비트 신호를 합쳐 정규화된 갱신 방향을 만든다. 초록의 표현대로 이 방법은 저마진 쌍에 대해 미분 가능한 선호 손실을 직접 최적화하지 않으면서 방향 정보를 뽑아낸다.
이 설계가 가능한 이유는 판정에 필요한 것이 로그 확률 두 개뿐이기 때문이다. 손실 함수의 기울기를 구하려면 전체 모델을 거슬러 올라가는 역전파가 필요하지만, 두 응답의 로그 확률 비교는 순방향 계산만으로 끝난다. 논문은 이 갱신이 전체 모델 역전파를 피하고 모든 섭동 벡터를 저장하지 않는다고 명시한다.
갱신 범위도 좁다. 다층 섭동 실험을 제외하면 출력층 바깥의 파라미터는 전부 동결되고, 임계값 λ_g가 출력층 항목 가운데 크기가 충분히 큰 것만 남긴다. Mistral-7B에서 출력층 크기는 0.13B이고 여기서 1.18%를 남기면 약 150만 개, 전체 7B 모델의 약 0.02%가 된다. 임계값을 바꿔 가며 실험한 결과 가장 좋은 성능은 항목의 약 1%에서 6%를 남길 때 나왔고, 작은 항목을 많이 남기거나 거의 전부를 걸러내면 성능이 떨어졌다.
버리던 저마진 쌍이 이 방법의 원료다
이 논문에서 실무적으로 가장 중요한 결정은 데이터를 둘로 쪼갠 지점이다. 연구진은 참조 모델 기준으로 선호 응답과 비선호 응답의 로그 확률 차이가 임계값 이하인 쌍을 D_noisy로 묶고, 나머지를 D_clean으로 둔다. 논문은 여기서 말하는 noisy가 저마진 부분집합을 가리킬 뿐 선호 라벨이 틀렸다고 전제하지 않는다고 못 박는다. 학습은 두 단계로 진행된다. DPO나 SimPO 같은 기존 방법을 D_clean에 먼저 적용하고, 그렇게 얻은 체크포인트에 ComPO를 D_noisy로 적용한다.
이 분리가 겨냥하는 문제가 가능도 변위(likelihood displacement)다. 선호 쌍의 두 응답이 모델 입장에서 서로 비슷할 때, 직접 정렬 방법이 비선호 응답을 밀어내면서 선호 응답의 확률까지 함께 끌어내리는 현상이 보고돼 왔다. 그런 쌍을 그냥 버리면 데이터가 줄고, 그대로 쓰면 학습이 엉뚱한 방향으로 간다. ComPO는 세 번째 길을 택해, 그 쌍들을 손실 함수의 표본이 아니라 잠재 목적함수에 관한 비교 신호로 취급한다.
표 2가 이 주장의 직접 근거다. Llama-3-Instruct-8B에서 선호·비선호 응답의 로그 확률은 학습 전 (−46.761, −47.410)이었고, γ를 1로 둔 세 번의 독립 시행에서 선호 쪽은 −46.728·−46.743·−46.753으로 올라가고 비선호 쪽은 −47.520·−47.525·−47.517로 내려갔다. Gemma-2-9B-it에서도 (−133.122, −134.557)에서 선호 쪽이 −133.059까지 오르고 비선호 쪽이 −134.565까지 내려간다. 두 확률이 같이 떨어지는 가능도 변위의 전형적 패턴이 나타나지 않는다는 것이 연구진의 진단이다.
저마진 쌍이 원료라는 성격은 규모 실험에서도 확인된다. 노이즈 쌍 수를 100개에서 300개로 늘리자 AlpacaEval 2의 두 지표와 Arena-Hard 모두 평균 성능이 올랐다. 기존 파이프라인이 품질이 낮다고 판단해 걸러내던 데이터가 이 방법에서는 늘릴수록 이득이 되는 자원으로 뒤집힌다.
표 1과 표 3의 숫자, 그리고 한 칸의 역행
측정 결과는 AlpacaEval 2 길이 보정 승률에서 가장 일관된다. Llama-3-8B-Instruct의 길이 보정 승률은 DPO 32.59%, D_clean만 쓴 DPO 32.92%, 여기에 ComPO를 얹은 구성 35.79%로 올라간다. 원 승률은 31.99%에서 35.03%로, MT-Bench 평균은 7.93에서 8.05로 함께 움직인다. Mistral-7B-Base는 9.71%에서 11.66%로, Llama-3-8B-Base는 4.14%에서 5.39%로 오른다.
이미 배포된 체크포인트 위에 덧붙이는 경우도 마찬가지다. 표 3은 공개된 SimPO 체크포인트에 ComPO만 추가로 적용한 결과를 담았다. Mistral-7B-Instruct는 길이 보정 승률 40.22%에서 42.27%로, Llama-3-8B-Instruct는 48.71%에서 49.53%로, Gemma-2-9B-it는 60.36%에서 62.42%로 올랐다. 원래의 학습 목적함수를 바꾸지 않고 기존 방법을 보강한다는 것이 연구진의 표현이다.
숫자를 읽을 때 두 가지는 짚고 가야 한다. 첫째, 이득의 크기가 벤치마크마다 다르다. 같은 표 3에서 Arena-Hard 승률은 20.8%에서 22.0%, 36.3%에서 37.3%로 소폭 오르는 데 그치고 Gemma-2-9B-it에서는 61.1%로 변화가 없다. AlpacaEval 2에서 2%포인트 안팎의 개선이 Arena-Hard에서는 1%포인트 남짓이거나 0이라는 뜻이다.
둘째, 모든 칸이 좋아지지는 않았다. Mistral-7B-Instruct에서 길이 보정 승률은 24.14%에서 26.17%로 올랐지만 Arena-Hard 승률은 14.4%에서 10.5%로 3.9%포인트 떨어졌다. 같은 구성에서 MT-Bench 평균은 5.86에서 7.69로 크게 뛰었으니, 지표들이 서로 다른 방향을 가리킨 셈이다. 한 지표의 개선을 모델 전반의 개선으로 옮겨 읽으면 안 된다는 경고가 논문 자신의 표 안에 들어 있다.
온라인 ComPO는 KL 반경으로 제동을 건다
온라인 확장의 핵심은 라벨 없는 생성물의 활용이다. 오프라인 ComPO가 선호 쌍에서만 비교 신호를 얻는 반면, 온라인 ComPO는 같은 비교 메커니즘을 유지한 채 현재 정책이 만들어 낸 라벨 없는 생성물로 참조 정책 대비 역 KL 발산을 추정한다. 후보 갱신을 만들어 보고 그 결과가 정해진 KL 반경 안에 들어오면 받아들이고, 벗어나면 보폭을 줄이는 방식이다.
표 10의 수치는 단계별로 쌓인다. Qwen3-4B-Base에서 AlpacaEval 2 길이 보정 승률은 DPO 15.28%, ComPO 추가 16.20%, 역 KL 제어 추가 17.43%, 리샘플링까지 더한 구성 18.57%로 올라가고 Arena-Hard는 29.3%에서 32.6%까지 간다. Gemma-3-4B-it는 38.30%에서 42.55%로, Arena-Hard는 56.9%에서 63.7%로 오른다. Llama-3.2-3B-Instruct는 11.72%에서 13.05%로 이득 폭이 가장 작다.
여기서 눈여겨볼 대목은 Arena-Hard의 반응이다. 오프라인 구성에서 Arena-Hard는 거의 움직이지 않았는데, 역 KL 제어가 붙은 뒤 Gemma-3-4B-it에서 57.7%에서 63.3%로 5.6%포인트 뛴다. 참조 정책에서 너무 멀어지지 않게 제동을 거는 장치가 어려운 과제군에서 더 크게 작용했다고 읽을 수 있다. 다만 논문은 이 온라인 변형이 쓰는 길이 정규화 감쇠 규칙을 알고리즘 4의 실용적 처방으로 제시할 뿐, 앞서 제시한 수렴 보장의 적용 범위 안에 넣지는 않는다.
23GB라는 숫자를 어떻게 읽을까
자원 수치는 인상적이지만 그대로 비교하면 안 된다. 논문은 Llama-3-8B ComPO에서 A40 한 장당 최대 메모리가 약 23GB였고, DPO와 SimPO의 보고된 최대치는 H100에서 각각 77GB와 69GB라고 적었다. 그리고 바로 다음 문장에서 이 측정이 서로 다른 하드웨어에서 이뤄졌으므로 통제된 일대일 비교가 아니라 실용적 자원 요건을 기술한 것이라고 스스로 못 박는다. 역전파가 없으니 메모리가 크게 줄어드는 것은 구조적으로 당연하지만, 77 대 23이라는 대비를 성능 대비 효율의 배수로 옮기는 해석은 논문이 허락하지 않는다.
비용은 다른 축으로 이동했을 뿐이라고 보는 편이 정확하다. 모든 ComPO 실험은 46GB 메모리의 NVIDIA A40 30장을 썼고, 600회 섭동을 마치는 데 50초가 걸렸다. 섭동 수를 늘릴수록 성능이 오른다는 것도 표 4에 나와 있다. AlpacaEval 2 길이 보정 승률 평균은 섭동 800회에서 24.72%, 1600회에서 25.02%, 3300회에서 25.91%, 5400회에서 26.49%로 단조 증가한다. 즉 이 방법은 장치 한 장이 감당할 메모리를 줄이는 대신 순방향 계산 횟수를 늘리는 교환을 한다.
이 교환의 성격이 실제 도입 조건을 결정한다. HBM이 큰 가속기 몇 장을 확보하기 어렵지만 중급 GPU를 여러 장 병렬로 돌릴 수 있는 조직에서는 유리한 교환이고, 장치 수가 제한된 환경에서는 그렇지 않다. 논문이 병렬화가 자연스럽다고 적은 것은 장점의 서술인 동시에 전제 조건의 서술이기도 하다.
API 시대의 한국 팀에 남는 실무적 선택지
국내 조직에 이 논문이 닿는 지점은 정렬 단계의 진입 비용이다. 자체 모델을 미세조정하는 국내 팀 상당수는 공개 체크포인트에서 출발하며, 정렬을 다시 돌리려면 데이터 정제부터 전체 학습 루프까지 되돌아가야 한다는 부담이 있다. 표 3이 보여준 것은 이미 정렬이 끝난 SimPO 체크포인트에 원래 목적함수를 건드리지 않고 추가 단계를 얹는 경로이고, 이 경로는 학습을 처음부터 다시 설계하는 것보다 시도 비용이 낮다.
갱신 범위가 출력층에 국한된다는 점도 운영 관점에서 유리하다. 바꾸는 파라미터가 전체의 0.02% 수준이면 변경분을 따로 보관하고 문제가 생겼을 때 되돌리는 일이 간단해진다. 반대로 말하면 이 방법이 모델의 깊은 표현을 재구성하지는 않는다는 뜻이기도 하다. 다층 섭동 실험에서 Mistral-7B-Instruct의 30·31층 MLP를 함께 흔들자 세 지표가 모두 개선됐고 최대 메모리는 16.3GB에서 16.7GB로, 600회 섭동 시간은 50초에서 60초로 늘었다. 범위를 넓히면 더 얻을 수 있다는 신호이지만 본 실험 대부분은 출력층만 건드린 결과다.
가장 현실적인 제약은 데이터 쪽에 있다. 이 방법의 원료는 한국어 선호 쌍 가운데 두 응답의 로그 확률 차이가 작은 저마진 쌍이고, 그 쌍을 골라내려면 참조 모델로 전체 데이터의 로그 확률을 한 번 훑어야 한다. 선호 데이터 자체가 부족한 상황에서 버리던 쌍을 재활용할 수 있다는 것은 분명한 이득이지만, 애초에 쌍이 수백 개 수준이라면 노이즈 쌍 100개에서 300개로 늘렸을 때의 이득을 재현할 여지가 크지 않다.
이론과 구현 사이에 남은 틈
이 논문의 이론적 기여와 실험적 기여는 같은 대상을 가리키지 않는다. 연구진은 오프라인 기본 스킴에 대해 평활성·기울기 희소성·오라클과 잠재 목적함수의 양립성이라는 조건 아래 수렴 보장을 세웠고, 희소성 수준이 고정되면 필요한 비교 질의 수가 전체 차원에 로그로만 의존한다는 결과를 얻었다. 그런데 논문 스스로 적듯 목적함수가 잠재적이기 때문에 기울기 노름을 실제 정지 기준으로 쓸 수 없고, LLM 미세조정 규모에 맞추기 위해 실제 구현은 기본 추정량을 근사한다.
온라인 쪽은 틈이 더 넓다. 성능 보장은 국소 커버리지와 분포 내 쌍 보상 정확도라는 조건 아래 기본 제약 스킴에 대해 세워졌지만, 표 10에서 가장 좋은 숫자를 낸 구성은 길이 정규화 감쇠와 리샘플링을 쓴 알고리즘 4다. 보장이 붙은 스킴과 숫자를 만든 스킴이 같지 않다는 뜻이고, 이는 최적화 이론 논문이 대규모 모델 실험을 붙일 때 흔히 생기는 간극이다. 독자가 이 논문에서 가져갈 것은 수렴 증명의 안전망이 아니라 비교 신호만으로도 방향이 잡힌다는 경험적 증거다.
규모의 문제도 남는다. 실험에 등장한 가장 큰 모델은 Gemma-2-9B-it이고 온라인 실험은 3B에서 4B 사이에 머문다. 출력층 항목의 1%만 남긴다는 설계는 어휘 크기와 은닉 차원이 커질수록 다른 양상을 보일 수 있으며, 한 비트 신호를 수천 번 모아 방향을 추정하는 방식이 훨씬 큰 출력층에서도 같은 신호 대 잡음비를 유지하는지는 이 논문이 답하지 않는다. 섭동 수를 5400회까지 늘려도 성능이 계속 올랐다는 표 4의 결과는 좋은 소식인 동시에, 더 큰 모델에서 필요한 섭동 수가 어디까지 늘어날지 모른다는 열린 질문이기도 하다.
출처: arXiv 2609.19144 "A Zeroth-Order Paradigm for LLM Preference Alignment"(2026년 9월 16일 제출, Peter Chen·Xi Chen·Wotao Yin·Tianyi Lin) 초록과 본문 4절, 표 1·표 2·표 3·표 4·표 10 기반 ASAP 정리. 같은 저자들의 초기 버전은 arXiv 2505.05465 "ComPO: Preference Alignment via Comparison Oracles"(2025년 5월 8일 제출)다.

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr