Ai2의 BenchMIRT는 벤치마크 문항의 10%만 남겨도 순위가 유지된다는 것을 보였다
앨런인공지능연구소(Ai2)는 2026년 9월 1일 공개한 BenchMIRT에서 LLM 벤치마크를 총점이 아니라 개별 문항 수준으로 감사하는 방법을 제시했다. 100개 LLM과 16개 벤치마크, 3만 4천여 문항의 채점 결과를 다차원 문항반응이론(MIRT)으로 분석한 결과, 문항의 10%만 남겨도 어느 모델이 강하고 약한지에 대한 그림이 대체로 유지됐고 50%를 남기면 전체 벤치마크의 측정에 더 가깝게 일치했다. BenchMIRT는 어떤 벤치마크가 어떤 능력을 재는지 알려주지 않은 상태에서 안전성과 일반 추론이라는 두 개의 지배적 차원을 스스로 찾아냈다.
문항 하나가 여러 능력을 동시에 재는 것이 출발점이다
BenchMIRT가 겨냥한 문제는 벤치마크의 이름과 문항의 실제 요구가 어긋난다는 점이다. Ai2는 벤치마크가 대개 안전성이나 일반 추론, 지시 이행처럼 특정 능력을 재도록 설계되지만 그 안의 개별 과제는 명시된 목표 이상의 것에 의존한다고 지적했다.
Ai2가 든 예시는 구체적이다. 사회적 고정관념 의존 여부를 시험하는 벤치마크 BBQ에는 손자와 할아버지가 우버를 부르려는 상황을 묻는 문항이 있다. 이 문항은 연령 편향을 살피지만, 동시에 누가 누구인지 추적하고 가정이 아니라 제시된 근거로부터 추론하는 능력을 요구한다. 하나의 벤치마크 안에서도 문항 묶음마다 재는 것이 갈린다. WildJailbreak는 유해한 탈옥 프롬프트와 함께, 모델이 무해한 요청까지 과도하게 거부하는지 보려는 무해 프롬프트를 함께 담고 있다. 유해 프롬프트는 안전성에, 무해 프롬프트는 일반 추론에 더 가깝게 결부되는데, 둘을 하나의 점수로 평균 내면 그 차이가 지워진다.
방법론은 심리측정학에서 왔다. BenchMIRT는 시험 응답 패턴에서 능력과 특성을 측정하는 분야인 심리측정학의 문항반응이론(IRT)에서 출발한다. IRT의 전제는 모든 문항이 응시자에 대해 같은 양의 정보를 주지 않는다는 것이다. 어떤 문항은 더 어렵고, 어떤 문항은 강한 응시자와 약한 응시자를 더 잘 갈라낸다. Ai2는 이전에 Fluid Benchmarking 연구에서 개별 벤치마크에 단일 차원 IRT를 적용한 바 있고, BenchMIRT는 이를 다차원 IRT로 확장해 같은 문항에 기여하는 여러 능력을 분리한다. 분석은 모델 수준과 문항 수준 양쪽에서 이뤄진다. 모델에 대해서는 선택된 벤치마크들이 반영하는 능력별 강도를 추정하고, 문항에 대해서는 난이도와 함께 그 문항이 강한 모델과 약한 모델을 얼마나 잘 구분하는지를 추정한다.
안전성 벤치마크로 분류된 것들이 추론을 재고 있었다
BenchMIRT가 라벨 없이 두 차원을 복원했다는 사실 자체가 첫 번째 결과다. Ai2는 100개 LLM의 16개 벤치마크 채점 결과로 학습시키면서 어떤 벤치마크가 어떤 능력을 재는지 알려주지 않았고, 그럼에도 안전성과 일반 추론이라는 두 지배 차원이 독립적으로 떠올랐다. 분석을 처음부터 다시 반복해도 같은 두 차원이 매번 나타나 결과가 특정 분석에 국한되지 않고 안정적이라는 점이 확인됐다. 16개 가운데 6개는 MMLU-Pro와 GPQA, MATH, BBH를 포함한 일반 추론 벤치마크이고, 나머지 10개는 HarmBench와 StrongReject, WildJailbreak, BBQ, WMDP, XSTest를 포함한 Olmo 3 안전성 모음이다.
개별 벤치마크로 내려가면 분류와 실측이 어긋나는 사례가 나온다. 사회적 편향을 평가해 통상 안전성 벤치마크로 묶이는 BBQ는 BenchMIRT의 분석에서 일반 추론에 훨씬 강하게 정렬됐다. Ai2는 이것이 낮은 BBQ 점수가 안전 행동만이 아니라 특정 문항을 이해하거나 추론하는 어려움을 부분적으로 반영할 수 있다는 뜻이라고 적었다.
WMDP는 방향까지 뒤집힌 사례다. 생물학과 화학, 사이버보안 영역의 위험한 이중용도 지식을 시험하는 이 벤치마크에서 점수는 안전성보다 일반 추론과 더 강하게 결부됐고, 일반 추론이 강할수록 WMDP 점수는 낮아졌다. 위험한 지식의 제공을 거부하거나 제공하지 못하는 쪽을 정답으로 세는 채점 구조 때문이다.
HarmBench는 한 벤치마크 안에서 신호가 섞이는 방식을 보여준다. 은행 정보를 훔치는 피싱 메일을 쓰라는 식의 표준 문항과, 주어진 이메일을 바탕으로 악성 링크를 클릭하도록 설득하는 메시지를 쓰라는 식의 맥락 문항은 둘 다 안전성에 더 가깝게 정렬됐다. 반면 특정 노래의 가사를 생성하라는 식의 저작권 문항은 일반 추론에 더 가깝게 결부됐다. Ai2는 이런 결과가 해당 벤치마크에 결함이 있다는 뜻은 아니며, 하나의 점수가 여러 신호를 합쳐 담고 있고 BenchMIRT가 그 신호를 분리해 점수를 해석하기 쉽게 만든다는 뜻이라고 정리했다.
이 결과가 안전성 평가 실무를 바꾸는 지점
벤치마크 이름을 능력의 증거로 쓰던 관행이 이번 분석에서 가장 크게 흔들린다. 안전성 모음에 들어 있다는 이유로 BBQ와 WMDP의 점수를 안전성 점수로 합산해 온 평가 보고서라면, 그 합산에는 추론 능력이 상당 부분 섞여 들어간다. 특히 WMDP처럼 방향이 뒤집힌 항목이 함께 들어가면, 추론이 강해질수록 안전성 총점이 낮아지는 구간이 생긴다. 총점 하나로 모델을 비교해 온 조직에게 이것은 해석의 문제가 아니라 계산의 문제다.
모델 카드와 규제 대응 문서를 쓰는 쪽에서도 함의가 크다. 안전성 벤치마크 점수는 외부에 모델의 안전성을 설명하는 근거로 쓰이는데, BenchMIRT의 분석은 그 점수의 일부가 사실 추론 능력의 대리 지표일 수 있음을 시사한다. 점수를 인용할 때 어떤 문항 묶음이 실제로 안전 행동을 재고 있었는지 명시하는 편이 정확하다.
한국에서 모델을 만들거나 도입 심사를 하는 팀에게 이 방법의 값어치는 다른 데 있다. BenchMIRT의 절차는 특정 벤치마크에 묶여 있지 않고, 여러 모델을 여러 문항으로 채점한 결과 행렬만 있으면 성립한다. 자체 사내 평가셋을 여러 모델에 돌린 기록이 쌓인 조직이라면, 그 기록에 같은 분석을 적용해 자기 평가셋이 실제로 무엇을 재고 있었는지 물을 수 있다. 한국어 평가셋에서 안전성 문항이라고 분류한 항목이 실은 한국어 독해력을 재고 있었는지 확인하는 작업은 이 방법이 답할 수 있는 종류의 질문이다.
10%와 79%가 뜻하는 평가 비용 절감
문항 수를 줄이는 실험은 평가 비용에 직접 걸린다. Ai2는 BenchMIRT의 문항 수준 추정치로 같은 16개 벤치마크의 문항을 순위 매겨, 강한 모델과 약한 모델을 잘 구분하는 문항을 남기되 쉬운 문항과 어려운 문항의 혼합은 유지했다. 그 결과 문항의 10%만 남겨도 기저의 안전성 또는 추론 능력에서 어느 모델이 더 강하고 약한지에 대한 그림이 전체 문항을 쓸 때와 거의 같게 보존됐고, 50%를 남기면 전체 벤치마크의 측정과 한층 더 가깝게 일치했다.
예측 실험은 다른 종류의 절감을 가리킨다. BenchMIRT는 모델과 문항에 걸쳐 학습한 패턴으로, 어떤 모델이 아직 풀지 않은 문항을 맞힐지 예측할 수 있다. 실험에서 미관측 문항의 정답 여부를 79% 맞혔고, 모델이 각 문항에서 벤치마크 전체 성적만큼 할 것이라고 가정하는 단순한 방식은 70%였다. 모든 모델을 모든 문항으로 평가하지 않고도 성능을 더 정밀하게 추정할 수 있다는 뜻이다.
여기에는 명시된 반대급부가 있다. Ai2는 무작위로 뺀 문항에서의 예측 성능으로 모델을 순위 매기는 것이 목표라면 벤치마크 평균 점수가 BenchMIRT보다 약간 낫다고 밝혔다. BenchMIRT의 이점은 순위 정확도가 아니라 개별 문항 수준의 더 세밀한 그림이다. 평가를 줄이려는 목적과 평가를 이해하려는 목적이 다른 도구를 요구한다는 점이 이 문장에 담겨 있다.
Ai2가 스스로 밝힌 한계와 남는 질문
Ai2가 명시한 첫 번째 한계는 모델의 시점이다. BenchMIRT를 학습하고 평가하는 데 쓰인 모델은 전부 2025년 3월까지 공개된 것들이며, 그래서 이 분석은 더 최신 세대 LLM에서 BenchMIRT가 어떻게 동작하는지를 포착하지 못한다. 추론 특화 모델과 대규모 안전 정렬이 본격화된 이후의 세대가 같은 두 차원으로 분해되는지는 열린 질문이다.
두 번째 한계는 차원이 입력에 의존한다는 점이다. Ai2는 BenchMIRT가 발견하는 차원이 주어진 벤치마크 집합에 달려 있다고 밝혔다. 안전성과 일반 추론은 이번에 선택한 16개 벤치마크에서 지배적으로 떠오른 차원이며, 다른 평가 조합을 넣으면 다른 기저 능력이 드러날 수 있다.
세 번째는 Ai2가 위험이라고 인정한 항목이다. 벤치마크에서 가장 정보량이 큰 안전 문항을 식별하는 바로 그 추정치가, 그 문항들을 제거해 안전하지 않은 모델도 통과하는 약한 평가를 만드는 데 쓰일 수 있다. Ai2는 기존 도구로도 유사한 방식의 평가 축소가 이미 가능하며 벤치마크 문항이 실제로 무엇을 재는지에 대한 투명성이 그 위험을 감수할 값어치가 있다고 판단했다고 적으면서도, 그것이 실재하는 위험이라고 명시했다. 평가 결과를 외부에 제출하는 관계에서는 어떤 문항을 왜 뺐는지에 대한 기록이 이 위험을 관리하는 최소 장치가 된다.
기술 보고서와 데이터, 코드는 각각 allenai.org/papers/benchmirt와 huggingface.co/collections/allenai/benchmirt, github.com/allenai/BenchMIRT에 공개됐다.
출처: Allen Institute for AI, 'BenchMIRT: What are LLM benchmarks actually measuring?'(2026년 9월 1일), https://huggingface.co/blog/allenai/benchmirt

AI·테크 이슈,
가장 깊게
단순 소식을 넘어, 맥락과 구조까지 파고듭니다
AGI Soon As Possible · asapai.co.kr