SWE-bench 상위권 코딩 에이전트는 수렴했고, 리더보드는 순위 대신 비교집합별 해상도와 모델-스캐폴드 출처를 보고해야 한다

Coding Agents Have Converged: Why the SWE-bench Leaderboard Can No Longer Order Its Top Entries, and What to Measure Instead

arXiv2609.17394v1

Fengshuo Liu2026-09-15조회 4

무엇인가

이 논문은 SWE-bench 같은 코딩 에이전트 리더보드에서 작은 점수 차이를 시스템 순위로 읽는 관행을 감사한다. 저자들은 과제 자체의 품질 문제를 묻는 기존 연구와 달리, 과제가 건전하더라도 공개된 판정이 순위를 지지하는지 묻는다. 이는 모델 선택, 조달, 연구 보고에서 리더보드 순위가 실제 결정을 좌우하기 때문에 중요하다. 분석은 모델을 다시 실행하지 않고, SWE-bench 유지관리자가 공개한 인스턴스별 하네스 판정과 메타데이터만 사용한다. 2026년 7월 30일 기준 네 개 공개 split의 254개 제출을 대상으로 한다.

어떻게 동작하나

핵심 도구는 비교집합 S에 대해 모든 구성원이 해결하거나 아무도 해결하지 못한 인스턴스를 퇴화로 정의하고, 실제로 비교에 기여하는 비퇴화 인스턴스 수 n_eff(S)=|{i:0<resolved_S(i)<|S|}|를 계산하는 것이다. 또한 강한 시스템 A와 약한 B의 중첩 계수 cov(A,B)=|A∩B|/|B|를 점수로부터 기대되는 기준 E[cov]=|A|/n과 비교해, 공유 성공이 우연보다 큰지 측정한다. 순위 판단은 같은 인스턴스에서의 짝지은 비교이므로 인접 순위 쌍에 exact McNemar 검정을 적용하고, 원 p값과 Holm 보정 p값을 함께 보고한다. 모델과 스캐폴드의 효과를 보기 위해 공개 메타데이터에서 (모델, 스캐폴드) 요인 설계를 재구성한다. 134개 Verified 제출 중 61개(46%)만 단일 사용 가능 모델 태그를 가져 수작업 정규화가 필요했고, 그 결과 34개 스캐폴드, 30개 모델, 55개 점유 셀을 얻었다. 저자들은 다섯 단계 감사 프로토콜을 제안한다. 중첩 비교집합별 n_eff 프로파일링, 점수 기대 기준 대비 중첩 설명, 모든 쌍의 exact McNemar와 Holm 보정, 현재 티어 리더와 비교해 p<0.05에서 새 티어를 시작하는 서술적 분할과 민감도 보고, 짝지은 조건을 역산해 새 인스턴스 예산을 산정하는 단계다.

무엇과 다른가

Verified 500개 인스턴스에서 상위 두 제출은 각각 396개를 해결해 동점이다. 상위 10개는 285개 성공과 51개 실패를 공유해, 이들을 구분할 수 있는 인스턴스는 164개뿐이다. 전체 134개 Verified 제출에서 n_eff/n은 0.94로 건강해 보이지만, 상위 10개에서는 0.33, 상위 2개에서는 0.07(36개 인스턴스)로 붕괴한다. Lite도 상위 10개에서 0.89에서 0.54로 같은 패턴을 보이고, 2294개 인스턴스의 Test split을 포함한 네 split 모두에서 붕괴가 확인된다. 해결집합은 전문화가 아니라 중첩되어, 프런티어의 중첩 계수 중앙값은 0.935이고 점수 기대 기준은 0.774다. 상위 두 시스템의 해결 합집합은 414개로 최고 단일 시스템 396개보다 조금 크고, 상위 10개의 합집합은 449개다.

어떻게 쓰나

점수는 모델만의 속성이 아니다. 같은 모델에서 스캐폴드가 달라질 때 관측 범위 중앙값은 78개 인스턴스(15.6%p)이고, claude-3-5-sonnet은 9개 스캐폴드에서 168개에서 317개까지 149개(29.8%p) 차이를 보인다. claude-4-sonnet은 8개 스캐폴드에서 99개, gpt-4o는 6개에서 78개 차이다. 같은 스캐폴드에서 모델이 달라질 때 중앙값은 60개(12.0%p)다. 비교하자면 상위 30개 제출 전체 점수 폭은 8.8%p에 불과하다. 동일 모델-스캐폴드 반복 제출의 범위는 13, 15, 27, 41, 116개(중앙값 27개, 5.4%p)로, 모델 내 스캐폴드 중앙 범위가 반복 바닥보다 2.9배 크다. 연결된 핵심 20개 셀, 10개 스캐폴드, 7개 모델의 가법 최소제곱 적합은 R^2=0.989이고 스캐폴드 효과 범위 37.6%p, 모델 효과 범위 47.9%p로 비율 0.78이다. 상호작용 검정에서는 9개 중 6개가 Holm 보정 후에도 유의했고, 2023 rag 사례를 제외하면 8개 중 5개가 유의했다. epam-ai-run은 sweagent를 claude-3-5-sonnet에서 95개, claude-4-sonnet에서 51개 앞서며 상호작용 +44, Holm p=0.0035였다. agentless와 epam-ai-run의 비교는 claude-3-5-sonnet과 gpt-4o 사이에서 부호가 뒤집혔고 상호작용은 -75.5개(-15.1%p)였다. autocoderover와 epam-ai-run도 -83개로 뒤집혔고 보정 p<0.001이었다.

전제와 한계

인접 순위 비교에서 Verified 상위 30개의 29개 인접 쌍은 alpha=0.05에서 하나도 분리되지 않았고 Lite도 같았다. 중앙 점수 차이는 1개 인스턴스, 중앙 불일치 수는 Verified 61개, Lite 57개였으며, 순위 거리를 2에서 5로 넓혀도 분리되는 쌍은 0개였다. 반면 2294개 인스턴스의 Test split에서는 상위 24개가 0.2%에서 52.6%까지 넓게 퍼져 있고 23개 인접 쌍 중 14개가 분리되었으며 중앙 차이는 42개였다. 상위 30개 내 435개 쌍 중 194개(44.6%)는 보정 없이 분리되고 41개(9.4%)만 Holm 후 살아남지만, 인접 29개는 어느 쪽이든 0개이고 가장 작은 인접 p값은 0.545다. 저자들의 리더 기반 규칙은 서술적 3개 티어를, Holm 보정 후에는 2개 티어를 준다. KR-20은 전체 134개에서 0.994, 상위 50개에서 0.940, 상위 20개에서 0.722, 상위 10개에서 0.475로 프런티어에서 내적 일관성이 급락한다. 새 인스턴스 예산을 역산하면 Verified 상위 10개 인접 쌍 중 0 차이 두 쌍을 제외한 상위 중앙 배수는 52배로 같은 성격의 약 26,000개 인스턴스가 필요하다. 불균형이 0이면 추가 인스턴스로 동점 쌍을 분리할 수 없고, 54/500 불일치 기준 쌍에서 불균형률 0.2면 약 900개로 줄어든다. 퇴화 인스턴스를 은퇴시키는 해법은 상위 20개에 비퇴화인 209개로 재척도할 때 점수 폭을 8.8%p에서 18.7%p로 두 배 이상 늘리고 인접 3쌍을 재정렬하지만, 분리 가능한 쌍은 여전히 29개 중 0개다.

개발자에게 이 논문의 실무적 결론은 작은 집계 점수 차이를 확립된 순위 차이로 해석하지 말라는 것이다. 모델을 고를 때는 외부 모델 순위를 그대로 옮기지 말고 실제 배포할 (모델, 자체 하네스) 쌍을 평가해야 한다. 스캐폴드 순서가 모델에 따라 뒤집히기 때문이다. 벤치마크 크기는 결정에 필요한 해상도에 맞춰 정하고, 테스트 전에 탐지 가능한 차이를 명시해야 한다. 예를 들어 n=100이면 독립 표본 기준 탐지 가능 차이는 약 17%p이고, WorkBuddy Bench의 50, 80, 500개 하위 집합에서는 각각 약 23%p, 19%p, 8.2%p다. 후보별 n_eff를 추적해 모든 후보가 통과하거나 실패하는 과제가 구분에 기여하지 않음을 관리해야 한다. 채점은 에이전트가 스스로 보고한 결과가 아니라 기계 판독 가능한 산출물로 해야 하며, 패치와 채점기의 구조화 보고서를 저장하고 테스트 파일을 건드린 패치를 거부하며, 저장 산출물로 재계산할 수 없는 실행은 실패가 아니라 결측으로 처리하는 것이 좋다. 결측 판정 규칙은 실행 전에 정하고 점수와 함께 결측 수를 보고해야 한다. 의사결정자에게는 순위표 대신 소수의 티어와 티어별 비용·지연을 보고하는 편이 정직하다. 내부 과제를 선호하고 주기적으로 재마이닝하되, 내부 벤치마크도 같은 이유로 포화된다는 점을 기억해야 한다.

저자들이 밝힌 한계는 분명하다. 모델-스캐폴드 요인 설계는 관찰 연구라서 팀이 스캐폴드와 모델을 함께 선택하고, 스캐폴드 효과에 공동 최적화, 엔지니어링 노력, 차별적 모델 접근이 섞인다. 따라서 인과 효과가 아니며, 54%의 제출은 설계에 배치할 수 없어 여러 팀이 구축한 모델 세대로 편향된다. 제출당 한 번의 실행만 있어 시스템 간 차이를 실행 간 분산과 분리할 수 없고, 구간과 검정은 관측된 제출에 조건을 두고 인스턴스를 재표집하므로 실행 변동성을 포함하지 않으며 총 불확실성을 정량화하거나 동등성을 증명하지 않는다. Verified는 사전학습 데이터와 겹쳐, 이슈 텍스트만 주면 모델이 버그 파일을 Verified에서 76%, 보지 못한 저장소에서 53% 정확도로 식별한다. 연도 기반 검정은 효과를 찾지 못했지만 연도는 대리 변수에 불과해 2023~2025 코호트 내 상위 10개의 n_eff/n 변화(0.06에서 0.50, 다시 0.33)를 능력 성장의 증거로 읽지 않는다. 과제 결함은 하네스 판정을 주어진 것으로 두며, 인간 노력 추정과의 정렬은 결함이 퇴화의 주원인이라는 해석에 반한다. 풀은 하나의 벤치마크 계열, 하나의 하네스, 자발적 제출에 한정되고, 프로토콜은 다른 짝지은 판정 행렬에도 쓸 수 있지만 다른 리더보드에서의 검증은 미래 작업이다. 또한 비기각은 동등성이나 비열등성을 뜻하지 않고, 비유의성은 이행적이지 않으며, 티어는 서술적이지 동시 순위 구간이 아니다.