LongHarness가 장문맥 하네스의 정확도와 비용을 함께 시험한다
LongHarness Bench: Stress-Testing Language Model Harnesses for Long-Context Reasoning
무엇인가
언어모델 하네스(LM harness)는 베이스 모델 바깥에서 컨텍스트와 도구, 상호작용 순서를 관리하는 제어 계층을 말한다. 검색, 컨텍스트 분할, 도구 호출, 추가 모델 호출로 긴 문맥 추론 성능을 끌어올리지만 그만큼 계산 비용이 든다. 이 논문은 기존 장문맥 평가에 두 가지 구멍이 있다고 지적한다. 첫째, 단순 검색이나 세그먼트 독립 처리로 풀리는 과제는 추론이 진행되면서 전략을 바꾸는 하네스의 능력을 드러내지 못하고, 강한 모델-하네스 조합의 정확도가 포화되어 하네스 간 차별화가 되지 않는다. 둘째, 정확도만으로는 같은 모델로 만든 시스템이 비슷한 정확도를 내면서 전혀 다른 계산량을 쓰는 현실을 포착하지 못한다.
어떻게 동작하나
저자들은 이 두 문제를 겨냥해 LongHarness라는 벤치마크를 만든다. 설계 요건은 다섯 가지다. 정보 필요에 따라 어휘 검색과 의미 검색, 직접 읽기를 골라 쓰는 적응적 검색, 의미적으로 헷갈리는 증거의 검증, 중간 발견이 다음 검색을 바꾸는 다단계 추론, 그리고 계산 비용이 다른 여러 해법의 공존이다. 과제는 네 개다. Constraint Solving Search는 약 12만 토큰 분량의 문서에 흩어진 160명 정보에서 3~5개 조건을 모두 만족하는 사람을 정확히 5명 찾아낸다. 조건 하나만 못 채우는 사람들이 섞여 있어, 모든 사람에 모든 조건을 확인하는 완전 탐색과 가장 적은 사람이 만족하는 조건부터 좁히는 선택적 전략이 갈린다.
무엇과 다른가
Equivalent Program Pair Search는 APPS에서 각색한 파이썬 프로그램 200개(약 10만 토큰) 중 같은 입력에 같은 출력을 내는 쌍을 모두 찾는 과제로, 프로그램 본문과 입출력 예시가 지워져 있고 행동이 다른 변형(mutant)이 섞여 있다. Program Execution Tracing은 320개의 셔플된 과거 계산 기록에서 8단계 쿼리 프로그램의 결과를 복원해 8개 셀 ID와 최종 결과를 JSON으로 내야 한다. Outlier Memo Detection은 700개 메모, 2,500개 진술에서 다른 곳의 관계와 모순되는 메모 15개를 정확히 집어낸다. 평가는 인스턴스마다 입력·출력 누적 3M 토큰 예산을 주고 과제별 정확 일치(exact accuracy)를 측정한다.
어떻게 쓰나
GPT-5.6-sol, Gemini 3.8 Flash, GLM-5.3, Qwen3.8-27B, Kimi-K2.6 다섯 모델을 직접 추론과 네 가지 하네스(OpenCode, mini-swe-agent, RLM, ReAct)로 평가했다. 최고 조합인 GPT-5.6-sol + mini-swe-agent가 4개 스위트 매크로 평균 68%에 그쳤고, 비GPT 최고인 GLM-5.3 + mini-swe-agent는 42.5%, Kimi-K2.6은 어느 조합에서도 1.5%를 넘지 못했다. 과제별 최고 정확도는 Outlier Memo Detection 100%에서 Equivalent Program Pair Search 52%까지 벌어지고, 네 과제 모두에서 앞서는 하네스는 없었다.
전제와 한계
정확도가 비슷해도 비용은 크게 갈린다. Program Execution Tracing에서 GPT-5.6-sol 직접 추론은 94%에 입력 0.121M 토큰·인스턴스당 0.648달러, OpenCode는 96%에 1.29M 토큰·1.37달러다. Constraint Solving Search에서는 직접 추론 58%가 0.690달러, OpenCode 56%가 1.72달러다. 하네스 효과는 모델과 과제에 따라 부호가 바뀐다. GPT-5.6-sol에서 OpenCode는 Program Execution Tracing을 94%에서 96%로 올리지만 Outlier Memo Detection을 44%에서 10%로, Equivalent Program Pair Search를 44%에서 0%로 떨어뜨린다. mini-swe-agent는 매크로 정확도를 60%에서 68%로 올리면서 Outlier Memo Detection을 44%에서 100%로 끌어올리지만 Constraint Solving Search는 58%에서 42%로 낮춘다.
직접 추론 정확도가 낮은 모델일수록 하네스 이득이 컸다. Qwen3.8-27B는 0%에서 38.5%, GLM-5.3은 9.5%에서 42.5%로 오르고, Gemini 3.8 Flash는 10%에서 25%, GPT-5.6-sol은 60%에서 68%로 오른다. 반대로 추론을 더 쓴다고 성공하지도 않는다. Equivalent Program Pair Search에서 GPT-5.6-sol + RLM은 인스턴스당 7.86달러를 쓰고 2%를 기록해, 0.780달러에 44%인 직접 추론이나 2.68달러에 52%인 ReAct보다 나쁘다. Outlier Memo Detection에서도 RLM은 7.23달러에 92%, mini-swe-agent는 0.583달러에 100%다.
기존 벤치마크와 비교하면 차별화 능력이 드러난다. OOLONG-Synth에서는 모든 에이전트 하네스가 직접 읽기 64%를 넘어 70~86%를 기록했고, LongBench-v2에서는 다섯 구성이 60~68% 좁은 구간에 몰렸다. LongHarness에서는 같은 GPT-5.6-sol이 하네스에 따라 정확도-비용 평면의 네 영역을 모두 오간다. 저자들은 실패 원인도 분석한다. RLM은 컨텍스트를 잘게 쪼개 호출 수를 줄이지만 최종 결정 공간을 충분히 좁히지 못하고, ReAct의 임베딩 검색은 검색된 항목 자체가 비교 후보일 때만 유효하며, mini-swe-agent처럼 사실을 표로 모아 로컬 스크립트로 검증하는 방식이 메모 탐지에서 정확도와 비용을 동시에 개선했다.
실무적으로 이 논문은 장문맥 시스템을 모델 단독이 아니라 모델-하네스 조합으로 평가하고, 정확도 옆에 토큰과 비용을 함께 재야 한다는 주장이다. 하네스를 바꿀 때 과제별로 이득과 손해가 갈리므로 배포 전에 자기 워크로드에서 직접 비교해야 한다. 한계도 명시된다. Equivalent Program Pair Search의 정답 키는 두 프로그램이 원래 문제의 테스트를 모두 통과하면 같은 것으로 취급하는데, 이는 모든 가능한 입력에서의 동등성을 증명하지 않는다. 또한 벤치마크마다 정확 일치의 의미가 달라 백분율을 난이도로 정규화해 비교할 수 없다는 점과 인스턴스당 3M 토큰 예산이라는 전제도 밝힌다.