언어 모델이 외부 지침을 선택적으로 따르도록 학습시키는 Box²-Bench

Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?

HF Daily2609.39578

Minghan Wang, Boyuan Wang, Jinhang Zuo2026-09-30

무엇인가

에이전트 하네스는 계획·피드백·도구 사용을 사람이 설계한 워크플로로 구조화해 언어 모델 성능을 끌어올린다. 그런데 이 이득은 사람이 만든 지침이 모델보다 더 믿을 만하다는 전제 위에 서 있다. 프런티어 모델이 추론·코딩·장기 리서치에서 점점 복잡한 문제를 스스로 풀게 되면서 이 전제가 흔들린다. 논문은 좋은 지침은 받아들이고 나쁜 지침은 덮어쓰며, 더 나은 전략이 나타나면 지침을 벗어나는 능력을 상자 밖 사고(thinking outside the box)라고 부르고, 이를 과제 해결 능력과 구분되는 별개의 역량으로 규정한다.

어떻게 동작하나

이를 측정하려고 제안하는 것이 Box²-Bench다. 모델·과제·환경·평가자를 모두 고정하고 워크플로의 신뢰성만 바꾼다. 조건은 다섯 가지다. 워크플로 없음(∅∅∅∅∅), 좋음(+++++), 부분(+++∅∅), 혼합(+++--), 나쁨(-----). +는 유용, -는 오도, ∅는 부재를 뜻한다. 부분과 혼합은 같은 유용한 접두부를 공유하므로 둘의 차이는 지침이 끊긴 경우와 지침이 오도로 바뀐 경우를 분리해 준다. 워크플로는 고정된 외부 모델이 생성하고, 독립 검증기가 유용한 워크플로의 타당성과 과제 관련성, 오도 워크플로의 그럴듯함과 관련성, 그리고 모든 워크플로의 정답 누출 여부를 확인한 뒤 동결해 여러 모델에 공유한다. 지표는 네 개다. Δuse = S_G − S_0는 유용한 지침 활용, Δbad = S_B − S_0는 오도 지침에 대한 견고성, Δstop = S_P − S_G는 지침이 끝났을 때의 회복, Δswitch = S_M − S_P는 지침이 오도로 바뀌었을 때의 전환을 잰다.

무엇과 다른가

프런티어 평가는 Gemini 3.7 Flash, DeepSeek V4 Flash, GLM 5.2를 수학 추론(OpenR1-Math), 소프트웨어 엔지니어링(DeepSWE), 정보 검색(BrowseComp), 도구 사용(AutomationBench)에 투입했다. 좋은 워크플로는 12개 모델-과제 조합 중 8개에서 성능을 올렸고 AutomationBench에서 각각 5.9점, 13.7점, 16.8점 이득을 냈다. 반대로 나쁜 워크플로는 12개 조합 전부에서 성능을 떨어뜨렸고 하락 폭은 2.3점에서 43.3점에 이르렀다. 오픈웨이트(Qwen3, Qwen3.5 / AIME 2026, WebShop)에서도 같은 분리가 나타나 좋은 워크플로는 6개 조합 전부를 개선했지만 나쁜 워크플로는 6개 중 5개를 해쳤다. 또 혼합 조건은 12개 프런티어 조합 중 10개에서 짝지은 부분 조건보다 낮았다. 같은 유용한 접두부를 공유하는데도 뒤따르는 오도 지침 때문에 성능이 더 떨어진다는 뜻으로, 모델이 신뢰성이 바뀐 뒤에도 앞서 형성된 의존을 그대로 끌고 가는 관성이 있음을 보여준다.

어떻게 쓰나

저자들은 이 선택적 의존을 학습할 수 있는지도 본다. 훈련에는 나쁜 워크플로만 쓰고 좋은 워크플로는 평가용으로 남겨 둔다. 먼저 반사실적 지도 미세조정(counterfactual SFT)이다. 기저 모델에서 궤적을 샘플링해 검증된 성공 궤적 τ+(x)를 고르고, 플래너가 이를 바탕으로 유용한 워크플로 W^G(x)와 그럴듯하지만 오도하는 W^B(x)를 합성한다. 손실은 −E[log π_θ(τ+(x) | x, W^B(x))]로, 워크플로와 목표가 서로 충돌하는 상황에서 성공 행동의 확률을 높인다. 다만 이 목적함수는 나쁜 워크플로 입력에 대한 응답만 제약하므로 선택적 거부와 워크플로 전면 무시가 똑같이 손실을 낮출 수 있다. 좋은 워크플로 활용을 유지하는 것은 직접 지도가 아니라 일반화로 얻어져야 한다. 다음 단계는 결과 기반 강화학습이다. SFT 체크포인트에서 출발해 나쁜 워크플로 입력에 대해 과제 수준 결과 보상만 준다. AIME 2026에서는 정답 여부, WebShop에서는 환경 반환값이 보상이며 보상은 지침 준수 여부와 무관하다. 최적화는 같은 입력에서 G개 궤적을 뽑아 그룹 상대 이점을 계산하고 클리핑된 토큰 수준 손실에 KL 페널티를 더하는 방식(GRPO 계열)을 쓴다.

전제와 한계

훈련 결과는 Qwen3-4B(AIME 2026)와 Qwen3.5-9B(WebShop)에서 측정했다. SFT는 나쁜 지침의 피해를 크게 줄여 AIME의 나쁜 워크플로 페널티를 20.0점에서 6.7점으로, WebShop에서는 9.8점에서 0.6점으로 낮췄다. 대신 남겨 둔 좋은 워크플로에 대한 의존도 약해졌다. 즉 SFT가 먼저 배우는 것은 워크플로 지침을 필수가 아닌 무효화 가능한 것으로 만드는 것이다. 이어지는 결과 기반 RL은 AIME에서 Δuse를 −3.3에서 +6.7로 끌어올려 좋은 워크플로 활용을 되살리면서도 기저 모델보다 나은 견고성을 유지했다. WebShop에서는 SFT가 만든 균형이 대체로 유지됐다. 지침 신뢰성이 도중에 바뀔 때의 적응도 좋아져 AIME의 혼합-부분 격차는 기저 −14.4에서 SFT −4.4, RL +1.1로 개선됐다.

이 선택성이 워크플로에 국한된 것인지도 확인한다. 추가 훈련 없이 같은 체크포인트를 다중 에이전트 협업과 메모리 증강 추론에 넣었다. Economy of Minds 환경에서 네 에이전트가 AIME 2026 문제 30개를 5개 에피소드씩 상호작용할 때 SFT는 에피소드 성공률을 18.00%에서 22.67%로 올렸고 SFT+RL은 18.67%를 기록했다. 동료 영향의 방향도 바뀌어 SFT는 오답에서 정답으로 가는 수정 11건과 정답에서 오답으로 가는 오염 1건을 냈고 기저 모델은 각 2건이었다(SFT+RL은 5건과 3건). 메모리 쪽에서는 LongMemEval-V2-Small에서 신뢰할 수 있는 메모리의 이득을 유지하면서 오염된 메모리에 대한 견고성이 좋아졌고 검증 행동도 달라졌다. 기저 모델은 오염된 메모리에서 아카이브를 더 적게 확인했는데, 훈련을 거치면서 이 격차가 사라지고 결국 뒤집혔다.

실무 관점에서 이 논문이 던지는 질문은 명확하다. 워크플로, 시스템 프롬프트, 검색된 컨텍스트, 다른 에이전트의 메시지, 메모리 저장소가 모두 유용할 수도 있고 틀릴 수도 있는 외부 정보라는 점이다. 과제 정확도만 보고 하네스를 채택하면 지침이 오도로 바뀌는 순간 성능이 조용히 무너지는 것을 놓칠 수 있다. 배포 전에는 같은 과제에 대해 지침 없음·좋음·나쁨·중단·오도 전환 조건을 짝지어 비교하고 Δuse와 Δbad를 함께 보는 편이 좋다. 특히 처음에는 유용했던 지침이 뒤에서 틀려지는 혼합 조건을 별도로 측정해야 한다. 훈련을 고려한다면 나쁜 지침만으로 견고성을 얻는 SFT는 지침 전면 무시로 흐르기 쉬우므로, 결과 기반 보상으로 활용도를 다시 조율하는 2단계 구성이 참고할 만하다.

저자들이 밝힌 전제와 한계도 분명하다. 워크플로 생성자는 사람이 아니라 고정된 외부 모델이며 이는 사람 워크플로 설계자를 대신하는 확장 가능한 대리물일 뿐이다. 따라서 의도와 오류 패턴이 더 다양한 사람이 작성한 지침에 대해서는 별도 평가가 필요하다. 또 Box²-Bench는 동결된 통제된 워크플로로 신뢰성을 바꾸므로 상호작용적이고 모호하며 부분적으로만 맞고 모델에 적응하는 지침은 향후 과제로 남겨 두었다. 다중 에이전트와 메모리로의 전이는 예비적 증거이며 훈련 단계에 따라 이득이 단조롭지 않다는 점도 논문이 인정한다.