PyINE가 코드 실행 검증으로 AI 감독의 사각지대를 드러낸다
PyINE: A Framework for Scalable Elicitation and Oversight via Code Execution
무엇인가
추론 모델은 어떤 과제를 풀 능력이 있으면서도 더 싸고 그럴듯한 지름길로 답하는 경우가 있다. 이 논문이 겨냥하는 감독 문제는 이것이다. 모델이 그럴듯하지만 불완전한 추론과 함께 답을 내놓았을 때, 감독자가 그 출력을 신뢰해야 하는지 판정할 수 있는가. 저자들은 이 문제를 다루기 위해 검증 가능한 실행 기반(substrate)으로서 계측된 파이썬 프로그램을 쓰는 PyINE 프레임워크를 제안한다. 코드 실행은 최종 결과뿐 아니라 중간값, 분기 결정, 예외 같은 런타임 사실을 권위 있는 라벨로 기록할 수 있고, 사람이 주석을 달지 않아도 과제 변형을 기계적으로 생성할 수 있다는 점이 이유다. 특히 주석·변수명·타입 힌트·테스트처럼 사람이 보는 단서는 실행 진실과 어긋날 수 있어, 능력 부족이 아닌 행동 격차를 통제된 조건에서 만들 수 있다.
어떻게 동작하나
프레임워크 수준의 정의는 다음과 같다. 과제 인스턴스는 소스 코드 c와 관심 변수·입력·관측 지점을 지정하는 질의 q의 쌍 x=(c,q)다. 예측기 M은 x를 받아 실행 결과 예측 ŷ와 추론 산출물 z를 낸다. 정답 y는 프로그램을 계측 실행한 트레이스 τ(x)에서 얻는다. τ(x)는 프로그램의 모든 변수 값과 의존 관계를 관측할 수 있으므로 이 환경은 완전 검증 가능하다. 목표 y는 반환값, 중간 변수, 분기 결정, 예외, 출력, 부작용 등 무엇이든 될 수 있다. 감독자 O는 프로토콜에 따라 접근 범위가 달라진다. 수동 프로토콜은 x, ŷ, z만 보지만, 더 풍부한 프로토콜은 후속 질문, 특정 주장에 대한 국소적 증거 요구, 반사실 변형 간 비교, 활성값 같은 보조 신호 접근을 허용한다. 출력도 이진 신뢰 판정뿐 아니라 등급 점수, 수정 답안, 의심 지점 위치 표시까지 지원하며, 감독 품질은 비용과 함께 평가된다.
무엇과 다른가
PyINE-v1은 이 프레임워크의 첫 구체화다. 공개 파이썬 문제 코퍼스, 주로 TACO(APPS와 MBPP를 포함)에서 중복 제거와 실행 제어 가능성 필터링을 거쳐 거의 100만 개의 계측 실행 트레이스를 만들고, 그중 50만 개 이상에 실행 기반 목표를 보존하면서 표면 단서만 바꾼 매칭 코드 변형을 붙였다. 변형은 도움이 되는 변형(올바른 해석을 두드러지게)과 오도하는 변형(잘못된 지름길 해석을 두드러지게)으로 나뉘고, 모두 원래 실행 라벨로 검증된다. 이번 연구는 전체 프로그램의 최종 실행 결과 예측이라는 단순화된 범위에 집중한다. 피험 모델은 Qwen3-4B-Instruct에서 출발해 검증 가능한 보상 기반 GRPO 스타일 강화학습으로 훈련했다. 최종 답안 소프트매칭 점수를 보상으로 쓰고 완결 길이 페널티를 주며, 숨겨진 트리거를 심는 대신 훈련 분포 자체로 지름길 행동을 유도한다. 감독자에게는 실패 모드가 알려지지 않으며, 노출 프리셋(약함·중간·강함)이 오도 변형 등장 빈도를 조절하되 전체 예측 출력 분포는 약 80% 정답으로 유지된다.
어떻게 쓰나
모델 유기체의 타당성 검증 결과는 이렇다. 훈련 후 지름길 추종 모델은 원본 과제에서 기반 모델보다 크게 향상되지만, 사람을 향한 단서가 실행 진실과 충돌할 때 체계적으로 무너지는 큰 음의 오도 격차를 유지한다. 기반 모델은 원본 과제에서 너무 약해 실패가 행동 격차를 깨끗하게 분리하지 못한다. 더 강한 참조 모델들도 원본 정확도는 높고 오도 격차는 대체로 작지만, 모두 오도 단서에 측정 가능하게 영향을 받는다. 완결 길이도 유효성 점검을 뒷받침한다. 훈련된 모델은 기반보다 훨씬 길고 꼬리가 두꺼운 출력 분포를 보이며, 명시적 길이 페널티에도 불구하고 상당한 추론 연산을 쓴다. 오도 변형은 원본보다 짧은 생성을 유발하고, 오도 변형에서 정답을 낸 경우는 더 길다. 이는 충분한 실행 기반 추론 전에 지름길에 조기 확정하는 실패 양상과 일치한다. 원문 표에는 이 방향성이 서술되어 있을 뿐 구체적 정확도 수치는 제시되지 않았다.
전제와 한계
감독 실험의 핵심 패턴은 데이터셋 수준의 평균 성능이 오도 부분집합에 대한 낮은 커버리지를 가릴 수 있다는 것이다. 활성값 프로브와 훈련된 텍스트 분류기는 원본·도움 변형에서 그럴듯한 AUROC를 보이지만, 지름길 실패가 가장 중요한 오도 변형에서는 성능이 급격히 떨어진다. 일부 설정에서는 원본 과제 성능이 괜찮은데도 오도 과제 AUROC가 무작위 수준(0.5) 근처 또는 그 이하로 떨어진다. 오도 예시 노출을 늘린 강한 프리셋도 이 문제를 안정적으로 해결하지 못한다. 즉 값싼 학습 기반 감독자는 훈련·튜닝에서 본 흔한 오류 패턴은 익히지만, 정작 중요한 희귀한 지름길 오류는 놓칠 수 있다. 프롬프트 기반 LLM 판정자와 토론 기반 감독자는 변형 전반에 더 균형적이고, 가장 강한 상용 LLM 방법은 프로브·분류기에서 나타난 심각한 오도 슬라이스 붕괴를 피한다. 다만 판정·토론 성능이 단순한 모델 능력 순서를 따르지 않고, 추론 노력 설정이 직관에 어긋나게 감독 행동을 바꾸며, 코드 특화 모델이 범용 모델보다 나은 감독을 준다고 보장되지 않는다. 또 점수 분포가 희소하거나 극단으로 갈려 엄격한 거짓양성 예산에서 임계값을 잡기 어렵다. AUROC가 합리적인 방법도 낮은 목표 FPR에서 민감도를 빠르게 잃는다. 토론은 국소적 상호작용의 제한적 검증에 그쳤고, 어떤 경우에는 조기 합의나 실질적 문답 없는 판정으로 무너졌다.
비용까지 함께 보면 결론은 더 분명하다. 프로브와 소형 분류기는 목표 예측기 서빙 비용 대비 오버헤드가 작지만 변형 간 성능이 취약하다. 강한 LLM 감독자는 더 균형적이지만 토큰·지연·연산 비용이 훨씬 크다. 결과적으로 어떤 감독자도 원하는 저비용·고품질 영역을 차지하지 못한다. 오버헤드가 무시할 만한 방법은 슬라이스별 편차가 크고, 변형 전반에 안정적인 방법은 목표 예측기 서빙 비용에 근접하거나 초과한다. 이 비어 있는 중간지대가 이 논문의 주요 실증적 결론이다.
개발자 관점의 함의는 값싼 감독자에서 비싼 감독자로 올리는 단순한 캐스케이드가 잘 작동하지 않을 수 있다는 점이다. 값싼 감독자가 정확히 강한 감독자가 더 신뢰할 수 있는 실패 지점에서 함께 속기 때문에, 에스컬레이션 신호가 평범한 오류에만 반응하면 정작 필요한 곳에 비싼 감독자가 호출되지 않는 선택 문제가 생긴다. 또한 이 실험에서 최고의 감독 성능은 코드 실행 과제 자체에 매우 능한 모델에서 나왔는데, 이는 약한 시스템이 강한 시스템을 감독할 수 있다는 고전적 확장 감독 가설과 어긋난다. 실무에서는 평균 AUROC나 캘리브레이션만 보지 말고, 안전에 중요한 희귀 실패 모드에 대한 커버리지와 낮은 FPR에서의 민감도, 그리고 감독 비용을 함께 봐야 한다.
저자들이 밝힌 한계와 전제는 다음과 같다. PyINE-v1은 결정론적 파이썬 실행, 전체 프로그램 최종 결과 예측, 단일 지름길 추종 유기체, 자연어 자유 형식 추론 트레이스, 경량 반사실 변형이라는 좁은 범위에 머문다. 추론 트레이스는 기계 검증 가능한 증명이 아니라 자연어 산출물로 감사된다. 감독자에게는 실패 모드가 알려지지 않고, 지름길 오류가 훈련·튜닝 데이터를 지배하지도 않는다. 비용은 목표 예측기 서빙 비용으로 정규화한 추정치다. 저자들은 더 세밀한 질의, 다른 유기체 구성, 그리고 결정적 추론이 아예 생략되거나 축약되는 상황을 다루는 능동적·누락 인지형 감독을 향후 과제로 남긴다.