60만 행 모놀리스 AI 리팩터링, '코드 이전' 대신 '행위 이전'으로 검증한다

InfoQ 中文17일 전조회 10

앤트그룹 알리페이의 디지털 민생 기술 연구개발 엔지니어 장위가 QCon 상하이 2026에서 약 60만 행 규모 Java 모놀리식 시스템을 AI로 교차 언어 리팩터링한 사례를 발표할 예정이다. 발표의 핵심은 리팩터링의 목표를 '코드 이전'이 아니라 '행위 이전'으로 다시 정의한 데 있다. 대상 시스템은 알리페이 생활요금 납부 서비스의 핵심 온라인 시스템으로, 600개가 넘는 인터페이스와 복잡한 업무 분기, 기관별 차등 설정, 분산 호출 체인, 외부 의존성을 포함한다.

기존 방식의 한계는 분명하다. 코드 리뷰를 통과하고, 보강한 테스트 케이스가 통과하고, 커버리지가 올라가도 그것은 일부 구현이 검사됐다는 뜻일 뿐이다. 새 시스템이 기존 시스템의 핵심 행위를 예상된 업무 경계 안에서 그대로 유지하는지는 증명되지 않는다. 발표자는 이 지점을 세 가지 질문으로 정리한다. 기존 시스템에서 이전해야 할 핵심 행위는 무엇인가, 새 시스템이 그 행위를 실제로 재현했는가, 차이를 발견했을 때 그것을 근거로 배포 결정을 내릴 수 있는가.

이를 위해 서로를 검증하는 두 개의 루프를 둔다. Loop 1은 기존 시스템에서 업무 행위를 추출한다. PERS 모델링으로 선행 조건, 트리거 이벤트, 업무 결과, 부작용을 프로그래밍 언어와 무관한 행위 기술로 정리하고, Case-Forge로 경로를 압축한 뒤 사람과 AI가 협업해 시나리오를 만든다. Loop 2는 Bubble을 이용해 새 시스템에서 같은 시나리오를 재생하고 실제 실행 경로를 확인해 양쪽의 행위 차이를 판정한다. 두 루프는 행위 시나리오로 연결되며, 각 시나리오는 목표 행위, 입력 제약, 실제 경로 증거, 차이 결론을 갖춰야 다음 단계로 넘어간다.

경로 압축에서 중요한 것은 케이스 수를 최소화하는 게 아니라 실행 비용을 통제하면서 각 핵심 업무 종점마다 대표성 있는 실행 경로를 남기는 것이다. Case-Forge는 업무 종점 기준으로 후보 경로를 묶고, 공유 분기 조건을 재사용하며, 국소 결과에만 영향을 주는 독립 요인은 증분 전개하고, 제약 충돌이나 도달 불가능한 조합은 잘라낸다. 결정적 분석이 경로 골격과 조건 제약을 제공하고, AI가 추상 조건을 구체적인 업무 데이터·기관 설정·목으로 펼치며, 사람이 고위험 종점과 의미 경계를 확인하는 분업 구조다.

발표에서 강조하는 실패 유형은 '거짓 커버리지'다. AI가 만든 케이스 설명은 그럴듯하고 최종 단언도 통과하는데, 실제 실행은 선행 분기에서 일찍 끝나 목표 호출과 목표 업무 종점이 아예 발생하지 않는 경우다. 문제는 단언이 아니라 입력·설정·목의 조합이 목표 경로 제약을 만족하지 못한 데 있다. 그래서 유효 커버리지는 최종 단언만 보지 않고 목표 종점 도달, 핵심 조건 충족, 필요 호출 발생, 부작용 일치를 함께 확인한다. 실제 실행 증거가 목표 경로와 일치할 때만 시나리오를 유효 커버리지로 인정한다.

차이 판정도 단순 비교가 아니다. 빈 문자열과 null, 타임스탬프 같은 비결정 필드는 정규화하고, 기존 시스템에 원래 있던 행위와 이번에 의도한 변경은 따로 확인하며, 원인을 귀속할 수 없는 차이는 다음 단계를 막는다. 오프라인 시나리오 검증을 통과한 뒤에는 녹화한 트래픽을 재생해 실제 요청 분포를 확인하고, 화이트리스트·소량 트래픽·단계적 전환으로 범위를 넓힌다. 각 단계는 관측 지표와 롤백 경로를 갖춰야 한다.

배경에는 AI가 단순 도구에서 스스로 계획하고 실행하는 시스템으로 옮겨가는 흐름이 있다. 엔지니어링의 무게 중심이 개별 모델 성능 최적화에서 시스템 수준 설계로 이동하면서 에이전트 런타임과 프레임워크, 보안·관측 가능성이 인프라로 부각된다. QCon 상하이 2026은 10월 22일부터 24일까지 열리며 AI 네이티브 아키텍처, 에이전트 런타임, AI 인프라, 데이터 시스템, 에이전트 보안·관측 가능성, 루프 엔지니어링, 바이브 코딩, 엔드-클라우드 협업 등을 주제로 다룬다.

실무 관점에서 이 사례가 던지는 질문은 명확하다. AI가 코드를 생성하는 능력이 아니라, 그 코드가 기존 업무 행위를 실제로 보존하는지 증명하는 능력이 배포 가능성을 가른다. 커버리지와 테스트 통과 개수는 그 증명이 될 수 없다. 다만 발표자가 밝힌 트레이드오프도 함께 봐야 한다. 행위 완전성과 실행 비용, AI 생성 효율과 경로 진실성, 엄격한 일치와 프로덕션 차이, 오프라인 반복성과 온라인 현실성은 서로 당긴다. 오프라인 일치가 배포의 충분조건이 아니며, 경로 증거가 없거나 차이를 귀속할 수 없거나 실제 트래픽에서의 거동이 불분명하거나 롤백 수단이 없으면 트래픽을 확대해서는 안 된다는 것이 발표의 전제다. 이 방법은 모놀리식이든 분산이든 구조에 의존하지 않지만, 유지해야 할 업무 행위를 정의하고 관측할 수 있는지가 관건이라고 발표 내용은 설명한다.