DeGG-Flow가 다중 에이전트 생성의 결합 제약을 분산 유도로 보장한다
Multi-Agent Flow Matching with Decoupled Generative Guidance
무엇인가
생성 모델은 복잡한 다중모드 분포에서 다양한 결과물을 만들어내지만, 그 결과물이 안전이나 물리 법칙 같은 하드 제약을 만족한다는 보장은 일반적으로 없다. 다중 에이전트 생성에서는 문제가 더 까다로워진다. 하나의 하드 요구사항이 여러 에이전트에 걸쳐 정의될 수 있는데, 각 에이전트는 다른 에이전트가 동시에 계산하는 유도 입력을 참조하지 않고 자기 유도 입력을 스스로 정해야 하기 때문이다. 기존의 제약 생성 기법을 다중 에이전트 전체 상태에 그대로 적용하면 자연스럽게 중앙집중적 결합 유도 문제가 되고, 이는 단일 의사결정자에게 팀 전체가 의존하는 구조를 만든다. 이 논문은 UC 어바인과 UNC 채플힐 연구진이 제안한 DeGG-Flow로, 에이전트별 유도를 유지하면서도 여러 에이전트가 얽힌 요구사항에 형식적 보장을 주는 것을 목표로 한다.
어떻게 동작하나
DeGG-Flow는 다중 에이전트 플로 매칭의 생성 과정을 제어 아핀 동역학계로 표현한다. 각 에이전트 i의 생성 상태 z_i(τ)는 z_i의 도함수가 명목 벡터장 f_i^θ(τ, z|χ)와 유도 항 g_i(τ, z|χ)u_i의 합으로 주어지는 꼴을 따른다. 여기서 u_i가 유도 입력이고, g_i는 그 입력이 상태에 작용하는 방식을 정하는 행렬이다. 명목 벡터장은 메시지 패싱 그래프 신경망으로 구현되며 모든 에이전트가 같은 파라미터를 공유하고 순열 등변성을 갖는다. 학습은 다중 에이전트 조건부 플로 매칭 손실(식 5)로 이루어지고, 유도는 학습된 모델을 재학습하거나 생성 후 결과물을 별도로 보정하지 않고 생성 과정 중에 적용된다.
무엇과 다른가
유도는 두 종류로 나뉜다. 공유 요구사항(SE) 유도는 팩터 그래프로 표현되며, 하나의 팩터에 속한 여러 에이전트가 요구사항을 함께 만족시킨다. 각 에이전트는 자신의 상태와 이웃에서 모은 메시지만으로 자기 제약 조건을 만족하는 u_i를 계산하고, 팩터 수준의 항을 가중치 w_{a,i}로 에이전트들에게 나눠 배분한다. 개별 요구사항(PE) 유도는 각 에이전트가 자기 요구사항 V_i^PE를 갖되 그 만족 여부가 이웃에 의존하는 경우로, 전체 V^PE를 각자의 V_i^PE 합으로 두고 시간에 따라 변하는 ω^PE(τ)와 서브가산적 class K∞ 함수 α^PE를 쓴다. 두 경우 모두 각 에이전트가 다른 에이전트의 동시 계산 유도 입력 없이 자기 입력을 정한다.
어떻게 쓰나
저자들은 유한 지평 수렴 보장을 세운다. SE 유도에서는 초기 샘플에서 출발해 β(0) ≥ q(0)를 만족하고 β(1)=0으로 조여지는 시간가변 상한 β^SE(τ)를 도입하는데, 각 에이전트가 자신의 제약을 만족하면 생성이 끝날 때 공유 요구사항 q^SE(1) ≤ 0이 성립한다(정리 3.1). 제약의 실행가능성을 확보하기 위해 유도 입력이 요구사항에 미치는 영향의 크기 제곱에 비례해 배분 계수를 적응적으로 정하고(식 14), 두 개의 SE 팩터가 동시에 활성화되어 같은 u_i를 두고 경쟁할 때는 두 영향 방향의 정렬 정도에 따라 유효 방향을 조정한다. 각 에이전트가 동시에 활성인 SE 팩터에 최대 두 개까지만 관여하고 배분 계수의 분모가 0이 아니면 제약을 만족하는 유도 입력이 존재하며, 이는 이차계획법(식 15)으로 구할 수 있다(명제 3.2). 또한 유도가 생성 분포를 얼마나 밀어내는지에 대한 바서슈타인 상한도 유도한다. 명목 벡터장이 립시츠이고 유도 보정항의 제곱 기대값이 적분 가능하면, 유도된 최종 분포와 명목 최종 분포의 W2 거리는 유도 보정 크기의 적분으로 상한이 잡히고(식 19), 디코더가 립시츠이면 출력 공간에서도 같은 상한이 L_D배로 유지된다(식 20).
전제와 한계
실험은 MuJoCo에서 두 과제로 진행된다. 첫 번째는 여러 로봇이 널판을 협력해 공간 틈을 건널 수 있는 다리를 만드는 정책 생성이다. 명목 벡터장은 N ∈ {4,5,6}으로 학습했고, N ∈ {4,5,6,7,8} 각각에 대해 50회씩 총 250회 조작 시행을 평가했다. 명목 모델은 32회 실패한 반면, SE 유도를 적용한 Guided는 학습에서 보지 못한 N=7,8의 100회를 포함해 250회 전부에서 통과 가능한 다리를 만들었다. 두 번째는 탁상 위 다중 물체 장면 생성으로, 각 물체의 어포던스(접근·사용) 요구사항이 이웃 물체에 의존한다. 여기서도 명목은 N ∈ {4,5,6}으로 학습하고 N ∈ {4,5,6,7,8} 각 50회를 평가했는데, 물체 수가 늘수록 명목의 성공률이 떨어졌고, 기본 요구사항에서 유효했던 장면도 요구사항이 바뀌면 무효가 된다는 것을 Private Nominal 조건으로 확인했다. 반면 PE 유도를 적용한 Guided는 학습에 없던 N=7,8의 100회를 포함해 250회 전부에서 모든 요구사항을 만족했다. 논문은 노트북의 오른손 사용 요구를 왼손 사용 요구로 바꾼 N=7 예시에서 재학습 없이 장면이 적응하는 것을 보여준다.
실무적으로 이 논문이 흥미로운 지점은 이미 쓸 만한 생성 모델이 있는데 학습 이후에 새로운 하드 제약이 생긴 상황이다. DeGG-Flow는 데이터를 새로 모으거나 모델을 재학습하거나 생성 결과를 사후 보정하지 않고, 생성 과정에 유도 입력을 더하는 것만으로 제약을 만족시킨다. 명목 벡터장의 신경망 구조를 특정하지 않으므로 사전학습된 플로 매칭 모델 위에 얹을 수 있고, 각 에이전트가 자기 유도만 계산하므로 중앙 의사결정자 없이 분산 실행이 가능하다. 다만 도입 전에 확인할 것은 제약을 연속 미분 가능한 함수로 표현할 수 있는지, 유도 입력이 제약에 실제로 영향을 주는지, 그리고 동시에 활성화되는 SE 팩터가 에이전트당 두 개를 넘지 않는지다.
저자들이 밝힌 한계는 분명하다. 이론적 보장은 연속시간 생성 과정을 전제로 하며, 이산시간 구현에 대한 보장은 향후 과제로 남겨두었다. 실제 환경의 대규모 다중 에이전트 시스템으로의 확장도 미래 연구로 언급된다. 정리들이 성립하기 위한 전제도 있다. 명목 벡터장의 립시츠 연속성, 최종 분포들의 유한한 2차 모멘트, 디코더의 립시츠성, 그리고 SE 유도에서 에이전트당 동시 활성 팩터 수 제한과 배분 계수 분모가 0이 아닐 조건 등이다. 실험은 MuJoCo 시뮬레이션에서 N이 8 이하인 규모로만 수행되었고, 학습에 쓰이지 않은 팀 크기로의 일반화는 확인했지만 그보다 큰 규모는 검증되지 않았다.