Org-Agent가 조직용 LLM 에이전트의 다중 사용자 조율을 의존성 그래프로 푼다

Org-Agent: Beyond Personal Assistants Towards Organizational Agents

HF Daily2609.34392

Luyao Zhuang, Yujing Zhang, Zijin Hong2026-09-28조회 4

무엇인가

기존 LLM 에이전트는 대부분 단일 사용자를 기준으로 설계되고 평가됐다. 반면 조직의 워크플로는 여러 사용자가 정보와 권한을 나눠 가진 상태에서 진행된다. 이 논문은 조직용 에이전트에 필요한 두 가지 상보적 능력을 정의한다. 하나는 여러 사용자와 상호작용하며 요청을 조율하고 결정을 내리는 cross-user interaction and decision-making이고, 다른 하나는 서로 다른 사용자와의 상호작용에서 쌓인 지식을 정리·검색해 이후 질문에 답하는 cross-user memory and knowledge use다. 저자들은 이 두 능력이 세 측면의 조직 제약을 받는다고 본다. 사용자 측면에서는 정체성, 권한 서열, 접근 권한이고, 정보 측면에서는 진술·결정의 귀속 주체와 시간적 유효성(최신 개정으로 대체됐는지)이며, 공동 결정 측면에서는 사용자 간 요구 충돌 해소 규칙과 어떤 사용자의 요구까지 충족해야 완료로 보는지다. 모든 사용자의 요청을 단순히 이어 붙이면 이런 제약이 명시적으로 표현·강제되지 않고, 사용자별로 따로 처리하면 제약이 만들어내는 사용자 간 의존성을 놓친다는 것이 문제 진단이다.

어떻게 동작하나

제안 방법 Org-Agent는 제약 중심 추론 프레임워크로, 실행을 세 단계로 조직한다. 출발점은 조직 과제의 제약이 에이전트에게 던지는 두 가지 근본 문제다. 첫째, 각 행동의 전제조건이 여러 사용자와 상호작용 이력에 흩어져 있다. 예를 들어 조율 행동은 더 높은 권한의 사용자 승인이 있어야 진행될 수 있고, 정보 검색 행동은 질문이 가리키는 프로젝트를 먼저 특정해야 한다. 둘째, 각 행동은 실행되는 동안 관련 제약을 만족해야 한다. 예를 들어 답변은 사용자가 접근 권한이 없는 정보를 노출해서는 안 된다.

무엇과 다른가

첫 단계는 태스크 분해와 그래프 구성이다. 현재 대기 중인 요청을 원자적 서브태스크로 쪼개고, 이를 Task Dependency Graph(TDG)라는 방향성 비순환 그래프로 묶는다. 노드는 세 종류다. 상호작용 이력에서 관련 기록을 검색하거나 사용자에게 정보를 요청하는 inquiry 노드, 사용자 지시의 수락·거부 결론 같은 과제별 결정을 내리는 decision 노드, 사용자 요청에 답하는 response 노드다. 엣지 (v_j, v_k)는 v_k 실행에 v_j의 출력이 필요하다는 의존성을 뜻한다. 구성은 세 단계로 이뤄진다. LLM이 제약 규칙을 고려해 원자적 서브태스크를 식별하고, 어떤 노드가 먼저 해결돼야 하는지 판단해 엣지를 만들며 사이클이 감지되면 LLM이 수정한다. 실행이 진행되다 새 사용자 입력이 대기 서브태스크를 바꾸면 기존 의존성을 재사용하거나 그래프를 재구성해 남은 계획을 조정한다.

어떻게 쓰나

두 번째 단계는 의존성 인지 스케줄링이다. TDG에 위상정렬을 적용해 (v_j, v_k)가 엣지이면 j < k가 성립하도록 노드를 순서화한다. 모든 선행 노드가 끝난 뒤에만 해당 노드가 실행된다. 순차 실행도 가능하고, 서로 의존하지 않는 노드를 같은 계층으로 묶어 계층 단위로 병렬 실행할 수도 있다. 세 번째 단계는 제약 인지 노드 실행이다. 모델 추론에만 맡기지 않고 두 종류의 도구를 쓴다. 증거 획득 도구는 유사도 점수화(어휘·의미 관련도 결합으로 후보 기록 순위화), 조건부 필터링(작성자·역할·프로젝트 단계·주제·채널 같은 메타데이터 조건으로 검색 제한), 관계 순회(특정 기록에서 답글·원글·후속 결정 기록으로 명시적 링크를 따라가 논의와 결정의 변화를 추적)를 제공한다. 메모리 관리 도구는 실행 메모리 M을 Read/Write로 유지한다. 노드 실행 전에는 C_j = Assemble(C_j^base, Read(M))로 컨텍스트를 만들고, 실행 후에는 M ← Write(M, a_j, o_j)로 행동과 관찰 결과를 반영한다.

전제와 한계

실험은 두 벤치마크에서 이뤄졌다. GroupMemBench는 745개 질문, 4개 도메인(Finance, Healthcare, Manufacturing, Technology)과 6개 질의 범주(Multi-Hop, Update, Ambiguity, Implicit, Temporal, Abstention)로 cross-user memory and knowledge use를 평가한다. Org-Agent는 평균 정확도 44.03%로 비교 대상 중 최고였고, BM25를 6.31점, text-embedding-3-large를 10.74점, 가장 강한 메모리 시스템인 Hindsight를 5.24점 앞섰다. 눈에 띄는 관찰은 기존 에이전트 메모리 시스템이 기본 검색 베이스라인을 일관되게 앞서지 못한다는 점이다. SimpleMem 28.99%, MemGPT 27.11%로 BM25보다 각각 8.73점, 10.61점 낮았고 LightMem은 17.05%까지 떨어졌다. 비용이 큰 메모리 구축을 하는 Hindsight도 BM25를 1.07점 상회하는 데 그쳤다. 저자들은 압축된 메모리 표현이 cross-user 과제에서 기록을 해석·선택하는 데 필요한 맥락 세부를 생략한다고 분석한다. 또한 Org-Agent의 이득은 질의를 받기 전에 메모리 그래프를 구축하는 과정을 요구하지 않는다.

MUSES-Bench는 Queue(지시 선택), Instruct(지시 따르기), Cross-user Access(사용자 간 정보 접근), Meeting(회의 일정 조율)으로 cross-user interaction and decision-making을 평가한다. GPT-4o-mini 백본에서 Org-Agent는 평균 72.39%로 vanilla 베이스라인을 8.27점 앞섰고, Instruct 정확도는 58.69%에서 73.41%로, Meeting 성공률은 37.04%에서 60.19%로 올랐다. Meeting에서의 상승폭이 23.15%포인트로 가장 컸는데, 여러 턴에 걸친 사용자 간 상호작용을 통해 조직 과제의 제약이 완료 조건에 영향을 주는 모습이 이 과제에서 가장 선명하기 때문이라고 설명한다. 백본을 바꿔도 개선은 유지됐다. DeepSeek-V4.1-Flash에서 4.24점, Qwen3-32B에서 5.29점이 올랐다. vanilla 점수가 80.8인 DeepSeek보다 vanilla가 64 근처인 두 약한 백본에서 이득이 더 컸는데, 명시적 제약 처리가 백본의 추론 약점을 보완한다는 해석이다. 멀티턴 과제는 최대 T=10 턴으로 제한했다.

절제 실험은 두 핵심 요소의 기여를 뒷받침한다. TDG의 모든 엣지를 제거해 위상 순서 없이 서브태스크를 독립 실행하면 GroupMemBench 평균이 44.03%에서 41.61%로, MUSES-Bench가 72.39%에서 71.10%로 떨어졌다. 조건부 필터링·관계 순회·메모리 관리를 끄고 유사도 점수화만 쓰면 각각 40.40%와 67.10%로 더 크게 하락했다. 사용자 그룹 크기에 따른 변화도 보고된다. 사용자가 늘수록 두 방법 모두 성능이 떨어지지만 기울기가 다르다. Org-Agent는 Queue에서 사용자 1명당 0.35점, Meeting에서 1.67점을 잃는 반면 vanilla는 1.75점과 4.58점을 잃었고, Instruct는 0.90 대 1.26이었다.

실무에서는 사내 다중 사용자 에이전트, 승인 절차가 얽힌 조율, 권한 필터링이 필요한 지식 검색, 여러 참가자의 일정 조율 같은 기능을 설계할 때 참고할 만하다. 특히 제약 규칙 R을 어떤 형태로 정의해 각 노드 컨텍스트에 주입하는지, 증거 획득 도구의 스키마와 메모리 표현을 어떻게 잡는지가 재현의 핵심이므로 그 부분을 확인해야 한다. 한계는 저자가 별도의 한계 절로 정리하지 않았고, 결과가 두 벤치마크와 최대 10턴, 그리고 평가에 포함된 사용자 그룹 크기 범위 안에서만 보고된다는 점이다. 사용자 수에 따른 우위도 "평가된 범위 내에서"라는 단서가 붙어 있다. 코드와 재현 자료는 초록에서 언급한 익명 저장소에서 제공한다고만 밝히고 있으며, 본문에는 저장소 URL이 제시되지 않았다.