디자이너 에이전트의 절차 기억을 사용자 트래픽으로 진화시킨다.

Designer-RSI: Evolving Procedural Memory from User Traffic for Agentic Graphic Design

HF Daily2609.22086

Hongyang Du, Lan Yan, Christian Flores2026-09-18조회 5

무엇인가

이 논문은 전문가 수준의 그래픽 디자인을 에이전트가 수행하는 문제를 다룬다. 이미지 생성 모델이 그럴듯한 그림을 만들 수는 있어도, 전문 디자인은 레이어와 편집 가능성을 유지한 구조적 산출물을 요구한다. 저자들은 디자인을 순차적 의사결정 문제로 규정한다. 에이전트가 자산을 배치하고 타이포그래피와 벡터를 조작하며 마스크와 효과를 만들고, 편집 가능성을 보존한 채 이전 결정을 수정한다. 문제는 학습 신호다. 하나의 디자인이 수십 개의 상호의존적 조작을 요구하기 때문에 최종 결과만으로는 어느 결정이 성공이나 실패를 만들었는지 식별하기 어렵다. 게다가 브리프에는 텍스트·색상·배치 같은 구체적 요구와 위계·구도·스타일 같은 주관적 기준이 섞여 있어 자동 평가자가 일부만 포착한다. 실행 가능한 테스트가 있는 코드와 달리 디자인에는 성공 판정 오라클이 없다.

어떻게 동작하나

저자들의 접근은 모델 자체를 학습시키는 대신, 고정된 모델 주변의 절차 기억을 학습 대상으로 삼는다. 프론티어 모델은 Adobe Photoshop, Illustrator, InDesign에 해당하는 기능을 230개 이상의 도구로 조작하며, 외부에는 자연어 스킬(SKILL.md 플레이북) 라이브러리가 쌓인다. 진화 루프는 네 역할로 구성된다. Prompter는 사용자 데이터와 LLM으로 디자인 브리프를 제시하고, Solver는 스킬 뱅크와 도구로 렌더링된 이미지를 만들며, Grader는 멀티모달로 각 이미지를 채점하고 어떤 요구가 왜 실패했는지 설명하며, Reflector는 그 실패를 SKILL.md의 표적 수정으로 바꾼다. 뱅크는 두 축으로 변한다. 넓히기는 현재 라이브러리가 다루지 못하는 반복적 미커버 하위 작업을 찾아 새 스킬로 증류한다. 하위 작업이 정규화된 라벨 기준 k_min = 3회 나타나면 후보 스킬을 만들고, 게이트를 통과할 때만 채택한다. 깊게 하기는 실패와 반복적으로 연관된 기존 스킬을 고친다. 성공 임계값 τ = 0.6 미만 점수를 받은 궤적은 검색한 모든 스킬에 대한 실패로 계산되고, 실패 횟수가 임계값 m(기본 2)을 넘는 스킬을 실패가 많은 순서로 선택한다. Reflector는 브리프, 요구별 결과와 실패 사유, 현재 SKILL.md, 그리고 같은 스킬이 유사 과제에서 성공한 대조군(도구 호출 순서, 중간 결과, 사고 토큰)을 받는다. 성공 실행은 회귀 방지 기준선이 되고 실패 사유는 개선 지점을 알려준다. 같은 스킬에 대한 표적 재작성이 반복 실패하면 전체 재작성으로 확대하고, 거부된 재작성은 스킬의 운명을 갱신·삭제·유지로 판정하는 탐색 주기를 촉발한다. 유지로 판정된 개선 불가 기록은 다시 넓히기의 커버리지 풀에 들어간다.

무엇과 다른가

핵심 설계는 제안과 채택을 분리하는 매칭 리플레이 게이트다. 두 가지 교란 요인을 다룬다. 첫째, VLM Grader의 절대 점수는 실행마다 흔들리므로 평균 점수가 올랐다는 이유로 채택하면 심판 표류를 개선으로 오인한다. 그래서 게이트는 절대 점수를 쓰지 않는다. 둘째, 자산 검색 등 상류 상태가 달라 후보가 더 좋은 입력을 받아 이길 수 있다. 게이트는 스킬을 자극하는 프롬프트를 뽑고 프롬프트마다 서로 다른 검색 자산과 상류 상태를 가진 여러 컨텍스트를 만든다. 각 컨텍스트를 고정한 뒤 같은 배치에서 후보와 기존 스킬(재작성의 경우), 또는 후보와 무스킬 에이전트(신규 생성의 경우) 두 갈래로 새로 실행한다. 출력은 순서를 무작위화한 쌍대 비교로 판정되므로 컨텍스트 안에서 시험되는 차이는 스킬 조건뿐이다. 프롬프트는 후보가 그 컨텍스트 과반에서 이겨야 승리로 계산되어, 한 컨텍스트의 큰 이득이 다른 곳의 손실을 가리지 못한다. 변경은 (진 프롬프트가 없음) 그리고 (이긴 프롬프트가 존재함)일 때만 배포된다. 리플레이는 성공 이력과 실패 이력을 모두 포함하므로, 재작성은 기존 성공을 퇴행시키지 않으면서 실패를 고쳐야 한다.

어떻게 쓰나

실험은 5라운드 진화로 진행되며 모델 가중치 갱신도 사람 라벨도 없다. 라운드마다 사용자 트래픽과 LLM 증강 변형에서 약 300개의 브리프를 소비해 총 1,406개의 중복 없는 브리프를 사용했고, 사람 라벨 없이 1,869개의 채점된 궤적을 얻었다. 스킬 뱅크는 콜드 스타트의 문서 기반 76개에서 139개로 늘었다. 게이트는 재작성 제안 231개 중 100개를, 신규 후보 136개 중 67개를 거부해 각각 131개와 69개를 채택했고, 깊게 하기가 대체·병합된 스킬 6개를 버려 순증가는 63개다. 생성된 스킬은 중복이 아니다. 콜드 스타트 뱅크와의 최근접 거리가 시드 뱅크 내부 간격보다 크다(중앙값 0.215 대 0.158, Mann-Whitney p < 10^-8, Cliff's δ = 0.58). 성능은 라운드마다 뱅크를 고정해 진화용 1,406개와 겹치지 않는 사람 작성 브리프 200개로 측정했다. R5는 완전성 0.5 이상 비율을 86%에서 93%로, 0.9 이상을 43%에서 56%로, 1.0을 24%에서 32%로 올렸고 τ ≥ 0.9에서 최대 +13%p 격차를 냈다. 궤적은 단조롭지 않다. R4는 완전성 0.3 이상에서 무스킬보다 낮았지만(90% 대 94%) 0.9 이상에서는 +7%p를 유지했다. R3와 R4가 각각 26개, 13개를 생성해 한 번도 수정되지 않은 v1 스킬 재고가 가장 많았기 때문이다. R5는 재작성 21개와 생성 4개로 구성을 뒤집어 모든 임계값에서 가장 강한 라운드가 되었다.

전제와 한계

일반 T2I 벤치마크에서 Evolve는 평균 품질을 Claude-Opus-4.6에서 +3.83, Claude-Sonnet-4에서 +7.70, Qwen3.6-27B에서 +9.67 올렸다. 실행 신뢰성은 Claude-Sonnet-4에서 가장 두드러져 GenEval2 성공률이 72.7%에서 99.3%로, DPG-Bench에서 82.7%에서 100%로 상승했고 생성 품질은 +11.99포인트 올랐다. 지연 오버헤드는 백본 전반에서 평균 3.4%~6.2%에 그쳤고, DPG-Bench의 Sonnet은 113초에서 82초로 오히려 줄었다. 전문 디자인 벤치마크 4종(OpenCOLE, GraphicBench, CreatiDesign, BannerRequest400)에서 무스킬 에이전트 대비 승률은 Claude-Opus-4.6이 67.6%(CreatiDesign에서 71.7%로 최고), Claude-Sonnet-4가 61.8%였다. 절제 실험은 두 메커니즘의 결합 효과를 보여준다. 문서 기반 콜드 스타트는 Base 대비 개선이 없었고(완전성 68.62 대 69.08, 승률 46.4%), 재작성만으로는 69.02와 48.6%, 신규 생성만으로는 69.79와 49.4%였다. 결합하면 완전성 74.04(콜드 스타트 대비 +5.42)와 Base 대비 58.5% 승률(p = 0.025)을 얻어, 콜드 스타트 대비 +3.85의 초가산적 이득을 냈다. 이득은 완전성에 집중되고 미학(65.92 → 66.53)과 비평은 거의 변하지 않았다. 스킬 검색은 Base 대비 프롬프트 토큰을 약 28% 늘리지만, 진화 자체는 추가 토큰 비용을 만들지 않아 Evolve가 콜드 스타트보다 프롬프트·출력 토큰을 적게 쓴다(436.6k/5167 대 445.2k/5298).

실무 관점에서 이 논문이 주는 패턴은 명확하다. 모델을 파인튜닝할 수 없거나 외부 호스팅 모델을 쓰는 상황에서, 자연어 절차 라이브러리를 외부 상태로 두고 사용자 트래픽에서 자동으로 넓히고 고치는 루프를 돌릴 수 있다는 것이다. 특히 눈여겨볼 부분은 배포 결정 규칙이다. 절대 점수를 버리고 컨텍스트를 고정한 쌍대 리플레이만 사용하며, 진 프롬프트가 하나도 없어야 한다는 보수적 조건을 걸어 심판 표류와 상류 상태 차이를 동시에 차단한다. 또한 넓히기와 깊게 하기를 따로 쓰면 이득이 미미하고 결합해야 초가산적 효과가 난다는 절제 결과는, 신규 스킬 추가와 기존 스킬 개선을 별개 파이프라인으로 운영하지 말아야 한다는 실무 지침으로 읽힌다. 도입 시에는 라운드별로 뱅크를 고정해 고정 평가셋에서 측정하는 방식, 그리고 스킬 검색이 프롬프트 토큰을 약 28% 늘린다는 비용을 함께 확인해야 한다.

저자들이 밝힌 한계도 분명하다. 자연어 스킬은 선호 절차를 서술할 수 있을 뿐, 모델이 강한 기본 전략을 갖고 있으면 검색만으로 그 절차를 따르게 만들지 못할 수 있다. 정밀한 기하 조작은 모델 인식과 자동 검증 양쪽의 한계에 묶여 있고, 긴 절차는 실행 단계가 쌓일수록 충실도를 잃는다. 리플레이 게이트도 평가된 사례에 국소적이어서, 리플레이 집합에서 관찰된 회귀를 거부한다고 해서 전체 사용자 트래픽 분포에 대해 단조적 개선이 보장되지는 않는다. 저자들은 이를 해결하려면 선호 인식 검색, 결정적 프리미티브, 구조화된 계획, 더 정밀한 검증 같은更强的 실행 메커니즘이 필요하다고 말하며, 절차 기억은 지속적 적응의 한 메커니즘이지 자연어 지도가 안정적으로 유도할 수 없는 능력이 필요한 과제에서 모델 학습이나 구조화된 실행을 대체하는 것이 아니라고 정리한다.