배포 후에도 얼어붙은 의료 AI가 경험으로 전문성을 쌓는 방법

Frozen Models, Evolving Expertise: Model-Agnostic Learning from Deployment Experience for Multimodal Medical AI

HF Daily2610.09146

Yexiao He, Yucheng Tang, Pengfei Guo2026-10-06

무엇인가

LLM과 VLM은 배포된 뒤 파라미터가 동결되어, 자기가 푼 사례에서 배우지 못한다. 의료에서는 특히 문제가 된다. 새 임상 근거, 갱신된 가이드라인, 새 치료법과 약물이 기존 진료 관행을 바꾸기 때문이다. 파인튜닝으로 모델을 갱신할 수는 있지만 모델 가중치 접근과 추가 학습이 필요하고, 폐쇄형 모델에는 불가능하며 비용도 든다. 파라미터를 건드리지 않는 방법들도 한계가 있다. EvoSkill이나 SkillOpt 같은 방식은 고정된 검증셋으로 스킬 문서 업데이트를 선택하기 때문에 같은 사례에 반복 최적화하면 과적합되어 새 사례로 일반화되지 않는다. 상호작용 궤적에서만 뽑은 경험은 신뢰할 도메인 지식이 부족하고, Reflexion·ExpeL·ACE처럼 경험을 텍스트로만 저장하면 유용한 시각적 디테일이 사라진다.

어떻게 동작하나

이 논문은 모델 파라미터를 고정한 채 외부 전문성(external expertise)을 축적·갱신하는 모델 비종속 프레임워크를 제안한다. 문제 설정은 이렇다. 동결된 베이스 모델이 사례를 배치 F1, F2, … 단위로 처리하고, t번째 배치에 쓰이는 전문성을 E_t = (S_t, K_t, V_t)로 둔다. S는 Skill, K는 Knowledge Memory, V는 Multimodal Knowledge Base(MMKB)다. 모델은 배치 안의 모든 사례에 먼저 답하고, 그 뒤에야 점수와 출처 정답이 공개되므로 피드백은 이후 배치에만 영향을 준다. S1과 K1은 비어 있고, 시각 과제에서 V1은 초기 참조 데이터로 채운다. 목표는 모델 파라미터를 바꾸지 않고 이후 사례의 점수를 높이는 방향으로 E_t를 갱신하는 것이다.

무엇과 다른가

Skill은 추론과 도구 사용을 안내하는 자연어 문서로, 유용한 단계와 그 사용 조건, 추가 행동이 불필요한 시점을 기술한다. 배치가 끝날 때마다 옵티마이저가 현재 Skill과 Memory, 점수가 매겨진 궤적, 이전 후보의 비교 결과를 검토해 문서 전체를 다시 쓴다. 빠진 단계를 넣고, 지나치게 넓은 규칙을 고치고, 도움이 안 되는 지침을 지우며 길이 제한을 지킨다. 덧붙이기(append)가 아니라 재작성하는 이유는 매 배치마다 컨텍스트가 길어지고 상충하는 규칙이 남을 수 있기 때문이다. 예컨대 어떤 배치가 "기침과 발열 환자에 흉부 X선 촬영"을 제안하고 이후 배치가 활력징후와 폐 청진이 정상이면 불필요하다고 보여주면, 두 규칙을 "활력징후나 폐 청진이 비정상일 때 촬영"으로 병합한다. Knowledge Memory는 근거와 사용 조건이 붙은 사실과 관계를 저장한다. 모델이 도구 호출로 지식 질문을 던지면 텍스트 검색이 관련 항목을 찾고, 별도 모델이 그것이 질문에 직접 답하고 해당 사례에 적용되는지 확인한다. 적합한 항목이 없으면 PubMed 같은 신뢰 출처를 검색한다. 사례 기반 제안은 지지 궤적을 인용하고 근거를 직접 인용해야 하며, 원 사례를 넘어 재사용할 근거가 있어야 한다. 보통 여러 지지 사례를 요구하고, 단일 사례는 신뢰할 외부 출처의 직접 지지가 있을 때만 허용한다. 환자 특이적 관찰과 개별 정답 키는 배제한다.

어떻게 쓰나

MMKB는 텍스트 교훈이 놓치는 시각 정보를 보존한다. 원본 이미지, 질문이나 맥락, 출처 정답, 가능하면 설명까지 담고, 평가 스트림 밖의 참조 사례로 초기화한 뒤 배포 중 완료된 사례로 성장한다. 고정된 멀티모달 인코더가 이미지와 질문 텍스트를 함께 표현하고 코사인 유사도로 참조를 검색한다. 중요한 차이는 어떤 참조를 가져오는가뿐 아니라 가져온 참조를 어떻게 쓰는가다. 각 참조에 대해 모델은 그 이미지와 맥락이 왜 해당 출처 정답을 지지하는지 살피고, 어떤 관찰과 조건이 현재 사례에도 적용되는지 식별하며, 차이·결손 증거·모순을 답하기 전에 고려해야 한다. 배치가 끝나면 이미지와 출처 정답이 있는 사례를 모델 예측이 아니라 출처 정답과 기존 설명 그대로 V에 추가하므로, 틀리게 답한 사례도 유용한 참조가 될 수 있다. 검색에서는 현재 사례, 같은 소스 그룹의 사례, 중복 이미지를 제외한다.

전제와 한계

업데이트 검증이 이 프레임워크의 핵심 장치다. 배치 F_{t-1} 이후 제안된 Skill·Memory 후보를 포함한 E~_t와 현재 E_t를, 새 배치 F_t와 과거 사례 대표 버퍼 B_t에서 같은 베이스 모델·같은 MMKB·같은 설정·같은 시드로 비교한다. 채택 조건은 네 가지다. 새 배치에서 평균 점수 변화가 양수이고(Δ̄_Ft > 0), 이긴 사례 수가 진 사례 수 이상이며(W_Ft ≥ L_Ft), 과거 버퍼에서 평균 변화가 0 이상이고(Δ̄_Bt ≥ 0), 버퍼에서도 이긴 수가 진 수 이상이어야 한다(W_Bt ≥ L_Bt). 이진 점수 과제에서는 승패 조건이 평균 조건에서 따라오지만, 연속 점수 과제에서는 소수 사례의 큰 향상으로 평균만 오르고 더 많은 사례가 나빠진 후보를 추가로 걸러낸다. 버퍼는 LLM이 과제 목표와 질문 텍스트만으로 갱신하며 정답과 점수는 쓰지 않는다. 주기적으로 현재 버전을 이전 보존 버전과 버퍼에서 비교해 더 나쁘면 이전 Skill과 Memory를 복원한다.

실험은 6개 벤치마크로 구성된다. AgentClinic-MedQA는 상호작용 진단, MedChain은 다단계 임상 워크플로, MedThink-Bench는 텍스트 기반 의료 추론, MedThinkVQA는 다중 이미지 진단, VisuLogic은 시각 논리, QCalEval은 양자 캘리브레이션 추론으로 의료 밖 영역까지 포함한다. 베이스 모델은 Qwen3.8-27B, Nemotron-3-Nano-Omni-30B, GPT-5.6-Sol, GPT-4o-mini 네 개를 동결해 쓰고 옵티마이저는 GPT-5.6-Sol이다. MMKB는 이미지 과제에서만 켠다. 온라인 프로토콜은 시드 42의 고정 사례 순서, 32개 배치 단위 갱신이다. 결과적으로 24개 벤치마크-모델 조합 전부에서 Base를 넘었고 22개에서 최고 점수를 냈다. 평균 이득은 17.6%로 ACE의 5.6%를 크게 앞섰고, ACE는 7개 조합에서 Base 아래로 떨어졌다. 이득은 재사용 가능한 전문성이 도움이 되는 곳에서 컸다. AgentClinic 34.2%, VisuLogic 81.9%, QCalEval은 모든 베이스 모델에서 16%를 넘었다. 반면 독립 문제 성격이 강한 MedThink-Bench와 MedThinkVQA는 0.4~5.0%에 그쳤다. 사례 순서 민감도도 확인해 AgentClinic과 QCalEval에서 5개 랜덤 순서로 반복했을 때 평균 5.7%와 16.5% 향상이 유지됐고, 두 격차 모두 최대 표준편차의 5배 이상이었다.

절제 실험은 구성 요소별 기여를 분리한다. Skill을 빼면 텍스트·다단계 과제에서 하락이 가장 커서 MedChain 12.1%, AgentClinic 5.5%가 Base 수준으로 돌아갔다. MMKB를 빼면 시각 과제 하락이 가장 커서 QCalEval 14.0%, VisuLogic 8.2%가 빠졌고 두 과제 모두 Base 점수(72.4 대 72.3, 45.9 대 45.8)로 회귀했다. Knowledge Memory 제거 효과는 상대적으로 작아 MedThink-Bench에서 2.5%가 최대였다. MedChain 안에서는 MMKB 제거가 이미지가 있는 Task 3만 바꾸는 반면 Skill 제거는 다섯 과제 모두를 낮춘다. 검증 없이 모든 업데이트를 수용하면 6개 벤치마크 전부에서 Full 대비 21.8~37.8% 하락하고 모든 점수가 Base 아래로 내려간다. MMKB의 효과가 단순 검색이 아님도 확인했다. 동일한 참조를 주고 표준 멀티모달 검색으로 쓰면 Base 대비 −3.5~+5.0%에 머물렀고 MedChain Task 3과 MedThinkVQA에서는 오히려 점수를 떨어뜨렸다. MMKB는 같은 참조로 4개 이미지 과제 모두를 개선해 MedChain Task 3에서 최대 23.9%를 올렸다. 초기 참조만 쓰는 Initial MMKB도 최대 22.6%를 올렸고, 배포 사례를 더하면 이득이 더 커졌다. 고정 일반화 실험에서는 스트림 앞 70%로 학습한 뒤 학습을 끄고 나머지 30%를 평가했는데(환자·소스·실험 식별자가 같은 사례는 같은 분할에 유지), 24개 중 21개에서 Base를 넘고 19개에서 최고였으며 평균 이득 20.7%로 SkillOpt 8.3%, ACE 1.9%를 앞섰다. Base 아래로 내려간 경우는 MedThinkVQA의 Nemotron 조합 −3.6% 한 번뿐이었다. 모델 간 전이도 된다. 한 모델로 학습한 Skill·Memory·MMKB를 그대로 다른 세 모델에 옮겼을 때 36개 결과 중 33개가 향상됐고 평균 이득 20.0%였다. Qwen3.8-27B로 배운 전문성이 폐쇄형 GPT-5.6-Sol을 AgentClinic 11.8%, QCalEval 23.2% 올렸고, 더 약한 GPT-4o-mini는 AgentClinic에서 47.3% 향상을 얻었다.

실무 관점에서 이 논문이 주는 것은 두 가지다. 첫째, 모델 가중치에 접근할 수 없는 폐쇄형 API 기반 제품에서도 배포 로그를 외부 자산으로 축적해 성능을 올리는 패턴이다. 둘째, 외부 메모리 업데이트를 무조건 반영하지 않고 새 사례와 과거 사례 버퍼 양쪽에서 검증하는 규칙으로, 검증 없는 누적이 오히려 성능을 21.8~37.8% 떨어뜨린다는 결과는 실무에서 바로 참고할 만하다. 도입 전에 확인할 전제도 분명하다. 정답과 점수가 배치 이후에 공개되는 피드백 루프가 있어야 하고, MMKB를 쓰려면 평가 스트림 밖의 초기 참조 사례가 필요하며, 검증을 위해 과거 사례를 후보 버전으로 다시 돌리는 재생 비용이 든다. 원문에는 별도의 한계 절이 없지만 전제와 실패 사례는 드러나 있다. 독립 문제형 벤치마크에서는 이득이 0.4~5.0%로 작았고, 고정 일반화 실험에서 MedThinkVQA와 Nemotron-3-Nano-Omni-30B 조합은 −3.6%로 Base보다 낮았다. 또한 이득의 상당 부분이 MMKB에 집중된 시각 과제에 있고, 텍스트 과제는 Skill 의존도가 크다는 점도 방법 선택 시 고려해야 한다.