LLM 에이전트가 출처만 보고 상품을 고르는 편향을 실측한다

Source Preference in the Wild: How LLM Agents Favor Items by Source, and How to Reduce It

arXiv2610.03195v1

Jonghyun Song2026-10-02

무엇인가

LLM 에이전트가 사용자를 대신해 어떤 상품을 사고, 어떤 호텔을 예약하고, 어떤 논문을 인용할지 정하는 시대에 특정 출처(사이트나 서비스)의 항목을 더 선호하는 성향은 사용자가 실제로 받는 결과와 어떤 출처가 선택되는지를 좌우한다. 기존 연구는 의미상 동일한 콘텐츠에 출처만 다르게 붙여 모델이 특정 출처를 선호한다는 증거를 제시했지만, 실제 검색에서는 출처마다 자기 항목을 제공하고 그 내용과 요구사항 충족도가 서로 다르다. 이 논문은 12개 에이전트 모델과 쇼핑·숙박·학술 세 도메인에서 실제 end-to-end 검색에서도 출처 선호가 나타나는지, 항목의 출처를 알려주는 정보 자체가 선택에 기여하는지, 그런 의존이 어떻게 생겨나고 어떻게 줄일 수 있는지를 묻는다.

어떻게 동작하나

실험은 ReAct 스타일 상호작용 루프를 따르는 12개 모델(GPT-5.4-nano, GPT-5.6-Luna, Gemini-3.7-Flash, GLM-5.3-Flash, DeepSeek-v4-Flash-0731, Llama-4-Maverick/Scout, Llama-3.1-8B-Instruct, Tulu-3-8B, Qwen3.5-27B, Qwen3-30B-A3B, Qwen2.5-32B-Instruct)로 구성된다. 에이전트는 검색 질의를 던져 제목·내용·URL로 이루어진 최대 10개 결과를 받고, 요청과 대조해 여러 항목을 선택하거나 재검색한다. 항목의 출처는 URL의 등록 가능 도메인으로 정의한다. 요청은 총 4,822개로 WebShop 1,500개, HotelQuEST 786개(원본 214개에 구조를 유지한 위치 치환 변형 572개 추가), ScholarGym 2,536개를 쓴다. 요구사항 충족 여부는 URL과 출처명을 제거한 제목·내용만으로 판정하는 출처 차단 LLM 판정자가 평가하며, 인간 주석자와의 일치도(Krippendorff α 0.65~0.75)는 주석자 간 일치도(0.67~0.72)와 비슷한 수준이다.

무엇과 다른가

출처 선호를 재려면 검색된 항목 간 차이를 통제해야 한다. 선택률만 높다고 선호라 할 수 없기 때문이다. 그 출처 항목이 요구사항을 더 잘 충족하거나 유리한 위치에 있을 수 있다. 저자들은 같은 요구사항 집합 q를 충족하는 서로 다른 출처의 항목을 요구사항 매칭 쌍으로 묶고, 길이 L인 결과 목록을 L가지 순환 회전으로 모두 제시해 각 항목이 모든 위치에 정확히 한 번씩 나오게 한다(cyclic Latin square). 위치별로 두 항목의 선택 여부를 비교해 선택 차이 D_c ∈ {-1,0,1}을 만들고, 어떤 출처와 비교됐는지에 따라 점수가 좌우되는 문제를 없애기 위해 Davidson의 동점 확장을 적용한 Bradley–Terry 모델로 출처별 레이팅 β_s를 추정한다(ℓ2 페널티, 평균 출처가 β=0이 되도록 중심화). 선호 점수 τ_s는 평균적 출처 대비 기대 선택 차이로 정의되며, 예컨대 τ_s=0.10은 그 출처 항목이 기준 출처보다 10%포인트 더 자주 선택된다는 뜻이다. 요청 단위 클러스터 부트스트랩으로 유의성을 판정하고 모델·도메인별로 FDR 5%를 통제해 출처를 선호(+)/비선호(−)/중립(0)으로 분류한다.

어떻게 쓰나

결과는 일관됐다. 12개 모델 모두 세 도메인 각각에서 어떤 출처는 선호하고 어떤 출처는 피했다. 도메인별 최빈 출처 4개(해당 도메인 검색 결과의 약 4분의 1)를 보면 144개 모델-출처 조합 중 110개가 + 또는 −로 분류됐고, 중앙 선호 점수는 각각 +15%포인트와 −18%포인트였다. 모델들은 대체로 같은 출처를 선호하고 같은 출처를 피했다. 12개 출처 중 10개에서는 어떤 모델도 다른 모델이 피하는 출처를 선호하지 않았고, 예외는 Amazon과 eBay로 GPT-5.4-nano는 피하지만 다른 모델들은 선호했다. 같은 유형의 사이트끼리도 갈렸다. Walmart는 12개 모델 모두 선호했지만 또 다른 종합 유통업체인 Target은 2개만 선호했고, Booking.com은 10개가 선호한 반면 같은 호텔 예약 사이트인 Expedia는 절반이 피했다. 상위 20개 출처로 넓혀도 32개 적/청 출처 중 27개에서 τ_s의 부호가 모든 모델에서 같았고, Scholar에서는 선호 출처가 우세한 반면(17개 중 14개) Shopping(8개 중 6개)과 Accommodation(7개 중 6개)에서는 비선호 출처가 우세했다. Qwen과 Llama 계열에서는 최신 모델일수록 선호가 더 강했다.

전제와 한계

선호는 요구사항 충족도보다 우선하기도 했다. 요구사항을 하나 덜 충족하는 항목과 하나 더 충족하는 항목을 짝지어, 둘 중 정확히 하나만 선택된 경우를 세어 역전(inversion) 비율을 계산했다. 덜 충족하는 항목이 선호 출처에서 오고 더 나은 항목이 비선호 출처에서 오면 중앙값 68%에서 덜 충족하는 항목이 선택됐다. 반대로 뒤집으면 그 비율이 중앙값 2%로 거의 선택되지 않았다. 중립 출처끼리 짝지은 기준선은 중앙값 19%로 그 사이에 있었고, 이 순서는 모든 모델-도메인 조합에서 유지됐다. 각각을 중립 출처와 짝지어 분리해 보면 비선호 쪽의 영향이 더 컸다. 모든 도메인에서 대부분의 모델이 선호 출처가 있을 때(Inv+,0)보다 비선호 출처가 있을 때(Inv0,−) 역전을 더 많이 보였다.

출처 선호가 있다고 해서 선택이 명시적 출처 정보(URL, 제목·내용 속 출처명)에 의존한다는 뜻은 아니다. 항목 간 다른 차이 때문일 수 있다. 그래서 저자들은 같은 결과 목록에서 출처 정보만 숨기고(Hidden), URL만 노출하고(URL-only), 원본(Original)으로 되돌리는 실험을 했다. 출처 정보를 복원하면 모든 모델에서 선호 출처의 τ가 오르고 비선호 출처의 τ가 내려갔으며, 평균적으로 +5.8%포인트 상승과 −5.9%포인트 하락으로 거의 대칭이었다. 격차 확대의 대부분은 URL만 복원한 단계에서 일어났다. 11개 모델 중 9개에서 Hidden→Original 격차 확대의 80% 이상이 Hidden→URL-only에서 발생했고, 본문 속 출처명 복원은 거의 변화가 없었다. 두 번째 실험에서는 요구사항 매칭 쌍의 제목과 내용은 고정한 채 표시되는 출처를 선호와 비선호로 맞바꾸고 두 순서로 제시해 네 번 평가했다. 같은 콘텐츠가 선호 출처를 달았을 때 더 자주 선택됐고(T+ − T− > 0), 12개 모델 모두 최소 한 도메인에서 p<0.01로 유의했다.

선호가 어디서 오는지도 실험했다. DPO(Direct Preference Optimization)로 Qwen3.5-9B, Llama-3.1-8B-Instruct, Tulu-3-8B-SFT를 학습시키되 낯선 가짜 출처 쌍(Kelto–Varnis, Temnuki–Dalnuki, Roveki–Tavumi)을 쓰고 선호 응답이 더 잘 맞는 상품을 고르게 했다. 대상 출처가 더 나은 상품에 붙는 비율을 50%(Balanced), 80%(Aligned), 20%(Reversed)로 조절하자, 추론 시 두 상품의 요구사항 충족도가 같음에도 대상 출처 선택률이 Balanced에서 49.4~51.0%, Aligned에서 70.1~75.1%로 오르고 Reversed에서 24.5~28.5%로 떨어졌다. 즉 라벨이 요구사항 충족만으로 정해져도 출처와 선호 응답의 연관이 출처 선호를 만들어낸다. 기존 선호를 줄이는 방향도 통했다. Amazon 대비 eBay·Etsy·AliExpress 비교에서 학습 전 Amazon 선택률 53.7~62.7%가 Balanced DPO 후 49.7~51.9%로 50%에 가까워졌고, Aligned는 78.0~82.5%로 올리고 Reversed는 17.7~25.3%로 낮춰 이전에 덜 선호되던 출처를 앞세웠다. 추론 시점 개입도 효과가 있었다. 요청이 가격을 요구하는데 항목 내용에 가격이 없으면 에이전트가 그 출처는 보통 저렴하다는 선입견으로 빈틈을 메우는 정황이 관찰됐는데, 두 상품에 동일한 가격을 채워 넣으면(Same Price) 모든 모델에서 선호 출처 선택률이 낮아졌다. 시스템 프롬프트로 출처 URL은 가격과 무관하다고 알려주는 General은 선택률을 거의 바꾸지 못했지만, 비선호 출처가 보통 저렴하다고 지정하는 Designate는 모든 모델에서 선택률을 낮췄다.

개발자 입장에서 이 논문이 주는 실무적 신호는 분명하다. 검색·추천 에이전트를 만들거나 평가할 때 출처 라벨 하나가 결과를 바꾸므로, 요구사항 충족도를 평가할 때는 출처를 가린 판정자를 쓰고, DPO 같은 선호 학습 데이터에서 특정 출처가 선호 응답과 얼마나 자주 짝지어지는지 점검해야 한다. 누락된 정보를 채워 주는 것만으로도 출처 의존이 줄어든다는 점은 프롬프트와 데이터 설계에 바로 쓸 수 있는 단서다. 저자들이 밝힌 한계도 함께 봐야 한다. 중립(Source 0)은 선호가 0이라는 뜻이 아니라 어느 방향으로도 선호의 증거가 충분하지 않다는 의미이고, 선호와 비선호 분류는 효과 크기가 아니라 통계적 유의성에 기반한다. Designate 프롬프트는 선호의 원인을 제거하는 것이 아니라 상쇄하는 것이며 어느 출처가 비선호인지 미리 알아야 한다. 요구사항 충족 판정은 LLM 판정자에 의존하고 그 인간 일치도는 주석자 간 일치도 수준이지만 완벽하지 않다. 코드와 데이터셋은 게재 시 공개할 예정이라고 밝히고 있다.