강화학습으로 LLM에 '나이트 사이언스'를 가르친 AI Night-Scientist

Reinforcing Agentic Creativity in Scientific Ideation with Night Science

arXiv2609.35706v1

Priyanka Kargupta2026-09-28조회 3

무엇인가

대형 언어모델은 코드 작성이나 정량 추론처럼 검증 가능한 구조적 과제에서는 강하지만, 토큰 엔트로피를 최소화하려는 경향 때문에 출력이 동질적이고 예측 가능해진다. 이 논문은 그 성질이 열린 과학적 아이디어 발상에서 치명적이라고 지적한다. 기존 LLM 연구 에이전트들은 검색, 토론, 작성 같은 행동을 고정된 행동으로 취급하고 창의성을 최종 아이디어의 속성으로만 평가해 왔다. 그 결과 추론 과정에서 언제, 얼마나 관습적 경로에서 벗어날지를 스스로 제어하지 못한다. 저자들은 과학적 발견이 가설 검증 중심의 구조적 '데이 사이언스'와 직관·우연에 기대는 느슨한 '나이트 사이언스'의 스펙트럼 위에 있다는 관점을 도입하고, LLM이 이 스펙트럼을 능동적으로 오갈 수 있게 만드는 문제를 다룬다.

어떻게 동작하나

제안하는 AI Night-Scientist는 ReAct식 추론을 확장한 에이전트 프레임워크다. 각 단계에서 에이전트는 행동 a와 함께 그 행동을 어떻게 수행할지 자연어로 서술한 창의성 수준 c를 선택하고, 실행한 뒤 현재 아이디어 상태를 갱신한다. 창의성은 세 축으로 표현된다. 행동 수준은 같은 행동을 관습적·고확률적 방식에서 탐색적·비관습적 방식까지 변화시키는 '어떻게', 과정 수준은 추론이 전개되는 양상에 따라 낮은 창의성과 높은 창의성 행동 사이를 전환하는 '언제', 결과 수준은 산출된 아이디어의 새로움과 유용성을 함께 보는 '무엇'이다. 과제는 상위 연구 문제 하나로부터 장기 연구 제안서를 생성하는 것이며, 행동 공간은 Search, Debate, Spark, Write, Stop으로 구성된다. Search·Debate·Spark는 여러 창의성 수준을 갖고, Write는 고정되어 최종 제안서가 앞선 탐색을 반영하도록 하며, 궤적은 최대 5개 행동으로 제한된다.

무엇과 다른가

학습은 GRPO로 이루어지며 롤아웃 단계와 보상 단계로 나뉜다. 보상 설계가 눈에 띄는데, 최종 제안서를 원자적 연구 아이디어 단위로 분해한 뒤 원래 연구 문제와 검색된 문헌에 비추어 선례성, 실현 가능성, 관련성 세 축으로 평가한다. 선례성과 관련성은 아이디어 전체에 대해 평균을 내지만 실현 가능성은 실험 계획들 가운데 최솟값을 취한다. 한 단계라도 실행 불가능하면 제안서 전체가 흔들린다는 판단이다. 세 점수는 동일 가중치로 합쳐져 R_out = 1/3 (R_P + R_F + R_R)이 된다. 여기에 두 가지 선택적 장치를 실험한다. 하나는 학습 초기에 일정 확률 Pr(swap)로 선택된 (행동, 창의성 수준) 쌍을 다른 것으로 바꿔주고 감쇠 계수 γ로 그 확률을 줄여나가는 세렌디피티 개입이고, 다른 하나는 각 중간 행동이 새로운 방향을 도입했는지(exploration)와 최종 제안서에 얼마나 기여했는지(contribution)를 평가해 R_po = 1/2 (R_proc + R_out)로 합치는 과정 보상이다. 기본 설정은 결과 보상만 사용한다.

어떻게 쓰나

데이터셋은 NSF Awards Database에서 2018년 이후 컴퓨터과학·공학·수학 분야 수상 과제를 가져와 90:10으로 나눈 것으로, 학습 4,414건과 테스트 491건이다. 모델에는 수상 과제 제목만 입력되고 초록, 성과 보고서, 관련 논문은 주어지지 않는다. 학습셋은 46개 연구 도메인에 걸쳐 있고 하위 분야 라벨의 23.1%가 핵심 AI/ML, 48% 이상이 AI/ML과 핵심 CS·공학 바깥이다. 비교용 참조 제안서는 각 과제의 초록, 성과 보고서, PI 정보, 수상 기간과 PI의 arXiv 논문을 근거로 GPT-5.1이 재구성한 것이며, 원래 NSF 제안서를 복원하려는 것이 아니라 실제로 지원·수행된 방향에 대한 표준화된 참조로만 쓴다. 실험은 Qwen3-8B-Base와 Qwen3-14B-Base를 verl로 GRPO 학습해 수행했다. 평가는 세 갈래다. 인용 영향력은 30B 규모 SciJudge로 참조 제안서와의 쌍대 비교 승률을 재고(인용 예측 정확도 평균 82.7%), 독창성은 가장 가까운 논문을 검색해 GPT-5.1이 쌍대 비교하며, 다양성은 GPT-5.4-mini로 연구 패러다임과 기여 유형을 분류해 7개 범주 중 실효 범주 수를 정규화해 측정한다(인간 판단과 κ=0.84).

전제와 한계

결과는 일관되게 AI Night-Scientist 쪽으로 기운다. Qwen3-8B 대비 Night-8B는 예측 인용 영향력을 29.43%포인트, 독창성을 53.79점 올렸고, 14B에서는 각각 32.03%포인트와 66.15점으로 격차가 커진다. 제로샷 모델을 8B에서 14B로 키우면 거의 개선이 없지만, Night-Scientist를 키우면 인용 3.29점, 독창성 12.36점이 추가로 오른다. 디코딩 온도만 올린 베이스라인과의 차이가 특히 분명한데, 같은 제안서 수준 보상을 최적화했는데도 Night-8B가 온도 제어 변형을 독창성 36.50점, 인용 18.37점 앞선다. ReAct도 격차를 상당히 좁히지만 의미론적 창의성 수준이 독창성 9.72점, 인용 4.95점을 더 보탠다. 행동 공간도 중요해서, 같은 창의성 수준과 보상을 쓰면서 Search와 Write만 남기면 독창성이 22.99점 떨어진다. 참조 제안서에 의존하지 않는 직접 비교에서도 Night-8B는 GPT-4.1을 상대로 인용 74.95%, 독창성 86.96% 승률을, Qwen3-8B를 상대로 82.48%와 97.56%를 기록한다.

다양성 지표에서도 정규화된 연구 패러다임 커버리지가 0.738에서 0.943으로 올라 7개 범주 중 약 1.4개가 실효적으로 늘고, 기여 유형 커버리지는 0.370에서 0.425로 오른다. 초기의 세렌디피티 행동 교체를 제거하면 패러다임 커버리지가 0.099(약 0.7 범주), 기여 커버리지가 0.067(약 0.5 범주) 줄어든다. 개선은 특정 주제에 몰려 있지 않고 평가된 36개 도메인 전부에서 나타난다. 과정 보상은 다른 효과를 낸다. Night-8B에서 과정+결과 학습은 독창성을 5.29점 올리는 대신 예측 인용을 3.69점 떨어뜨리고 패러다임·기여 커버리지도 각각 약 0.6, 0.4 범주 줄인다. 같은 과정 보상을 ReAct에 붙이면 인용과 독창성이 모두 급감하고 온도 기반 변형도 두 지표 모두 하락한다. 정책 분석에서는 GPT-4.1이 짧은 search→write→stop 패턴을 따르는 반면, 과정+결과로 학습한 Night-Scientist-8B는 Spark를 더 자주, 중간 이상의 창의성 수준으로 선택한다. Debate는 궤적 예산을 많이 잡아먹어 상대적으로 드물게 선택된다.

개발자 관점에서 이 논문의 실용적 메시지는 창의성을 샘플링 잡음으로 다루지 말라는 것이다. 온도를 올리는 것만으로는 같은 보상을 최적화하고도 독창성과 인용에서 큰 격차가 남았고, 자연어로 '어떤 종류의 창의성'을 지정하는 의미론적 지도가 학습 가능한 신호를 제공했다. 에이전트를 만든다면 행동 목록에 창의성 수준이라는 축을 추가하고, 최종 산출물뿐 아니라 그 산출물을 만든 궤적에 보상을 배분하는 구조를 검토할 만하다. 다만 과정 보상은 공짜가 아니어서, 이 논문의 설정에서는 독창성을 얻는 대신 인용 영향력과 다양성을 잃었다. 또 평가가 SciJudge, GPT-5.1, GPT-5.4-mini 같은 모델 심판에 크게 의존하므로, 인간-LLM 일치도(인용 76.7%, 독창성 72.4%)를 감안해 자체 도메인에서는 별도 검증이 필요하다.

저자들이 명시한 전제와 한계도 분명하다. AI Night-Scientist는 연구 초기 단계의 발상 보조 도구로 설계되었고 자율 연구자가 아니다. 생성된 제안서는 그럴듯하지만 틀렸거나 실행 불가능하거나 근거가 부족할 수 있으며, 대규모로 저품질 과학 콘텐츠를 만드는 데 악용될 수 있다. 따라서 AI 생성 제안으로 표시하고, 주장과 인용을 독립적으로 검증하고, 전문가의 감독을 거쳐야 한다. 또한 참조 제안서는 원래 NSF 제안서가 아니라 사후 증거로 재구성한 것이며 쌍대 평가용으로만 쓰였다는 점, 연구 아이디어의 장기적 가치는 수년이 지나야 관측될 수 있어 예측 지표에 의존할 수밖에 없다는 점도 전제로 깔려 있다. 더 넓은 탐색이 낯선 아이디어를 자동으로 더 낫게 만드는 것은 아니라는 점도 저자들은 강조한다.