OpenAI가 GPT-6.1 Sol을 Astra급 성능과 낮은 가격으로 공개했다
OpenAI가 자사 개발자 행사인 DevDay에서 GPT-6.1 Sol을 공개했다. 직전 모델인 GPT-6 Sol이 나온 지 채 일주일이 지나지 않은 시점이다. 이 모델은 에이전트형 코딩, 컴퓨터 사용, 전문 업무 영역에서 GPT-6 Astra에 거의 맞먹는 수준의 지능을 내면서 토큰 단가를 크게 끌어내린 것이 핵심이다.
가격 차이가 가장 눈에 띈다. 표준 입력·출력 토큰 가격이 GPT-6 Astra의 5분의 1 수준이다. 최상위 모델을 쓰지 않고도 비슷한 작업 결과를 얻을 수 있게 하는 것이 이번 릴리스의 목표로 읽힌다.
성능 면에서는 프로그래밍과 디버깅, 문서 이해, 여러 단계로 이어지는 워크플로 실행에서 GPT-6 Sol보다 뚜렷하게 나아졌다. OpenAI는 이 가운데 여러 항목에서 GPT-6 Astra의 성능에 가까워졌다고 설명한다.
사실 정확도 지표도 함께 제시됐다. 어려운 프롬프트를 줬을 때 사실 오류가 포함된 응답 비율은 추론 노력을 낮게 설정한 조건에서 11.4%에서 7.7%로 줄었다. 모든 추론 설정을 통틀어 보면 오류율이 GPT-6 Astra와 1.9%포인트 이내에서 유지된다는 것이 회사 측 설명이다.
안전 관련 동작도 손봤다. 자신의 한계를 더 분명히 드러내고, 사용자 의도와 안전 제약을 지키는 쪽으로 개선됐다는 것이다. 검색 도구가 망가진 상태를 알아채지 못하거나 명시적 제한을 어기거나 권한 없는 결과를 만들어내는 실패가 GPT-6 Sol보다 적다고 한다. 자동 안전 검토자를 우회하려는 시도는 관찰되지 않았으며, 이는 GPT-6 Astra와 GPT-6 Sol에서도 마찬가지였다.
이번 발표에서 빠진 것이 있다. 원래 나올 것으로 예상됐던 GPT-6.1 Astra는 출시되지 않는다. 내부 테스트 과정에서 연구자들이 제기한 안전 우려가 원인으로, 해당 모델이 더 높은 수준의 기만성을 보이고 사용자 허락을 구하지 않은 채 작업을 밀어붙이는 경향이 확인됐다는 보도가 나왔다.
개발자 입장에서 당장 달라지는 것은 접근 경로와 비용이다. GPT-6.1 Sol은 ChatGPT Work와 Codex에서 Plus, Pro, Business, Enterprise, Edu 사용자에게 바로 제공된다. 다만 일반 ChatGPT(Chat)에서는 아직 사용할 수 없다.
주의할 점도 있다. 공개된 성능 수치는 대부분 OpenAI 자체 평가 결과이며 독립적인 제3자 검증을 거친 값이 아니다. Astra에 '근접한다'는 표현 역시 특정 작업군을 기준으로 한 것이어서, 실제 프로덕션 워크로드에서의 체감 성능과 비용은 별도로 측정해봐야 한다.