GPT-6 Astra, 채팅 한 번으로 차량 주행 과제 수행… 3회 시도 벤치마크 공개

Hacker News17일 전조회 9

GPT-6 Astra가 차량을 몰고 코스를 주행하는 과제를 수행했다는 결과가 공개됐다. 단발성 데모가 아니라, 하나의 연속된 채팅 세션 안에서 최대 3번의 시도를 허용하고 그중 가장 좋은 기록으로 순위를 매기는 평가 방식이라는 점이 핵심이다. 각 시도는 궤적과 영상, 주고받은 명령, 소모된 토큰과 비용까지 함께 드러난다.

평가의 중심에는 '진행률' 지표가 있다. 코스 중심선을 따라가면서 중심선에서 4m 넘게 벗어나지 않은 채 얼마나 멀리 갔는지를, 결승 구역까지 남은 중심선 길이에 대한 비율로 환산한다. 도중에 충돌이 발생하면 충돌 직전까지 도달한 진행률이 그대로 기록된다.

주행 거리는 첫 번째 set_motion 명령이 수락된 시점부터 해당 시도의 마지막 engagement가 끝난 시점까지 GPS 속도를 적분해 계산한다. 완주 시간도 같은 구간을 기준으로 삼으며 완주한 주행에만 표시되고, 끝까지 가지 못한 경우는 DNF로 처리된다.

명령 수 지표는 시도 중 수락된 set_motion과 stop_now 호출 횟수를 센다. 여기에 정가 기준 총 토큰 수와 비용이 붙는데, 시도가 끝난 뒤의 reflection 단계에서 쓴 토큰까지 포함한다. 즉 얼마나 잘 몰았는가와 얼마나 비싸게 몰았는가를 같은 표에서 함께 본다.

순위는 동일한 컨텍스트에서 이뤄진 최대 3회 시도 중 최고 기록을 기준으로 매겨지고, 첫 시도 기록도 따로 확인할 수 있다. 모델 항목을 펼치면 개별 런이 나열되고, 런을 클릭하면 추론 흔적과 주행 영상이 함께 열린다. 코스 자체의 궤적 리플레이도 제공된다.

텍스트나 코드 생성 능력을 겨루던 평가가 '에이전트가 연속된 환경에서 얼마나 오래 버티는가'로 옮겨가는 흐름과 맞닿아 있다. 차량 제어는 명령 하나가 잘못되면 되돌릴 수 없고, 상태가 계속 이어지며, 실패가 즉시 누적된다는 점에서 정적인 벤치마크와 성격이 다르다.

실무에서 눈여겨볼 지점은 평가 항목의 구성이다. 명령 API 호출 횟수, 재시도 허용 범위, 토큰·비용이 모두 순위표에 들어간다는 것은 로봇·차량·자율 에이전트를 다루는 팀이 성능뿐 아니라 호출 효율과 비용까지 함께 최적화해야 한다는 신호다. set_motion과 stop_now처럼 최소한의 제어 명령만 노출하는 인터페이스 설계도 참고할 만하다.

다만 원문에서 확인할 수 있는 것은 지표 정의와 결과 열람 방식이다. 모델별 실제 점수, 코스 환경, 차량 종류, 시뮬레이션 여부 같은 조건은 제시되지 않았다. 3회 시도와 동일 컨텍스트라는 전제가 결과 해석에 큰 영향을 주므로, 수치를 인용할 때는 이 조건을 함께 봐야 한다.

관련 글