← 목록으로

GPT-6 Astra, 실제 자동차를 운전해 주행 코스 완주

요약
  • 범용 AI 모델의 실제 차량 제어 성능을 평가하는 DrivingBench 실험에서 GPT-6 Astra가 비교 모델 중 유일하게 주행 코스를 완주했다.
  • Astra는 첫 시도의 실패 요인을 스스로 분석하고 속도와 조향 방식을 수정하여 두 번째 시도에서 5분 22초 만에 코스를 통과했다.
  • DrivingBench는 범용 AI 모델에 실제 Toyota Corolla의 카메라 영상과 차량 상태를 제공하고, 도구 호출로 조향과 가감속을 제어하게 하는 주행 실험
  • GPT-6 Astra는 첫 시도에서 코스의 49%까지 진행한 뒤, 두 번째 시도에서 5분 22초 만에 완주했으며 비교한 네 모델 중 유일하게 성공함
  • 첫 실패에서 너무 일찍 핸들을 풀고 속도를 높였다는 점을 돌아본 뒤, 두 번째에는 요청 속도를 초속 0.8m 이하로 낮추고 조향 방식을 바꿔 코스를 통과함
  • 같은 대화를 유지하며 최대 세 번 시도한 결과, Claude Fable 5.1은 45%, Grok 4.6은 11%, GPT-5.6 Sol은 6% 까지 진행함
  • 빈 주차장에 교통 콘으로 만든 코스를 저속으로 주행하고 사람이 즉시 제동할 수 있도록 한 실험으로, 일반 도로의 자율주행 성능을 평가한 것은 아님
실제 차량을 이용한 평가
  • DrivingBench는 실제 Toyota Corolla의 조향, 가속, 제동을 언어 모델이 제어하도록 하고, 고정된 콘 코스에서 평가함
  • 모델별로 하나의 연속된 대화에서 최대 3회 시도하며, 각 주행의 실행 추적과 영상을 확인할 수 있음
모델별 주행 결과
  • GPT-6 Astra는 Codex의 medium 설정에서 최고 진행률 100% 를 기록함
    • 첫 번째 시도는 49%, 두 번째 시도는 100%였으며, 완주 시간은 5분 22초임
    • 두 번째에 완주해 세 번째 시도는 진행하지 않음
  • Claude Fable 5.1은 Claude Code의 medium 설정에서 시도별로 9%, 10%, 45%를 기록해 최고 진행률이 45% 임
  • Grok 4.6은 Cursor의 medium 설정에서 시도별로 8%, 11%, 10%를 기록해 최고 진행률이 11% 임
  • GPT-5.6 Sol은 Codex의 medium 설정에서 세 번 모두 진행률 6% 를 기록함
카메라를 보고 도구 호출로 자동차 제어
  • 모델은 카메라 영상과 속도, 조향 상태를 확인하고, 방향과 조향 정도, 목표 속도, 동작 시간을 지정해 차량을 움직임
  • Codex, Claude Code, Cursor에 연결한 MCP 도구 3개로 주변 관찰, 주행 명령, 즉시 정지를 수행함
  • 명령은 comma four 장치와 openpilot을 거쳐 실제 차량 제어로 이어짐
    • 모델이 다음 행동을 생각하는 동안에도 이전 주행 명령은 계속 실행됨
    • 새 명령은 이전 명령을 대체하며, 지정한 시간이 끝나면 제동함
  • Astra는 약 5~6초마다 주변을 관찰하고 분당 약 6개의 명령을 보냄
    • 반면 Fable의 두 번째 시도에서는 총 190초 중 실제로 움직인 시간이 31초에 그쳤으며, 나머지 시간 대부분은 차를 세워둔 채 추론함
실패를 설명하는 것과 다음 주행을 바꾸는 것
  • 각 모델은 실패한 뒤 같은 대화 안에서 실수와 개선 방법을 돌아보고 다시 시도함
  • Astra는 첫 주행에서 차가 정렬됐다고 너무 일찍 판단해 핸들을 풀고 속도를 높인 점을 짚음
    • 두 번째 주행에서는 더 낮은 속도와 큰 조향값을 활용해 완주함
  • Fable도 세 번째 시도에서 코스 경계를 더 잘 이해해 긴 직선 구간을 통과했지만, 이후 회전에 필요한 공간을 확보하지 못함
  • Grok은 명령 사이의 긴 공백을 줄여야 한다고 정리했으나, 다음 시도에서도 명령을 미리 갱신하지 못함
  • 주요 실패 원인 중 하나는 콘이 차로의 어느 쪽 경계인지 잘못 해석하는 것이었으며, 실패 원인을 말로 설명해도 실제 행동이 개선되는 것은 아니었음
측정 지표와 결과 확인
  • 진행률은 코스 중심선에서 4m 이내를 유지하며 도달한 위치를, 결승 구역까지의 중심선 전체 길이에 대한 비율로 계산함
    • 충돌하더라도 그 전에 도달한 진행률은 유지됨
  • 주행 거리는 처음 수락된 set_motion부터 해당 시도의 마지막 제어 구간 종료까지 GPS 속도를 적분해 계산함
  • 완주 시간도 처음 수락된 set_motion부터 해당 시도의 마지막 제어 구간 종료까지 측정함
    • 완주한 주행에만 시간을 표시하며, DNF는 미완주를 뜻함
  • 명령 수는 해당 시도에서 수락된 set_motion과 stop_now 호출 수임
  • 토큰 사용량과 비용은 시도 후 회고까지 포함한 총량이며, 비용은 정가 기준으로 계산함
  • 결과 화면에서 모델별 시도를 펼쳐 실행 추적과 영상을 확인하고, 코스의 주행 궤적을 재생할 수 있음
그냥 목록으로
원문 보기 ↗