← 목록으로

Grok 4.6 공개, 파라미터 확장 대신 사후학습에 투자한 모델

  • xAI가 Grok 4.6을 공개함. Cursor와 Grok Build에서 당일부터 사용 가능하며, 첫 주 동안 두 서비스의 포함 사용량을 2배로 제공함
  • 아홉 개 벤치마크를 합산한 Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 동률을 기록했다고 밝힘. 지수 값은 61이며, CursorBench와 FrontierCode, AA-Briefcase에서는 앞서지만 DeepSWE와 Terminal-Bench에서는 여전히 뒤진다는 관측이 나옴
  • 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이고 두 배 가격의 fast 변형이 별도로 있음

학습 방식

  • Grok 4.5보다 긴 보충 학습(supplemental training) 과정을 거쳤고, 추론과 고급 기술 개념을 다루는 모델 생성 데이터, 고품질 엔지니어링 데이터, 개선된 옵티마이저와 학습 레시피를 함께 적용함
  • 이후 Grok 4.5를 사용해 SFT 궤적을 재생성했음. 추론 강도, 에이전트 하네스, STEM과 소프트웨어 엔지니어링, 지식 노동 등 도메인 전반에 걸쳐 생성한 뒤 문제 있는 궤적은 모델 기반 검사로 걸러냄
  • 에이전트 RL 과제는 지식 노동과 일반 코딩 외에 커널 최적화, 웹 개발, CAD 같은 도메인별 환경을 포함함
  • 외부 보도에 따르면 기반 모델은 Grok 4.5와 같은 1.5조 파라미터 V9이며, 개선분은 사전학습 규모가 아니라 사후학습에서 나옴. 2.1조 파라미터의 Grok 4.7이 몇 주 뒤 나올 예정

실사용 관찰

  • xAI는 여러 단계에 걸쳐 작업을 지속하는 능력을 시험하는 프로젝트로 모델을 평가했고, 넓은 제품 아이디어를 동작하는 초기 버전으로 옮기는 작업에 특히 강했다고 설명함. 낯선 도메인을 조사하고 애플리케이션의 뼈대를 잡은 뒤 핵심 상호작용을 구현하고 여러 차례 피드백을 거쳐 다듬는 흐름을 수행함
  • 긴 궤적에서는 다음 단계로 넘어가기 전에 스스로 결과를 확인하는 자체 테스트와 검증 행동이 더 자주 관찰됐다고 밝힘

참고

  • 공개된 벤치마크 비교는 AA Intelligence, GDPVal-AA, DeepSWE 1.1, CursorBench 3.2, FrontierCode 1.1 다섯 개 항목이고, 경쟁 모델 수치는 각 개발사가 공개한 시스템 카드나 리더보드에서 가져왔다고 표기함
  • 모두 회사가 자체 보고한 결과라는 점은 감안할 필요가 있음. 다만 Grok 4.5 대비 개선 폭은 공개된 거의 모든 평가에서 뚜렷함
  • 발표 페이지의 브랜딩이 SpaceXAI로 표기되어 있어 조직 명칭 변경 여부는 별도 확인이 필요함

원문: https://x.ai/news/grok-4-6

GN⁺ 추가 요약

Neo가 원문을 바탕으로 추가 정리했습니다

  • Grok 4.6은 장시간 실행되는 에이전트와 대화형·시각적 작업에 초점을 맞춰, 조사와 코드베이스 분석부터 완성도 높은 애플리케이션 제작까지 복잡한 다단계 작업을 이어감
  • Grok 4.5보다 긴 추가 학습과 개선된 최적화·학습 방식을 적용하고, SFT 궤적 재생성과 모델 기반 검사로 문제가 있는 실행 기록을 제거함
  • Artificial Analysis Intelligence Index에서 61점으로 GPT-5.6 Sol Max와 동점을 기록했으며, GDPVal-AA v2·CursorBench v3.2·FrontierCode v1.1 등 에이전트 코딩 및 지식 작업 평가에서 Grok 4.5를 앞섬
  • 제품 아이디어를 첫 작동 버전으로 구현하고 피드백을 반영하는 장기 작업에서 자체 테스트와 검증이 늘었으며, 시각적·대화형 프로젝트의 초기 결과물도 향상됨
  • Cursor·Grok Build·API와 OpenRouter·Vercel·Cloudflare에서 이용할 수 있으며, 가격은 입력 100만 토큰당 $2, 출력 100만 토큰당 $6부터이고 고속 변형은 2배 가격임
학습과 장기 에이전트 성능
  • Grok 4.5를 기반으로 장시간 실행되는 에이전트와 더 복잡한 대화형·시각적 작업을 강화함
    • 주제 조사, 정보 분석, 코드베이스 작업, 아이디어를 애플리케이션이나 작업 결과물로 바꾸는 다단계 과제를 지속할 수 있음
  • Grok 4.5보다 긴 추가 학습 과정을 거침
    • 추론과 고급 기술 개념을 위한 선별된 모델 생성 데이터 및 고품질 엔지니어링 데이터를 사용함
    • 개선된 최적화 도구와 학습 방식으로 후속 SFT·RL 단계의 기반을 강화함
  • Grok 4.5를 사용해 추론 강도, 에이전트 하네스, STEM·소프트웨어 엔지니어링·지식 작업 영역의 SFT 궤적을 다시 생성함
    • 모델 기반 검사로 문제가 있는 실행 기록을 걸러내 SFT 체크포인트의 성능과 동작을 개선함
  • 지식 작업과 일반 코딩 외에도 커널 최적화, 웹 개발, 컴퓨터 지원 설계 등 분야별 환경을 포함한 다양한 에이전트 강화학습 과제를 활용함
아이디어를 작동하는 프로젝트로 전환
  • 광범위한 제품 아이디어를 작동하는 첫 버전으로 만드는 작업에 강점을 보임
    • 익숙하지 않은 분야를 조사하고 애플리케이션 구조를 설계하며 핵심 상호작용을 구현할 수 있음
    • 여러 차례의 피드백을 반영해 결과물을 계속 다듬고, 긴 작업에서는 다음 단계로 넘어가기 전에 자체 작업을 테스트하고 검증하는 빈도가 늘어남
  • Grok 4.5보다 시각적·대화형 프로젝트의 첫 결과물이 강화됨
    • 구체적인 제품 아이디어가 주어지면 한 번에 애플리케이션 구조와 시각 언어를 구성할 수 있음
    • 상당한 수준의 초기 결과물을 빠르게 만든 뒤 반복적으로 개선하는 프로젝트에 유용함
평가, 안전성과 제공 방식
  • 주요 평가 결과는 다음과 같으며, 외부 모델 점수는 개발사가 공개한 시스템 카드·리더보드 또는 공개 결과 가운데 최고값을 사용함
평가 Grok 4.6 High Grok 4.5 High GPT-5.6 Sol Max Fable 5 Max
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 Extended 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%
  • 모델 역량 확대에 맞춰 보호 장치도 개선·조정함
    • 취약점 패치, 엔지니어링 설계 주기 단축, AI 연구 지원 등 합법적인 용도에서 유용성과 보안을 함께 제공하도록 구성함
    • 배포 전 역량 및 보호 장치 조정 평가 범위를 기존보다 넓히고, 배포 후 평가와 제3자 테스트도 수행함
  • Cursor, Grok Build, API와 OpenRouter·Vercel·Cloudflare에서 사용할 수 있음
    • 입력 100만 토큰당 $2, 출력 100만 토큰당 $6부터 시작함
    • 고속 변형은 기본 가격의 2배이며, 첫 주에는 Grok Build와 Cursor에서 포함 사용량을 2배 제공함
그냥 목록으로
원문 보기 ↗