- xAI가 Grok 4.6을 공개함. Cursor와 Grok Build에서 당일부터 사용 가능하며, 첫 주 동안 두 서비스의 포함 사용량을 2배로 제공함
- 아홉 개 벤치마크를 합산한 Artificial Analysis Intelligence Index에서 GPT-5.6 Sol과 동률을 기록했다고 밝힘. 지수 값은 61이며, CursorBench와 FrontierCode, AA-Briefcase에서는 앞서지만 DeepSWE와 Terminal-Bench에서는 여전히 뒤진다는 관측이 나옴
- 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러이고 두 배 가격의 fast 변형이 별도로 있음
학습 방식
- Grok 4.5보다 긴 보충 학습(supplemental training) 과정을 거쳤고, 추론과 고급 기술 개념을 다루는 모델 생성 데이터, 고품질 엔지니어링 데이터, 개선된 옵티마이저와 학습 레시피를 함께 적용함
- 이후 Grok 4.5를 사용해 SFT 궤적을 재생성했음. 추론 강도, 에이전트 하네스, STEM과 소프트웨어 엔지니어링, 지식 노동 등 도메인 전반에 걸쳐 생성한 뒤 문제 있는 궤적은 모델 기반 검사로 걸러냄
- 에이전트 RL 과제는 지식 노동과 일반 코딩 외에 커널 최적화, 웹 개발, CAD 같은 도메인별 환경을 포함함
- 외부 보도에 따르면 기반 모델은 Grok 4.5와 같은 1.5조 파라미터 V9이며, 개선분은 사전학습 규모가 아니라 사후학습에서 나옴. 2.1조 파라미터의 Grok 4.7이 몇 주 뒤 나올 예정
실사용 관찰
- xAI는 여러 단계에 걸쳐 작업을 지속하는 능력을 시험하는 프로젝트로 모델을 평가했고, 넓은 제품 아이디어를 동작하는 초기 버전으로 옮기는 작업에 특히 강했다고 설명함. 낯선 도메인을 조사하고 애플리케이션의 뼈대를 잡은 뒤 핵심 상호작용을 구현하고 여러 차례 피드백을 거쳐 다듬는 흐름을 수행함
- 긴 궤적에서는 다음 단계로 넘어가기 전에 스스로 결과를 확인하는 자체 테스트와 검증 행동이 더 자주 관찰됐다고 밝힘
참고
- 공개된 벤치마크 비교는 AA Intelligence, GDPVal-AA, DeepSWE 1.1, CursorBench 3.2, FrontierCode 1.1 다섯 개 항목이고, 경쟁 모델 수치는 각 개발사가 공개한 시스템 카드나 리더보드에서 가져왔다고 표기함
- 모두 회사가 자체 보고한 결과라는 점은 감안할 필요가 있음. 다만 Grok 4.5 대비 개선 폭은 공개된 거의 모든 평가에서 뚜렷함
- 발표 페이지의 브랜딩이 SpaceXAI로 표기되어 있어 조직 명칭 변경 여부는 별도 확인이 필요함
원문: https://x.ai/news/grok-4-6
GN⁺ 추가 요약
Neo가 원문을 바탕으로 추가 정리했습니다
- Grok 4.6은 장시간 실행되는 에이전트와 대화형·시각적 작업에 초점을 맞춰, 조사와 코드베이스 분석부터 완성도 높은 애플리케이션 제작까지 복잡한 다단계 작업을 이어감
- Grok 4.5보다 긴 추가 학습과 개선된 최적화·학습 방식을 적용하고, SFT 궤적 재생성과 모델 기반 검사로 문제가 있는 실행 기록을 제거함
- Artificial Analysis Intelligence Index에서 61점으로 GPT-5.6 Sol Max와 동점을 기록했으며, GDPVal-AA v2·CursorBench v3.2·FrontierCode v1.1 등 에이전트 코딩 및 지식 작업 평가에서 Grok 4.5를 앞섬
- 제품 아이디어를 첫 작동 버전으로 구현하고 피드백을 반영하는 장기 작업에서 자체 테스트와 검증이 늘었으며, 시각적·대화형 프로젝트의 초기 결과물도 향상됨
- Cursor·Grok Build·API와 OpenRouter·Vercel·Cloudflare에서 이용할 수 있으며, 가격은 입력 100만 토큰당 $2, 출력 100만 토큰당 $6부터이고 고속 변형은 2배 가격임
- Grok 4.5를 기반으로 장시간 실행되는 에이전트와 더 복잡한 대화형·시각적 작업을 강화함
- 주제 조사, 정보 분석, 코드베이스 작업, 아이디어를 애플리케이션이나 작업 결과물로 바꾸는 다단계 과제를 지속할 수 있음
- Grok 4.5보다 긴 추가 학습 과정을 거침
- 추론과 고급 기술 개념을 위한 선별된 모델 생성 데이터 및 고품질 엔지니어링 데이터를 사용함
- 개선된 최적화 도구와 학습 방식으로 후속 SFT·RL 단계의 기반을 강화함
- Grok 4.5를 사용해 추론 강도, 에이전트 하네스, STEM·소프트웨어 엔지니어링·지식 작업 영역의 SFT 궤적을 다시 생성함
- 모델 기반 검사로 문제가 있는 실행 기록을 걸러내 SFT 체크포인트의 성능과 동작을 개선함
- 지식 작업과 일반 코딩 외에도 커널 최적화, 웹 개발, 컴퓨터 지원 설계 등 분야별 환경을 포함한 다양한 에이전트 강화학습 과제를 활용함
- 광범위한 제품 아이디어를 작동하는 첫 버전으로 만드는 작업에 강점을 보임
- 익숙하지 않은 분야를 조사하고 애플리케이션 구조를 설계하며 핵심 상호작용을 구현할 수 있음
- 여러 차례의 피드백을 반영해 결과물을 계속 다듬고, 긴 작업에서는 다음 단계로 넘어가기 전에 자체 작업을 테스트하고 검증하는 빈도가 늘어남
- Grok 4.5보다 시각적·대화형 프로젝트의 첫 결과물이 강화됨
- 구체적인 제품 아이디어가 주어지면 한 번에 애플리케이션 구조와 시각 언어를 구성할 수 있음
- 상당한 수준의 초기 결과물을 빠르게 만든 뒤 반복적으로 개선하는 프로젝트에 유용함
- 주요 평가 결과는 다음과 같으며, 외부 모델 점수는 개발사가 공개한 시스템 카드·리더보드 또는 공개 결과 가운데 최고값을 사용함
| 평가 | Grok 4.6 High | Grok 4.5 High | GPT-5.6 Sol Max | Fable 5 Max |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 Extended | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
- 모델 역량 확대에 맞춰 보호 장치도 개선·조정함
- 취약점 패치, 엔지니어링 설계 주기 단축, AI 연구 지원 등 합법적인 용도에서 유용성과 보안을 함께 제공하도록 구성함
- 배포 전 역량 및 보호 장치 조정 평가 범위를 기존보다 넓히고, 배포 후 평가와 제3자 테스트도 수행함
- Cursor, Grok Build, API와 OpenRouter·Vercel·Cloudflare에서 사용할 수 있음
- 입력 100만 토큰당 $2, 출력 100만 토큰당 $6부터 시작함
- 고속 변형은 기본 가격의 2배이며, 첫 주에는 Grok Build와 Cursor에서 포함 사용량을 2배 제공함