← 목록으로

Strata - Qwen 3.8 Flash Next(125B)를 일반 PC에서 초당 100토큰으로 실행하기

요약
  • Strata는 Qwen3.8-Flash-Next 모델을 일반 PC에서 클라우드 없이 실행할 수 있게 해주는 오픈소스 추론 엔진입니다.
  • GPU, CPU, 시스템 메모리에 작업을 분산하는 기술을 통해 대규모 모델을 효율적으로 구동하며, OpenAI 및 Anthropic 호환 API를 지원합니다.
  • Qwen3.8-Flash-Next를 개인 PC에서 실행하는 오픈소스 추론 엔진으로, 대화·코딩·이미지 이해를 클라우드 없이 처리
  • 모델 전체를 GPU에 올리는 대신 GPU와 CPU, 시스템 메모리에 작업을 분산하며, 자주 사용하는 전문가 네트워크를 GPU에 유지
  • 작은 모델이 다음 토큰을 예측하고 큰 모델이 검증하는 방식으로 동일한 출력을 1.6~1.8배 빠르게 생성
  • 자체 측정에서 RTX 5070 12GB·RAM 64GB로 초당 94토큰을 생성하며, Q2_0 양자화 모델의 입력 처리 속도는 초당 2,650토큰
  • Windows와 Linux에서 실행하며 OpenAI·Anthropic 호환 API로 앱과 코딩 에이전트에 연결 가능. 최소 VRAM 12GB·RAM 32GB가 필요하며 메모리에 맞춰 모델을 선택
PC 전체를 활용하는 실행 구조
  • Strata는 일반 PC에서 Qwen3.8-Flash-Next를 실행하며, 대화·코드 작성·이미지 이해와 코딩 에이전트 연동을 지원함
  • 모델의 24,576개 전문가 네트워크 중 토큰마다 10개만 사용하는 구조를 활용해 작업을 분산함
    • GPU에는 자주 사용하는 전문가를 유지하고, RAM에는 전체 전문가를 보관함
    • CPU는 GPU에 없는 전문가의 연산을 병렬로 처리함
  • 작은 보조 모델이 다음 토큰을 예측하고 큰 모델이 한꺼번에 검증해, 같은 출력을 1.6~1.8배 빠르게 생성함
  • 상세 구조는 작동 원리와 기술 문서에서 확인 가능
일반 PC에서의 실측 성능
  • RTX 5070 12GB·Ryzen 5 7600·RAM 64GB에서 Q2_0 양자화 모델의 답변 생성 속도는 초당 94토큰, 입력 처리 속도는 초당 2,650토큰임
    • 더 높은 정밀도의 IQ3_S는 답변 생성 초당 53토큰, 입력 처리 초당 1,620토큰을 기록함
  • RX 9070 XT 16GB·Ryzen 9 3900X·RAM 47GB에서는 Q2_0 기준 답변 생성 초당 60토큰, 입력 처리 초당 1,160토큰을 기록함
  • 답변 생성은 4K토큰, 입력 처리는 32K토큰 기준의 자체 측정이며, 모델의 양자화 수준과 하드웨어에 따라 속도가 달라짐
  • RTX 5070에서 IQ3_S·128K 컨텍스트를 사용해 단일 프롬프트로 브라우저에서 실행되는 복셀 정원을 만드는 데모도 공개함
  • 다른 GPU와 긴 대화의 결과는 성능 측정표와 커뮤니티 벤치마크에서 확인 가능
메모리에 맞춘 모델 선택
  • 기본 요구 사양은 VRAM 12GB 이상인 NVIDIA·AMD GPU, RAM 32GB 이상, 여유 디스크 약 80GB이며 Windows 10/11과 Linux를 지원함
  • 동일 모델을 여러 양자화 수준으로 제공하며, 더 작게 압축하면 빠르고 높은 정밀도를 선택하면 답변 품질이 높아짐
    • RAM 32GB: 전문가 절반을 줄인 코딩용 Coder 모델
    • RAM 48GB: IQ2_XS 또는 속도 중심의 Q2_0
    • RAM 64GB: IQ2_XS와 더 높은 정밀도의 IQ3_XXS·IQ3_S
  • Coder는 제작자 측 측정에서 전체 모델의 SWE-bench Verified 점수 대비 91% 를 유지함
    • 코드 외 작업과 한국어를 포함한 CJK 텍스트에는 모든 전문가를 유지한 모델을 권장함
  • 설치 프로그램이 하드웨어에 맞는 엔진과 모델을 추천하며, 세부 선택 기준은 모델 안내에서 제공함
앱과 코딩 에이전트 연동
  • 내장 브라우저 앱에서 대화하고 GPU·CPU·메모리 사용 상태를 실시간으로 확인 가능
  • OpenAI Chat Completions·Responses와 Anthropic Messages 호환 API를 제공해 기존 앱과 코딩 에이전트를 로컬 모델에 연결 가능
  • Claude Code·Cursor·Codex 등이 설치 안내에 따라 환경을 구성할 수 있으며, MCP 서버를 통한 설치·시작·중지도 지원함
  • Strata는 MIT 라이선스로 공개되며, 사용하는 모델과 일부 구성 요소에는 별도 라이선스가 적용됨
그냥 목록으로
원문 보기 ↗