← 목록으로
지난 소식
AI 경쟁이 난처해졌다
요약
- 중국 AI 연구소 DeepSeek가 공개한 KV 캐시 압축 등 추론 최적화 기술이 서구 AI 기업들의 비용 절감에 도움을 주고 있다.
- 그동안 중국의 모델 증류를 비판해 온 서구 기업들이 정작 중국의 효율 개선 기술을 활용하는 역설적인 상황이 전개되고 있다.
- 중국 연구소의 모델 증류를 비판하던 서구 AI 기업들이, 이번에는 중국이 공개한 추론 최적화 기술의 수혜자가 됐다는 역설을 다룸
- DeepSeek는 긴 문맥을 처리할 때 GPU 메모리에 보관하는 KV 캐시를 대폭 압축했으며, 특정 조건에서 DeepSeek-V1 대비 메모리 사용량을 약 437분의 1로 줄임
- 캐시가 작아지면 같은 GPU로 더 많은 요청을 처리할 수 있어, 긴 대화와 코딩 에이전트의 운영 비용을 낮추는 데 도움이 됨
- Claude Opus 5.5와 GPT-6.1 Sol의 캐시 읽기 가격이 각각 60%, 80% 낮아진 것을 기술 도입의 흔적으로 해석하지만, 실제 도입 여부를 확인하는 근거는 제시하지 않음
- 첨단 GPU 접근이 제한된 중국 연구소의 효율 개선과 기술 공개가 서구 경쟁사에도 도움을 줄 수 있음. AI 경쟁은 모델 성능뿐 아니라 추론 비용을 낮추는 기술에서도 벌어지고 있음
모델 증류 논란과 기술 공개
- Anthropic은 중국 AI 연구소의 Claude 증류 의혹을 제기하고, 증류 공격의 위험을 경고함
- 이런 주장은 중국 모델에 대한 법적 규제와 제한을 정당화하는 토대가 될 수 있음
- 그러나 경쟁은 서구 모델의 답변을 따라 학습하는 증류뿐 아니라, 중국 연구소가 공개한 기술을 서구 기업이 활용하는 방향으로도 전개되고 있음
- 공개된 구현법을 활용하는 것은 ‘도둑질’보다 ‘도입’에 가까움
- 이 글은 중국의 모델 증류를 비판하던 서구 기업들이 정작 중국의 최적화 기술에서는 도움을 받는다는 역설에 초점을 맞춤
DeepSeek가 줄인 KV 캐시의 크기
- KV 캐시는 이미 처리한 토큰의 정보를 저장해, 다음 토큰을 생성할 때 같은 계산을 반복하지 않도록 하는 장치임
- 코딩처럼 문맥이 길어지는 작업에서는 캐시를 보관하는 GPU 메모리 비용이 커짐
- DeepSeek는 MLA에 이어 Compressed Sparse Attention과 Heavily Compressed Attention 등으로 캐시를 압축해 왔음
- DeepSeek-V4.1-Flash에는 CSA2, 계층 간 캐시 재사용, 인과적 인코더-디코더 구조와 FP4 캐싱을 적용했다고 설명함
- 원문의 캐시 크기 그래프는 100만 토큰을 보관할 때의 메모리 사용량을 다음과 같이 비교함
- DeepSeek-V1: 389.12GB
- DeepSeek-V3.2: 48.07GB
- DeepSeek-V4-Flash: 3.51GB
- DeepSeek-V4.1-Flash: 890MB
- 이 비교에서 V4.1-Flash의 캐시는 V1의 약 437분의 1이며, 메모리 사용량은 약 99.77% 감소함
- 이는 특정 조건의 KV 캐시 비교로, 모델 가중치를 포함한 전체 메모리나 전체 추론 비용이 같은 비율로 줄었다는 뜻은 아님
서구 모델의 캐시 가격도 크게 하락
- 원문의 가격 비교 그래프는 이전 모델과 새 모델의 100만 토큰당 가격을 비교함
| 항목 |
Claude Opus 5 → 5.5 |
GPT-5.6 Sol → GPT-6.1 Sol |
| 입력 |
$5.00 → $4.00 |
$5.00 → $2.00 |
| 캐시 쓰기 |
$6.25 → $5.00 |
$6.25 → $2.50 |
| 캐시 읽기 |
$0.50 → $0.20 |
$0.50 → $0.10 |
- 캐시 읽기 가격은 Claude가 60%, GPT가 80% 낮아짐
- 긴 문맥을 반복해서 사용하는 작업에서 캐시된 입력의 이용 비용이 크게 줄어든 비교임
- 글은 이 가격 하락을 DeepSeek의 최적화 기술을 도입한 증거로 해석함
- 그러나 두 회사의 기술 도입을 확인하는 발표나 내부 구현 자료는 제시하지 않으므로, 가격 변화와 특정 기술의 채택은 구분해야 함
중국의 제약이 서구 기업의 구명줄이 됐다는 역설
- 첨단 GPU 접근이 제한된 중국 연구소는 성능과 메모리 효율 개선에 집중할 유인이 컸으며, DeepSeek의 기술 공개는 그 성과를 다른 연구소도 활용할 수 있게 함
- Claude Opus 5.5와 GPT-6.1 Sol은 좋은 사용자 평가와 함께, 대표 모델인 Claude Fable 5.1과 GPT-6 Astra에 크게 뒤지지 않는 품질을 제공한다는 평가를 받음
- 큰 사전 홍보 없이 출시한 이유를 기술 복제에 대한 부담과 연결하지만, 이 역시 확인된 출시 배경은 아님
- 글의 결론은 중국 연구소가 공개한 효율 개선 기술이 적자를 내는 서구 연구소의 구명줄이 됐다는 것임
- 기술 도입과 수익성 개선의 인과관계는 입증되지 않았지만, 중국을 단순한 추격자로만 보는 구도와는 다른 경쟁의 모습을 드러냄