GPU 간 데이터 교환 늦어지면 값비싼 연산 자원도 멈춰
내부망은 촘촘하게·거점은 DCI로…설계부터 함께 짜야
네이버 데이터센터 ‘각 세종’ 서버실. [사진 네이버][이코노미스트 정길준 기자] 그래픽처리장치(GPU)를 많이 확보했다고 인공지능 데이터센터(AIDC)가 제 성능을 내는 것은 아니다.
AI 모델을 학습할 때는 수천장의 GPU가 하나의 작업을 나눠 처리한다. 이 과정에서 데이터를 주고받는 통신망이 느리면 계산을 끝낸 GPU도 다음 작업을 시작하지 못하고 기다린다. 값비싼 장비를 쌓아두고도 제대로 활용하지 못하는 일이 벌어지는 것이다.
AIDC 안에서는 GPU가 들어간 서버들을 빠르게 연결해야 한다. 떨어진 데이터센터끼리도 초고속 전용망으로 이어야 한다. GPU 배치와 내부 통신망, 센터 간 연결망을 처음부터 함께 설계해야 하는 이유다.
결국 승부는 ‘연결’에서 갈린다. 수천장의 GPU를 얼마나 빠르고 안정적으로 하나의 컴퓨터처럼 작동시키느냐가 AIDC의 경쟁력을 결정한다.
GPU 수보다 중요한 ‘데이터 길’
AIDC 내부의 통신망은 GPU와 서버, 네트워크 스위치를 하나로 연결한다. 업계에서는 이를 ‘패브릭’이라고 부른다. GPU와 GPU 사이에서 데이터를 나르는 고속도로와 같은 역할을 한다.
AI 모델은 하나의 GPU에 담기 어려울 정도로 크다. 여러 GPU가 계산을 나눠 맡고 중간 결과와 학습값을 계속 교환해야 한다. 데이터가 오가는 길목이 막히면 GPU는 계산보다 다른 GPU를 기다리는 데 더 많은 시간을 쓰게 된다.
GPU가 어디에 배치됐는지도 중요하다. 같은 랙(서버가 들어찬 선반형 장치) 안에 있는 GPU보다 다른 랙이나 건물에 있는 GPU와 데이터를 주고받을 때 더 많은 스위치와 긴 케이블을 거쳐야 하기 때문이다.
메타가 10만개 이상의 GPU를 연결한 학습 클러스터를 분석한 결과, 같은 랙 안의 통신과 비교해 다른 랙 간 지연은 7배, 다른 연산 구역 간은 15배, 다른 데이터센터 건물 간은 최대 30배로 늘어났다. 스위치를 거치는 횟수와 케이블 길이가 늘어난 영향이다.
GPU를 무작정 늘리는 것만으로는 이런 병목을 해결하기 어렵다. 서로 데이터를 자주 주고받는 GPU는 가까이 배치하고, 작업을 나눠주는 소프트웨어도 실제 연결 구조를 반영해야 한다. 특정 구간에 통신이 몰리면 작업을 다른 곳으로 옮기고, 고장 난 GPU나 통신장비를 빠르게 찾아 격리하는 기능도 필요하다.
메타는 이러한 통신 최적화 기술을 적용한 ‘NCCLX’를 통해 자체 환경에서 AI 학습 단계의 지연 시간을 최대 12% 줄였다. 대규모 학습을 시작하는 데 걸리는 시간도 최대 11배 단축했다. GPU를 추가하는 것만큼 이미 확보한 GPU를 쉬지 않게 만드는 운영 기술이 중요하다는 의미다.
국내에서는 네이버가 자체 데이터센터 운영 경험과 엔비디아의 ‘DSX’를 결합하는 방식을 택했다. 네이버는 ‘각 세종’을 시작으로 DSX 기반 AI 팩토리를 구축해 초기 55MW에서 기가와트급으로 확대할 계획이다.
DSX는 반도체와 네트워크뿐 아니라 전력·냉각·운영체계를 하나의 시스템으로 설계하고 가상 환경에서 미리 검증하는 플랫폼이다. 장비를 들여온 뒤 서로 연결하는 것이 아니라 데이터센터를 짓기 전부터 GPU와 네트워크, 전력·냉각 설비가 함께 작동하도록 설계하는 방식이다.
네이버 데이터센터 ‘각 세종’ 컨트롤센터. [사진 네이버]센터끼리 잇는 DCI, 거리까지 없애진 못해
통신 과제는 데이터센터 내부에서 끝나지 않는다. 전력과 부지를 찾아 AIDC가 여러 지역에 나뉘어 들어서면서 떨어진 데이터센터를 연결하는 기술도 중요해졌다.
대표적인 것이 데이터센터 간 연결망(DCI·Data Center Interconnection)이다. 데이터센터 간 전용 광통신망을 구축해 데이터와 AI 모델, 서비스 트래픽을 빠르게 주고받는 방식이다.
다만 DCI가 멀리 떨어진 데이터센터를 같은 건물처럼 만드는 것은 아니다. 물리적 거리가 멀수록 통신 지연은 커질 수밖에 없다. 여러 GPU가 동시에 계산 결과를 주고받아야 하는 대규모 학습은 한 센터나 가까운 거점에 모으고, 멀리 떨어진 센터는 데이터 백업과 모델 전송, 분산 추론 등으로 역할을 나누는 편이 효율적이다.
이 영역에서는 전국 광통신망을 보유한 이동통신 3사가 경쟁하고 있다.
SK텔레콤과 SK브로드밴드는 내년 첫 가동을 목표로 하는 울산 AIDC를 수도권과 복수 경로의 DCI로 연결할 계획이다. 부산의 국제 해저케이블망과도 연계해 북미와 아시아·태평양 지역으로 연결 범위를 넓힌다. 한 경로에 장애가 생겨도 다른 길로 우회할 수 있도록 처음부터 회선을 이중화하는 구조다.
KT는 향후 5년 동안 5조원을 투입해 총 1GW 규모의 AIDC를 구축할 계획이다. 중앙 AIDC와 산업 현장 인근의 소규모 AI 거점을 연결하고 국제 해저케이블 용량도 128Tbps 이상으로 확대한다는 구상이다. 대규모 학습은 중앙에서 처리하고 빠른 응답이 필요한 추론은 이용자와 가까운 거점에서 수행하는 방식이다.
LG유플러스도 카카오 등 대형 플랫폼과 글로벌 클라우드 기업에 DCI를 제공한 경험을 바탕으로 관련 사업을 확대하고 있다. 평촌 데이터센터 운영 경험과 파주 AIDC 구축을 연계해 여러 거점의 연결과 운영을 함께 제공한다는 전략이다.
기업이 AIDC를 구축할 때는 먼저 어떤 AI 작업을 처리할지 정해야 한다. 대규모 학습이 중심이라면 센터 내부 통신망의 속도와 GPU 배치가 중요하다. 실시간 추론이나 재해복구가 목적이라면 이용자와의 거리, DCI 경로와 이중화가 우선이다.
이통사 관계자는 “과거에는 데이터센터를 다 지은 뒤 연결을 고민했다면, 이제는 설계 단계부터 DCI 네트워크 인프라를 함께 검토하는 고객이 급증하고 있다”며 “연결이 곧 인프라의 성능이자 안정성을 결정짓는 핵심 기준인 만큼, 데이터센터 간 초저지연 연결망 확보가 AI 비즈니스의 성패를 가르는 가장 중요한 요소가 됐다”고 설명했다.