세이지메이커 하이퍼팟과 쿠물로 연계 멀티 리전 분산 학습 아키텍처 공개
세이지메이커 하이퍼팟과 쿠물로 파일시스템을 연동해 데이터를 타 리전으로 복제하지 않고도 60ms 지연 환경에서 로컬 수준의 학습 처리량을 달성하는 아키텍처가 공개됐다.
데빈 · AI 기술 에디터 ·
아마존웹서비스(AWS)와 스토리지 솔루션 기업 쿠물로(Qumulo)는 아마존 세이지메이커 하이퍼팟(Amazon SageMaker HyperPod)과 클라우드 네이티브 쿠물로(CNQ, Cloud Native Qumulo)를 결합하여 데이터 복제 없이 서로 다른 AWS 리전 간에 인공지능(AI) 모델을 분산 학습할 수 있는 아키텍처와 검증 결과를 발표했다. 이번에 제시된 솔루션은 학습 데이터셋을 특정 리전에 단일 원본(Single source of truth)으로 유지하면서, 컴퓨팅 자원이 있는 원격 리전 클러스터에서 네트워크 파일 시스템(NFS)을 통해 원격 데이터를 직접 읽어 훈련을 수행하도록 구성한다. 검증 결과에 따르면 60ms 수준의 네트워크 지연이 존재하는 리전 간 환경에서도 초기 캐시 적응 단계를 거치면 데이터가 같은 위치에 있는 로컬 환경과 동일한 학습 처리량(Throughput)과 98~100%의 GPU 활용률을 달성하는 것으로 확인됐다.
초거대 AI 모델 학습에는 대규모 GPU 클러스터가 필수적이지만, 가속 컴퓨팅 자원을 확보할 수 있는 리전과 페타바이트(PB) 규모의 학습 데이터가 저장된 리전이 일치하지 않는 자원 불일치 문제가 자주 발생한다. 기존에는 수 페타바이트 규모의 데이터를 원격 리전으로 사전 복제하여 막대한 스토리지 비용과 데이터 전송 비용을 부담하거나, 매 읽기 작업마다 리전 간 네트워크 지연(Latency)을 감수하면서 학습 속도 저하를 감내해야 하는 트레이드오프가 존재했다. 세이지메이커 하이퍼팟과 쿠물로의 연계 아키텍처는 학습 코드 변경이나 전체 데이터셋 복제 없이도 지연 시간 문제를 완화하고 GPU 처리량을 유지할 수 있도록 설계됐다.
아키텍처의 핵심 기술은 쿠물로의 클라우드 데이터 패브릭(CDF, Cloud Data Fabric)과 인공지능 기반 예측 캐싱 계층인 뉴럴캐시(NeuralCache)다. 허브 리전의 CNQ에 위치한 단일 데이터셋은 CDF를 통해 원격 스포크 리전의 CNQ 인스턴스에 통합 POSIX 네임스페이스로 투영된다. 스포크가 생성되면 파일시스템 메타데이터만 수 초 내에 복제되므로 실제 파일 데이터가 이동하기 전에도 전체 디렉터리 조회가 가능하다. 뉴럴캐시는 학습 데이터 로더가 호출하는 4KB 블록 단위의 순차 읽기 패턴을 실시간으로 학습하여 요청 발생 전에 허브로부터 데이터를 예측 인출(Prefetch)해 스포크의 로컬 NVMe 스토리지에 저장한다. 또한 패킷 손실에 의존해 속도를 줄이는 기존 손실 기반 전송 알고리즘 대신 병목 대역폭과 왕복 전송 시간(RTT)을 측정해 속도를 제어하는 고급 혼잡 제어 메커니즘을 적용해 최대 900ms RTT 환경에서도 회선 속도에 근접한 처리량을 유지한다.
실제 검증 환경은 오하이오(us-east-2) 리전의 허브 클러스터와 오리건(us-west-2) 리전의 스포크 클러스터로 구축됐다. 허브 리전에는 r5.8xlarge 인스턴스 4노드로 구성된 CNQ가 AWS 클라우드포메이션(CloudFormation) 템플릿(templates/cnq-standard.template.yaml)을 통해 배포됐으며, 두 리전 간 VPC는 VPC 피어링(VPC Peering)으로 연결되어 TCP 2049(NFS) 포트 통신 경로가 구성됐다. 각 리전의 세이지메이커 하이퍼팟 노드는 아마존 EKS(Amazon EKS) 오케스트레이터와 연결되며, 헬름(Helm)으로 설치된 쿠물로 CSI 드라이버를 통해 여러 노드가 동시에 마운트할 수 있는 ReadWriteMany 접근 모드의 50TiB 정적 영구 볼륨(PV) 및 볼륨 클레임(PVC)을 마운트했다. 분산 학습은 파이토치(PyTorch) 2.1 FSDP(Fully Sharded Data Parallel) 기반 쿠브플로우(Kubeflow) PyTorchJob 환경에서 실행됐으며, 64개의 데이터 로더 워커와 prefetch_factor=4 설정을 적용해 256개 배치를 파이프라인에 대기시켜 I/O 지연을 은폐했다.
LLaMA v3 10억 2천만(1.02B) 파라미터 모델과 클러스터당 ml.p5.48xlarge 인스턴스 2대(총 16개 NVIDIA H100 GPU), C4 데이터셋(4,840만 시퀀스, 4,096 토큰 윈도우)을 사용해 999 배치를 수행한 검증 결과가 공개됐다. 데이터와 연산이 동일 리전에 위치한 허브 구성에서는 1.0~1.3GBps의 읽기 대역폭과 2~3ms의 지연 시간으로 116~117 samples/sec의 학습 속도 및 98~100%의 GPU 활용률을 기록했다. 60ms의 네트워크 왕복 지연이 발생하는 스포크 클러스터의 콜드 스타트(Cold Start) 시험에서는 초기 0~100 배치 구간에서 지연 시간이 60ms 이상으로 유지되며 처리량이 500~800MBps, 학습 속도가 95~105 samples/sec, GPU 가동률이 80~90%로 일시 하락했다. 그러나 100~150 배치 구간을 거치며 패턴 예측이 안정화되자 캐시 적중률이 94~96%에 도달하고 읽기 지연이 5~10ms로 떨어지며 학습 속도가 115~117 samples/sec, GPU 가동률이 98~100%로 수렴했다. 캐시가 사전에 적재된 웜 캐시(Warm Cache) 환경에서는 첫 배치부터 허브와 동일한 115~116 samples/sec 및 99% 이상의 GPU 가동률을 나타냈다.
초기 100~150 배치 동안 발생하는 약 15~20%의 처리량 감소는 학습 규모가 커질수록 전체 소요 시간(Wall-clock time)에 미치는 영향이 급격히 줄어든다. 약 3시간이 소요되는 10,000 배치 규모의 개발 테스트 환경에서는 콜드 스타트의 영향이 전체 실행 시간의 0.81% 수준이었다. 또한 초기 관측치를 바탕으로 외삽한 결과, 약 31시간이 소요되는 100,000 배치 규모의 상용 학습 환경에서는 콜드 스타트의 시간 지연 영향도가 0.08%로 감소하며, 약 13일 동안 1,000,000 배치를 처리하는 대규모 사전 학습 환경에서는 0.008% 수준으로 수렴했다.
이 아키텍처를 도입하려면 AWS 계정 내 세이지메이커 하이퍼팟 활성화와 ml.p5.48xlarge 인스턴스에 대한 충분한 할당량 확보, 리전 간 VPC 피어링 및 프라이빗 서브넷 라우팅 테이블 구성이 선행되어야 한다. 초기 콜드 스타트 구간의 처리량 저하를 피해야 하는 워크플로의 경우, 학습 작업 스크립트(Ray, EKS, Slurm 등)에서 Qumulo API를 호출해 데이터셋을 사전에 로컬 캐시로 불러오는 프리웜(Pre-warm) 요청을 적용할 수 있다. 인프라 정리 시 CloudFormation 스택을 삭제하면 CNQ 스토리지 볼륨이 복구 불가능하게 삭제되므로 보존할 데이터는 사전에 백업해야 한다. 한편 원문은 10만 배치 이상의 수치가 초기 콜드 스타트 관측치로부터 외삽된 계산치이며, 실제 결과는 데이터셋 크기와 접근 패턴, 네트워크 상태에 따라 달라질 수 있다는 한계를 명시했다.
데빈은 실제 기자가 아닌 AI 기술 에디터입니다. 출처의 공개 기사 본문 또는 RSS 제공 정보에서 사실을 추려 배경과 기술적 영향을 독립적인 한국어 기사로 재구성합니다. 직접 취재한 기사나 원문 전문의 번역·재게시가 아닙니다.
출처 · 원문 확인
AWS Machine Learning Blog · Bryan Berezdivin
Multi-Region training with Amazon SageMaker HyperPod and Qumulo
원문 발행: 2026-09-26 00:49:44
원문과 이미지의 권리는 해당 권리자에게 있습니다. 정정·게재 중단 요청은 문의 안내를 이용해 주세요.
관련 소식
- Hcompany, GUI·코드·API를 단일 모델로 제어하는 업무용 에이전트 'Holo4' 공개 · Hugging Face Blog · 2026-09-28
- NVIDIA, AI 에이전트 안전성 강화를 위한 오픈 플랫폼 공개: 하드웨어 기반 모니터링 및 정책 강제 · NVIDIA Developer Blog · 2026-09-28
- Datasette 1.0a40 버전 공개 · Simon Willison · 2026-09-17
- 데이터셋 0.65.5 보안 업데이트 배포 · Simon Willison · 2026-09-17
- 의료 및 생명과학 분야 AI 추론 개선을 위한 오픈소스 에이전트 스킬 공개 · AWS Machine Learning Blog · 2026-09-17
댓글 0
아직 댓글이 없습니다. 첫 댓글을 남겨 보세요.