01 / VERA RUBIN / GTC 2026
Vera Rubin 랙·POD 설계 — AI 인프라의 설계 단위가 서버에서 랙·POD로 커지고 있습니다.
7 CHIPS · 5개 전용 랙이 함께 동작하는 Vera Rubin 플랫폼NVIDIA는 GTC 2026에서 Vera Rubin을 7개 칩과 5개 전용 랙이 하나의 AI 슈퍼컴퓨터로 작동하는 플랫폼으로 발표했습니다. Vera Rubin NVL72 랙은 72개 Rubin GPU와 36개 Vera CPU를 NVLink 6로 연결하며, ConnectX-9, BlueField-4와 Spectrum-6가 함께 구성됩니다.
GPU 수량과 단품 사양만 비교하지 않고 랙 전력, 액체 냉각, NVLink 도메인, 스케일아웃 패브릭, 스토리지와 운영 소프트웨어를 함께 산정해야 합니다.
GPU 용량과 랙 전력·냉각, NVLink, 스케일아웃 패브릭, 스토리지와 운영 항목을 하나의 도입 조건으로 정리합니다.
- 랙·POD 단위의 전력과 냉각 조건은 확인됐는가
- NVLink와 스케일아웃 패브릭의 경계는 어디인가
- 스토리지와 운영 소프트웨어를 어떤 순서로 검증할 것인가
Vera Rubin 랙·POD 인프라 조건 검토GPU COMPUTE 수행 경로02 / PHYSICAL CAPACITY
전력·냉각과 물리 수용 조건 — GPU 클러스터의 첫 제약은 전산실 바깥에서 시작됩니다.
17% · 2025년 전 세계 데이터센터 전력 수요 증가율IEA는 2025년 데이터센터 전력 수요가 17% 증가했으며 AI 중심 데이터센터의 수요는 그보다 더 빠르게 늘었다고 분석했습니다. 전력망 연결과 공급 병목은 GPU 도입 일정과 배치 가능한 밀도를 결정하는 선행 조건입니다.
GPU 수량만 산정해서는 실행 가능한 구성이 되지 않습니다. 전력 인입, 랙 밀도, 냉각 방식, 열 여유와 네트워크 배선을 같은 물리 설계 경계에서 확인해야 합니다.
전력·랙·냉각·배선 조건을 GPU 서버와 네트워크 패브릭 구성의 선행 입력과 검수 항목으로 정리합니다.
- 가용 전력과 랙당 허용 밀도는 얼마인가
- 냉각 방식과 확장 여유는 확인됐는가
- 전력·열·네트워크 장애 경계는 어디인가
GPU 전력·냉각·랙 수용 조건 검토GPU COMPUTE 수행 경로03 / CONTEXT MEMORY STORAGE
BlueField-4 STX 컨텍스트 메모리 — 장기 컨텍스트는 용량과 별개의 고속 저장 계층을 요구합니다.
STX · GTC 2026에서 공개된 AI 스토리지 참조 아키텍처NVIDIA는 GTC 2026에서 BlueField-4 STX를 장기 컨텍스트 추론을 위한 모듈형 스토리지 참조 아키텍처로 발표했습니다. STX는 Vera CPU, ConnectX-9, Spectrum-X, DOCA를 결합해 컨텍스트 메모리와 기업 데이터를 GPU 가까이 공급하는 구조를 제시합니다.
원천 데이터, 체크포인트와 컨텍스트 메모리의 접근 패턴을 구분하고 GPU까지 이어지는 대역폭, 지연, 보존과 복구 경로를 별도로 설계해야 합니다.
원천 데이터·체크포인트·컨텍스트 메모리의 접근 패턴과 GPU 공급·보존·복구 경로를 분리해 정리합니다.
- 원천 데이터와 컨텍스트 메모리를 어떻게 구분할 것인가
- GPU까지의 대역폭과 지연 기준은 무엇인가
- 컨텍스트 계층의 보존·격리·복구 책임은 어디에 있는가
컨텍스트 메모리·AI 스토리지 경로 검토AI DATA 수행 경로04 / AI NETWORK FABRIC
AI 패브릭과 혼잡 제어 — 랙 간 East-West 트래픽이 패브릭 설계의 핵심 경계가 됩니다.
END-TO-END · NIC·스위치·광·케이블을 잇는 공개 규격 범위NVIDIA는 GTC 2026에서 Spectrum-6와 co-packaged optics 기반 Spectrum-X Ethernet Photonics를 Vera Rubin의 스케일아웃 패브릭으로 발표했습니다. Ultra Ethernet Consortium의 2026년 공개 규격 v1.0.3도 AI·HPC용 Ethernet의 NIC, 스위치, 광, 케이블, RDMA와 혼잡 제어를 하나의 통신 스택으로 다룹니다.
링크 속도와 포트 수뿐 아니라 통신 패턴, 토폴로지, 수용비, 혼잡 제어, 장애 경계와 관측 항목도 설계 조건에 포함해야 합니다.
GPU 서버의 통신 패턴을 네트워크 토폴로지, 스토리지 경로와 운영 관측 기준에 연결해 초기 설계 입력으로 정리합니다.
- 노드 간 통신과 스토리지 트래픽을 어떻게 구분할 것인가
- 토폴로지·수용비·장애 경계 기준은 무엇인가
- 혼잡·손실·꼬리 지연을 어떤 지표로 관측할 것인가
AI 패브릭 설계 입력 검토NETWORK FABRIC 수행 경로05 / GPU OPERATING LAYER
GPU 자원 운영과 배포 — AI 인프라는 구축보다 반복 가능한 운영에서 완성됩니다.
66% · 생성형 AI 호스팅 조직 중 Kubernetes로 추론을 운영하는 비율CNCF의 2026 Annual Cloud Native Survey는 생성형 AI 모델을 호스팅하는 조직의 66%가 일부 또는 전체 추론 워크로드를 Kubernetes로 관리한다고 보고했습니다. 컨테이너 사용자의 82%는 Kubernetes를 프로덕션에서 사용합니다.
GPU 스케줄링, 배포, 구성 변경, 관측과 복구를 공통 운영 체계에서 관리해야 자원 공유와 반복 배포를 통제할 수 있습니다.
GPU 스케줄링·배포·변경·관측·복구를 MLOps 운영 정책과 GPU 서버 자원 관리 절차로 연결합니다.
- GPU 스케줄링과 할당 정책은 누가 관리하는가
- 모델·구성·데이터 변경을 어떻게 추적하는가
- 관측과 장애 복구의 책임 경계는 어디인가
GPU 스케줄링·배포·관측 운영 검토MLOPS & OPERATIONS 수행 경로06 / AGENT STANDARDS
에이전트 신원·권한·상호운용성 — 에이전트 운영에는 신원·권한·프로토콜 기준이 필요합니다.
3 PILLARS · 표준 · 오픈 프로토콜 · 보안·신원 연구NIST는 2026년 AI Agent Standards Initiative를 시작하며 산업 주도 표준, 커뮤니티 기반 오픈 프로토콜, 에이전트 보안·신원 연구를 세 축으로 제시했습니다. 이는 기존 위험 관리 체계를 대체하는 것이 아니라 자율 에이전트의 상호운용성과 신뢰를 위한 추가 기술 과제입니다.
에이전트별 신원, 도구와 데이터 권한, 외부 통신, 승인·중단·감사 기록을 모델 밖의 실행 경로에 포함해야 합니다.
에이전트 신원, 도구·데이터 권한, 외부 통신, 승인·중단·감사 기록을 MLOps, 네트워크와 AI 스토리지 운영 경로에 연결합니다.
- 에이전트와 사용자 신원을 어떻게 연결할 것인가
- 도구·데이터·외부 통신 권한을 어디에서 제한할 것인가
- 승인·중단·감사 기록을 어떤 형식으로 남길 것인가
에이전트 신원·권한·프로토콜 기준 검토MLOPS & OPERATIONS 수행 경로07 / AGENTIC RUNTIME
에이전트형 AI 실행 경로 — 에이전트는 한 번의 응답이 아니라 상태와 도구를 가진 실행 흐름입니다.
1 IN 3 · 구조화된 에이전트 벤치마크에서 남는 실패 비율(약)Stanford HAI의 2026 AI Index는 AI 에이전트가 2025년에 질문 응답에서 작업 수행으로 진전했지만, 구조화된 벤치마크에서는 여전히 약 3번 중 1번 실패한다고 정리합니다. NIST의 2026 에이전트 보안 의견 분석은 기존 사이버보안 원칙이 계속 중요하지만 에이전트의 새로운 위협에 맞춘 조정이 필요하다는 공통 의견을 보고했습니다.
여러 단계와 도구 호출을 거치는 요청은 GPU 점유 시간, 상태 저장, 데이터 접근, 외부 통신, 권한과 실행 기록을 함께 설계해야 합니다. 성공 응답뿐 아니라 중단, 재시도와 사람 승인 경로가 운영 기준에 포함돼야 합니다.
실행 상태, 도구·데이터 권한, 외부 통신, 재시도와 사람 승인을 GPU·스토리지·네트워크·MLOps 전체 경계에서 검토합니다.
- 한 요청은 몇 단계로 얼마나 오래 실행되는가
- 도구·데이터 접근과 외부 통신 권한은 어디에서 제어하는가
- 입력·행동·출력·재시도와 사람 승인을 어떻게 추적하는가
에이전트 실행·권한·상태 추적 기준 검토MLOPS & OPERATIONS 수행 경로