RTX Spark 128GB 통합 메모리, 1200억 파라미터 모델이 도는 근거

8/09/2026 ·impact

NVIDIA RTX Spark 는 최대 128GB 통합 메모리를 20코어 Grace CPU 와 Blackwell RTX GPU 가 함께 씁니다. 1,200억 파라미터 모델이 노트북 한 대에 들어가는 근거는 연산 속도가 아니라 이 용량입니다.

1 페타플롭이라는 숫자에는 FP4 정밀도라는 조건이 붙습니다. 출시는 2026년 가을이고, 가격과 메모리 대역폭은 2026년 8월 9일 기준 공개되지 않았습니다.

노트북 한 대에서 1,200억 파라미터 모델이 돕니다

NVIDIA 가 내건 핵심은 1,200억 파라미터 모델을 100만 토큰 컨텍스트로 노트북에서 돌린다는 대목입니다. 같은 크기의 모델이 지금까지 노트북에 못 올라간 이유는 연산이 느려서가 아닙니다. GPU 전용 메모리가 8~16GB 에서 끝났기 때문입니다.

파라미터 하나를 4비트로 눌러 담아도 1,200억 개면 60GB 안팎을 차지합니다. 여기에 지금까지 읽은 토큰의 중간 상태를 들고 있는 KV 캐시가 더 붙습니다. 100만 토큰 컨텍스트를 유지한다면 그 몫도 작지 않습니다. 전용 메모리 16GB 짜리 GPU 로는 가중치의 절반도 못 올린 채 끝납니다.

NVIDIA 가 같이 든 작업 목록은 90GB 넘는 3D 장면 렌더링, 12K 4:2:2 영상 편집, 1440p 게임 100fps 이상입니다. 앞의 둘은 큰 데이터를 통째로

메모리에 올려 두어야 하는 일입니다. 셋 중 연산 쪽 지표는 게임 프레임 하나뿐입니다. 목록을 읽는 방향이 여기서 잡힙니다.

용량이 곧 속도는 아닙니다. 모델을 메모리에 올릴 수 있느냐와 토큰을 초당 몇 개 뽑느냐는 다른 질문입니다. 뒤쪽 답을 정하는 값은 대역폭인데, 그 숫자는 아직 나오지 않았습니다.

비결은 CPU와 GPU가 같이 쓰는 128GB 메모리입니다

통합 메모리는 CPU 와 GPU 가 같은 주소 공간을 보는 구조입니다. 시스템 메모리에 있는 데이터를 GPU 메모리로 복사해 넘기는 단계가 사라집니다. RTX Spark 에서 두 칩을 잇는 것은 NVLink-C2C 라는 칩 간 연결입니다.

일반 노트북에서는 GPU 가 자기 메모리만 봅니다. 시스템 램이 32GB 여도 GPU 에 8GB 가 붙어 있으면 모델은 8GB 안에 들어가야 합니다. 넘치면 램으로 흘려 쓰거나 아예 못 올립니다. 128GB 를 한 덩어리로 쓰는 구조에서는 그 벽이 없습니다.

구성은 20코어 Grace CPU 와 6,144 CUDA 코어짜리 Blackwell RTX GPU 입니다. 둘은 한 패키지 안에서 NVLink-C2C 로 붙어 128GB 를 나눠 씁니다. 복사가 없으니 큰 데이터를 다루는 작업에서 단계 하나가 통째로 빠집니다.

통합 메모리가 유리한 쪽은 데이터가 큰 작업입니다. 90GB 넘는 3D 장면이나 12K 영상 편집이 목록에 오른 이유도 같습니다. 반대로 데이터가 작고 연산만 무거운 작업이라면 얻는 것이 별로 없습니다. 128GB 가 모든 작업을 빠르게 만들어 주지는 않습니다.

1 페타플롭에는 FP4라는 조건이 붙습니다

NVIDIA 발표의 1 페타플롭은 FP4 정밀도에서 나온 최대치입니다. FP4 는 4비트 부동소수점이고, 근거는 5세대 텐서 코어가 이 정밀도를 지원한다는 것입니다. 더 높은 정밀도로 돌리면 같은 숫자가 유지되지 않습니다.

희소성까지 얹은 이론값이라는 해석도 있습니다. NVIDIA 1차 자료에 희소성이 적혀 있지는 않고, the-decoder 의 분석이 FP4 에 희소성을 적용한 최선의 경우로 읽었습니다. 어느 쪽이든 기대할 실제 처리량은 표기보다 낮게 잡는 편이 맞습니다.

희소성은 가중치 상당수가 0 이라고 보고 그 곱셈을 건너뛰는 기법입니다. 0 이 충분히 많아야 이득이 납니다. 돌리려는 모델이 그 조건을 못 맞추면 처리량은 표기값에 닿지 못합니다.

숫자를 비교할 때 실제로 걸리는 대목은 단위입니다. NPU 사양에 흔히 붙는 INT8 TOPS 와 FP4 페타플롭은 정밀도도 단위도 다릅니다. 한 표에 나란히 올려 둔 자료를 만나면 각 값이 어느 정밀도에서 나왔는지부터 봅니다. 그 줄이 없으면 비교 자체가 성립하지 않습니다.

다만 노트북에서 1,200억 파라미터가 도느냐를 정하는 값은 연산 최대치가 아닙니다. 128GB 라는 용량은 정밀도 조건을 타지 않습니다. 연산 쪽 숫자가 조건에 따라 흔들려도, 모델이 메모리에 들어가느냐 마느냐는 그대로입니다.

이 성능으로 뭘 하나 — 로컬에서 도는 AI 에이전트

NVIDIA 와 마이크로소프트가 겨냥하는 용처는 기기 안에서 상시로 도는 AI 에이전트입니다. 마이크로소프트는 에이전트를 OS 수준에서 격리해 실행하기 위한 보안 프리미티브를 함께 냈습니다. 구성은 신원, 격리, 정책, 종단 간 보안 네 가지입니다.

NVIDIA 의 OpenShell 런타임은 윈도우의 새 격리 프리미티브 위에 얹는 계층입니다. 맡는 몫은 정책입니다. 에이전트가 무엇을 할 수 있고 무엇은 할 수 없는지 사용자가 직접 정의하게 합니다.

권한 경계가 문제가 되는 이유는 에이전트의 동작 방식에 있습니다. 파일을 읽고 명령을 실행하는 프로그램이 상시로 돌면, 그 프로그램이 어디까지 손을 뻗을 수 있는지가 곧바로 쟁점이 됩니다. 클라우드 API 뒤에 있을 때와 다릅니다. 기기 안 자원에 직접 닿기 때문입니다.

에이전트 하네스 자체는 이미 노트북에서 돕니다. 가재코드 같은 CLI 에이전트가 그런 형태이고, 모델 호출은 별도 제공자 설정을 따릅니다. RTX Spark 가 겨냥하는 것은 그 모델까지 같은 기기 안으로 들어오는 경우입니다. 지금은 API 로 나가는 부분이 로컬 가중치로 바뀌는 그림입니다.

2026년 가을 출시, 가격은 아직 없습니다

출시는 2026년 가을입니다. 첫 물량은 ASUS, Dell, HP, Lenovo, Microsoft Surface, MSI 여섯 곳에서 나오고 Acer 와 GIGABYTE 가 뒤를 잇습니다. 노트북과 소형 데스크톱 양쪽입니다. 가격은 2026년 8월 9일 기준 공개되지 않았고, 돌아다니는 금액은 NVIDIA 뉴스룸에서 나온 값이 아니라 추정치입니다.

메모리 대역폭도 숫자가 없습니다. 용량과 대역폭은 다른 값입니다. 토큰을 하나 뽑을 때마다 가중치를 훑는 구조라, 대역폭이 낮으면 128GB 에 모델을 올려 두고도 생성 속도가 떨어집니다. 로컬 추론을 목적으로 사는 사람에게는 이 값이 용량만큼 중요합니다.

전력과 배터리 시간도 나오지 않았고 실측 벤치마크는 아직 없습니다. Grace CPU 가 Arm 기반이라 이 기기는 Windows on Arm 이고, x86 으로 빌드된 프로그램은 변환 계층을 거치거나 Arm64 빌드가 따로 나와야 제 속도를 냅니다.

지금 상태에서 내릴 수 있는 판단은 하나입니다. 1,200억 파라미터급 모델을 기기 안에 두어야 하는 일이 실제로 있다면 후보입니다. 그렇지 않다면 128GB 는 값을 치를 이유가 되지 못합니다. 제조사 사양표가 나오면 용량 옆에 대역폭 숫자가 붙었는지부터 확인하세요.

NVIDIA 발표 원문 보기