메타 Muse Glimmer 30B 공개, 24GB 그래픽카드로 돌립니다

메타가 연 Muse Glimmer 30B는 4비트로 누른 판이 24GB VRAM을 목표로 잡습니다. RTX 4090이나 3090 한 장이면 됩니다. 라이선스는 Apache 2.0입니다.
원본 BF16 가중치는 59.6GB, 24GB 카드 두 장 반에 해당합니다. 이걸 4비트로 눌러 한 장 안에 넣었고 정확도는 1.0% 내려갔습니다. 텍스트와 이미지를 함께 받습니다.
24GB 그래픽카드 한 장에서 돌아가게 만들었습니다
4비트 양자화판은 모델 카드에 두 종류로 올라와 있습니다. K-Quant-17GB는 24GB VRAM을 목표로 잡고 정확도가 1.0% 내려가고, K-Quant-Dynamic은 32GB를 목표로 0.2%만 내려갑니다. 저하 값은 널리 쓰는 벤치마크 15종의 정확도 평균입니다.
언어 모델은 52층 밀집형 인과 트랜스포머입니다. 여기에 18억 파라미터짜리 ViT-G/14 비전 인코더가 붙어 합계 296억이 됩니다. 이미지 한 장을 시각 토큰 4,096개까지 쪼개 받고, 컨텍스트는 131,072 토큰 이상이며 100개 넘는 언어로 학습했습니다. BF16 원본은 safetensors 두 조각을 합쳐 59.6GB이고 목표 하드웨어는 64GB VRAM이라, 개인 카드 한 장에는 올리지 못합니다.
가중치를 목표 VRAM보다 작게 누른 이유는 가중치가 카드를 다 먹으면 안 되기 때문입니다. 언어 모델 가중치를 줄여 놓으면 남는 자리에 KV 캐시, 이미지를 읽는 비전 인코더, 초안 모델이 함께 들어갑니다. 24GB나 32GB 한도 안에서 이 넷이 함께 돌도록 계산한 배치입니다.
세 판을 나란히 놓으면 내 카드가 어느 줄인지 보입니다.
| 판 | 목표 VRAM | 정확도 저하 |
|---|---|---|
| BF16 원본 | 64GB | 기준 |
| K-Quant-Dynamic | 32GB | 0.2% |
| K-Quant-17GB | 24GB | 1.0% |
이 표에서 볼 것은 마지막 줄입니다. 24GB면 RTX 4090이나 3090 한 장입니다. 1.0%는 벤치마크 15종 평균이라 특정 작업에서는 더 크게 벌어질 수 있고, 32GB를 쓸 수 있다면 저하가 5분의 1인 위쪽 판이 낫습니다.
받을 수 있는 것은 4비트 두 판만이 아닙니다. BF16 원본, 양자화 2종, DFlash 초안 헤드, 고정된 ViT-G/14 비전 인코더가 전부 Apache 2.0으로 올라와 있습니다. 모델 카드는 품질이 같은 체급에서 겨룰 만하다고 적었습니다.
카드에 직접 올려 돌려 보지는 못했습니다. 여기 적힌 숫자는 전부 모델 카드의 목표값입니다. 그럼 24GB 카드면 무조건 되나? 그건 아닙니다. 컨텍스트를 길게 쓸수록 KV 캐시가 자리를 더 먹으니, 131,072 토큰을 다 채우는 것과 몇천 토큰만 쓰는 것은 다른 이야기입니다.
속도는 딸려 나온 초안 모델이 냅니다
생성 속도는 DFlash 초안 모델에서 나옵니다. 토큰을 하나씩 뽑는 대신 16개짜리 블록을 한 번에 제안하고, 본 모델이 그 제안을 병렬로 검증해 맞으면 받고 틀리면 고칩니다. 출력 품질은 추측 디코딩을 끄고 돌렸을 때와 같습니다.
속도가 나는 이유는 검증이 생성보다 싸기 때문입니다. 큰 모델이 토큰 하나를 뽑을 때마다 가중치 전체를 메모리에서 읽어 와야 하는데, 개인 카드에서는 이 읽기가 병목입니다. 5층짜리 작은 초안 모델이 16개를 미리 던져 놓으면, 큰 모델은 한 번 읽어 오는 동안 16개를 한꺼번에 채점합니다. 틀린 자리부터 버리고 다시 제안받습니다.
초안 모델은 블록 16에 쿼리 헤드 32, KV 헤드 8을 쓰는 GQA 구성입니다. 본 모델 옆에 얹어도 자리를 크게 차지하지 않습니다.
측정은 K-Quant-17GB에 양자화한 DFlash를 얹어서 했습니다. 속도 표의 조건은 배치 1과 그리디 디코딩이고, 맥은 ExecuTorch, RTX는 llama.cpp를 썼습니다. 배치 1은 혼자 쓰는 조건이라 개인 카드 사정에 맞는 숫자입니다.
| 기기 | 추측 없이 | DFlash 켜고 | 배수 |
|---|---|---|---|
| RTX 5090 | 74.9 tok/s | 233.4 tok/s | 3.1배 |
| Apple M4 Max | 23.7 | 37.8 | 1.5배 |
| Apple M5 Max | 26.6 | 50.2 | 1.8배 |
이 표에서 볼 것은 3.1배가 아니라 기기마다 배수가 다르다는 점입니다. RTX 5090은 세 배 넘게 뛰는데 맥 두 대는 1.5배와 1.8배에 머뭅니다. 초안 모델을 굴릴 연산 여유가 기기마다 다르기 때문이고, 5090의 3.1배를 자기 카드에 그대로 옮겨 적으면 안 됩니다.
233 tok/s면 화면에 뜨는 글자를 눈으로 따라가기 어렵습니다. 맥의 37.8 tok/s는 그보다 훨씬 느려도 대화용으로 답답한 구간은 아니고, 긴 코드를 통째로 뱉게 할 때 차이가 드러납니다. 표의 값은 생성 중 속도이지 첫 토큰이 나오기까지 걸리는 시간이 아닙니다.
닷새 전 같은 회사가 이 자리에 값을 매겨 팔았습니다
닷새 전인 2026년 8월 5일, 메타는 Muse Code 베타와 함께 muse-spark-1.2를 API 상품으로 냈습니다. 표준 요금은 입력 100만 토큰당 1.25달러, 출력 4.25달러입니다. 무료로 열린 30B와 값이 매겨진 플래그십이 닷새 간격으로 나란히 놓였습니다.
눈여겨볼 것은 같은 모델의 두 번째 등급입니다. muse-spark-1.2-contributor는 입력 0.10달러, 출력 0.20달러로 열두 배 넘게 쌉니다. 대신 이 등급으로 보낸 프롬프트와 응답은 메타 제품 개선에 쓰이고, 표준 등급으로 보낸 것은 쓰지 않습니다. 값을 데이터로 치르는 구조입니다. 이 요금은 여러 보도가 같이 전한 값입니다.
그럼 무료 공개가 API 장사의 미끼인가? 그렇게까지 읽을 근거는 없습니다. 확인되는 것은 두 자리가 나뉘어 있다는 사실입니다. 개인 기기에서 도는 30B는 열고, 가장 센 모델은 값을 붙여 API로 팝니다.
쓰는 사람에게 걸리는 지점은 여기입니다. 사내 코드나 문서를 다루면서 값을 아끼려고 컨트리뷰터 등급을 고르면 그 내용이 학습에 들어갑니다. 30B를 자기 카드에 올려 돌리면 그 문제 자체가 없어집니다. 성능은 플래그십보다 아래이고, 그 차이를 감수할지가 실제 선택입니다.
메타가 마지막으로 연 개방형 모델은 라마 4입니다. Llama-4-Scout-17B-16E-Instruct 저장소가 HuggingFace에 올라온 날이 2025년 4월 2일이니 약 16개월 만입니다. 이번 가중치를 낸 곳은 메타 슈퍼인텔리전스 랩입니다.
저커버그는 Glimmer를 공개한 날 muse-spark-1.2의 가중치도 곧 열겠다고 밝혔습니다. 날짜도 라이선스도 아직 붙지 않았습니다.
30B를 연 것과 플래그십에 값을 매긴 것은 닷새 사이에 함께 일어났습니다. 2026년 8월 10일 기준으로 개인 카드에서 굴릴 수 있는 것은 4비트로 누른 30B이고, 가장 센 모델은 100만 토큰당 1.25달러짜리 API 뒤에 있습니다. 24GB 카드라면 K-Quant-17GB, 32GB 이상이면 저하 0.2%인 K-Quant-Dynamic이 받을 판입니다.
다음 확인 지점은 muse-spark-1.2 가중치가 실제로 열리는지입니다. 열리면 개인 기기용 30B만 내준 것이 아니게 되고, 안 열린 채 시간이 지나면 이번 공개의 성격은 30B 한 종으로 정해집니다. 메타 모델 목록에 muse-spark 저장소가 올라오는지 보면 됩니다.