Qwen3.8-27B 공개, Opus 4.6 Max 대비 성적과 실행 사양

Alibaba가 Qwen3.8-27B 가중치를 Apache 2.0 라이선스로 공개했습니다. NVFP4로 양자화한 공식 배포본이 24.6GiB라 24GB 카드에는 올라가지 않고, 돌리려면 Blackwell 세대 GPU 한 장이 필요합니다.
Claude Opus 4.6 Max와 견준 수치는 항목마다 결과가 다릅니다. 코드 수정과 사무 자동화 쪽은 앞서고, 터미널 조작과 저장소 단위 코드 생성은 Opus가 앞섭니다. 모두 Alibaba가 발표한 자사 수치입니다.
Qwen3.8-27B가 Apache 2.0으로 공개됐다
공개 시점은 8월이고, 27B 파라미터를 매 토큰마다 전부 쓰는 dense 구조입니다. 일부 전문가만 켜는 MoE가 아니라서 총 파라미터가 곧 활성 파라미터입니다. 입력도 텍스트에 그치지 않아 이미지와 영상을 함께 받습니다.
컨텍스트는 기본 262,144 토큰이고 최대 100만 토큰까지 늘릴 수 있습니다. 26만 토큰이면 한글 장편 소설 한 권을 통째로 넣고도 자리가 남는 분량입니다. 내부는 64개 레이어에 Gated DeltaNet과 Gated Attention을 섞은 구성이고, 가중치는 BF16 세이프텐서로도 배포됩니다.
같은 세대의 Max급인 Qwen3.8-2.4T-A95B도 오픈 웨이트로 함께 공개됐습니다. 이쪽은 2.4T 규모의 MoE라 성격이 다르고, GPU 한 장을 놓고 이야기할 수 있는 크기는 27B 쪽입니다.
사무 자동화는 앞서고 터미널 조작은 뒤진다
Alibaba가 발표한 자사 수치로 Claude Opus 4.6 Max와 비교하면 결과가 항목마다 다릅니다. 코드 수정과 사무 자동화 벤치마크에서는 Qwen3.8-27B가 앞서고, 터미널 조작과 저장소 단위 코드 생성에서는 Opus가 앞섭니다. 제3자가 재현한 값이 아닙니다.
표의 위 두 줄이 Qwen 쪽이 앞선 항목이고, 아래 두 줄이 Opus 쪽이 앞선 항목입니다.
| 항목 | Qwen3.8-27B | Claude Opus 4.6 Max |
|---|---|---|
| SWE-bench Pro | 61.7 | 53.4 |
| CoWorkBench (사무 자동화) | 70.7 | 68.2 |
| Terminal Bench 2.1 | 73.0 | 78.2 |
| NL2Repo-Bench (저장소 단위 코드) | 42.3 | 47.6 |
과학·다분야 추론인 GPQA Diamond와 HLE도 Opus 쪽이 앞섭니다. 코드 수정과 사무 자동화에서 앞서고 터미널 조작과 저장소 단위 코드 생성에서 뒤지는 그림이지, 전부 이겼다는 이야기가 아닙니다.
상대를 같은 크기대의 오픈 웨이트로 바꾸면 간격이 커집니다. Muse Glimmer 30B를 다룬 글의 그 모델과 견주면 Terminal Bench 2.1이 73.0 대 51.7로 벌어집니다. GPQA Diamond(89.2 대 83.5)와 IFBench(79.5 대 77.0)에서도 Qwen 쪽이 앞섭니다.
양자화본 24.6GiB, 24GB 카드에는 안 올라간다
공식 기준 NVFP4 양자화본이 24.6GiB입니다. 24GB 카드에는 올라가지 않고, vLLM 배포 레시피는 Blackwell 세대 GPU 한 장을 전제로 잡습니다. FP8은 텐서 병렬 4장 구성이 예시로 나와 있습니다.
내려받아 올릴 때 쓰는 값은 세 가지입니다.
- 지원 런타임: vLLM, SGLang, TokenSpeed, Hugging Face Transformers
- 모델 ID: Qwen/Qwen3.8-27B
- FP8 버전: Qwen/Qwen3.8-27B-FP8
커뮤니티가 만드는 GGUF나 MLX 변환본은 가중치 공개 뒤에 뒤따라 나오는 것이 보통입니다. 이번 모델은 변환본 용량이 아직 확인되지 않아서, 지금 기준으로 삼을 수 있는 값은 공식 NVFP4 24.6GiB 하나입니다.
가중치는 나왔고 재현 결과는 아직 없다
가중치와 벤치마크 수치가 공개된 상태이고, 제3자가 같은 조건에서 다시 돌린 결과는 아직 나오지 않았습니다. 지금 확정된 것은 라이선스와 실행 요구 사양입니다. Apache 2.0, NVFP4 24.6GiB, Blackwell GPU 한 장.
사무나 에이전트 성격의 작업을 로컬에서 돌릴 생각이면 후보에 올릴 만합니다. 터미널 조작과 저장소 단위 코드 생성이 주력이라면 Terminal Bench 2.1(73.0 대 78.2)과 NL2Repo-Bench(42.3 대 47.6)에서는 아직 Opus 4.6 Max 쪽이 앞섭니다.