Qwen3.8-27B — 2026년 8월 14일, 데스크톱에서 구동되는 멀티모달 AI 모델
분류: AI/LLM
2026년 8월 14일 밤12시 신상 Qwen3.8-27B 모델이 출시 되었다.
1. 개요
Qwen3.8-27B는 Alibaba(알리바바)의 Qwen 팀이 2026년 8월 14일에 공개한 27B(270억) 파라미터의 오픈웨이트 다중모달(multimodal) 모델이다. Qwen3.5 아키텍처 기반으로 Qwen 오픈모델 계열에서 가장 강력한 세대인 Qwen3.8의 컴팩트 모델이다.
핵심 특징은 다음과 같다:
- Dense 모델: MoE가 아닌 순수 Dense 구조 (27B 파라미터, 64 레이어)
- 멀티모달: 이미지 + 영상(최대 시간 단위) 이해 지원 — STEM 도표, 문서, 시간급 영상
- 262K 네이티브 컨텍스트: YaRN 스케일링 시 최대 1,000,000 토큰까지 확장 가능
- Apache 2.0 라이선스: 상업적 사용 포함 완전 오픈
- 하이브리드 어텐션: Gated DeltaNet(선형 어텐션) + Gated Attention(전통적 트랜스포머 어텐션) 혼합
- MTP(Multi-Token Prediction): 체크포인트 내장, 추론 속도 향상
- Thinking Mode 기본 활성화: reasoning_effort로 추론 깊이 조절 (xhigh / medium / low)
2. 아키텍처 상세
Qwen3.8-27B는 Qwen3.5의 하이브리드 어텐션 백본을 계승한다. 64개 레이어는 16 x (3x(Gated DeltaNet → FFN) → 1x(Gated Attention → FFN)) 구성으로, 매 4개 레이어 중 3개가 효율적인 선형 어텐션(DeltaNet), 1장이 고품질 Gated Attention을 담당한다.
| 항목 | 값 |
|---|---|
| 파라미터 수 | 27B (HF에서 28B로 표기) |
| Hidden Dimension | 5,120 |
| 레이어 수 | 64 |
| Token Embedding / LM Output | 248,320 (Padded) |
| Gated DeltaNet | V: 48 heads, QK: 16 heads, head dim 128 |
| Gated Attention | Q: 24 heads, KV: 4 heads, head dim 256, RoPE dim 64 |
| FFN Intermediate Dim | 17,408 |
| MTP | Multi-step training 완료, 체크포인트 내장 |
| 네이티브 컨텍스트 | 262,144 tokens |
| 최대 확장 컨텍스트 (YaRN) | 1,000,000 tokens |
| 텐서 형식 (공개) | BF16 |
| 라이선스 | Apache 2.0 |
이 하이브리드 설계의 핵심 장점은 KV 캐치 효율이다. DeltaNet 레이어는 컨텍스트가 길어질수록 KV 캐치가 거의 증가하지 않아, 262K~1M 컨텍스트에서도 VRAM 사용량이 전통적 트랜스포머보다 훨씬 적다.
3. 벤치마크 성능
텍스트 성능 (Coding / Agent / General)
| 벤치마크 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B |
|---|---|---|---|---|
| Coding | ||||
| Terminal Bench 2.1 (Agentic terminal) | 73.0 | 63.4 | 64.0 | 51.7 |
| SWE-bench Pro (Agentic coding) | 61.7 | 53.5 | 57.6 | 51.2 |
| NL2Repo-Bench (Repo-level code gen) | 42.3 | 36.2 | 41.1 | -- |
| DeepSWE 1.1 (Agentic coding) | 42.2 | 13.3 | 14.2 | -- |
| QwenSWEBench (Software engineering) | 79.0 | 49.3 | 59.2 | -- |
| Agent | ||||
| CoWorkBench (Long-horizon office work) | 70.7 | 61.0 | 65.1 | -- |
| JobBench (Professional job tasks) | 33.4 | 21.8 | 27.6 | -- |
| Agents' Last Exam (Pass@1 / Score) | 20.4 / 42.9 | 10.6 / 27.3 | 13.2 / 33.6 | -- |
| General | ||||
| IFBench (Instruction following) | 79.5 | 69.1 | 79.1 | 77.0 |
| GPQA Diamond (Scientific reasoning) | 89.2 | 87.8 | 90.3 | 83.5 |
| HLE (Multidisciplinary reasoning) | 30.8 | 24.0 | 34.7 | 22.0 |
| LiveCodeBench v6 (Competitive coding) | 90.3 | 83.9 | 89.6 | -- |
Qwen3.8-27B는 같은 27B 크기의 Qwen3.6-27B 대비 거의 모든 벤치마크에서 큰 폭의 향상을 기록했다. 특히 SWE-bench Pro(61.7 vs 53.5), QwenSWEBench(79.0 vs 49.3), DeepSWE 1.1(42.2 vs 13.3)에서 두드러진다.
Vision-Language (VL) 성능
| 벤치마크 | Qwen3.8-27B | Qwen3.6-27B |
|---|---|---|
| Agentic Multimodal | ||
| OSWorld-Verified (Computer use) | 84.3 | 63.9 |
| WebArena-Verified (Browser use) | 64.8 | 48.8 |
| AndroidWorld (Mobile use) | 81.9 | 70.3 |
| RecreationBench (Application recreation) | 47.1 | 29.8 |
| SWE-MM (Multimodal SW engineering) | 38.6 | 25.7 |
| General Multimodal | ||
| MathVision (With CI) | 94.6 | 85.1 |
| BabyVision (With CI) | 85.6 | 70.4 |
| CharXiv RQ (With CI) | 90.2 | 85.9 |
| OmniDocBench 1.5 (Document intelligence) | 91.1 | 89.4 |
| RealWorldQA (Real-world perception) | 85.9 | 84.1 |
OSWorld-Verified(84.3)와 WebArena-Verified(64.8) 점수는 27B 크기의 오픈웨이트 모델로선 전례 없는 수준이다. 특히 전작 대비 OSWorld가 63.9에서 84.3으로 약 20점 점프했다.
4. 로컬 실행 — VRAM/RAM 요구사항
Ollama 패키지 크기는 약 17~18GB(BF16 기준 24.6 GiB, FP8/NVFP4 양자화 시 더 작음). 즉:
- 17GB RAM/VRAM: GGUF Q4~Q5 양자화로 실행 가능 (Unsloth, LM Studio, Ollama)
- 24GB VRAM: BF16 풀 정밀도 또는 FP8 양자화로 실행 가능 (RTX 4090, RTX PRO 6000)
- AMD Radeon GPU: Day 0 지원 — LM Studio + ROCm
- DGX Spark / RTX 5090 / H200: SGLang 공식 지원
- CPU only (32GB+ RAM): llama.cpp GGUF로 실행 가능, 속도는 느림
하드웨어별 VRAM 가이드 (추천):
| 양자화 | 파일 크기 (약) | VRAM/RAM 요구 |
|---|---|---|
| BF16 (풀 정밀도) | ~54 GB | 2x24GB GPU 또는 1x48GB+ GPU |
| FP8 / NVFP4 W4A4 | ~27 GB | 1x24GB GPU (RTX 3090/4090) |
| GGUF Q6_K | ~24 GB | 1x24GB GPU + 32GB RAM |
| GGUF Q4_K_M (Ollama) | ~17 GB | 32GB RAM 또는 16GB+ VRAM GPU |
5. 서비스/배포 방법
공식 지원되는 인퍼런스 프레임워크:
- SGLang: BF16/FP8/NVFP4, MTP 내장 — H200, RTX PRO 6000, RTX 5090, DGX Spark
- vLLM: YaRN 1M 컨텍스트 확장 지원, video frame sampling 가능
- Ollama / LM Studio: GGUF 양자화 기반 로컬 실행 (17GB RAM/VRAM)
- TokenSpeed: Alibaba 자체 인퍼런스 엔진
- Hugging Face Transformers: Python 코드에서 직접 로딩 가능
- Qwen Cloud API: 호스티드 서비스 (1M 컨텍스트 기본, 공식 도구 내장) — 공개 예정
추천 샘플링 파라미터
| 모드 | temperature | top_p | top_k | presence_penalty |
|---|---|---|---|---|
| Thinking Mode (기본) | 1.0 | 0.95 | 20 | 0.0 |
| Instruct / Non-thinking | 0.7 | 0.80 | 20 | 1.5 |
추가로 reasoning_effort 파라미터를 통해 추론 깊이를 조절할 수 있다:
- xhigh (기본): 복잡한 태스크, 철저한 분석 필요 시
- medium: 정확도-속도 균형
- low: 속도/비용 최적화 (단, agent 태스크에서 오히려 실패율 증가 가능)
6. 사용시 유의사항
- 1M 컨텍스트 사용 시: YaRN 설정이 필수. rope_parameters를 변경하거나 vLLM/SGLang CLI 인자로 전달. 단, 짧은 텍스트에서 성능 저하가 발생할 수 있으므로 factor 값을 상황에 맞게 조절 (524K 컨텍스트면 factor=2.0 권장)
- 타임 단위 영상: video_preprocessor_config.json의 longest_edge를 469,762,048(약 224K video tokens)로 설정해야 고프레임 샘플링이 동작
- preserve_thinking: 기본 활성화. 대화 전체의 사고 블록을 유지하여 agent 시나리오에서 의사결정 일관성 + KV 캐치 효율 향상. 필요시 False로 비활성화 가능
- Agentic 태스크에서 reasoning_effort=low: 단일 턴은 빠지만, 불충분한 분석 → 실패 → 재시도 → 총 지연/토큰 소모 증가할 수 있음. 공식 문서에서 경고
- Hacker Note: VRAM 효율이 Gemma 4나 Muse Glimmer보다 낮은 편이라는 커뮤니티 피드백 있음 (32K 컨텍스트에 2.5GB VRAM)
7. Qwen3.8 시리즈 전체 구성
| 모델 | 타입 | 파라미터 | 특징 |
|---|---|---|---|
| Qwen3.8-Max (API) | 2.4T MoE | 2,400B (MoE) | Coding + Cowork 최상위, 2026.8.3 출시 |
| Qwen3.8-27B (오픈웨이트) | Dense + Vision | 27B (28B 표기) | 본 글 주인공. 17GB로 로컬 실행 |
Qwen3.8-Max API는 2026년 8월 3일에 먼저 출시되었고, 11일 뒤인 8월 14일에 27B 오픈웨이트가 공개되었다. Max의 오픈웨이트는 "이번 주"라는 공식 발표가 있었으나 27B 공개 시점 기준 아직 미공개 상태이다 (커뮤니티에서 지연 우려 보도 있음).
8. 커뮤니티 반응
- r/LocalLLaMA: "2026년 가장 중요한 로컬 AI 릴리스 중 하나" — 17GB로 27B 멀티모달이 돌아간다는 점이 화제
- Hacker News: 추론 과정이 Qwen3.8은 명시적(explicit), Gemma 4는 암시적(implicit)이라는 비교. VRAM 효율이 다른 모델보다 낮은 점 지적
- AMD 공식 블로그: Ryzen AI Max + Radeon GPU Day 0 지원 — LM Studio로 즉시 실행 가능
- Unsloth: NVFP4, GGUF 양자화 버전 공식 공개. 17GB RAM/VRAM 환경 실행 안내
- NxCode (한국): "18GB가 가장 실용적인 숫자" — Ollama 패키지 크기를 강조하며 노트북/데스크톱에서도 최신 멀티모달 모델을 불러올 수 있다고 평가
9. 요약 — Qwen3.8-27B를 선택해야 할 경우
- 로컬/엣지에서 27B급 다중모달 agent를 돌리고 싶을 때 (17~24GB VRAM/RAM)
- Coding + Computer use(OSWorld 84.3) + Browser use를 한 모델로 처리하고 싶을 때
- Apache 2.0 라이선스로 상업적 내장 필요
- 262K~1M 장문 컨텍스트를 VRAM 부담 없이 처리할 때 (하이브리드 어텐션의 KV 캐치 효율)
- AMD GPU + LM Studio 생태계와 완벽하게 호환 (Day 0)
참고 출처
- Hugging Face 공식 모델 카드
- AMD Day 0 지원 블로그
- Yotta Labs — 스펙 & 하드웨어 가이드
- Unsloth 로컬 실행 문서
- NxCode — 한국 커뮤니티 분석
- vLLM 공식 레시피
- SGLang 공식 쿡북
- LM Studio 모델 페이지
- Hacker News 토론
- r/LocalLLaMA
- QJC — 오해 4개 정리
이 포스트는 2026년 8월 15일 기준 Qwen3.8-27B 공식 문서와 커뮤니티 정보를 기반으로 작성되었습니다.
댓글 없음:
댓글 쓰기