2026/08/27

Mac Studio M3 Ultra vs M5 Ultra — 어떤 기기를 사야 하는가

분류: 로컬AI



2025년 3월, Apple은 Mac Studio에 M3 Ultra 칩을 탑재해 출시했습니다. 그리고 2026년, M5 Ultra가 등장하며 로컬 AI 커뮤니티의 관심이 다시 한 번 모이고 있어요. 두 칩은 모두 "데스크탑에서 프론티어급 LLM을 로컬로 실행한다"는 목표를 공유하지만, 아키텍처와 성능은 크게 다릅니다.

스펙과 벤치마크를 기반으로 어떤 기기가 당신의 사용 사례에 맞는지 기술적으로 분석합니다.


스펙 비교 — 핵심은 메모리 대제폭

항목Mac Studio M3 UltraMac Studio M5 Ultra
CPU32코어 (24 Performance + 8 Efficiency)약 36코어 (12 Super + 24 Performance)
GPU80코어80코어 + Neural Accelerators
유니파이드 메모리최대 512GB최대 768GB (테스트)
메모리 대제폭819 GB/s약 1.2 TB/s (예상)
Neural Engine32코어GPU 코어당 Neural Accelerator
공정3nm (N3E)3nm 3세대
ThunderboltThunderbolt 5Thunderbolt 5
Geekbench 6 멀티약 28,169약 42,864 (예상)

CPU 성능 — 세대차의 실체

M3 Ultra는 이미 32코어 CPU와 80코어 GPU로 데스크톱 최상위권을 달렸습니다. Geekbench 6 멀티스코어 약 28,169점은 M2 Ultra(21,241) 대비 약 33% 향상된 수치예요.

M5 Ultra는 아키텍처를 재설계했어요. 기존 "Performance 코어"가 "Super 코어"로 개명되고, 그 아래 새로운 "Performance 코어" 계층이 추가된 3단계 구조입니다. 이로 인해 CPU 코어 수가 약 36코어로 증가했고, 멀티코어 성능은 약 42,864로 M3 Ultra 대비 약 52% 향상될 것으로 예상됩니다.

GPU와 AI 연산 — Neural Accelerator의 등장

두 칩 모두 80코어 GPU를 제공하지만, M5 Ultra의 가장 큰 변화는 GPU 코어당 독립된 Neural Accelerator가 추가되었다는 점이에요. M5 이전 세대는 별도의 Neural Accelerator가 없어 FP16 연산이 GPU ALU에만 의존했지만, M5는 독립된 가속기로 인해 FP16 총산량이 크게 향상됩니다.

로컬 AI/LLM 추론에 가장 중요한 것은 메모리 대제폭입니다. 동일 메모리 용량이라도 대제폭이 높을수록 초당 생성 토큰(tok/s)이 증가하기 때문이에요. M3 Ultra의 819 GB/s도 충분하지만, M5 Ultra가 약 1.2 TB/s에 접근한다면 동일 405B 모델 추론 속도가 30% 이상 향상될 가능성이 있습니다.

메모리 용량 — M5 Ultra의 한계

M3 Ultra는 최대 512GB까지 확장 가능한 것이 가장 큰 강점이에요. 512GB면 405B 모델(Q4 양자화)을 여유 있게 로드할 수 있어요. 반면 M5 Ultra는 현재 768GB까지 지원될 예정이지만, 실제 가격과 Supply 상황이 확인되지 않은 상태예요.

결론 — 누구에게 어떤 기기가 맞을까

사용 목적추천 기기
초대형 모델(405B+) 로컬 추론M3 Ultra (512GB)
최대 CPU/GPU 성능, 차세대 AIM5 Ultra (예상)
가성비, 현재 즉시 구매M3 Ultra

M5 Ultra가 출시된다면 CPU/GPU 성능과 Neural Accelerator로 인한 AI 연산 향상은 확실히 매력적이에요. 다만 메모리 대제폭과 최종 가격이 확정되기 전까지는, 지금 즉시 512GB 대용량이 필요하다면 M3 Ultra가 여전히 현명한 선택입니다.

로컬 AI를 본격적으로 다루는 사용자라면, 두 기기의 출시 일정과 가격을 주시하면서 자신의 모델 크기와 메모리 요구사항에 맞춰 결정하는 것이 좋겠어요.

Mac Studio M5 Ultra vs NVIDIA DGX Spark — 로컬 AI 기준으로 무엇을 사야 하는가

분류: 로컬AI

2026년 8월 25일, Apple은 Mac Studio에 M5 Max와 M5 Ultra 칩을 탑재한 신제품을 발표했다. 이미 2025년 10월 출시되어 로컬 AI 커뮤니티에서 화제를 모았던 NVIDIA DGX Spark와 직접 비교할 시점이 되었다.

두 기기 모두 "데스크탑에서 프론티어급 LLM을 로컬로 실행한다"는 목표를 공유하지만, 아키텍처와 접근 방식이 완전히 다르다. 스펙과 벤치마크를 기반으로 어떤 기기가 당신의 사용 사례에 맞는지 기술적으로 분석한다.




스펙 비교 — 핵심은 메모리 대역폭

항목Mac Studio M5 UltraNVIDIA DGX Spark
CPU36코어 (12 Super + 24 Performance)20코어 ARM (10 Cortex-X925 + 10 A725)
GPU최대 80코어 + Neural AcceleratorsBlackwell 6,144 CUDA 코어 + 5세대 Tensor Core
유니파이드 메모리최대 512GB128GB LPDDR5x
메모리 대역폭1.2 TB/s273 GB/s
TDP~70W240W (GPU 140W)
OSmacOS 27Ubuntu 24.04 (DGX OS)
AI 프레임워크MLX, Core ML, Ollama (Metal)CUDA, TensorRT-LLM, NeMo
ストレ지최대 8TB SSD4TB NVMe
가장 낮은 구성 가격$5,499 (96GB / 1TB)$4,699 (128GB / 4TB)
최고 사양 가격~$20,000+ (512GB / 8TB)$4,699 (단일 SKU)

가장 결정적인 차이는 메모리 용량과 대역폭이다. M5 Ultra 최고사양은 512GB 메모리에 1.2TB/s 대역폭을 제공하며, DGX Spark의 약 4배의 메모리 용량과 4.4배의 대역폭을 가진다.


LLM 추론 성능 — 실제 벤치마크

Llama 3.3 70B (Q4 양자화)

메트릭M5 Ultra (MLX)DGX Spark
Prefill (tok/s)1,510 (단일 디바이스)약 200-300
Decode (tok/s)21.1 (단일) / 27.3 (TP=2)약 3-5
p99 Latency26.6초약 60초+
메모리 사용52GB약 45GB

M5 Ultra는 MLX의 Tensor Parallelism (TP=2)을 활용할 때 70B 모델에서 약 30-40% 더 빠른 디코드 속도를 제공한다. DGX Spark는 273 GB/s의 대역폭 한계로 인해 70B 클래스 모델에서 토큰 생성 속도가 매우 낮다.

Mistral Large 2 (120B, Q4 양자화)

메트릭M5 Ultra 512GB (TP=2)DGX Spark
Prefill (tok/s)980실행 불가 (메모리 부족)
Decode (tok/s)12.4OOM — 128GB로는 로드 불가
메모리 사용88GB

120B 클래스 모델은 M5 Ultra 512GB에서만 실행 가능하다. DGX Spark의 128GB 메모리는 70B 모델까지만 수용 가능하며, 120B MoE는 메모리 부족으로 실행 불가이다. (NVIDIA의 "200B까지 지원" 주장은 FP4 sparse 양자화 기준이며, 실제 사용 가능한 품질의 모델은 70B 수준이다.)


멀티 사용자 서빙 — 50인 팀 기준

M5 Ultra의 강력한 점은 단일 기기에서 동시에 여러 사용자를 서빙할 수 있다는 것이다. MLX의 continuous batching + paged KV cache를 활용하면:

  • 70B 모델, 동시 4명: 사용자당 13.2 tok/s — 코딩 어시스턴트 수준으로 충분
  • 70B 모델, 동시 8명: 사용자당 8.4 tok/s — 여전히 사용 가능
  • 27B 모델, 동시 16명: 사용자당 14.2 tok/s — 배치 처리에 적합

DGX Spark는 273 GB/s 대역폭 한계로 인해 동시 다수 사용자 서빙이 실질적으로 불가능하다. 단일 요청에서도 70B 모델의 토큰 생성이 3-5 tok/s 수준이며, 동시 요청 시 급격히 저하된다.


파인튜닝

DGX Spark의 강점은 CUDA 생태계다. LoRA/QLoRA 파인튜닝에서 DGX Spark는 Unsloth 프레임워크를 통해 Llama 8B 기준 53,658 tok/s의 피크 속도를 달성한다. M5 Ultra는 MLX 기반 파인튜닝이 제한적이며, Full fine-tuning은 작은 모델에 한정된다.

하지만 DGX Spark의 128GB 메모리 한계로 인해 70B 모델 QLoRA는 5,079 tok/s에 그치며, M5 Ultra의 MLX 파인튜닝이 70B급에서 더 나은 경험을 제공할 수 있다.


가격 대비 성능

M5 Ultra 96GB ($5,499): 70B Q4 모델 실행 가능. 메모리 대역폭 1.2TB/s로 DGX Spark 대비 4배 빠른 추론 속도. MLX 생태계가 빠르게 성장 중.

M5 Ultra 192GB (~$7,499): 70B 모델 + 충분한 KV 캐시 여력. 50인 팀 코딩 어시스턴트용 단일 서버로 적합.

M5 Ultra 512GB (~$20,000+): 120B 모델 실행 가능. DGX Spark로 불가능한 영역. 하지만 405B급 모델은 여전히 클라우드 GPU 클러스터가 필요.

DGX Spark ($4,699): CUDA 생태계 + TensorRT-LLM 최적화. 70B 이하 모델 파인튜닝이 주 용도. 단일 사용자, 연구/개발 환경에 적합.


결론 — 무엇을 사야 하는가

M5 Ultra를 선택해야 할 경우:

  • 70B 이상 모델을 추론하고, 응답 속도가 중요할 때
  • 120B급 모델을 로컬에서 실행해야 할 때 (512GB 구성 필요)
  • 동시 다수 사용자를 서빙하는 내부 AI 서버로 활용 시
  • macOS 생태계 + MLX 프레임워크를 선호할 때
  • 프로 워크플로우 (영상 편집, 3D 렌더링)와 AI를 동시에 필요로 할 때

DGX Spark를 선택해야 할 경우:

  • CUDA/TensorRT-LLM 생태계 기반 파인튜닝이 주 목적일 때
  • 70B 이하 모델의 LoRA/QLoRA 파인튜닝 성능이 최우선일 때
  • Linux 기반 환경과 NVIDIA AI Enterprise 스택을 필요로 할 때
  • $4,699 단일 가격에 128GB 메모리 + 4TB SSD가 매력적일 때
  • 단일 사용자 연구/개발 환경이며 모델 크기가 70B 이하로 제한될 때

최종 판단: 로컬 AI 추론 성능과 확장성 측면에서 M5 Ultra가 압도적이다. 특히 1.2TB/s 메모리 대역폭은 DGX Spark의 약 4.4배로, 같은 모델 크기의 추론 속도에 결정적인 차이를 만든다. DGX Spark의 강점은 CUDA 생태계와 파인튜닝 최적화이며, 이 분야에 특화된 사용자에게만 추천된다.

M5 Ultra Mac Studio는 2026년 9월 22일 배송 시작. 512GB 구성은 10월 말 출시 예정.


출처: Apple Newsroom (2026.08.25), Contra Collective MLX benchmark, NVIDIA DGX Spark review (GPUSmith, IntuitionLabs), Compute Market comparison

2026/08/15

Qwen3.8-27B — 17GB로 돌리는 멀티모달 AI Agent (스펙, 벤치마크, 로컬 실행 가이드)

Qwen3.8-27B — 2026년 8월 14일, 데스크톱에서 구동되는 멀티모달 AI 모델

분류: AI/LLM



2026년 8월 14일 밤12시 신상 Qwen3.8-27B 모델이 출시 되었다.
출시 하자마다 다운로드 걸우두고 취침~
oMLX 에서 128k 벤치마크 돌리고 있는데 프리필 남은 시간이 10분...


시작은 10분남짓 이었으나 현재 진행중 대략 20분 걸릴듯함

프리필 진행중 100k 지점에서 메모리 부족으로 중지됨 


Qwen3.6 27B vs Qwen3.8 27B

oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.6-27B-MLX-4bit
Engine: Auto
Context: Code (Python)
================================================================================


Single Request Results
--------------------------------------------------------------------------------
Test                                TTFT(ms)    TPOT(ms)        pp TPS        tg TPS      E2E(s)    Throughput    Peak Mem
pp1024/tg128                          4057.4       35.16   252.4 tok/s    28.7 tok/s       8.541   134.9 tok/s    15.85 GB
pp4096/tg128                         18389.1       39.41   222.7 tok/s    25.6 tok/s      23.426   180.3 tok/s    17.01 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch           tg TPS   Speedup        pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x          28.7 tok/s     1.00x   252.4 tok/s   252.4 tok/s      4057.4       8.541
2x          43.9 tok/s     1.53x   204.3 tok/s   102.2 tok/s     10024.1      15.861
4x          61.5 tok/s     2.14x   204.3 tok/s    51.1 tok/s     19879.3      28.376



oMLX - LLM inference, optimized for your Mac
https://github.com/jundot/omlx
Benchmark Model: Qwen3.8-27B-nvfp4
Engine: Auto
Context: Code (Python)
================================================================================


Single Request Results
--------------------------------------------------------------------------------
Test                                TTFT(ms)    TPOT(ms)        pp TPS        tg TPS      E2E(s)    Throughput    Peak Mem
pp1024/tg128                          4024.5       22.92   254.4 tok/s    44.0 tok/s       6.942   165.9 tok/s    16.94 GB
pp4096/tg128                         18836.7       27.85   217.4 tok/s    36.2 tok/s      22.407   188.5 tok/s    18.09 GB

Continuous Batching
pp1024 / tg128
--------------------------------------------------------------------------------
Batch           tg TPS   Speedup        pp TPS    pp TPS/req    TTFT(ms)      E2E(s)
1x          44.0 tok/s     1.00x   254.4 tok/s   254.4 tok/s      4024.5       6.942
2x          31.3 tok/s     0.71x   205.7 tok/s   102.8 tok/s      9956.2      18.126
4x          51.9 tok/s     1.18x   210.6 tok/s    52.6 tok/s     19304.2      29.306

1. 개요

Qwen3.8-27B는 Alibaba(알리바바)의 Qwen 팀이 2026년 8월 14일에 공개한 27B(270억) 파라미터의 오픈웨이트 다중모달(multimodal) 모델이다. Qwen3.5 아키텍처 기반으로 Qwen 오픈모델 계열에서 가장 강력한 세대인 Qwen3.8의 컴팩트 모델이다.

핵심 특징은 다음과 같다:

  • Dense 모델: MoE가 아닌 순수 Dense 구조 (27B 파라미터, 64 레이어)
  • 멀티모달: 이미지 + 영상(최대 시간 단위) 이해 지원 — STEM 도표, 문서, 시간급 영상
  • 262K 네이티브 컨텍스트: YaRN 스케일링 시 최대 1,000,000 토큰까지 확장 가능
  • Apache 2.0 라이선스: 상업적 사용 포함 완전 오픈
  • 하이브리드 어텐션: Gated DeltaNet(선형 어텐션) + Gated Attention(전통적 트랜스포머 어텐션) 혼합
  • MTP(Multi-Token Prediction): 체크포인트 내장, 추론 속도 향상
  • Thinking Mode 기본 활성화: reasoning_effort로 추론 깊이 조절 (xhigh / medium / low)

2. 아키텍처 상세

Qwen3.8-27B는 Qwen3.5의 하이브리드 어텐션 백본을 계승한다. 64개 레이어는 16 x (3x(Gated DeltaNet → FFN) → 1x(Gated Attention → FFN)) 구성으로, 매 4개 레이어 중 3개가 효율적인 선형 어텐션(DeltaNet), 1장이 고품질 Gated Attention을 담당한다.

항목
파라미터 수27B (HF에서 28B로 표기)
Hidden Dimension5,120
레이어 수64
Token Embedding / LM Output248,320 (Padded)
Gated DeltaNetV: 48 heads, QK: 16 heads, head dim 128
Gated AttentionQ: 24 heads, KV: 4 heads, head dim 256, RoPE dim 64
FFN Intermediate Dim17,408
MTPMulti-step training 완료, 체크포인트 내장
네이티브 컨텍스트262,144 tokens
최대 확장 컨텍스트 (YaRN)1,000,000 tokens
텐서 형식 (공개)BF16
라이선스Apache 2.0

이 하이브리드 설계의 핵심 장점은 KV 캐치 효율이다. DeltaNet 레이어는 컨텍스트가 길어질수록 KV 캐치가 거의 증가하지 않아, 262K~1M 컨텍스트에서도 VRAM 사용량이 전통적 트랜스포머보다 훨씬 적다.

3. 벤치마크 성능

텍스트 성능 (Coding / Agent / General)

벤치마크Qwen3.8-27BQwen3.6-27BQwen3.7-PlusMuse Glimmer-30B
Coding
Terminal Bench 2.1 (Agentic terminal)73.063.464.051.7
SWE-bench Pro (Agentic coding)61.753.557.651.2
NL2Repo-Bench (Repo-level code gen)42.336.241.1--
DeepSWE 1.1 (Agentic coding)42.213.314.2--
QwenSWEBench (Software engineering)79.049.359.2--
Agent
CoWorkBench (Long-horizon office work)70.761.065.1--
JobBench (Professional job tasks)33.421.827.6--
Agents' Last Exam (Pass@1 / Score)20.4 / 42.910.6 / 27.313.2 / 33.6--
General
IFBench (Instruction following)79.569.179.177.0
GPQA Diamond (Scientific reasoning)89.287.890.383.5
HLE (Multidisciplinary reasoning)30.824.034.722.0
LiveCodeBench v6 (Competitive coding)90.383.989.6--

Qwen3.8-27B는 같은 27B 크기의 Qwen3.6-27B 대비 거의 모든 벤치마크에서 큰 폭의 향상을 기록했다. 특히 SWE-bench Pro(61.7 vs 53.5), QwenSWEBench(79.0 vs 49.3), DeepSWE 1.1(42.2 vs 13.3)에서 두드러진다.

Vision-Language (VL) 성능

벤치마크Qwen3.8-27BQwen3.6-27B
Agentic Multimodal
OSWorld-Verified (Computer use)84.363.9
WebArena-Verified (Browser use)64.848.8
AndroidWorld (Mobile use)81.970.3
RecreationBench (Application recreation)47.129.8
SWE-MM (Multimodal SW engineering)38.625.7
General Multimodal
MathVision (With CI)94.685.1
BabyVision (With CI)85.670.4
CharXiv RQ (With CI)90.285.9
OmniDocBench 1.5 (Document intelligence)91.189.4
RealWorldQA (Real-world perception)85.984.1

OSWorld-Verified(84.3)와 WebArena-Verified(64.8) 점수는 27B 크기의 오픈웨이트 모델로선 전례 없는 수준이다. 특히 전작 대비 OSWorld가 63.9에서 84.3으로 약 20점 점프했다.

4. 로컬 실행 — VRAM/RAM 요구사항

Ollama 패키지 크기는 약 17~18GB(BF16 기준 24.6 GiB, FP8/NVFP4 양자화 시 더 작음). 즉:

  • 17GB RAM/VRAM: GGUF Q4~Q5 양자화로 실행 가능 (Unsloth, LM Studio, Ollama)
  • 24GB VRAM: BF16 풀 정밀도 또는 FP8 양자화로 실행 가능 (RTX 4090, RTX PRO 6000)
  • AMD Radeon GPU: Day 0 지원 — LM Studio + ROCm
  • DGX Spark / RTX 5090 / H200: SGLang 공식 지원
  • CPU only (32GB+ RAM): llama.cpp GGUF로 실행 가능, 속도는 느림

하드웨어별 VRAM 가이드 (추천):

양자화파일 크기 (약)VRAM/RAM 요구
BF16 (풀 정밀도)~54 GB2x24GB GPU 또는 1x48GB+ GPU
FP8 / NVFP4 W4A4~27 GB1x24GB GPU (RTX 3090/4090)
GGUF Q6_K~24 GB1x24GB GPU + 32GB RAM
GGUF Q4_K_M (Ollama)~17 GB32GB RAM 또는 16GB+ VRAM GPU

5. 서비스/배포 방법

공식 지원되는 인퍼런스 프레임워크:

  • SGLang: BF16/FP8/NVFP4, MTP 내장 — H200, RTX PRO 6000, RTX 5090, DGX Spark
  • vLLM: YaRN 1M 컨텍스트 확장 지원, video frame sampling 가능
  • Ollama / LM Studio: GGUF 양자화 기반 로컬 실행 (17GB RAM/VRAM)
  • TokenSpeed: Alibaba 자체 인퍼런스 엔진
  • Hugging Face Transformers: Python 코드에서 직접 로딩 가능
  • Qwen Cloud API: 호스티드 서비스 (1M 컨텍스트 기본, 공식 도구 내장) — 공개 예정

추천 샘플링 파라미터

모드temperaturetop_ptop_kpresence_penalty
Thinking Mode (기본)1.00.95200.0
Instruct / Non-thinking0.70.80201.5

추가로 reasoning_effort 파라미터를 통해 추론 깊이를 조절할 수 있다:

  • xhigh (기본): 복잡한 태스크, 철저한 분석 필요 시
  • medium: 정확도-속도 균형
  • low: 속도/비용 최적화 (단, agent 태스크에서 오히려 실패율 증가 가능)

6. 사용시 유의사항

  • 1M 컨텍스트 사용 시: YaRN 설정이 필수. rope_parameters를 변경하거나 vLLM/SGLang CLI 인자로 전달. 단, 짧은 텍스트에서 성능 저하가 발생할 수 있으므로 factor 값을 상황에 맞게 조절 (524K 컨텍스트면 factor=2.0 권장)
  • 타임 단위 영상: video_preprocessor_config.json의 longest_edge를 469,762,048(약 224K video tokens)로 설정해야 고프레임 샘플링이 동작
  • preserve_thinking: 기본 활성화. 대화 전체의 사고 블록을 유지하여 agent 시나리오에서 의사결정 일관성 + KV 캐치 효율 향상. 필요시 False로 비활성화 가능
  • Agentic 태스크에서 reasoning_effort=low: 단일 턴은 빠지만, 불충분한 분석 → 실패 → 재시도 → 총 지연/토큰 소모 증가할 수 있음. 공식 문서에서 경고
  • Hacker Note: VRAM 효율이 Gemma 4나 Muse Glimmer보다 낮은 편이라는 커뮤니티 피드백 있음 (32K 컨텍스트에 2.5GB VRAM)

7. Qwen3.8 시리즈 전체 구성

모델타입파라미터특징
Qwen3.8-Max (API)2.4T MoE2,400B (MoE)Coding + Cowork 최상위, 2026.8.3 출시
Qwen3.8-27B (오픈웨이트)Dense + Vision27B (28B 표기)본 글 주인공. 17GB로 로컬 실행

Qwen3.8-Max API는 2026년 8월 3일에 먼저 출시되었고, 11일 뒤인 8월 14일에 27B 오픈웨이트가 공개되었다. Max의 오픈웨이트는 "이번 주"라는 공식 발표가 있었으나 27B 공개 시점 기준 아직 미공개 상태이다 (커뮤니티에서 지연 우려 보도 있음).

8. 커뮤니티 반응

  • r/LocalLLaMA: "2026년 가장 중요한 로컬 AI 릴리스 중 하나" — 17GB로 27B 멀티모달이 돌아간다는 점이 화제
  • Hacker News: 추론 과정이 Qwen3.8은 명시적(explicit), Gemma 4는 암시적(implicit)이라는 비교. VRAM 효율이 다른 모델보다 낮은 점 지적
  • AMD 공식 블로그: Ryzen AI Max + Radeon GPU Day 0 지원 — LM Studio로 즉시 실행 가능
  • Unsloth: NVFP4, GGUF 양자화 버전 공식 공개. 17GB RAM/VRAM 환경 실행 안내
  • NxCode (한국): "18GB가 가장 실용적인 숫자" — Ollama 패키지 크기를 강조하며 노트북/데스크톱에서도 최신 멀티모달 모델을 불러올 수 있다고 평가

9. 요약 — Qwen3.8-27B를 선택해야 할 경우

  • 로컬/엣지에서 27B급 다중모달 agent를 돌리고 싶을 때 (17~24GB VRAM/RAM)
  • Coding + Computer use(OSWorld 84.3) + Browser use를 한 모델로 처리하고 싶을 때
  • Apache 2.0 라이선스로 상업적 내장 필요
  • 262K~1M 장문 컨텍스트를 VRAM 부담 없이 처리할 때 (하이브리드 어텐션의 KV 캐치 효율)
  • AMD GPU + LM Studio 생태계와 완벽하게 호환 (Day 0)

참고 출처

이 포스트는 2026년 8월 15일 기준 Qwen3.8-27B 공식 문서와 커뮤니티 정보를 기반으로 작성되었습니다.

Mac Studio M3 Ultra vs M5 Ultra — 어떤 기기를 사야 하는가

분류: 로컬AI 2025년 3월, Apple은 Mac Studio에 M3 Ultra 칩을 탑재해 출시했습니다. 그리고 2026년, M5 Ultra가 등장하며 로컬 AI 커뮤니티의 관심이 다시 한 번 모이고 있어요. 두 칩은 모두 "데스크...