2026/08/27

Mac Studio M5 Ultra vs NVIDIA DGX Spark — 로컬 AI 기준으로 무엇을 사야 하는가

분류: 로컬AI

2026년 8월 25일, Apple은 Mac Studio에 M5 Max와 M5 Ultra 칩을 탑재한 신제품을 발표했다. 이미 2025년 10월 출시되어 로컬 AI 커뮤니티에서 화제를 모았던 NVIDIA DGX Spark와 직접 비교할 시점이 되었다.

두 기기 모두 "데스크탑에서 프론티어급 LLM을 로컬로 실행한다"는 목표를 공유하지만, 아키텍처와 접근 방식이 완전히 다르다. 스펙과 벤치마크를 기반으로 어떤 기기가 당신의 사용 사례에 맞는지 기술적으로 분석한다.




스펙 비교 — 핵심은 메모리 대역폭

항목Mac Studio M5 UltraNVIDIA DGX Spark
CPU36코어 (12 Super + 24 Performance)20코어 ARM (10 Cortex-X925 + 10 A725)
GPU최대 80코어 + Neural AcceleratorsBlackwell 6,144 CUDA 코어 + 5세대 Tensor Core
유니파이드 메모리최대 512GB128GB LPDDR5x
메모리 대역폭1.2 TB/s273 GB/s
TDP~70W240W (GPU 140W)
OSmacOS 27Ubuntu 24.04 (DGX OS)
AI 프레임워크MLX, Core ML, Ollama (Metal)CUDA, TensorRT-LLM, NeMo
ストレ지최대 8TB SSD4TB NVMe
가장 낮은 구성 가격$5,499 (96GB / 1TB)$4,699 (128GB / 4TB)
최고 사양 가격~$20,000+ (512GB / 8TB)$4,699 (단일 SKU)

가장 결정적인 차이는 메모리 용량과 대역폭이다. M5 Ultra 최고사양은 512GB 메모리에 1.2TB/s 대역폭을 제공하며, DGX Spark의 약 4배의 메모리 용량과 4.4배의 대역폭을 가진다.


LLM 추론 성능 — 실제 벤치마크

Llama 3.3 70B (Q4 양자화)

메트릭M5 Ultra (MLX)DGX Spark
Prefill (tok/s)1,510 (단일 디바이스)약 200-300
Decode (tok/s)21.1 (단일) / 27.3 (TP=2)약 3-5
p99 Latency26.6초약 60초+
메모리 사용52GB약 45GB

M5 Ultra는 MLX의 Tensor Parallelism (TP=2)을 활용할 때 70B 모델에서 약 30-40% 더 빠른 디코드 속도를 제공한다. DGX Spark는 273 GB/s의 대역폭 한계로 인해 70B 클래스 모델에서 토큰 생성 속도가 매우 낮다.

Mistral Large 2 (120B, Q4 양자화)

메트릭M5 Ultra 512GB (TP=2)DGX Spark
Prefill (tok/s)980실행 불가 (메모리 부족)
Decode (tok/s)12.4OOM — 128GB로는 로드 불가
메모리 사용88GB

120B 클래스 모델은 M5 Ultra 512GB에서만 실행 가능하다. DGX Spark의 128GB 메모리는 70B 모델까지만 수용 가능하며, 120B MoE는 메모리 부족으로 실행 불가이다. (NVIDIA의 "200B까지 지원" 주장은 FP4 sparse 양자화 기준이며, 실제 사용 가능한 품질의 모델은 70B 수준이다.)


멀티 사용자 서빙 — 50인 팀 기준

M5 Ultra의 강력한 점은 단일 기기에서 동시에 여러 사용자를 서빙할 수 있다는 것이다. MLX의 continuous batching + paged KV cache를 활용하면:

  • 70B 모델, 동시 4명: 사용자당 13.2 tok/s — 코딩 어시스턴트 수준으로 충분
  • 70B 모델, 동시 8명: 사용자당 8.4 tok/s — 여전히 사용 가능
  • 27B 모델, 동시 16명: 사용자당 14.2 tok/s — 배치 처리에 적합

DGX Spark는 273 GB/s 대역폭 한계로 인해 동시 다수 사용자 서빙이 실질적으로 불가능하다. 단일 요청에서도 70B 모델의 토큰 생성이 3-5 tok/s 수준이며, 동시 요청 시 급격히 저하된다.


파인튜닝

DGX Spark의 강점은 CUDA 생태계다. LoRA/QLoRA 파인튜닝에서 DGX Spark는 Unsloth 프레임워크를 통해 Llama 8B 기준 53,658 tok/s의 피크 속도를 달성한다. M5 Ultra는 MLX 기반 파인튜닝이 제한적이며, Full fine-tuning은 작은 모델에 한정된다.

하지만 DGX Spark의 128GB 메모리 한계로 인해 70B 모델 QLoRA는 5,079 tok/s에 그치며, M5 Ultra의 MLX 파인튜닝이 70B급에서 더 나은 경험을 제공할 수 있다.


가격 대비 성능

M5 Ultra 96GB ($5,499): 70B Q4 모델 실행 가능. 메모리 대역폭 1.2TB/s로 DGX Spark 대비 4배 빠른 추론 속도. MLX 생태계가 빠르게 성장 중.

M5 Ultra 192GB (~$7,499): 70B 모델 + 충분한 KV 캐시 여력. 50인 팀 코딩 어시스턴트용 단일 서버로 적합.

M5 Ultra 512GB (~$20,000+): 120B 모델 실행 가능. DGX Spark로 불가능한 영역. 하지만 405B급 모델은 여전히 클라우드 GPU 클러스터가 필요.

DGX Spark ($4,699): CUDA 생태계 + TensorRT-LLM 최적화. 70B 이하 모델 파인튜닝이 주 용도. 단일 사용자, 연구/개발 환경에 적합.


결론 — 무엇을 사야 하는가

M5 Ultra를 선택해야 할 경우:

  • 70B 이상 모델을 추론하고, 응답 속도가 중요할 때
  • 120B급 모델을 로컬에서 실행해야 할 때 (512GB 구성 필요)
  • 동시 다수 사용자를 서빙하는 내부 AI 서버로 활용 시
  • macOS 생태계 + MLX 프레임워크를 선호할 때
  • 프로 워크플로우 (영상 편집, 3D 렌더링)와 AI를 동시에 필요로 할 때

DGX Spark를 선택해야 할 경우:

  • CUDA/TensorRT-LLM 생태계 기반 파인튜닝이 주 목적일 때
  • 70B 이하 모델의 LoRA/QLoRA 파인튜닝 성능이 최우선일 때
  • Linux 기반 환경과 NVIDIA AI Enterprise 스택을 필요로 할 때
  • $4,699 단일 가격에 128GB 메모리 + 4TB SSD가 매력적일 때
  • 단일 사용자 연구/개발 환경이며 모델 크기가 70B 이하로 제한될 때

최종 판단: 로컬 AI 추론 성능과 확장성 측면에서 M5 Ultra가 압도적이다. 특히 1.2TB/s 메모리 대역폭은 DGX Spark의 약 4.4배로, 같은 모델 크기의 추론 속도에 결정적인 차이를 만든다. DGX Spark의 강점은 CUDA 생태계와 파인튜닝 최적화이며, 이 분야에 특화된 사용자에게만 추천된다.

M5 Ultra Mac Studio는 2026년 9월 22일 배송 시작. 512GB 구성은 10월 말 출시 예정.


출처: Apple Newsroom (2026.08.25), Contra Collective MLX benchmark, NVIDIA DGX Spark review (GPUSmith, IntuitionLabs), Compute Market comparison

댓글 없음:

댓글 쓰기

Mac Studio M3 Ultra vs M5 Ultra — 어떤 기기를 사야 하는가

분류: 로컬AI 2025년 3월, Apple은 Mac Studio에 M3 Ultra 칩을 탑재해 출시했습니다. 그리고 2026년, M5 Ultra가 등장하며 로컬 AI 커뮤니티의 관심이 다시 한 번 모이고 있어요. 두 칩은 모두 "데스크...