솔직히 말하면, 처음 DGX Spark 발표를 봤을 때 '또 엔비디아 마케팅이구나' 싶었다. $3,000짜리 미니 PC에 supercomputer라는 단어를 붙이는 건 좀 오버 아닌가 싶었으니까. 그런데 실제 리뷰들을 파고들수록 생각이 달라졌다. 128GB 통합 메모리로 120B 파라미터 모델을 캐리어 가방에 들어가는 기계에서 돌린다는 게 — 이건 진짜다.
이번 글은 DGX Spark와 Mac Studio를 로컬 LLM 추론 관점에서 직접 비교해봤다. 둘 다 같은 포지션을 노리는 듯 보이지만, 실제로는 꽤 다른 철학을 가진 제품이다.
DGX Spark — 뭐가 다른가
DGX Spark의 핵심은 NVIDIA GB10 Grace Blackwell 칩이다. 3nm TSMC 공정, Blackwell GPU, 20코어 ARM CPU, 그리고 128GB LPDDR5X 통합 메모리. 현재 이 가격대($3,000~4,000)에서 128GB 통합 메모리를 제공하는 미니 PC는 사실상 없다.
ServeTheHome의 실제 벤치마크 기준으로 Ollama + Open WebUI 환경에서 gpt-oss 120B 모델을 돌렸을 때 14.48 토큰/초가 나왔다. 느리다고 생각할 수도 있지만, 120B 모델을 $3,000짜리 기기에서 이 속도로 돌릴 수 있다는 자체가 특이점이다. gpt-oss 20B는 약 49 토큰/초, Qwen3 32B는 9~10 토큰/초.
메모리 대역폭은 273 GB/s인데, 이게 좀 아쉬운 부분이다. 내부 NVLink C2C로는 600 GB/s까지 나오지만, 실제 추론 성능의 병목은 여기서 온다. STH 리뷰어도 '273 GB/s는 프로토타이핑 머신에 더 가깝다'고 솔직하게 평가했다.
눈에 띄는 부가 스펙은 ConnectX-7 200GbE 네트워크 카드다. 단품으로 사면 $900 넘는 물건이 기본 탑재되어 있다. RDMA/RoCE 지원으로 DGX Spark 여러 대를 클러스터로 묶을 수 있다. 이게 supercomputer라는 말이 완전 허풍은 아닌 이유다.
단점도 분명하다. 현재 Linux 전용이고, 초기 버전에서 디스플레이 출력 버그, GPU 전력 상태 오류 등 소프트웨어 미성숙 이슈가 있었다. 하드웨어는 훌륭한데 소프트웨어가 따라가는 중인 느낌이다.
Mac Studio — 대역폭의 힘
2025년 Mac Studio는 M4 Max(기본)와 M3 Ultra(최고 사양)로 나뉜다. M4 Ultra는 아직 없다.
M4 Max 32코어 모델($1,999 기본형)에서 llama.cpp로 LLaMA 7B Q4를 돌리면 약 70 토큰/초가 나온다. 40코어 버전은 83 토큰/초, M3 Ultra는 88~92 토큰/초. 이 숫자들이 DGX Spark보다 높은 건 대역폭 덕분이다. M4 Max는 410~546 GB/s, M3 Ultra는 819 GB/s로 DGX Spark(273 GB/s) 대비 2~3배 차이다.
소형~중형 모델(7B~70B)에서는 같은 가격대라면 Mac Studio가 훨씬 빠르다. M4 Max 64GB 모델이 약 $2,500 정도인데, Llama 3 70B를 Q4로 쾌적하게 돌릴 수 있다.
Mac Studio의 또 다른 강점은 메모리 상한선이다. M3 Ultra를 512GB로 구성하면 DeepSeek V3 671B(q4_K_M, 약 405GB)도 로드할 수 있다. hardware-corner.net 실측 결과 671B 모델에서 생성 속도 6.2 토큰/초, 프롬프트 처리 9 토큰/초가 나왔다. $10,000짜리 기계지만 700B급 모델을 로컬에서 돌리는 현실적인 선택지는 이게 거의 유일하다.
프레임워크 선택도 중요하다. llama.cpp보다 MLX를 쓰면 프롬프트 처리 속도가 4~5배 빠르다. Ollama는 내부적으로 llama.cpp를 사용하기 때문에, Mac Studio에서 최대 성능을 뽑으려면 MLX 기반 툴을 쓰는 게 낫다.
핵심 수치 비교
DGX Spark ($3,000~4,000 | 128GB | 273 GB/s)
7B Q4 속도 미공개 / 20B ~49 t/s / 32B ~9~10 t/s / 120B 14.48 t/s ✅
클러스터링 지원 (ConnectX-7 200GbE RDMA) / Linux 전용 / 소비전력 60~90W
Mac Studio M4 Max 40C (~$2,500~3,000 | 128GB | 546 GB/s)
7B Q4 ~83 t/s / 70B 가능 / 120B 어려움
클러스터링 미지원 / macOS / 소비전력 ~60~100W
Mac Studio M3 Ultra 80C ($3,999~ | 192GB~512GB | 819 GB/s)
7B Q4 ~92 t/s / 120B 가능 / 671B (512GB 구성 시) 가능
클러스터링 미지원 / macOS / 소비전력 ~100~200W
결론 — 어떤 걸 골라야 할까
대부분의 개발자에게는 Mac Studio M4 Max가 답이다. 가성비, 속도, 생태계 모두 우위다. $1,999에 7B~30B 모델을 빠르게 돌리는 용도라면 이게 최선이다.
DGX Spark는 두 가지 시나리오에서 의미가 있다. 첫째, 120B급 대형 모델을 포터블한 환경에서 돌려야 할 때. 둘째, 여러 대를 200GbE로 묶어 분산 추론 클러스터를 구성할 때. 이 두 요구가 없다면 Mac Studio 대비 가격 프리미엄이 잘 정당화되지 않는다.
700B급 모델이 필요하면 Mac Studio M3 Ultra 512GB인데, $10,000이라는 가격을 감수할 수 있는지가 관건이다.
로컬 LLM 시장이 빠르게 성숙하고 있다. 1년 전만 해도 70B 모델을 로컬에서 돌리는 게 특수한 취미였다면, 지금은 $2,000짜리 기기로 충분히 가능해졌다. DGX Spark의 존재는 그 다음 단계 — 100B+급 모델의 민주화 — 가 이미 시작됐다는 신호라고 본다.
📎 참고: ServeTheHome DGX Spark Review | llama.cpp Apple Silicon Benchmarks (GitHub Discussions) | hardware-corner.net M3 Ultra DeepSeek Test | Apple Mac Studio 공식 스펙
댓글 없음:
댓글 쓰기