레이블이 Mac Studio인 게시물을 표시합니다. 모든 게시물 표시
레이블이 Mac Studio인 게시물을 표시합니다. 모든 게시물 표시

2026/06/03

DGX Spark vs Mac Studio — 로컬 LLM, 뭘 사야 하나

솔직히 말하면, 처음 DGX Spark 발표를 봤을 때 '또 엔비디아 마케팅이구나' 싶었다. $3,000짜리 미니 PC에 supercomputer라는 단어를 붙이는 건 좀 오버 아닌가 싶었으니까. 그런데 실제 리뷰들을 파고들수록 생각이 달라졌다. 128GB 통합 메모리로 120B 파라미터 모델을 캐리어 가방에 들어가는 기계에서 돌린다는 게 — 이건 진짜다.

이번 글은 DGX Spark와 Mac Studio를 로컬 LLM 추론 관점에서 직접 비교해봤다. 둘 다 같은 포지션을 노리는 듯 보이지만, 실제로는 꽤 다른 철학을 가진 제품이다.


DGX Spark — 뭐가 다른가

DGX Spark의 핵심은 NVIDIA GB10 Grace Blackwell 칩이다. 3nm TSMC 공정, Blackwell GPU, 20코어 ARM CPU, 그리고 128GB LPDDR5X 통합 메모리. 현재 이 가격대($3,000~4,000)에서 128GB 통합 메모리를 제공하는 미니 PC는 사실상 없다.

ServeTheHome의 실제 벤치마크 기준으로 Ollama + Open WebUI 환경에서 gpt-oss 120B 모델을 돌렸을 때 14.48 토큰/초가 나왔다. 느리다고 생각할 수도 있지만, 120B 모델을 $3,000짜리 기기에서 이 속도로 돌릴 수 있다는 자체가 특이점이다. gpt-oss 20B는 약 49 토큰/초, Qwen3 32B는 9~10 토큰/초.

메모리 대역폭은 273 GB/s인데, 이게 좀 아쉬운 부분이다. 내부 NVLink C2C로는 600 GB/s까지 나오지만, 실제 추론 성능의 병목은 여기서 온다. STH 리뷰어도 '273 GB/s는 프로토타이핑 머신에 더 가깝다'고 솔직하게 평가했다.

눈에 띄는 부가 스펙은 ConnectX-7 200GbE 네트워크 카드다. 단품으로 사면 $900 넘는 물건이 기본 탑재되어 있다. RDMA/RoCE 지원으로 DGX Spark 여러 대를 클러스터로 묶을 수 있다. 이게 supercomputer라는 말이 완전 허풍은 아닌 이유다.

단점도 분명하다. 현재 Linux 전용이고, 초기 버전에서 디스플레이 출력 버그, GPU 전력 상태 오류 등 소프트웨어 미성숙 이슈가 있었다. 하드웨어는 훌륭한데 소프트웨어가 따라가는 중인 느낌이다.

Mac Studio — 대역폭의 힘

2025년 Mac Studio는 M4 Max(기본)와 M3 Ultra(최고 사양)로 나뉜다. M4 Ultra는 아직 없다.

M4 Max 32코어 모델($1,999 기본형)에서 llama.cpp로 LLaMA 7B Q4를 돌리면 약 70 토큰/초가 나온다. 40코어 버전은 83 토큰/초, M3 Ultra는 88~92 토큰/초. 이 숫자들이 DGX Spark보다 높은 건 대역폭 덕분이다. M4 Max는 410~546 GB/s, M3 Ultra는 819 GB/s로 DGX Spark(273 GB/s) 대비 2~3배 차이다.

소형~중형 모델(7B~70B)에서는 같은 가격대라면 Mac Studio가 훨씬 빠르다. M4 Max 64GB 모델이 약 $2,500 정도인데, Llama 3 70B를 Q4로 쾌적하게 돌릴 수 있다.

Mac Studio의 또 다른 강점은 메모리 상한선이다. M3 Ultra를 512GB로 구성하면 DeepSeek V3 671B(q4_K_M, 약 405GB)도 로드할 수 있다. hardware-corner.net 실측 결과 671B 모델에서 생성 속도 6.2 토큰/초, 프롬프트 처리 9 토큰/초가 나왔다. $10,000짜리 기계지만 700B급 모델을 로컬에서 돌리는 현실적인 선택지는 이게 거의 유일하다.

프레임워크 선택도 중요하다. llama.cpp보다 MLX를 쓰면 프롬프트 처리 속도가 4~5배 빠르다. Ollama는 내부적으로 llama.cpp를 사용하기 때문에, Mac Studio에서 최대 성능을 뽑으려면 MLX 기반 툴을 쓰는 게 낫다.

핵심 수치 비교

DGX Spark ($3,000~4,000 | 128GB | 273 GB/s)

7B Q4 속도 미공개 / 20B ~49 t/s / 32B ~9~10 t/s / 120B 14.48 t/s ✅

클러스터링 지원 (ConnectX-7 200GbE RDMA) / Linux 전용 / 소비전력 60~90W

Mac Studio M4 Max 40C (~$2,500~3,000 | 128GB | 546 GB/s)

7B Q4 ~83 t/s / 70B 가능 / 120B 어려움

클러스터링 미지원 / macOS / 소비전력 ~60~100W

Mac Studio M3 Ultra 80C ($3,999~ | 192GB~512GB | 819 GB/s)

7B Q4 ~92 t/s / 120B 가능 / 671B (512GB 구성 시) 가능

클러스터링 미지원 / macOS / 소비전력 ~100~200W

결론 — 어떤 걸 골라야 할까

대부분의 개발자에게는 Mac Studio M4 Max가 답이다. 가성비, 속도, 생태계 모두 우위다. $1,999에 7B~30B 모델을 빠르게 돌리는 용도라면 이게 최선이다.

DGX Spark는 두 가지 시나리오에서 의미가 있다. 첫째, 120B급 대형 모델을 포터블한 환경에서 돌려야 할 때. 둘째, 여러 대를 200GbE로 묶어 분산 추론 클러스터를 구성할 때. 이 두 요구가 없다면 Mac Studio 대비 가격 프리미엄이 잘 정당화되지 않는다.

700B급 모델이 필요하면 Mac Studio M3 Ultra 512GB인데, $10,000이라는 가격을 감수할 수 있는지가 관건이다.

로컬 LLM 시장이 빠르게 성숙하고 있다. 1년 전만 해도 70B 모델을 로컬에서 돌리는 게 특수한 취미였다면, 지금은 $2,000짜리 기기로 충분히 가능해졌다. DGX Spark의 존재는 그 다음 단계 — 100B+급 모델의 민주화 — 가 이미 시작됐다는 신호라고 본다.

📎 참고: ServeTheHome DGX Spark Review | llama.cpp Apple Silicon Benchmarks (GitHub Discussions) | hardware-corner.net M3 Ultra DeepSeek Test | Apple Mac Studio 공식 스펙

MacBook M4 Max vs Mac Studio M4 Max — 로컬 LLM 속도, 진짜 차이 있을까?

동일 칩, 동일 메모리, 동일 모델 — 근데 왜 속도가 다를까?

솔직히 처음엔 별 차이 없겠지 싶었다. M4 Max에 64GB RAM이면 두 기기 모두 스펙지에선 완전히 동일하다. 근데 실제로 LLM을 돌려보니 얘기가 달랐다.

테스트 환경

칩: Apple M4 Max (동일)

통합 메모리: 64 GB (동일)

SSD: 1 TB (동일)

런타임: LM Studio

모델: Qwen3 27B dense (quantized)

태스크: 단일 페이지 Kanban 보드 HTML 생성

결과: Mac Studio가 35.7% 빠르다

MacBook Pro M4 Max: 16.74 tok/s

Mac Studio M4 Max: 22.72 tok/s

차이: +5.98 tok/s, +35.7%

숫자만 보면 "같은 칩인데?" 싶지만, 체감상 35%는 결코 작은 차이가 아니다. 긴 코드 생성이나 장문 요약 태스크에선 누적 차이가 꽤 크게 느껴진다.

왜 차이가 날까?

이유는 폼 팩터 차이에 있다.

MacBook은 얇고 가벼운 노트북 바디에 M4 Max를 집어넣은 구조라 열 설계(thermal design)에 제약이 있다. TDP 한계 때문에 지속적인 고부하 작업에서는 클럭을 조금씩 낮춰 온도를 관리하게 된다.

반면 Mac Studio는 데스크탑 폼 팩터답게 방열 공간이 넉넉하다. 결과적으로 서스테인드 클럭(sustained clock)이 더 높게 유지되고, LLM 추론처럼 Neural Engine + GPU를 지속적으로 강하게 쓰는 작업에서 이 차이가 그대로 성능 격차로 나타난다.

그래서 뭘 사야 할까?

이동이 필요하다 → MacBook Pro

16.74 tok/s도 로컬 LLM 용도로는 충분히 쾌적한 속도다. Qwen3 27B를 이 속도로 돌릴 수 있다는 것 자체가 몇 년 전엔 상상도 못 할 얘기였다.

책상에서 AI 개발 or 에이전트 서버로 쓸 거다 → Mac Studio

35% 속도 차이는 반복 추론, 배치 처리, 에이전트 루프에서 체감이 확실하다. 같은 돈으로 이 속도 차이를 얻는다면 Mac Studio가 명확히 유리하다.

마치며

같은 칩이어도 패키징 방식이 성능을 결정한다는 걸 다시 확인했다. 로컬 LLM을 진지하게 쓸 생각이라면 폼 팩터 차이를 절대 무시하지 말자.

Runtime: LM Studio · Model: Qwen3-27B-dense · Task: kanban board generation

SK하이닉스 ADR 상장 이후 한국 증시 급락의 원인 분석

분류: 증시분석 SK하이닉스 ADR 상장 이후 한국 증시 급락의 원인 분석 지난 7월 10일, SK하이닉스가 미국 나스닥에 미국주식예탁증서(ADR)를 상장했다. 공모가 149달러로 상장한 하이닉스 ADR은 첫 거래일인 13일 기준 약 168달...