레이블이 Gemma인 게시물을 표시합니다. 모든 게시물 표시
레이블이 Gemma인 게시물을 표시합니다. 모든 게시물 표시

2026/06/07

GitHub Copilot Pro+ 사용한도 소진 이후: 로컬 LLM(Gemma) 전환기

안녕하세요. 오늘 공유할 내용은 최근 저의 개발 도구 환경 변화에 대한 이야기입니다.

GitHub Copilot Pro+ 사용한도 소진

저는 Hermes Agent를 효과적으로 사용하기 위해 GitHub Copilot Pro+ 구독을 유지해 왔습니다. 코드 자동 완성, AI 기반 리팩토링, PR 리뷰 등 개발 워크플로우 전반에 Copilot이 깊이 통합되어 있었죠.

하지만 아직 6월의 절반도 지나지 않은 시점에서 사용한도 소진으로 구독을 취소하고 로컬 LLM 전환을 결정했습니다.

사용한도 소진 이후에는 기본적인 Copilot 기능만 제한적으로 사용할 수 있고, Pro급 고급 기능은 전혀 이용할 수 없는 상태가 되었죠.

로컬 LLM 모델로 전환 결정을 내리다

Copilot 사용 불가 상황에서도 개발 생산성을 유지하기 위해 여러 대안을 검토한 결과, 로컬에서 실행 가능한 LLM 모델로 방향을 전환하기로 결정했습니다.

구글의 Gemma 시리즈를 선택한 이유는 다음과 같습니다.

1. 오픈 소스 및 오픈 웨이트 — 상업적 사용 제한이 명확하고 투명합니다.

2. 다양한 사이즈 옵션 — 사용 환경에 맞게 모델을 선택할 수 있습니다.

3. 좋은 성능/속도 트레이드오프 — 작은 모델로도 충분한 성능을 발휘합니다.

사용 환경

현재 다음과 같은 Apple Silicon 환경을 보유하고 있습니다.

1. Mac Studio M4 Max 64GB — API 서버로 운영 중

2. MacBook Pro M4 Max 64GB — 개발용으로 사용

양쪽 모두 64GB 유니파이드 메모리로 로컬 LLM 실행에 충분한 사양을 갖추고 있습니다.

Gemma 4 E4B vs Qwen 3.6 35B A3B 혼용 전략

두 가지 모델을 상황에 맞게 혼용해서 사용하기로 했습니다.

Gemma 4 E4B (작은 모델)

속도 우선 작업에 적합 — 코드 자동 완성, 간단한 질문 응답, 빠른 탐색에 사용

리소스 Consumption이 적어 실시간 사용 가능 — macOS에서도 부담 없이 실행 가능

Qwen 3.6 35B A3B (대형 모델)

성능 우선 작업에 적합 — 복잡한 코드 분석, 아키텍처 설계, 심층 리서치에 사용

E4B보다 훨씬 높은 추론 능력 — 필요할 때만 호출하는 방식으로 리소스 효율화

전환 기대 효과

데이터 프라이버시 — 모든 추론이 로컬에서 이루어져 코드와 데이터가 외부로 유출되지 않습니다.

비용 효율 — 구독료 없이 무제한 사용 가능

커스터마이징 — 파인튜닝이나 로컬 환경 최적화가 자유롭습니다.

안정성 — 인터넷 연결이나 API 서버 상태에 의존하지 않습니다.

마무리하며

Copilot Pro+ 사용한도 소진은 불편한 변화였지만, 오히려 로컬 LLM 생태계를 본격적으로 탐색하는 계기가 되었습니다. Gemma 4 E4B와 Qwen 3.6 35B A3B를 상황에 맞게 혼용하는 전략으로, 클라우드 의존도를 낮추면서도 개발 생산성을 유지할 수 있을 것으로 기대합니다.

앞으로 Gemma 모델 활용 경험과 성능 비교 결과를 계속해서 공유하겠습니다. 관심 있으신 분들은 팔로우 부탁드립니다!

2026/06/05

Gemma 4 12B IT 완전 분석: 기존 모델과 무엇이 달라졌나, M4 Max에서는 얼마나 빠른가

솔직히 말하면, 구글이 Gemma 3을 출시했을 때만 해도 '그래, 이 정도면 준수하지'라는 반응이 많았다. 그런데 Gemma 4 12B가 나오고 나서 상황이 좀 달라졌다. 특히 12B 모델이 코딩 벤치마크에서 이전 세대 27B 모델을 훌쩍 뛰어넘는 수치를 보여주니, 이걸 그냥 지나치기가 어렵다.

이번 글에서는 Gemma 4 12B IT(Instruction-Tuned) 모델이 기존 모델들과 구체적으로 어떻게 다른지, 그리고 Apple M4 Max 같은 로컬 하드웨어에서 실제로 어떤 성능이 나오는지를 정리해봤다.


Gemma 4 12B가 기존과 다른 이유

가장 큰 변화: 인코더 없는 통합 멀티모달 아키텍처

Gemma 4 12B의 공식 명칭은 '12B Unified'다. 여기서 Unified가 핵심이다. 기존 Gemma 3나 다른 멀티모달 모델들은 이미지 처리용 비전 인코더(약 550M 파라미터)와 오디오 처리용 인코더를 LLM 앞단에 붙이는 구조였다. 그런데 12B Unified는 이 별도 인코더를 완전히 제거했다.

대신 이미지 패치와 오디오 파형을 가벼운 선형 레이어(Linear Layer)를 통해 직접 LLM의 임베딩 공간으로 투영한다. 결과적으로 텍스트, 이미지, 오디오가 하나의 디코더 전용 트랜스포머 안에서 처리된다. 이 방식의 이점은 두 가지다. 멀티모달 추론 지연시간이 줄어들고, 파인튜닝 시 전체 모델을 한 번에 학습할 수 있다.

하이브리드 어텐션과 256K 컨텍스트 윈도우

아키텍처 내부를 보면 로컬 슬라이딩 윈도우 어텐션과 글로벌 풀 컨텍스트 어텐션을 교차 배치(Interleave)하는 구조를 쓴다. 12B 모델 기준 슬라이딩 윈도우는 1024 토큰이며, 마지막 레이어는 항상 글로벌 어텐션이다. 덕분에 컨텍스트 윈도우가 256K 토큰까지 늘어났다. 이는 Gemma 3 12B의 128K에서 정확히 두 배다. 전체 레이어 수는 48개, 파라미터는 11.95B다.

Per-Layer Embeddings (PLE) — 레이어별 개별 임베딩

기존 트랜스포머는 토큰마다 입력 시 하나의 임베딩 벡터를 부여하고, 이를 모든 레이어가 공유했다. PLE는 각 디코더 레이어에 별도의 작은 임베딩을 추가해 레이어별로 토큰 특정 정보를 조절할 수 있게 한다. 두 가지 신호를 결합한다: 토큰 ID 기반 조회값과, 메인 임베딩의 학습된 프로젝션. 파라미터 오버헤드 대비 레이어별 전문화 효과가 큰 방식이다.

Shared KV Cache — 메모리 절약

모델 후반부 N개 레이어가 자체적인 K-V 프로젝션을 계산하지 않고, 이전 레이어의 K-V 텐서를 재사용하는 방식이다. 품질 저하를 최소화하면서 긴 컨텍스트에서 메모리와 연산을 아낄 수 있다. 특히 온디바이스 실행 시 실질적인 이득을 준다.

시스템 프롬프트 네이티브 지원 + 함수 호출

Gemma 4는 기존 Gemma 3에서 없던 시스템 역할(system role)을 네이티브로 지원한다. 구조화된 대화와 에이전틱 워크플로우 구성이 훨씬 자연스러워졌다. 함수 호출(Function Calling)도 네이티브로 지원해 Tool Use 기반 에이전트 구성에 적합하다.

사고 모드(Thinking Mode) 내장

enable_thinking=True 옵션 하나로 답변 전 내부 추론 과정을 거치는 체인 오브 소트(Chain-of-Thought) 스타일의 추론이 가능하다. 수학, 코딩, 논리 문제에서 추가 성능 향상을 기대할 수 있다. 멀티턴 대화에서는 이전 턴의 thinking 내용을 히스토리에 포함하지 않아야 한다는 점에 유의해야 한다.

벤치마크: 이전 세대 27B를 압도하는 12B

공식 발표된 벤치마크 수치다(Instruction-Tuned 기준). 비교 기준은 Gemma 3 27B(사고 모드 없음)다.

추론 및 지식

MMLU Pro: Gemma 4 12B 77.2% vs Gemma 3 27B 67.6% — 10%p 이상 차이

AIME 2026 수학 올림피아드(도구 없음): 77.5% vs 20.8% — 세 배 이상

GPQA Diamond(박사급 과학 문제): 78.8% vs 42.4% — 거의 두 배

MMMLU(다국어 지식): 83.4% vs 70.7%

BigBench Extra Hard: 53.0% vs 19.3%

코딩

LiveCodeBench v6: 72.0% vs 29.1%

Codeforces ELO: 1659 vs 110 — 사실상 다른 리그

비전

MMMU Pro(멀티모달 이해): 69.1% vs 49.7%

MATH-Vision: 79.7% vs 46.0%

OmniDocBench 1.5(문서 파싱, 낮을수록 우수): 0.164 vs 0.365

오디오 (12B 전용)

CoVoST 음성 번역: 38.5점, FLEURS 음성 인식 오류율: 0.069(중국어 제외)

한 줄 요약: Gemma 4 12B는 거의 모든 벤치마크에서 기존 Gemma 3 27B를 앞선다. 더 작은 모델이 더 큰 구세대 모델을 이기는 것이다.

Apple M4 Max에서 돌리면 어떨까

하드웨어 스펙과 메모리 사정

M4 Max는 Apple Silicon의 현행 최고 사양이다. 메모리 대역폭 546GB/s, 통합 메모리 최대 128GB(기본 36GB 또는 48GB), Neural Engine 38코어, GPU 40코어다. LLM 로컬 실행에서 토큰 생성 속도를 결정하는 핵심은 메모리 대역폭인데, 이 수치는 현존 소비자 하드웨어 중 최상위권이다.

메모리 요구량

BF16 풀 정밀도(원본): 약 24GB. M4 Max 36GB 모델이라면 여유 있게 로드 가능하다.

4비트 양자화(Q4): MLX Community 공식 4비트 양자화 버전 기준 약 11GB(비전 임베더 포함). 16GB 메모리에서도 실행 가능한 수준이다.

8비트 양자화(Q8): 약 12~13GB. 품질과 속도의 균형점으로 M4 Max에 최적화된 선택지다.

추정 토큰 생성 속도

2026년 6월 현재 Gemma 4 12B M4 Max에 대한 공개 벤치마크 데이터는 제한적이다. 다만 M4 Max에서의 유사 크기 모델 MLX 추론 사례와 이전 Gemma 3 12B M3 Max 성능 데이터를 토대로 추정하면:

Q4_K 양자화 기준 약 25~40 토큰/초를 기대할 수 있다. M4 Max는 M3 Max 대비 메모리 대역폭이 약 30% 높아, 전 세대에서 측정된 수치보다 개선될 가능성이 높다.

BF16 풀 정밀도는 10~15 토큰/초 수준으로 예상된다.

주의: mlx-lm 지원 이슈 (2026년 6월 기준)

gemma4_unified 모델 타입이 mlx-lm에서 공식 지원되지 않는 문제가 보고됐다(GitHub ml-explore/mlx-lm PR #1349, 진행 중). 'ValueError: Model type gemma4_unified not supported' 오류가 발생할 수 있다. 해당 PR이 머지되기 전까지는 직접 패치를 적용하거나 llama.cpp 기반 GGUF 버전을 사용하는 것이 낫다.

반면 llama.cpp는 이미 Gemma 4를 지원하며, GGUF 양자화 모델이 65개 이상 공개되어 있다. LM Studio나 Ollama를 통해 즉시 실행 가능하다.

M4 Max 최적 실행 방법 정리

1. llama.cpp / LM Studio: GGUF Q4_K_M 또는 Q8_0 양자화 버전 사용. 현재 가장 빠른 경로.

2. mlx-lm: PR 머지 후 mlx-community/gemma-4-12B-it-4bit 모델 사용. 현재는 패치 필요.

3. Transformers(HuggingFace): pip install -U transformers 최신 버전에서 AutoModelForMultimodalLM으로 로드 가능. MPS 백엔드 지원.

IT(Instruction-Tuned)란 무엇인가

모델 이름 끝의 '-it'는 Instruction-Tuned를 뜻한다. 프리트레이닝된 베이스 모델(google/gemma-4-12B)을 지시사항 따르기 및 대화 형식으로 추가 학습한 버전이다. 일반 사용자 대화, 코딩 어시스턴트, 에이전트 태스크에는 반드시 IT 버전을 써야 한다. 베이스 모델은 프롬프트 텍스트 완성용이지 지시사항 수행용이 아니다.

라이선스

Apache 2.0 라이선스다. 상업적 사용, 수정, 배포 모두 허용된다. Google DeepMind가 저자로, Hugging Face에서 공식 배포 중이다.

결론

Gemma 4 12B IT는 기존 12B급 오픈소스 모델의 벤치마크 기준점을 완전히 갈아엎었다. 이전 세대 27B 모델을 코딩에서는 완전히 압도하고, 수학에서는 비교가 무의미할 정도다. 여기에 256K 컨텍스트, 오디오 포함 네이티브 멀티모달, 인코더 없는 통합 아키텍처까지 더하면 사실상 새로운 카테고리를 열었다고 봐도 과언이 아니다.

M4 Max 환경에서는 Q4 양자화로 약 25~40 토큰/초, Q8으로 10~20 토큰/초 수준을 기대할 수 있다. mlx-lm의 공식 지원이 완료되면 Apple Silicon에서의 실용적 사용성은 더 올라갈 것이다. 당장 사용하고 싶다면 LM Studio + GGUF 조합이 가장 빠른 경로다.

출처: HuggingFace Model Card (google/gemma-4-12B-it) | HuggingFace Blog 'Welcome Gemma 4' (2026.04.02) | mlx-community/gemma-4-12B-it-4bit | GitHub ml-explore/mlx-lm PR #1349

SK하이닉스 ADR 상장 이후 한국 증시 급락의 원인 분석

분류: 증시분석 SK하이닉스 ADR 상장 이후 한국 증시 급락의 원인 분석 지난 7월 10일, SK하이닉스가 미국 나스닥에 미국주식예탁증서(ADR)를 상장했다. 공모가 149달러로 상장한 하이닉스 ADR은 첫 거래일인 13일 기준 약 168달...