로컬 LLM 시대가 열렸다
M5 맥에서 70B가 돈다
Apple M5, Gemma 4, Qwen 3.6, Llama 4. 광고·콘텐츠 제작자에게 의미하는 건 클라우드 비용과 데이터 의존에서 벗어날 수 있다는 것.
2026년 5월 시점에 "로컬에서 돌릴 수 있는 모델이 쓸 만한가" 라는 질문은 끝났다. 답은 그렇다.
무엇이 가능해졌나
하드웨어
- Apple M5 (2026-03-11 출시): MLX 프레임워크로 70B 모델을 노트북에서 인터랙티브 속도. 30B MoE 모델은 TTFT 3초 미만. M5 Max 는 M4 Max 대비 토큰/초 +28%.
- RTX 4090 1장 (24GB): 4-bit 양자화로 Llama 3.3 70B / Qwen 3.6-35B / Gemma 4 가 daily driver.
- 64GB 통합 메모리 이상: 70B 풀 모델을 그냥 쓴다.
모델
| 모델 | 규모 | 속도 (M5 Max / RTX 4090) | 강점 |
|---|---|---|---|
| Gemma 4 E2B | 2B (소형) | ~158 tok/s | 가장 빠름, 16GB RAM |
| Gemma 4 26B-A4B | 26B MoE / 4B active | ~50 tok/s | near-frontier reasoning |
| Qwen 3.6-35B-A3B | 35B MoE / 3.3B active | 55~120 tok/s | SWE-bench 73.4%, 한국어 자연스러움 |
| Llama 4 Scout | MoE | RTX 4090 1장 | "GPT-4 클래스 in modest hardware" |
| DeepSeek Nemotron Cascade 2 | 30B | ~54 tok/s (RTX 4060 Ti) | 추론 특화 |
한국 신호
LG U+ 가 LG AI연구원과 EXAONE 3.5 기반 온디바이스 sLM 을 발표했다. 전력 78% 감소, 모델 크기 82% 감소. CES 2026 발표 기준으로 3B~8B 파라미터가 온디바이스 표준으로 자리잡았다.
비용 차이
| 운영 형태 | 10,000 쿼리/일 비용 |
|---|---|
| 클라우드 LLM API (GPT-5 / Claude Opus 4.7) | $5,000 ~ $50,000 / 월 |
| 자체 호스팅 SLM 엔드포인트 | $500 ~ $2,000 / 월 |
| 자기 노트북에서 로컬 | 전력비만 (≈$30 / 월) |
토큰 단위로 보면 Mistral 7B 추론 ≈ $0.0004 / 1K tokens. GPT-4 클래스 ≈ $0.09 / 1K tokens. 약 225배 차이. 광고 카피 A/B 변형을 100개 만들 거냐 10,000개 만들 거냐의 결정이 비용이 아니라 검수 시간이 된다.
광고·콘텐츠 작업에서 의미하는 것
1. 민감 데이터를 클라우드에 안 보내도 된다
- 고객 DB, 매출 데이터, 미공개 캠페인 콘셉트, 경쟁사 분석 노트, 영업 비밀이 들어간 카피.
- 그동안 "ChatGPT 에 붙여넣어도 되나" 망설이던 자료를 그냥 로컬 모델에 던진다.
- GDPR / 개인정보보호법 / 광고주 NDA. 컴플라이언스 부담이 줄어든다.
2. 변형 비용이 0 에 가까워진다
- 한 콘셉트에서 카피 1만 개 변형 = 클라우드면 수십~수백 달러, 로컬은 무료.
- A/B 가 아니라 A/B/C/.../Z. 메타 광고의 풀 자동화 흐름과 정확히 맞물린다. 평균에서 벗어난 1%를 찾으려면 변형 양이 클수록 좋다.
3. 콘텐츠 정책 회피 (합법 범위 내)
- 클라우드 모델이 거절하는 톤이 있다: 술, 금융, 의료, 다이어트, 일부 성인용 제품 광고.
- 광고가 합법이고 브랜드도 합법인데 모델이 거절하는 경우가 흔하다.
- 로컬 오픈웨이트 모델 (Llama, Qwen, Gemma) 은 이런 제약이 훨씬 느슨하다.
4. 오프라인 / 격리 환경에서 작동
- 촬영 현장, 비행기, 보안 시설, 클라우드 사용이 금지된 대기업/공공 프로젝트.
- 인터넷 없이도 카피 생성·이미지 리터치·자막 생성·번역이 돌아간다.
한계: 아직 클라우드가 필요한 영역
- 최상위 품질: GPT-5, Claude Opus 4.7, Gemini Ultra 는 여전히 클라우드.
- 영상 생성: Veo 4 / Runway Gen-4.5 / Kling 은 클라우드. 로컬 영상 생성은 아직 너무 느리거나 너무 거칠다.
- 최상위 이미지: Midjourney v8 은 클라우드. 단 Flux 2 Pro / Stable Diffusion XL 은 로컬에서 충분히 광고용 품질 이 나온다.
- 에이전트·툴콜링: 멀티 스텝 자동화는 아직 frontier 모델이 안정적이다.
AX 패턴: 하이브리드 스택
전부 로컬, 전부 클라우드 둘 다 틀린 답이다. 광고·콘텐츠 제작자에게 권하는 분배:
[로컬]
- 카피 변형 (1만 개 단위)
- 민감 데이터가 들어간 분석·요약
- 이미지 리터치·배경 제거·업스케일 (Flux 로컬)
- 자막·번역·SNS 톤 변환
[클라우드]
- 콘셉트 단계의 사고 (Claude / GPT-5)
- 영상 생성 (Veo 4, Runway, Kling)
- 최상위 키 비주얼 (Midjourney v8)
- 멀티 스텝 에이전트
이렇게 나누면 클라우드 비용은 1/10 로 줄고, 작업 속도와 데이터 안전성은 둘 다 올라간다.
anyAX 관점
"AI 광고 sameness 노트" 에서 86% 의 마케터가 경쟁사와 비슷한 결과물을 본다고 했다. 평준화의 원인 하나는 모두가 같은 클라우드 모델에 비슷한 프롬프트를 넣는 것이다.
로컬 LLM 시대가 여는 가능성 중 가장 흥미로운 건 자기 데이터로 자기 모델 톤을 만드는 것이다. 자사 브랜드 카피 5년치, 고객 인터뷰 200개, 매출 잘 나온 SNS 글 모음으로 파인튜닝한 7B 모델. 이건 클라우드 API 로는 비용·정책상 불가능했다. 로컬에서는 노트북 한 대로 가능하다.
평준화의 시대에서 차별화의 가장 큰 자산은 자기 데이터다. 로컬 LLM 시대가 그 자산을 처음으로 손에 쥘 수 있게 했다.