기술 신호2026-05-12

로컬 LLM 시대가 열렸다

M5 맥에서 70B가 돈다

Apple M5, Gemma 4, Qwen 3.6, Llama 4. 광고·콘텐츠 제작자에게 의미하는 건 클라우드 비용과 데이터 의존에서 벗어날 수 있다는 것.

2026년 5월 시점에 "로컬에서 돌릴 수 있는 모델이 쓸 만한가" 라는 질문은 끝났다. 답은 그렇다.

무엇이 가능해졌나

하드웨어

  • Apple M5 (2026-03-11 출시): MLX 프레임워크로 70B 모델을 노트북에서 인터랙티브 속도. 30B MoE 모델은 TTFT 3초 미만. M5 Max 는 M4 Max 대비 토큰/초 +28%.
  • RTX 4090 1장 (24GB): 4-bit 양자화로 Llama 3.3 70B / Qwen 3.6-35B / Gemma 4 가 daily driver.
  • 64GB 통합 메모리 이상: 70B 풀 모델을 그냥 쓴다.

모델

모델 규모 속도 (M5 Max / RTX 4090) 강점
Gemma 4 E2B 2B (소형) ~158 tok/s 가장 빠름, 16GB RAM
Gemma 4 26B-A4B 26B MoE / 4B active ~50 tok/s near-frontier reasoning
Qwen 3.6-35B-A3B 35B MoE / 3.3B active 55~120 tok/s SWE-bench 73.4%, 한국어 자연스러움
Llama 4 Scout MoE RTX 4090 1장 "GPT-4 클래스 in modest hardware"
DeepSeek Nemotron Cascade 2 30B ~54 tok/s (RTX 4060 Ti) 추론 특화

한국 신호

LG U+ 가 LG AI연구원과 EXAONE 3.5 기반 온디바이스 sLM 을 발표했다. 전력 78% 감소, 모델 크기 82% 감소. CES 2026 발표 기준으로 3B~8B 파라미터가 온디바이스 표준으로 자리잡았다.

비용 차이

운영 형태 10,000 쿼리/일 비용
클라우드 LLM API (GPT-5 / Claude Opus 4.7) $5,000 ~ $50,000 / 월
자체 호스팅 SLM 엔드포인트 $500 ~ $2,000 / 월
자기 노트북에서 로컬 전력비만 (≈$30 / 월)

토큰 단위로 보면 Mistral 7B 추론 ≈ $0.0004 / 1K tokens. GPT-4 클래스 ≈ $0.09 / 1K tokens. 약 225배 차이. 광고 카피 A/B 변형을 100개 만들 거냐 10,000개 만들 거냐의 결정이 비용이 아니라 검수 시간이 된다.

광고·콘텐츠 작업에서 의미하는 것

1. 민감 데이터를 클라우드에 안 보내도 된다

  • 고객 DB, 매출 데이터, 미공개 캠페인 콘셉트, 경쟁사 분석 노트, 영업 비밀이 들어간 카피.
  • 그동안 "ChatGPT 에 붙여넣어도 되나" 망설이던 자료를 그냥 로컬 모델에 던진다.
  • GDPR / 개인정보보호법 / 광고주 NDA. 컴플라이언스 부담이 줄어든다.

2. 변형 비용이 0 에 가까워진다

  • 한 콘셉트에서 카피 1만 개 변형 = 클라우드면 수십~수백 달러, 로컬은 무료.
  • A/B 가 아니라 A/B/C/.../Z. 메타 광고의 풀 자동화 흐름과 정확히 맞물린다. 평균에서 벗어난 1%를 찾으려면 변형 양이 클수록 좋다.

3. 콘텐츠 정책 회피 (합법 범위 내)

  • 클라우드 모델이 거절하는 톤이 있다: 술, 금융, 의료, 다이어트, 일부 성인용 제품 광고.
  • 광고가 합법이고 브랜드도 합법인데 모델이 거절하는 경우가 흔하다.
  • 로컬 오픈웨이트 모델 (Llama, Qwen, Gemma) 은 이런 제약이 훨씬 느슨하다.

4. 오프라인 / 격리 환경에서 작동

  • 촬영 현장, 비행기, 보안 시설, 클라우드 사용이 금지된 대기업/공공 프로젝트.
  • 인터넷 없이도 카피 생성·이미지 리터치·자막 생성·번역이 돌아간다.

한계: 아직 클라우드가 필요한 영역

  • 최상위 품질: GPT-5, Claude Opus 4.7, Gemini Ultra 는 여전히 클라우드.
  • 영상 생성: Veo 4 / Runway Gen-4.5 / Kling 은 클라우드. 로컬 영상 생성은 아직 너무 느리거나 너무 거칠다.
  • 최상위 이미지: Midjourney v8 은 클라우드. 단 Flux 2 Pro / Stable Diffusion XL 은 로컬에서 충분히 광고용 품질 이 나온다.
  • 에이전트·툴콜링: 멀티 스텝 자동화는 아직 frontier 모델이 안정적이다.

AX 패턴: 하이브리드 스택

전부 로컬, 전부 클라우드 둘 다 틀린 답이다. 광고·콘텐츠 제작자에게 권하는 분배:

[로컬]
  - 카피 변형 (1만 개 단위)
  - 민감 데이터가 들어간 분석·요약
  - 이미지 리터치·배경 제거·업스케일 (Flux 로컬)
  - 자막·번역·SNS 톤 변환

[클라우드]
  - 콘셉트 단계의 사고 (Claude / GPT-5)
  - 영상 생성 (Veo 4, Runway, Kling)
  - 최상위 키 비주얼 (Midjourney v8)
  - 멀티 스텝 에이전트

이렇게 나누면 클라우드 비용은 1/10 로 줄고, 작업 속도와 데이터 안전성은 둘 다 올라간다.

anyAX 관점

"AI 광고 sameness 노트" 에서 86% 의 마케터가 경쟁사와 비슷한 결과물을 본다고 했다. 평준화의 원인 하나는 모두가 같은 클라우드 모델에 비슷한 프롬프트를 넣는 것이다.

로컬 LLM 시대가 여는 가능성 중 가장 흥미로운 건 자기 데이터로 자기 모델 톤을 만드는 것이다. 자사 브랜드 카피 5년치, 고객 인터뷰 200개, 매출 잘 나온 SNS 글 모음으로 파인튜닝한 7B 모델. 이건 클라우드 API 로는 비용·정책상 불가능했다. 로컬에서는 노트북 한 대로 가능하다.

평준화의 시대에서 차별화의 가장 큰 자산은 자기 데이터다. 로컬 LLM 시대가 그 자산을 처음으로 손에 쥘 수 있게 했다.


참고