2026년 09월 27일 Stories worth reading. Perspectives worth sharing.
퀄컴이 스마트폰에서 30B 모델을 돌린다는데, 실제로 얼마나 쓸 만할까
AI 도구 활용

퀄컴이 스마트폰에서 30B 모델을 돌린다는데, 실제로 얼마나 쓸 만할까

Caston 9월 23, 2026 1 min read

퀄컴이 새 스냅드래곤 8 엘리트 칩에서 30B 파라미터 모델을 실행한다고 발표하면서, 온디바이스 LLM이 정말 실용적인 도구가 될 수 있는가에 대한 논의가 다시 불붙었다. 이 발표는 단순히 숫자 경쟁을 넘어서, 스마트폰 안에 AI 모델을 그대로 넣어 클라우드 없이도 작동시킬 수 있다는 가능성을 보여준다. 그러나 30B라는 수치가 실제로 어떤 의미를 가지는지, 그리고 일상에서 어떤 체감을 줄 수 있는지를 하나씩 살펴보겠다.

퀄컴은 2026년 9월 22일 Snapdragon Summit에서 표준 버전과 Extreme 버전 두 가지 칩을 공개했다. Extreme 버전은 2nm 공정에 기반하며, 공유 메모리를 표준 대비 50% 늘리고 Hexagon NPU를 에이전틱 AI 워크로드에 최적화했다. 이 정도의 하드웨어 진전이 이뤄진 것은 그동안 모바일 기기의 메모리 대역폭과 전력 소모가 온디바이스 LLM의 최대 장벽으로 작용했기 때문이다. 과거에는 7B 이하 소형 모델만 간신히 구동할 수 있었는데, 이제는 더 큰 모델을 시도할 수 있는 기반이 마련된 것이다.

온디바이스 LLM이 어려웠던 이유

온디바이스에서 대규모 언어 모델을 돌리는 데는 세 가지 주요 장애물이 있었다. 첫째, 모델 파라미터를 모두 메모리에 올려야 하는데, 스마트폰의 LPDDR5X 메모리는 데스크톱 GPU에 비해 대역폭이 현저히 낮아 추론 속도가 크게 떨어진다. 둘째, 지속적인 계산은 전력 소모를 급격히 늘려 배터리 소모가 심해졌다. 예를 들어, 7B 모델을 20회 추론할 때 배터리 5~10%가 소모된다는 실측 데이터가 있다. 셋째, 열 스로틀링(기기가 뜨거워지면 성능을 스스로 낮추는 현상) 때문에 장시간 고부하 작업을 유지하기 어려웠다. 이러한 문제들은 클라우드 추론에 비해 속도와 효율성 면에서 경쟁력을 잃게 만들었다.

일상에서 인터넷이 닿지 않는 환경이나 개인 정보를 외부에 보내고 싶지 않은 상황이라면, 온디바이스 LLM은 실질적인 대안이 될 수 있다. 비행기 안에서의 오프라인 번역, 민감한 문서 요약, 항상 켜져 있는 경량 어시스턴트처럼 네트워크 의존도를 줄일 수 있는 시나리오가 구체적으로 나타난다. 또한, API 호출 비용이 반복적으로 발생하는 자동화 파이프라인에서는 로컬 모델이 장기적으로 비용 절감 효과를 가져올 수 있다. 따라서 이번 칩이 제공하는 가능성은 단순히 기술적 진보를 넘어서, 개인 사용자의 프라이버시와 편의성에 직접적인 영향을 줄 수 있다.

30B라는 숫자의 함정

퀄컴이 말하는 30B는 밀집형 파라미터 수가 아니라 Mixture‑of‑Experts(MoE) 방식이다. MoE 모델은 총 300억 개의 파라미터를 가지고 있지만, 실제로는 입력 토큰 하나를 처리할 때 전문가 그룹 중 일부만 활성화된다. 예를 들어, 30B 모델이 60개의 전문가로 구성되어 있고, 각 토큰당 2개의 전문가만 선택된다면 활성화되는 파라미터는 약 10억 수준에 불과하다. 이는 같은 30B 규모의 밀집형 모델과 비교했을 때 실제 연산량이 훨씬 적다는 의미이며, 따라서 “30B”라는 숫자에 현혹되지 말고 활성화되는 규모를 보는 것이 중요하다. 회사에 비유하면, 직원이 30명인 곳에서 회의에는 항상 3명만 참석한다고 생각하면 된다. 전체 인원은 많지만 실제 작업에 투입되는 인원은 훨씬 적으니, 자원 효율적인 구조라고 할 수 있다.

지금까지 공개된 성능 수치

항목현황
토큰 처리 속도소형 모델(7B 이하) 기준 iPhone 17 Pro에서 40+ 토큰/초; 30B MoE 공식 수치는 아직 미공개
배터리 소모추론 중 8~10W 소비, 소형 모델 20회 추론에 배터리 5~10% 감소
컨텍스트 길이32K 토큰 (KV 캐시 가속 기준) — GPT‑4o의 128K 대비 약 4분의 1
클라우드 대비 속도클라우드는 수백 토큰/초 가능; 온디바이스는 현재 약 10~40배 느림

위 표는 TechCrunch, HotHardware, XDA‑Developers, 그리고 v‑chandra.github.io 와 Artificial Analysis 에서 종합한 정보를 바탕으로 구성했다. 아직 퀄컴이 30B MoE 모델의 정확한 토큰 처리 속도나 열 스로틀링 데이터를 공개하지 않았기 때문에, 해당 항목은 “아직 확인되지 않았다”고 명시했다.

쓸 만한 곳과 아직 무리인 곳

쓸 만한 경우

  • 오프라인 번역: 비행기나 지하철 같은 환경에서 네트워크 없이도 문장 수준 번역을 수행
  • 프라이버시 민감 문서 요약: 의료 기록이나 법적 문서를 외부 서버에 업로드하지 않고 로컬에서 요약
  • 짧은 컨텍스트 코드 자동완성: 현재 파일 내부 정도 범위에서 변수명이나 함수 호출 제안
  • 항상 켜져 있는 경량 어시스턴트: 간단한 음성 명령이나 알림 설정을 지속적으로 처리

아직 무리인 경우

  • 긴 멀티턴 대화: 컨텍스트가 32K를 넘기면 이전 대화 내용이 잘려 잃어버릴 위험
  • 복잡한 추론·코딩: 여러 단계를 거쳐야 하는 문제 해결이나 대규모 디버깅 작업
  • 128K 이상 긴 문서 처리: 예를 들어 전체 논문이나 법률 문서를 한 번에 분석하는 작업
  • 최신 지식 요구 작업: 실시간 주식 시황이나 최신 의료 가이드처럼 최신 정보가 필수인 경우

내 폰에서 체험해 보기

지금 당장 퀄컴의 30B MoE 모델을 돌릴 수 있는 폰은 출시되지 않았으나, 기존에 출시된 기기로도 작은 규모의 온디바이스 LLM을 경험해 볼 수 있다.

  1. 앱 준비 – 구글이 만든 무료 앱 Google AI Edge Gallery를 설치한다. Google Play와 App Store 모두에 있고, 인터넷 없이 폰 안에서 Gemma 4 같은 소형 모델을 돌린다. 아이폰이라면 PocketPal AI도 선택지다.
  2. 모델 선택 – 앱의 모델 목록에서 기기 사양에 맞는 것을 고른다. 중급 폰이라면 Gemma 4 E2B, 최신 플래그십이라면 E4B가 기준이다.
  3. 테스트 시나리오 – 비행기 모드를 켠 상태에서 AI Chat에 영어 문장을 넣고 한국어로 번역해 달라고 해본다. 끝나면 설정 → 배터리 → 앱 사용량에서 배터리 소모를 확인할 수 있다.
  4. 결과 비교 – 같은 문장을 온라인 번역 서비스(예: Google Translate)와 비교해 품질과 속도를 체감해 본다. 오프라인 모델은 네트워크 지연이 없지만, 모델 크기에 따라 응답이 다소 느릴 수 있다.
  5. 배터리 측정 – 10회 이상 번역을 반복한 뒤 배터리 소모율을 계산해 보면, 앞서 언급한 5~10% 범위에 드는지 확인할 수 있다.

이 과정을 통해 현재 스마트폰이 어느 정도 수준의 온디바이스 LLM을 처리할 수 있는지를 직접 느껴볼 수 있다. 앞으로 퀄컴의 Extreme 칩이 탑재된 폰이 나오면 같은 절차로 더 큰 모델을 테스트해 볼 수 있다.

퀄컴이 내놓은 30B MoE 모델은 단순히 숫자 경쟁을 넘어서, 모바일 기기에 맞는 효율적인 설계를 보여주는 좋은 예시다. 아직 공개되지 않은 토큰 속도나 열 데이터 때문에 성능을 단정하기는 어렵지만, 오프라인 번역이나 프라이버시 민감한 요약처럼 네트워크에 의존하지 않아야 하는 상황에서는 이미 실용적인 가치를 발휘하기 시작했다. 앞으로 2년 뒤 폰을 교체할 때 그 기기 안에 이런 구조가 기본으로 탑재되어 있을 것을 기대하며, 오늘 들고 있는 폰에서도 가능한 작은 실험부터 시작해 보는 것이 좋겠다.

TechCrunch — Qualcomm launches two new smartphone chips with emphasis on AI
HotHardware — Qualcomm’s NPU Upgrade Unlocks Massive 30B Parameter AI Models For Next-Gen Phones
XDA-Developers — Qualcomm’s new Snapdragon 8 Elite Gen 6 chip lineup
v-chandra.github.io — On-Device LLMs: State of the Union, 2026
Artificial Analysis — Intelligence at pocket scale: Benchmarking small models and mobile phones

함께 읽기

1 Comment

  1. […] 퀄컴이 스마트폰에서 30B 모델을 돌린다는데, 실제로 얼마나 쓸 만할까 […]

    답글

Leave a Comment