출시된 지 오래된 손목 웨어러블 기기가 최신 생성형 인공지능을 완전히 오프라인으로 구동할 수 있을까요? 업계에서는 기기 내(on-device) AI를 실행하려면 수 기가바이트의 통합 메모리와 신경망 가속기(NPU)가 필수적이라는 것이 정설이었으나, 소프트웨어 엔지니어들이 그 상식을 깨뜨렸습니다. 획기적인 최적화 이정표를 세운 Better Stack의 개발자들은 Apple Watch Series 6에서 직접 로컬 대형 언어 모델(LLM)을 실행하여 iPhone이나 인터넷 연결 없이도 초당 최대 24토큰을 생성하는 데 성공했습니다.
엄격한 1GB RAM 제한과 watchOS 샌드박스 제약을 고려할 때, 2020년에 출시된 웨어러블에서 로컬 AI를 구동하는 것은 불가능해 보였습니다. 하지만 가벼운 9,000만 개 파라미터(90M)의 Falcon H1 모델을 배포하고 llama.cpp 런타임을 이식함으로써 엔지니어들은 클라우드 지연 시간을 완전히 없앴습니다. 이번 결과는 구형 Apple Silicon에 숨겨진 놀라운 연산 여유 공간을 입증합니다.
LLM을 watchOS에 배포하는 과정에는 심각한 소프트웨어 장벽이 있었습니다. Apple의 네이티브 Core ML 프레임워크는 표준 트랜스포머 어텐션 블록 대신 최첨단 Mamba-2 상태 공간 모델(SSM)을 사용하는 Falcon H1 아키텍처를 컴파일하지 못했습니다. 이를 우회하기 위해 개발팀은 오픈 소스 C++ llama.cpp 코드를 watchOS 빌드 플래그 환경에서 컴파일되도록 맞춤 수정했습니다.
또한 Apple Watch의 `arm64_32` 아키텍처는 64비트 연산 레지스터를 갖추고 있음에도 포인터 주소 지정을 32비트 공간으로 제한합니다. 가중치를 적극적으로 양자화하고 메모리 할당을 효율화함으로써, Falcon H1은 토큰 생성 길이에 관계없이 완벽히 일정한 메모리 점유율을 유지했습니다. 이 90M 모델은 초당 15~24토큰의 속도로 텍스트를 생성했으며, 이는 1세대 Raspberry Pi보다 거의 50배 빠른 속도입니다.
이 프로토타입 애플리케이션은 단순히 텍스트 문자열만 출력하는 데 그치지 않고, 음성 오디오 프롬프트를 처리하며 외부 클라우드 API를 호출하지 않고 캐시된 위키백과 항목을 조회하거나 날씨 데이터를 서식화하는 등의 로컬 도구 호출(tool call)을 실행합니다. 더 큰 1억 3,500만(135M) 파라미터 모델은 하드웨어의 허용 발열 한계를 넘어섰지만, 90M 구성은 매끄럽게 동작했습니다.
보존된 이점(Preserved Benefit): 완전한 비행기 탑승 모드에서도 동작하는 진정한 프라이버시 보호 및 무지연 온디바이스 지능으로, 구독료와 클라우드 추적을 배제합니다.
명시적 트레이드오프(Explicit Trade-Off): 지속적인 로컬 신경망 추론은 콤팩트한 리튬 이온 배터리 셀에서 눈에 띄는 발열을 발생시키고 배터리 소모를 가속화합니다.
집중적인 백그라운드 워크로드가 기기의 일상 사용 시간에 어떤 영향을 미치는지 궁금하신가요? 당사의 센서 매트릭스 도구로 환경을 테스트하거나 Apple Watch 배터리 계산기를 통해 일일 배터리 소모량을 확인해 보세요.