几年前的旧款手腕设备能否在完全离线状态下运行现代生成式人工智能?尽管业界普遍认为端侧 AI 需要数千兆字节(GB)的统一内存与专用神经加速器,但软件工程师们刚刚彻底打破了这一固有假设。在一项具有里程碑意义的深度优化成果中,Better Stack 的开发者展示了如何直接在 Apple Watch Series 6 上运行本地大语言模型(LLM)——在无需 iPhone 协助或网络连接的情况下,每秒生成多达 24 个 Token。
考虑到其仅 1GB RAM 的严苛硬件预算以及 watchOS 沙箱机制的限制,在 2020 年发布的穿戴设备上运行本地 AI 似乎令人难以置信。然而,通过部署仅有 9000 万参数的轻量级 Falcon H1 模型并移植 llama.cpp 运行时,工程师彻底规避了云端延迟。这一成果展现了早期 Apple Silicon 芯片中令人惊叹的算力冗余。
将 LLM 部署到 watchOS 面临着极其严峻的底层软件阻碍。苹果原生的 Core ML 框架无法直接编译 Falcon H1 架构,因为该架构依赖于前沿的 Mamba-2 状态空间模型(SSM),而非标准的 Transformer 注意力机制模块。为绕过这一限制,团队深度定制了开源 C++ 项目 llama.cpp 的底层代码,使其能够在 watchOS 编译标志下顺利编译。
此外,Apple Watch 采用的 `arm64_32` 架构尽管具备 64 位计算寄存器,但指针寻址被严格限制在 32 位地址空间内。通过采用高强度的权重量化策略并重构内存分配方案,Falcon H1 在整个 Token 生成深度中始终保持完全平直的内存占用开销。该 90M 模型以每秒 15 到 24 个 Token 的速度生成文本——比第一代 Raspberry Pi 快了近 50 倍。
该原型应用不仅仅是输出纯文本字符串;它还支持处理语音音频提示,并执行本地工具调用(Tool Calls),例如检索本地缓存的维基百科词条或格式化天气数据,全程无需请求任何外部云端 API。尽管更大的 1.35 亿(135M)参数模型会让硬件发热超出理想的温控舒适区间,但 90M 配置的运行表现却极其稳定流畅。
保留优势: 真正保护隐私、零延迟的端侧本地智能,可在完全飞行模式下独立运行,彻底免除订阅费用与云端数据追踪风险。
明确代价: 持续的本地神经网络推理会产生明显的热量积累,并加速紧凑型锂离子电池的电量消耗。
想了解高负载后台运行对设备日常续航的影响?欢迎使用我们的 传感器矩阵分析工具 测试您的配置,或通过我们的 Apple Watch 电池续航预估器 精确测算每日电量消耗。