数世代前のスマートウォッチで、最新の生成AIを完全オフライン動作させることは可能なのでしょうか?デバイス上でのオンデバイスAI実行には数ギガバイトのユニファイドメモリと専用のニューラルアクセラレータが不可欠であるというのが業界の共通認識でしたが、ソフトウェアエンジニアたちがその前提を覆しました。画期的な最適化のマイルストーンとして、Better Stackの開発陣はApple Watch Series 6上でローカル大規模言語モデル(LLM)を直接実行し、iPhoneやインターネット接続なしで毎秒最大24トークンを生成できることを実証しました。
厳格な1GBのRAM制限とwatchOSのサンドボックス制約を考慮すると、2020年に発売されたウェアラブル端末上でローカルAIを動かすことは不可能に思われました。しかし、9000万パラメータの軽量モデルFalcon H1を採用し、llama.cppのランタイムを移植することで、エンジニアたちはクラウド起因のレイテンシを完全に排除しました。この結果は、旧世代のApple Siliconに秘められた驚くべき計算余力を物語っています。
watchOSへのLLMの展開には、極めて厳しいソフトウェア上の障壁がありました。Apple純正のCore MLフレームワークは、標準的なTransformerのアテンションブロックではなく最先端のMamba-2状態空間モデル(SSM)に依存するFalcon H1のアーキテクチャをコンパイルできなかったのです。これを回避するため、開発チームはオープンソースのC++コードであるllama.cppをカスタマイズし、watchOS向けのビルドフラグでコンパイルできるようにしました。
さらに、Apple Watchの`arm64_32`アーキテクチャは、64ビットの演算レジスタを備えながらもポインタアドレッシングが32ビット空間に制限されています。ウェイトの大胆な量子化とメモリ割り当ての効率化を行うことで、Falcon H1はトークン生成の深度にかかわらず、完全にフラットなメモリフットプリントを維持しました。この90Mモデルは毎秒15〜24トークンでテキストを生成し、初代Raspberry Piと比較して約50倍の高速化を実現しています。
このプロトタイプアプリは単にテキスト文字列を出力するだけではありません。音声によるプロンプト入力を処理し、外部クラウドAPIに接続することなく、キャッシュされたWikipedia記事の照会や気象データのフォーマットといったローカルツール呼び出しを実行します。より大規模な1億3500万(135M)パラメータモデルではハードウェアの発熱が許容範囲を超えてしまいましたが、90Mの構成は極めてスムーズに動作しました。
維持されるメリット: サブスクリプション料金やクラウド追跡を排除し、完全な機内モードで動作する真にプライベートで低遅延(ゼロレイテンシ)のオンデバイスインテリジェンス。
明確なトレードオフ: 長時間のローカルニューラル推論は顕著な熱の蓄積を引き起こし、コンパクトなリチウムイオンバッテリーの消耗を加速させます。
負荷の高いバックグラウンド処理がお使いのデバイスの日常的な稼働時間にどう影響するか気になりませんか?当サイトのセンサーマトリックスツールで構成をテストするか、Apple Watchバッテリー推定ツールで日々のバッテリー消費量を計算してみてください。