Kann ein älteres Wearable am Handgelenk moderne generative künstliche Intelligenz vollkommen offline ausführen? Während der Branchenkonsens bisher davon ausging, dass On-Device-KI Gigabytes an Unified Memory und neuronale Beschleuniger voraussetzt, haben Software-Ingenieure diese Annahme nun widerlegt. In einem bahnbrechenden Optimierungsmeilenstein demonstrierten Entwickler von Better Stack, wie ein lokales Large Language Model direkt auf einer Apple Watch Series 6 betrieben werden kann – mit einer Ausgaberate von bis zu 24 Tokens pro Sekunde, ganz ohne iPhone oder Internetverbindung.
Lokale KI auf einem Wearable auszuführen, das ursprünglich im Jahr 2020 auf den Markt kam, klingt angesichts des knappen Budgets von 1 GB RAM und den Sandbox-Restriktionen von watchOS schier unmöglich. Durch den Einsatz des leichtgewichtigen, 90 Millionen Parameter umfassenden Modells Falcon H1 und die Portierung der llama.cpp-Laufzeitumgebung umgingen die Ingenieure die Cloud-Latenz jedoch vollständig. Die Ergebnisse offenbaren überraschende Leistungsreserven in älteren Apple Silicon-Chips.
Die Bereitstellung eines LLMs unter watchOS brachte erhebliche Software-Hürden mit sich. Apples natives Core ML-Framework konnte die Architektur von Falcon H1 nicht kompilieren, da diese auf einem modernen Mamba-2 State Space Model (SSM) statt auf Standard-Transformer-Attention-Blöcken aufbaut. Um dies zu lösen, passte das Team den Open-Source-C++-Code von llama.cpp an, damit dieser mit den Build-Flags von watchOS kompiliert werden konnte.
Darüber hinaus beschränkt die `arm64_32`-Architektur der Apple Watch die Pointer-Adressierung auf einen 32-Bit-Adressraum, obwohl 64-Bit-Rechenregister vorliegen. Durch aggressive Quantisierung der Gewichte und straffe Speicherallokation hielt Falcon H1 einen absolut flachen Speicher-Footprint aufrecht – unabhängig von der Tiefe der Token-Generierung. Das 90M-Modell generierte Text mit 15 bis 24 Tokens pro Sekunde – fast 50-mal schneller als ein Raspberry Pi der ersten Generation.
Die Prototyp-Anwendung gibt nicht nur Text aus; sie verarbeitet gesprochene Audio-Prompts und führt lokale Tool-Calls aus – beispielsweise das Abfragen zwischengespeicherter Wikipedia-Einträge oder das Formatieren von Wetterdaten, ohne externe Cloud-APIs aufzurufen. Während größere Modelle mit 135 Millionen Parametern die Hardware über thermisch komfortable Grenzen hinaus belasteten, lief die 90M-Konfiguration reibungslos.
Preserved Benefit: Echte Privatsphäre und latenzfreie On-Device-Intelligenz im vollständigen Flugmodus – ganz ohne Abonnementgebühren oder Cloud-Tracking.
Explicit Trade-Off: Anhaltende lokale neuronale Inferenz erzeugt spürbare Wärmeentwicklung und beschleunigt die Entladung kompakter Lithium-Ionen-Akkus.
Möchten Sie wissen, wie sich intensive Hintergrund-Workloads auf die tägliche Akkulaufzeit Ihres Geräts auswirken? Testen Sie Ihr Setup mit unserem sensor matrix tool oder berechnen Sie den täglichen Akkuverbrauch mit unserem Apple Watch battery estimator.