Czy starsze urządzenia naręczne mogą uruchamiać nowoczesną generatywną sztuczną inteligencję całkowicie offline? Choć branżowy konsensus zakładał, że sztuczna inteligencja uruchamiana bezpośrednio na urządzeniu wymaga gigabajtów zunifikowanej pamięci i akceleratorów neuronowych, inżynierowie oprogramowania właśnie obalili to założenie. W ramach przełomowego kroku w dziedzinie optymalizacji programiści z Better Stack zademonstrowali, jak uruchomić lokalny duży model językowy bezpośrednio na zegarku Apple Watch Series 6 — generując do 24 tokenów na sekundę bez udziału iPhone'a czy połączenia z Internetem.
Uruchomienie lokalnej sztucznej inteligencji na urządzeniu ubieralnym wprowadzonym na rynek w 2020 roku wydaje się mało prawdopodobne ze względu na ścisły limit 1 GB pamięci RAM i ograniczenia piaskownicy (sandbox) systemu watchOS. Jednak dzięki wdrożeniu lekkiego modelu Falcon H1 o 90 milionach parametrów oraz przeportowaniu środowiska wykonawczego llama.cpp, inżynierowie całkowicie wyeliminowali opóźnienia chmury. Wyniki ujawniają zaskakujący zapas mocy obliczeniowej w starszych układach Apple Silicon.
Wdrożenie modelu LLM w systemie watchOS napotkało poważne przeszkody programowe. Natywny framework Core ML firmy Apple nie był w stanie skompilować architektury Falcon H1, która bazuje na nowatorskim modelu przestrzeni stanów Mamba-2 (SSM) zamiast na standardowych blokach atencji transformerów. Aby to obejść, zespół dostosował kod open-source C++ llama.cpp, umożliwiając kompilację pod flagami konfiguracyjnymi watchOS.
Co więcej, architektura `arm64_32` zegarka Apple Watch ogranicza adresowanie wskaźników do 32-bitowych przestrzeni pomimo posiadania 64-bitowych rejestrów obliczeniowych. Dzięki agresywnej kwantyzacji wag i optymalizacji alokacji pamięci model Falcon H1 zachował całkowicie stałe zużycie pamięci, niezależnie od głębokości generowania tokenów. Model 90M generował tekst z prędkością od 15 do 24 tokenów na sekundę — prawie 50 razy szybciej niż Raspberry Pi pierwszej generacji.
Prototypowa aplikacja nie ogranicza się wyłącznie do wypisywania ciągów tekstowych; przetwarza ona polecenia głosowe i wykonuje lokalne wywołania narzędzi (tool calls), takie jak przeszukiwanie zbuforowanych wpisów z Wikipedii czy formatowanie danych pogodowych bez łączenia się z zewnętrznymi interfejsami API w chmurze. Podczas gdy większe modele o 135 milionach parametrów obciążały sprzęt ponad akceptowalne granice termiczne, konfiguracja 90M działała stabilnie i płynnie.
Zachowana korzyść: Prawdziwie prywatna inteligencja na urządzeniu działająca z zerowym opóźnieniem w pełnym trybie samolotowym, eliminująca opłaty subskrypcyjne i śledzenie w chmurze.
Wyraźny kompromis: Ciągłe lokalne wnioskowanie neuronowe powoduje zauważalne nagrzewanie się urządzenia i przyspiesza rozładowywanie baterii w kompaktowych ogniwach litowo-jonowych.
Chcesz dowiedzieć się, jak intensywne zadania w tle wpływają na codzienny czas pracy Twojego urządzenia? Przetestuj swoją konfigurację za pomocą naszego narzędzia macierzy czujników lub oblicz dzienne zużycie energii za pomocą naszego kalkulatora baterii Apple Watch.