Tasarım Liam Vance • 2026-09-22

Geliştiriciler Apple Watch üzerinde Yerel LLM Çalıştırdı: Series 6 üzerinde Saniyede 24 Token

Eski nesil bir akıllı saat, modern üretken yapay zekayı tamamen çevrimdışı olarak çalıştırabilir mi? Sektördeki genel kanı, cihaz içi yapay zekanın gigabaytlarca birleşik bellek ve nöral hızlandırıcılar gerektirdiği yönündeyken, yazılım mühendisleri bu varsayımı yerle bir etti. Çığır açan bir optimizasyon başarısına imza atan Better Stack geliştiricileri, yerel bir büyük dil modelini doğrudan Apple Watch Series 6 üzerinde çalıştırmayı başardı; iPhone veya internet bağlantısı olmaksızın saniyede 24 tokene kadar üretim sağlandı.

2020 yılında piyasaya sürülen bir giyilebilir cihazda, 1 GB RAM'lik sıkı bütçe ve watchOS korumalı alan (sandbox) kısıtlamaları göz önüne alındığında yerel yapay zeka çalıştırmak imkansız görünüyordu. Ancak hafif 90 milyon parametreli Falcon H1 modelini devreye alarak ve llama.cpp çalışma zamanını uyarlayarak mühendisler bulut gecikmesini tamamen ortadan kaldırdı. Sonuçlar, eski nesil Apple Silicon çiplerinde şaşırtıcı bir işlem kapasitesi payı bulunduğunu gözler önüne seriyor.

32-Bit Bellek ve Core ML Engellerini Aşmak

Bir LLM'in watchOS üzerine konuşlandırılması ciddi yazılım engelleri doğurdu. Apple'ın yerel Core ML çerçevesi, standart transformer dikkat blokları yerine son teknoloji Mamba-2 Durum Uzayı Modelini (SSM) temel alan Falcon H1 mimarisini derleyemedi. Bu sorunu aşmak için ekip, açık kaynaklı C++ llama.cpp kodunu watchOS derleme bayrakları altında derlenecek şekilde özelleştirdi.

Ayrıca Apple Watch'un `arm64_32` mimarisi, 64-bit hesaplama kayıtlarına sahip olmasına rağmen işaretçi adreslemeyi 32-bit alanlarla sınırlar. Ağırlıkların agresif bir şekilde kuantize edilmesi ve bellek tahsisinin sadeleştirilmesi sayesinde Falcon H1, token üretim derinliğinden bağımsız olarak tamamen sabit bir bellek ayak izi korudu. 90M model, saniyede 15 ila 24 token hızında metin üretti; bu da birinci nesil bir Raspberry Pi'den neredeyse 50 kat daha hızlıdır.

Sesli Komutlar, Çevrimdışı Araçlar ve Pil Ödünleşimi

Prototip uygulama yalnızca metin dizeleri üretmekle kalmıyor; sesli komutları işliyor ve harici bulut API'lerini aramadan önbelleğe alınmış Wikipedia kayıtlarını sorgulamak veya hava durumu verilerini biçimlendirmek gibi yerel araç çağrılarını yürütüyor. Daha büyük 135M parametreli modeller donanımı konforlu termal sınırların ötesine zorlarken, 90M yapılandırması sorunsuz çalıştı.

Korunan Avantaj (Preserved Benefit): Tam uçak modunda çalışan, abonelik ücretlerini ve bulut takibini ortadan kaldıran, tamamen gizli ve sıfır gecikmeli cihaz içi yapay zeka.

Belirgin Ödünleşim (Explicit Trade-Off): Sürekli yerel nöral çıkarım, belirgin bir termal birikim yaratır ve kompakt lityum-iyon hücrelerde pil tüketimini hızlandırır.

Yoğun arka plan iş yüklerinin cihazınızın günlük çalışma süresini nasıl etkilediğini merak mı ediyorsunuz? Sisteminizi sensör matrisi aracımız ile test edin veya Apple Watch pil tahmin aracımız ile günlük pil tüketiminizi hesaplayın.