Bisakah perangkat jam tangan pintar lawas menjalankan kecerdasan buatan generatif modern sepenuhnya secara offline? Meskipun konsensus industri menganggap bahwa AI pada perangkat memerlukan memori terpadu (unified memory) berukuran gigabita dan akselerator neural, para insinyur perangkat lunak baru saja mematahkan asumsi tersebut. Dalam sebuah pencapaian optimasi terobosan, para pengembang di Better Stack mendemonstrasikan cara menjalankan model bahasa besar lokal langsung di Apple Watch Series 6—menghasilkan hingga 24 token per detik tanpa iPhone atau koneksi internet.
Menjalankan AI lokal pada perangkat wearable yang awalnya dirilis pada tahun 2020 tampaknya mustahil mengingat anggaran RAM 1GB yang ketat dan pembatasan sandbox watchOS. Namun, dengan menerapkan model Falcon H1 berbobot ringan 90 juta parameter serta mem-porting runtime llama.cpp, para insinyur berhasil melewati latensi cloud sepenuhnya. Hasil ini mengungkap ruang komputasi yang mengejutkan pada Apple Silicon lawas.
Menerapkan LLM ke dalam watchOS menghadapi rintangan perangkat lunak yang berat. Kerangka kerja bawaan Apple, Core ML, tidak dapat mengompilasi arsitektur Falcon H1, yang mengandalkan Mamba-2 State Space Model (SSM) mutakhir alih-alih blok atensi transformer standar. Untuk menyiasatinya, tim memodifikasi kode C++ sumber terbuka llama.cpp agar dapat dikompilasi di bawah flag build watchOS.
Selain itu, arsitektur `arm64_32` Apple Watch membatasi pengalamatan pointer ke ruang 32-bit terlepas dari register komputasi 64-bit miliknya. Dengan melakukan kuantisasi bobot secara agresif dan menyederhanakan alokasi memori, Falcon H1 mempertahankan jejak memori yang sepenuhnya datar tanpa terpengaruh kedalaman pembuatan token. Model 90M ini menghasilkan teks pada kecepatan 15 hingga 24 token per detik—hampir 50 kali lebih cepat dibandingkan Raspberry Pi generasi pertama.
Aplikasi prototipe ini tidak hanya menghasilkan output untaian teks; aplikasi ini juga memproses perintah audio ucapan dan mengeksekusi pemanggilan fungsi lokal (local tool calls), seperti menanyakan entri Wikipedia yang di-cache atau memformat data cuaca tanpa menghubungi API cloud eksternal. Meskipun model 135M parameter yang lebih besar mendorong perangkat keras melampaui batas termal yang nyaman, konfigurasi 90M berjalan lancar.
Manfaat yang Dipertahankan: Kecerdasan pada perangkat yang benar-benar privat tanpa latensi dan beroperasi dalam mode pesawat sepenuhnya, meniadakan biaya langganan serta pelacakan cloud.
Konsekuensi Nyata: Inferensi neural lokal yang berkelanjutan menghasilkan peningkatan panas yang nyata dan mempercepat pengurasan baterai pada sel lithium-ion yang ringkas.
Tertarik untuk mengetahui bagaimana beban kerja latar belakang yang intensif memengaruhi waktu pakai harian perangkat Anda? Uji konfigurasi Anda dengan sensor matrix tool atau hitung pengurasan baterai harian dengan Apple Watch battery estimator.