I dispositivi da polso datati possono eseguire un'intelligenza artificiale generativa moderna completamente offline? Mentre il consenso del settore presumeva che l'IA on-device richiedesse gigabyte di memoria unificata e acceleratori neurali, gli ingegneri del software hanno appena infranto questa convinzione. In un traguardo di ottimizzazione pionieristico, gli sviluppatori di Better Stack hanno dimostrato come eseguire un modello linguistico di grandi dimensioni (LLM) locale direttamente su un Apple Watch Series 6, generando fino a 24 token al secondo senza iPhone o connessione Internet.
Eseguire un'IA locale su un dispositivo indossabile lanciato originariamente nel 2020 sembra improbabile, considerato il suo rigido limite di 1 GB di RAM e le restrizioni di sandbox di watchOS. Eppure, implementando il modello leggero da 90 milioni di parametri Falcon H1 e portando il runtime llama.cpp, gli ingegneri hanno aggirato del tutto la latenza del cloud. I risultati rivelano un margine computazionale sorprendente nei chip legacy Apple Silicon.
Il deployment di un LLM su watchOS ha presentato severe barriere a livello di software. Il framework nativo Core ML di Apple non riusciva a compilare l'architettura di Falcon H1, che si basa su un modello State Space Model (SSM) Mamba-2 all'avanguardia anziché sui blocchi di attenzione standard dei transformer. Per aggirare il problema, il team ha personalizzato il codice open-source C++ di llama.cpp per compilarlo con i flag di build di watchOS.
Inoltre, l'architettura `arm64_32` di Apple Watch limita l'indirizzamento dei puntatori a spazi a 32 bit, nonostante i registri di calcolo a 64 bit. Quantizzando in modo aggressivo i pesi e snellendo l'allocazione della memoria, Falcon H1 ha mantenuto un'impronta di memoria completamente piatta, a prescindere dalla profondità di generazione dei token. Il modello da 90M ha generato testo a una velocità compresa tra 15 e 24 token al secondo, quasi 50 volte più veloce di un Raspberry Pi di prima generazione.
L'applicazione prototipo non si limita a produrre stringhe di testo: elabora prompt audio vocali ed esegue chiamate a strumenti (tool calls) locali, come interrogare voci di Wikipedia memorizzate nella cache o formattare dati meteo senza contattare API cloud esterne. Sebbene i modelli più grandi da 135M di parametri abbiano spinto l'hardware oltre margini termici confortevoli, la configurazione da 90M ha funzionato in modo impeccabile.
Vantaggio mantenuto: Un'intelligenza on-device autenticamente privata e a latenza zero che opera completamente in modalità aereo, azzerando canoni di abbonamento e tracciamento nel cloud.
Compromesso esplicito: L'inferenza neurale locale prolungata genera un accumulo termico percettibile e accelera il consumo della batteria sulle compatte celle agli ioni di litio.
Ti interessa sapere come i carichi di lavoro intensivi in background influenzano l'autonomia quotidiana del tuo dispositivo? Verifica la tua configurazione con il nostro strumento a matrice di sensori o calcola il consumo giornaliero della batteria con il nostro stimatore di batteria per Apple Watch.