Par Liam Vance • 2026-09-22

Des développeurs font tourner un LLM local sur Apple Watch : 24 tokens/s sur Series 6

Une montre connectée vieillissante peut-elle exécuter une intelligence artificielle générative moderne entièrement hors ligne ? Alors que le consensus de l'industrie estimait que l'IA intégrée nécessitait des gigaoctets de mémoire unifiée et des accélérateurs neuronaux, des ingénieurs logiciels viennent de pulvériser cette certitude. Dans une avancée majeure d'optimisation, les développeurs de Better Stack ont démontré comment exécuter un grand modèle de langage local directement sur une Apple Watch Series 6, générant jusqu'à 24 tokens par seconde sans iPhone ni connexion Internet.

Faire tourner une IA locale sur un appareil portable lancé à l'origine en 2020 semble improbable compte tenu de son budget mémoire strict de 1 Go de RAM et des restrictions du bac à sable de watchOS. Pourtant, en déployant le modèle ultra-léger de 90 millions de paramètres Falcon H1 et en adaptant le runtime llama.cpp, les ingénieurs ont totalement contourné la latence du cloud. Les résultats révèlent une réserve de puissance de calcul surprenante au cœur des anciennes puces Apple Silicon.

Surmonter la mémoire 32 bits et les obstacles de Core ML

Déployer un LLM sur watchOS présentait de sérieux obstacles logiciels. Le framework natif Core ML d'Apple ne pouvait pas compiler l'architecture Falcon H1, qui repose sur un modèle d'espace d'états (SSM) Mamba-2 à la pointe de la technologie plutôt que sur les blocs d'attention standard des transformers. Pour contourner ce problème, l'équipe a personnalisé le code C++ open source de llama.cpp afin de le compiler avec les drapeaux de compilation de watchOS.

De plus, l'architecture `arm64_32` de l'Apple Watch limite l'adressage des pointeurs à des espaces 32 bits malgré ses registres de calcul 64 bits. Grâce à une quantification agressive des poids et à une optimisation rigoureuse de l'allocation mémoire, Falcon H1 a maintenu une empreinte mémoire parfaitement stable, quelle que soit la longueur de génération des tokens. Le modèle 90M a généré du texte à une cadence de 15 à 24 tokens par seconde — près de 50 fois plus vite qu'un Raspberry Pi de première génération.

Invites vocales, outils hors ligne et arbitrage sur la batterie

L'application prototype ne se contente pas d'afficher de simples chaînes de texte ; elle traite les invites vocales et exécute des appels d'outils locaux, comme l'interrogation d'articles Wikipédia mis en cache ou le formatage de données météo sans contacter d'API cloud externes. Si des modèles plus imposants de 135 millions de paramètres ont poussé le matériel au-delà de limites thermiques confortables, la configuration 90M s'est exécutée de manière fluide.

Preserved Benefit: Une intelligence embarquée véritablement confidentielle et sans aucune latence, fonctionnant en mode avion complet, sans aucun abonnement ni suivi dans le cloud.

Explicit Trade-Off: L'inférence neuronale locale prolongée entraîne une montée en température sensible et accélère la décharge de la batterie sur de petites cellules lithium-ion.

Curieux de savoir comment les charges de fond intensives affectent l'autonomie quotidienne de votre appareil ? Testez votre configuration avec notre sensor matrix tool ou calculez la consommation quotidienne de votre montre grâce à notre Apple Watch battery estimator.