Bởi Liam Vance • 2026-09-22

Các nhà phát triển chạy LLM cục bộ trên Apple Watch: 24 token/giây trên Series 6

Liệu một thiết bị đeo tay đời cũ có thể chạy trí tuệ nhân tạo tạo sinh hiện đại hoàn toàn ngoại tuyến? Trong khi quan điểm chung của ngành cho rằng AI trên thiết bị đòi hỏi hàng gigabyte bộ nhớ hợp nhất và bộ tăng tốc thần kinh, các kỹ sư phần mềm vừa phá vỡ định kiến đó. Trong một cột mốc tối ưu hóa đột phá, các nhà phát triển tại Better Stack đã chứng minh cách chạy trực tiếp một mô hình ngôn ngữ lớn cục bộ trên Apple Watch Series 6—tạo ra tới 24 token mỗi giây mà không cần đến iPhone hay kết nối internet.

Việc chạy AI cục bộ trên một thiết bị đeo ra mắt từ năm 2020 dường như là bất khả thi với giới hạn nghiêm ngặt chỉ 1GB RAM và các hạn chế sandbox của watchOS. Tuy nhiên, bằng cách triển khai mô hình Falcon H1 gọn nhẹ với 90 triệu tham số và chuyển đổi môi trường runtime llama.cpp, các kỹ sư đã loại bỏ hoàn toàn độ trễ đám mây. Kết quả cho thấy năng lực tính toán đáng ngạc nhiên tiềm ẩn trong các thế hệ Apple Silicon trước đây.

Vượt qua rào cản bộ nhớ 32-bit và Core ML

Triển khai một LLM lên watchOS đặt ra những trở ngại phần mềm nghiêm trọng. Framework Core ML gốc của Apple không thể biên dịch kiến trúc Falcon H1, vốn dựa trên Mô hình Không gian Trạng thái (SSM) Mamba-2 tiên tiến thay vì các khối attention transformer tiêu chuẩn. Để vượt qua điều này, nhóm đã tùy chỉnh mã nguồn mở C++ llama.cpp để biên dịch được dưới các cờ build của watchOS.

Hơn nữa, kiến trúc `arm64_32` của Apple Watch giới hạn không gian địa chỉ con trỏ ở 32-bit dù sở hữu các thanh ghi tính toán 64-bit. Bằng cách lượng tử hóa mạnh mẽ trọng số và tinh gọn việc phân bổ bộ nhớ, Falcon H1 đã duy trì mức tiêu thụ bộ nhớ hoàn toàn cố định bất kể độ dài tạo token. Mô hình 90M đã tạo văn bản ở tốc độ 15 đến 24 token mỗi giây—nhanh gần gấp 50 lần so với Raspberry Pi thế hệ đầu tiên.

Nhập lệnh bằng giọng nói, công cụ ngoại tuyến và sự đánh đổi về pin

Ứng dụng nguyên mẫu không chỉ xuất ra các chuỗi văn bản; nó còn xử lý lời nhắc âm thanh bằng giọng nói và thực thi các lệnh gọi công cụ cục bộ, chẳng hạn như truy vấn các mục Wikipedia đã lưu trong bộ nhớ cache hoặc định dạng dữ liệu thời tiết mà không cần gọi đến API đám mây bên ngoài. Trong khi các mô hình lớn hơn với 135 triệu tham số đẩy phần cứng vượt quá giới hạn nhiệt độ thoải mái, thì cấu hình 90M lại vận hành mượt mà.

Lợi ích được bảo toàn (Preserved Benefit): Trí tuệ nhân tạo trên thiết bị hoàn toàn riêng tư, độ trễ bằng không, hoạt động trơn tru ngay cả trong chế độ máy bay, loại bỏ hoàn toàn phí thuê bao và sự theo dõi qua đám mây.

Sự đánh đổi rõ ràng (Explicit Trade-Off): Quá trình suy luận mạng nơ-ron cục bộ liên tục tạo ra lượng nhiệt tích tụ đáng kể và đẩy nhanh tốc độ hao pin trên các cell pin lithium-ion nhỏ gọn.

Bạn có muốn biết các tác vụ nền chuyên sâu ảnh hưởng như thế nào đến thời lượng sử dụng hàng ngày của thiết bị? Hãy kiểm tra hệ thống của bạn bằng công cụ ma trận cảm biến hoặc tính toán mức tiêu hao pin hàng ngày bằng công cụ ước tính pin Apple Watch của chúng tôi.