อุปกรณ์สวมใส่บนข้อมือรุ่นเก่าสามารถรัน generative artificial intelligence ยุคใหม่แบบออฟไลน์ได้อย่างสมบูรณ์หรือไม่? ในขณะที่ข้อตกลงร่วมในอุตสาหกรรมคาดการณ์ว่า AI บนอุปกรณ์จำเป็นต้องใช้หน่วยความจำแบบรวม (Unified Memory) หลายกิกะไบต์และชิปเร่งความเร็วประสาท (Neural Accelerators) แต่วิศวกรซอฟต์แวร์เพิ่งทำลายข้อจำกัดนั้นลง ในหมุดหมายความสำเร็จด้านการปรับแต่งประสิทธิภาพครั้งสำคัญ นักพัฒนาจาก Better Stack ได้สาธิตวิธีการรันโมเดลภาษาขนาดใหญ่ (LLM) ในตัวเครื่องโดยตรงบน Apple Watch Series 6 ซึ่งสามารถสร้างข้อความได้สูงสุดถึง 24 โทเค็นต่อวินาที โดยไม่ต้องพึ่งพา iPhone หรือการเชื่อมต่ออินเทอร์เน็ตแต่อย่างใด
การรัน AI บนอุปกรณ์สวมใส่ที่เปิดตัวครั้งแรกในปี 2020 ฟังดูแทบจะเป็นไปไม่ได้ เมื่อพิจารณาจากขีดจำกัด RAM เพียง 1GB และข้อจำกัดของแซนด์บอกซ์ใน watchOS แต่ด้วยการปรับใช้โมเดล Falcon H1 ขนาดน้ำหนักเบา 90 ล้านพารามิเตอร์ และการพอร์ตระบบรันไทม์ llama.cpp วิศวกรจึงสามารถขจัดปัญหาความหน่วงเวลาของคลาวด์ได้อย่างสิ้นเชิง ผลลัพธ์นี้เผยให้เห็นสมรรถนะการประมวลผลที่น่าทึ่งซึ่งยังคงแฝงอยู่ใน Apple Silicon รุ่นเก่า
การปรับใช้ LLM ลงบน watchOS ต้องเผชิญกับอุปสรรคด้านซอฟต์แวร์อย่างหนักหน่วง เฟรมเวิร์ก Core ML ดั้งเดิมของ Apple ไม่สามารถคอมไพล์สถาปัตยกรรม Falcon H1 ได้ เนื่องจากใช้สถาปัตยกรรม Mamba-2 State Space Model (SSM) ที่ล้ำสมัย แทนที่จะเป็นบล็อกกลไกความสนใจ (Attention Blocks) ของ Transformer มาตรฐาน เพื่อหลีกเลี่ยงปัญหานี้ ทีมงานได้ปรับแต่งซอร์สโค้ด C++ ของโอเพนซอร์ส llama.cpp เพื่อให้คอมไพล์ได้ภายใต้แฟล็กการบิลด์ของ watchOS
นอกจากนี้ สถาปัตยกรรม `arm64_32` ของ Apple Watch ยังจำกัดการระบุตำแหน่งพอยน์เตอร์ไว้ที่ 32 บิต แม้ว่าจะมีเรจิสเตอร์คำนวณแบบ 64 บิตก็ตาม ด้วยการลดความแม่นยำของน้ำหนักโมเดล (Quantization) อย่างเข้มข้นและการจัดสรรหน่วยความจำที่มีประสิทธิภาพ Falcon H1 จึงรักษาระดับการใช้หน่วยความจำให้คงที่ได้อย่างสมบูรณ์ โดยไม่แปรผันตามความยาวของการสร้างโทเค็น โมเดลขนาด 90M สามารถสร้างข้อความได้ที่ความเร็ว 15 ถึง 24 โทเค็นต่อวินาที ซึ่งเร็วกว่า Raspberry Pi รุ่นแรกเกือบ 50 เท่า
แอปพลิเคชันต้นแบบนี้ไม่ได้ทำได้เพียงแค่แสดงผลข้อความเท่านั้น แต่ยังประมวลผลคำสั่งเสียงพูดและเรียกใช้คำสั่งเครื่องมือภายในเครื่อง (Local Tool Calls) เช่น การสืบค้นข้อมูลวิกิพีเดียที่แคชไว้ หรือการจัดรูปแบบข้อมูลสภาพอากาศโดยไม่ต้องเรียกใช้ Cloud API ภายนอก แม้ว่าโมเดลขนาดใหญ่ขึ้นอย่าง 135M พารามิเตอร์จะผลักดันฮาร์ดแวร์จนเกินขีดจำกัดอุณหภูมิที่เหมาะสม แต่การตั้งค่าขนาด 90M ยังคงทำงานได้อย่างราบรื่น
ผลประโยชน์ที่คงไว้: ระบบอัจฉริยะบนอุปกรณ์ที่มีความเป็นส่วนตัวอย่างแท้จริงและไม่มีความหน่วงเวลา ทำงานได้ในโหมดเครื่องบินอย่างสมบูรณ์แบบ ขจัดค่าธรรมเนียมการสมัครสมาชิกและการติดตามข้อมูลบนคลาวด์
การแลกเปลี่ยนที่ชัดเจน: การประมวลผลอนุมานเครือข่ายประสาทในเครื่องอย่างต่อเนื่องทำให้เกิดการสะสมความร้อนที่สัมผัสได้ และเร่งให้อัตราการใช้พลังงานแบตเตอรี่จากเซลล์ลิเธียมไอออนขนาดกะทัดรัดหมดเร็วขึ้น
สนใจหรือไม่ว่าภาระงานเบื้องหลังที่หนักหน่วงส่งผลต่อระยะเวลาการใช้งานอุปกรณ์ของคุณในแต่ละวันอย่างไร? ทดสอบการตั้งค่าของคุณด้วย sensor matrix tool หรือคำนวณอัตราการสิ้นเปลืองแบตเตอรี่ในแต่ละวันด้วย Apple Watch battery estimator