Expert • Les 11

On-device AI: Apple Silicon en NPU-architecturen

Inferentie in de cloud is duur, latency-gevoelig en vereist een internetverbinding. On-device AI voert modellen lokaal uit op gespecialiseerde hardware. Apple Silicon, Qualcomm Snapdragon en Google Tensor zijn de leidende platforms voor edge-inferentie.

Neural Processing Units (NPU)

Een NPU is een processor geoptimaliseerd voor de matrix-vermenigvuldigingen die ten grondslag liggen aan neurale netwerken. Anders dan een GPU is een NPU specifiek ontworpen voor lage-precisie inferentie (INT4, INT8, FP16) met maximale energie-efficiĆ«ntie. Apple’s Neural Engine in de M-serie chips voert tot 38 TOPS (trillion operations per second) uit bij uiterst laag energieverbruik.

Unified Memory Architecture

Apple Silicon’s onderscheidende kenmerk is unified memory: CPU, GPU en Neural Engine delen dezelfde geheugenpool zonder kopieeroperaties. Dit maakt het mogelijk modellen van 7-13 miljard parameters te draaien op een MacBook die bij reguliere discrete GPU’s veel meer VRAM vereist. LLM-inferentie op Apple Silicon is hierdoor praktisch haalbaar voor consumenterhardware.

Quantisatie voor edge-deployment

Modellen moeten worden gequantiseerd voor efficiĆ«nte on-device inferentie. 4-bit quantisatie (GGUF-formaat via llama.cpp) reduceert een 7B-model van 14 GB naar circa 4 GB met beperkt kwaliteitsverlies. Apple’s CoreML-framework en Google’s LiteRT (voorheen TFLite) bieden geoptimaliseerde runtimes voor respectievelijk iOS/macOS en Android/Pixel.

Privacy-voordelen

On-device inferentie stuurt geen data naar externe servers, wat het aantrekkelijk maakt voor privacy-gevoelige toepassingen. Apple Intelligence verwerkt de meeste taken lokaal op het apparaat; alleen complexe aanvragen worden doorgestuurd naar Private Cloud Compute met cryptografische garanties over dataverwerking. Dit patroon van edge-first met cloud-fallback wordt steeds gangbaarder.