AI/ML

Edge Inference

Definition

Edge Inference fuehrt KI-Modelle direkt auf dem Endgeraet aus, ohne Cloud-Verbindung. Dies reduziert Latenz, spart Bandbreite und schuetzt die Privatsphaere. NPUs mit 40+ TOPS ermoeglichen Edge Inference fuer LLMs mit bis zu 7 Milliarden Parametern.

Beispiel

Ein Smartphone mit 75-TOPS-NPU kann ein 3B-Parameter-LLM lokal mit 20 Tokens/Sekunde ausfuehren.