Edge Inference
Definition
Edge Inference fuehrt KI-Modelle direkt auf dem Endgeraet aus, ohne Cloud-Verbindung. Dies reduziert Latenz, spart Bandbreite und schuetzt die Privatsphaere. NPUs mit 40+ TOPS ermoeglichen Edge Inference fuer LLMs mit bis zu 7 Milliarden Parametern.
Beispiel
Ein Smartphone mit 75-TOPS-NPU kann ein 3B-Parameter-LLM lokal mit 20 Tokens/Sekunde ausfuehren.
Verwandte Begriffe
Mehr aus “AI/ML”
Attention Mechanism
Attention ist ein Konzept in Neural Networks, das dem Modell ermoeglicht, sich auf relevante Teile der Eingabe zu konzentrieren. Self-Attention berechnet fuer jedes Token, wie stark es alle anderen Tokens beeinflusst. Multi-Head Attention ist ein Kernbaustein der Transformer-Architektur.
KV Cache (Key-Value Cache)
Der KV Cache speichert die Key-Value-Paare aller bisherigen Tokens in einem LLM, um wiederholte Berechnungen zu vermeiden. Er w线性 mit der Sequenzlaenge. Bei grossen Context-Windows (1M Tokens) kann der KV Cache mehrere Gigabyte VRAM belegen.
GAN (Generative Adversarial Network)
GANs bestehen aus zwei Neural Networks, die gegeneinander antreten. Ein Generator erzeugt gefaelschte Daten, ein Diskriminator versucht, diese von echten zu unterscheiden. Durch diesen Wettbewerb werden beide besser. GANs werden fuer Deepfakes und Bildgenerierung verwendet.
FLOPS (Floating Point Operations Per Second)
FLOPS misst die Anzahl der Gleitkomma-Operationen pro Sekunde. Im Gegensatz zu TOPS, das ganze Operationen zaehlt, erfasst FLOPS genauer die mathematische Leistung. Es wird in PetaFLOPS (10^15) oder ExaFLOPS (10^18) angegeben.