Edge Inference
Definition
Edge Inference fuehrt KI-Modelle direkt auf dem Endgeraet aus, ohne Cloud-Verbindung. Dies reduziert Latenz, spart Bandbreite und schuetzt die Privatsphaere. NPUs mit 40+ TOPS ermoeglichen Edge Inference fuer LLMs mit bis zu 7 Milliarden Parametern.
Beispiel
Ein Smartphone mit 75-TOPS-NPU kann ein 3B-Parameter-LLM lokal mit 20 Tokens/Sekunde ausfuehren.
Verwandte Begriffe
Mehr aus “AI/ML”
LangChain
LangChain ist ein beliebtes Open-Source-Framework fuer die Entwicklung von LLM-Anwendungen. Es provides Module fuer Prompt-Management, Chains, Agenten, Memory und RAG-Pipelines. LangChain unterstuetzt alle grossen LLM-Anbieter und Vector Databases.
Token
Ein Token ist die Grundeinheit, die ein LLM verarbeitet. Ein Token entspricht durchschnittlich etwa 0,75 Woertern oder 4 Zeichen. Die Token-Anzahl bestimmt Verarbeitungsdauer und Kosten einer API-Anfrage.
FLOPS (Floating Point Operations Per Second)
FLOPS misst die Anzahl der Gleitkomma-Operationen pro Sekunde. Im Gegensatz zu TOPS, das ganze Operationen zaehlt, erfasst FLOPS genauer die mathematische Leistung. Es wird in PetaFLOPS (10^15) oder ExaFLOPS (10^18) angegeben.
FP8 (8-bit Floating Point)
FP8 ist ein 8-bit-Gleitkommaformat, das 2022 von NVIDIA, AMD und ARM gemeinsam spezifiziert wurde. Es bietet hoehere Praezision als INT8 bei gleichem Speicherbedarf. Die RTX 50-Serie unterstuetzt FP4 und FP8 nativ fuer maximale AI-Performance.