Edge AI
Definition
Edge AI bezeichnet die Ausführung von KI-Modellen direkt auf dem Endgerät (Smartphone, IoT, PC) statt in der Cloud. Dies reduziert Latenz, spart Bandbreite und schützt die Privatsphäre. NPUs sind die Grundlage für Edge AI auf mobilen Geräten.
Beispiel
Apples Intelligence-Features laufen komplett auf dem iPhone mit der Neural Engine, ohne Cloud.
Verwandte Begriffe
Mehr aus “AI/ML”
Token
Ein Token ist die Grundeinheit, die ein LLM verarbeitet. Ein Token entspricht durchschnittlich etwa 0,75 Wörtern oder 4 Zeichen. Die Token-Anzahl bestimmt Verarbeitungsdauer und Kosten einer API-Anfrage. Modelle haben ein maximales Token-Limit für Eingabe und Ausgabe.
NPU (Neural Processing Unit)
Eine NPU ist ein spezialisierter Prozessor für KI-Inference-Aufgaben. Sie ist extrem energieeffizient und entlastet CPU und GPU bei AI-Workloads. Moderne Smartphones und Laptops integrieren NPUs direkt im SoC. Die Leistung wird in TOPS (Tera Operations Per Second) gemessen.
Context Window (Kontextfenster)
Das Context Window ist die maximale Anzahl an Tokens, die ein LLM gleichzeitig verarbeiten kann. Es umfasst Eingabe und Ausgabe. Größere Context Windows erlauben längere Dokumente, mehrfew-Shot-Beispiele und ausgedehntere Konversationen. Gemini 2 erreicht 2 Millionen Tokens.
RAG (Retrieval-Augmented Generation)
RAG kombiniert ein LLM mit einer externen Wissensdatenbank, um aktuellere und präzisere Antworten zu liefern. Das System sucht zuerst relevante Dokumente und übergibt sie als Kontext an das LLM. RAG reduziert Halluzinationen und ermöglicht das Abfragen privater Daten.