MoE (Mixture of Experts)
Definition
MoE ist eine Architektur, bei der nur ein Teil der Modell-Parameter pro Token aktiviert wird. Ein Router entscheidet, welche Experten (Sub-Netzwerke) fuer jede Eingabe verwendet werden. DeepSeek-V3 und Mixtral nutzen MoE fuer hohe Kapazitaet bei niedriger Inferenz-Kosten.
Beispiel
DeepSeek-V3 hat 671 Milliarden Parameter, aktiviert aber nur 37 Milliarden pro Token.
Verwandte Begriffe
Mehr aus “AI/ML”
Speculative Decoding
Speculative Decoding ist eine Inferenz-Optimierungstechnik, bei der ein kleiles Modell schnell Entwuerfe generiert und ein grosses Modell diese verifiziert. Akzeptierte Tokens werden uebernommen, abgelehnte verworfen. Dies kann die Inference-Geschwindigkeit um den Faktor 2-3 erhoehen.
FP8 (8-bit Floating Point)
FP8 ist ein 8-bit-Gleitkommaformat, das 2022 von NVIDIA, AMD und ARM gemeinsam spezifiziert wurde. Es bietet hoehere Praezision als INT8 bei gleichem Speicherbedarf. Die RTX 50-Serie unterstuetzt FP4 und FP8 nativ fuer maximale AI-Performance.
Token
Ein Token ist die Grundeinheit, die ein LLM verarbeitet. Ein Token entspricht durchschnittlich etwa 0,75 Woertern oder 4 Zeichen. Die Token-Anzahl bestimmt Verarbeitungsdauer und Kosten einer API-Anfrage.
RAG (Retrieval-Augmented Generation)
RAG kombiniert ein LLM mit einer externen Wissensdatenbank, um aktuellere und praesisere Antworten zu liefern. Das System sucht zuerst relevante Dokumente und uebergibt sie als Kontext an das LLM. RAG reduziert Halluzinationen und ermueglicht das Abfragen privater Daten.