MoE (Mixture of Experts)
Definition
MoE ist eine Architektur, bei der nur ein Teil der Modell-Parameter pro Token aktiviert wird. Ein Router entscheidet, welche Experten (Sub-Netzwerke) fuer jede Eingabe verwendet werden. DeepSeek-V3 und Mixtral nutzen MoE fuer hohe Kapazitaet bei niedriger Inferenz-Kosten.
Beispiel
DeepSeek-V3 hat 671 Milliarden Parameter, aktiviert aber nur 37 Milliarden pro Token.
Verwandte Begriffe
Mehr aus “AI/ML”
Model Serving
Model Serving ist der Prozess, ein trainiertes KI-Modell in einer Produktionsumgebung verfuegbar zu machen. Es umfasst API-Endpunkte, Load Balancing, Versionierung und Monitoring. Bekannte Serving-Frameworks sind vLLM, TGI (Text Generation Inference) und TorchServe.
Diffusion Model
Diffusion Models generieren Daten (Bilder, Audio, Video), indem sie schrittweise Rauschen entfernen. Sie wurden von Nicht-Gleichgewichts-Thermodynamik inspiriert. Stable Diffusion, DALL-E und Midjourney basieren alle auf Diffusionsarchitektur.
Edge Inference
Edge Inference fuehrt KI-Modelle direkt auf dem Endgeraet aus, ohne Cloud-Verbindung. Dies reduziert Latenz, spart Bandbreite und schuetzt die Privatsphaere. NPUs mit 40+ TOPS ermoeglichen Edge Inference fuer LLMs mit bis zu 7 Milliarden Parametern.
GAN (Generative Adversarial Network)
GANs bestehen aus zwei Neural Networks, die gegeneinander antreten. Ein Generator erzeugt gefaelschte Daten, ein Diskriminator versucht, diese von echten zu unterscheiden. Durch diesen Wettbewerb werden beide besser. GANs werden fuer Deepfakes und Bildgenerierung verwendet.