Speculative Decoding
Definition
Speculative Decoding ist eine Inferenz-Optimierungstechnik, bei der ein kleiles Modell schnell Entwuerfe generiert und ein grosses Modell diese verifiziert. Akzeptierte Tokens werden uebernommen, abgelehnte verworfen. Dies kann die Inference-Geschwindigkeit um den Faktor 2-3 erhoehen.
Beispiel
Mit Speculative Decoding kann ein 70B-LLM 2.5x so schnell Text generieren wie ohne.
Mehr aus “AI/ML”
AI-PC
Ein AI-PC ist ein Computer mit integrierter NPU, der KI-Aufgaben lokal und energieeffizient ausfuehrt. Microsoft definiert AI-PCs mit mindestens 40 TOPS und Copilot+ Funktion. Sie ermoeglichen Features wie Live-Untertitel, Bildgenerierung und lokale LLMs ohne Cloud.
Diffusion Model
Diffusion Models generieren Daten (Bilder, Audio, Video), indem sie schrittweise Rauschen entfernen. Sie wurden von Nicht-Gleichgewichts-Thermodynamik inspiriert. Stable Diffusion, DALL-E und Midjourney basieren alle auf Diffusionsarchitektur.
GAN (Generative Adversarial Network)
GANs bestehen aus zwei Neural Networks, die gegeneinander antreten. Ein Generator erzeugt gefaelschte Daten, ein Diskriminator versucht, diese von echten zu unterscheiden. Durch diesen Wettbewerb werden beide besser. GANs werden fuer Deepfakes und Bildgenerierung verwendet.
VAE (Variational Autoencoder)
Ein VAE ist ein Neural Network, das Daten komprimiert und rekonstruiert. Im Gegensatz zu klassischen Autoencodern erzeugt der latente Raum eine kontinuierliche Verteilung, die das Generieren neuer Daten ermoeglicht. VAEs werden oft als Komponente in Diffusionsmodellen eingesetzt.