Inference (Inferenz)
Definition
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs fuer Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Geraet statt.
Beispiel
ChatGPT fuehrt bei jeder Benutzereingabe eine Inference auf NVIDIA H100-GPUs durch.
Mehr aus “AI/ML”
TOPS (Tera Operations Per Second)
TOPS ist die Messeinheit fuer die KI-Rechenleistung eines Prozessors. Ein TOPS entspricht einer Billion Operationen pro Sekunde. Microsofts Copilot+ Standard erfordert mindestens 40 TOPS. Haeufigere TOPS bedeuten jedoch nicht automatisch bessere AI-Performance.
Copilot+ PC
Copilot+ PC ist eine Microsoft-Zertifizierung fuer Windows-Rechner mit mindestens 40 TOPS NPU-Leistung. Solche PCs unterstuetzen Recall (Timeline-Suche), Live-Captions, Cocreator (Bildgenerierung) und lokale Phi-Silika-Modelle. Der Standard wurde mit Windows 11 24H2 eingefuehrt.
LoRA (Low-Rank Adaptation)
LoRA ist eine effiziente Fine-Tuning-Methode, die nur einen kleinen Satz zusaetzlicher Parameter trainiert statt des gesamten Modells. Dies reduziert Speicherbedarf und Trainingskosten um den Faktor 10 bis 100. QLoRA kombiniert LoRA mit Quantisierung fuer noch mehr Effizienz.
Attention Mechanism
Attention ist ein Konzept in Neural Networks, das dem Modell ermoeglicht, sich auf relevante Teile der Eingabe zu konzentrieren. Self-Attention berechnet fuer jedes Token, wie stark es alle anderen Tokens beeinflusst. Multi-Head Attention ist ein Kernbaustein der Transformer-Architektur.