Inference (Inferenz)
Definition
Inference ist die Anwendung eines trainierten KI-Modells auf neue Daten, um Vorhersagen zu generieren. Sie ist weniger rechenintensiv als das Training, erfordert aber dennoch NPUs oder GPUs für Echtzeit-Anwendungen. Edge-Inference findet direkt auf dem Gerät statt.
Beispiel
ChatGPT führt bei jeder Benutzereingabe eine Inference auf NVIDIA H100-GPUs durch.
Mehr aus “AI/ML”
Neural Network (Neuronales Netz)
Ein Neural Network ist ein vom menschlichen Gehirn inspiriertes KI-Modell aus verbundenen Knoten (Neuronen) in Schichten. Es lernt aus Daten, indem es Gewichte anpasst. Tiefe Netzwerke (Deep Learning) mit vielen Schichten können extrem komplexe Muster erkennen.
Attention Mechanism
Attention ist ein Konzept in Neural Networks, das dem Modell ermöglicht, sich auf relevante Teile der Eingabe zu konzentrieren. Self-Attention berechnet für jedes Token, wie stark es alle anderen Tokens beeinflusst. Multi-Head Attention ist ein Kernbaustein der Transformer-Architektur.
Hallucination (KI)
Hallucination beschreibt das Phänomen, dass ein LLM selbstbewusst falsche oder erfundene Informationen ausgibt. Es entsteht durch statistische Muster im Training, die nicht mit Fakten übereinstimmen. RAG und bessere Fine-Tuning-Methoden reduzieren Hallucinationen.
Token
Ein Token ist die Grundeinheit, die ein LLM verarbeitet. Ein Token entspricht durchschnittlich etwa 0,75 Wörtern oder 4 Zeichen. Die Token-Anzahl bestimmt Verarbeitungsdauer und Kosten einer API-Anfrage. Modelle haben ein maximales Token-Limit für Eingabe und Ausgabe.