Transformer (Architektur)
Definition
Die Transformer-Architektur wurde 2017 von Google eingefuehrt und ist die Grundlage aller modernen LLMs. Sie nutzt Self-Attention-Mechanismen, um Beziehungen zwischen allen Tokens gleichzeitig zu erfassen. Dadurch sind Transformer stark parallelisierbar und skalierbar.
Beispiel
GPT steht fuer 'Generative Pre-trained Transformer' — die Architektur aller OpenAI-Modelle.
Verwandte Begriffe
Mehr aus “AI/ML”
Neural Network (Neuronales Netz)
Ein Neural Network ist ein vom menschlichen Gehirn inspiriertes KI-Modell aus verbundenen Knoten (Neuronen) in Schichten. Es lernt aus Daten, indem es Gewichte anpasst. Tiefe Netzwerke (Deep Learning) mit vielen Schichten koennen extrem komplexe Muster erkennen.
Autoregressive Model
Autoregressive Modelle generieren Daten sequenziell, indem sie jedes neue Element basierend auf den zuvor generierten Elementen vorhersagen. LLMs wie GPT sind autoregressiv: Jedes Token wird basierend auf allen vorherigen Tokens generiert.
Apple Intelligence
Apple Intelligence ist Apples KI-Plattform fuer iOS, iPadOS und macOS. Sie nutzt On-Device Modelle (Phi-Silika) und Private Cloud Compute fuer komplexe Anfragen. Features umfassen Genmoji, Image Playground, Writing Tools und erweiterte Siri-Faehigkeiten.
MoE (Mixture of Experts)
MoE ist eine Architektur, bei der nur ein Teil der Modell-Parameter pro Token aktiviert wird. Ein Router entscheidet, welche Experten (Sub-Netzwerke) fuer jede Eingabe verwendet werden. DeepSeek-V3 und Mixtral nutzen MoE fuer hohe Kapazitaet bei niedriger Inferenz-Kosten.