Transformer (Architektur)
Definition
Die Transformer-Architektur wurde 2017 von Google eingeführt und ist die Grundlage aller modernen LLMs. Sie nutzt Self-Attention-Mechanismen, um Beziehungen zwischen allen Tokens gleichzeitig zu erfassen. Dadurch sind Transformer stark parallelisierbar und skalierbar.
Beispiel
GPT steht für 'Generative Pre-trained Transformer' — die Architektur aller OpenAI-Modelle.
Verwandte Begriffe
Mehr aus “AI/ML”
Deep Learning
Deep Learning ist ein Teilbereich des Machine Learning, der Neural Networks mit vielen Schichten verwendet. Es ermöglicht das Lernen hierarchischer Merkmale aus großen Datenmengen. Deep Learning treibt Innovationen in Bilderkennung, Sprachverarbeitung und autonomen Systemen.
Machine Learning
Machine Learning ist ein Teilbereich der KI, bei dem Computer aus Daten lernen, ohne explizit programmiert zu werden. Es umfasst überwacht (Supervised), unüberwacht (Unsupervised) und bestärkendes (Reinforcement) Lernen. Deep Learning ist eine spezielle Methode des Machine Learning.
Training (Modell-Training)
Training ist der Prozess, bei dem ein KI-Modell aus Daten lernt, indem es seine internen Gewichte iterativ anpasst. Es verwendet Algorithmen wie Backpropagation und Gradient Descent. Das Training großer Modelle kann Wochen bis Monate auf Clustern von GPUs dauern.
Edge AI
Edge AI bezeichnet die Ausführung von KI-Modellen direkt auf dem Endgerät (Smartphone, IoT, PC) statt in der Cloud. Dies reduziert Latenz, spart Bandbreite und schützt die Privatsphäre. NPUs sind die Grundlage für Edge AI auf mobilen Geräten.