TOPS (Tera Operations Per Second)
Definition
TOPS ist die Maßeinheit für die KI-Rechenleistung eines Prozessors. Ein TOPS entspricht einer Billion Operationen pro Sekunde. Microsofts Copilot+ Standard erfordert mindestens 40 TOPS. Höhere TOPS bedeuten jedoch nicht automatisch bessere AI-Performance, da auch Software-Optimierung eine Rolle spielt.
Beispiel
Ein AI-PC mit 80 TOPS kann lokale LLMs mit 7 Milliarden Parametern flüssig ausführen.
Mehr aus “AI/ML”
Attention Mechanism
Attention ist ein Konzept in Neural Networks, das dem Modell ermöglicht, sich auf relevante Teile der Eingabe zu konzentrieren. Self-Attention berechnet für jedes Token, wie stark es alle anderen Tokens beeinflusst. Multi-Head Attention ist ein Kernbaustein der Transformer-Architektur.
NPU (Neural Processing Unit)
Eine NPU ist ein spezialisierter Prozessor für KI-Inference-Aufgaben. Sie ist extrem energieeffizient und entlastet CPU und GPU bei AI-Workloads. Moderne Smartphones und Laptops integrieren NPUs direkt im SoC. Die Leistung wird in TOPS (Tera Operations Per Second) gemessen.
Transformer (Architektur)
Die Transformer-Architektur wurde 2017 von Google eingeführt und ist die Grundlage aller modernen LLMs. Sie nutzt Self-Attention-Mechanismen, um Beziehungen zwischen allen Tokens gleichzeitig zu erfassen. Dadurch sind Transformer stark parallelisierbar und skalierbar.
Vector Database
Eine Vector Database speichert Embeddings und ermöglicht schnelle Ähnlichkeitssuche. Sie ist essenziell für RAG-Systeme und AI-Anwendungen. Bekannte Vector DBs sind Pinecone, Weaviate, Qdrant und Chroma. Sie nutzen Approximate Nearest Neighbor (ANN) Algorithmen.