LoRA (Low-Rank Adaptation)
Definition
LoRA ist eine effiziente Fine-Tuning-Methode, die nur einen kleinen Satz zusätzlicher Parameter trainiert statt des gesamten Modells. Dies reduziert Speicherbedarf und Trainingskosten um den Faktor 10 bis 100. QLoRA kombiniert LoRA mit Quantisierung für noch mehr Effizienz.
Beispiel
Mit QLoRA kann man ein 70B-LLM auf einer einzigen consumer-GPU fine-tunen.
Mehr aus “AI/ML”
TOPS (Tera Operations Per Second)
TOPS ist die Maßeinheit für die KI-Rechenleistung eines Prozessors. Ein TOPS entspricht einer Billion Operationen pro Sekunde. Microsofts Copilot+ Standard erfordert mindestens 40 TOPS. Höhere TOPS bedeuten jedoch nicht automatisch bessere AI-Performance, da auch Software-Optimierung eine Rolle spielt.
Token
Ein Token ist die Grundeinheit, die ein LLM verarbeitet. Ein Token entspricht durchschnittlich etwa 0,75 Wörtern oder 4 Zeichen. Die Token-Anzahl bestimmt Verarbeitungsdauer und Kosten einer API-Anfrage. Modelle haben ein maximales Token-Limit für Eingabe und Ausgabe.
AI-PC
Ein AI-PC ist ein Computer mit integrierter NPU, der KI-Aufgaben lokal und energieeffizient ausführt. Microsoft definiert AI-PCs mit mindestens 40 TOPS und Copilot+ Funktion. Sie ermöglichen Features wie Live-Untertitel, Bildgenerierung und lokale LLMs ohne Cloud.
Deep Learning
Deep Learning ist ein Teilbereich des Machine Learning, der Neural Networks mit vielen Schichten verwendet. Es ermöglicht das Lernen hierarchischer Merkmale aus großen Datenmengen. Deep Learning treibt Innovationen in Bilderkennung, Sprachverarbeitung und autonomen Systemen.