QLoRA (Quantized LoRA)
Definition
QLoRA kombiniert LoRA mit 4-bit Quantisierung des Basis-Modells. Dadurch wird der Speicherbedarf drastisch reduziert, sodass sogar 70-Milliarden-Parameter-Modelle auf einer einzelnen GPU fine-getuned werden koennen. Es ist der De-facto-Standard fuer ressourceneffizientes Fine-Tuning.
Beispiel
QLoRA ermoeglicht das Fine-Tuning von Llama 3 70B auf einer einzelnen RTX 4090.
Verwandte Begriffe
Mehr aus “AI/ML”
JAX
JAX ist Googles numerisches Computing-Framework mit automatischer Differenzierung und XLA-Compiler fuer GPU/TPU. Es ist die Grundlage fuer moderne KI-Forschung bei Google DeepMind. JAX ermoeglicht funktionale Programmierung mit NumPy-Syntax und nativer Beschleuniger-Unterstuetzung.
CUDA (Compute Unified Device Architecture)
CUDA ist NVIDIAs parallele Computing-Plattform und Programmiermodell fuer GPUs. Es ermoeglicht Entwicklern, die Rechenleistung von NVIDIA-GPUs fuer nicht-grafische Aufgaben wie KI-Training zu nutzen. CUDA ist der De-facto-Standard fuer GPU-Computing in der KI-Forschung.
Fine-Tuning
Fine-Tuning ist die Anpassung eines vortrainierten Modells an eine spezifische Aufgabe oder Doemaene. Es benötigt deutlich weniger Daten und Rechenleistung als das Training von Grund auf. LoRA und QLoRA sind beliebte effiziente Fine-Tuning-Methoden.
Transformer (Architektur)
Die Transformer-Architektur wurde 2017 von Google eingefuehrt und ist die Grundlage aller modernen LLMs. Sie nutzt Self-Attention-Mechanismen, um Beziehungen zwischen allen Tokens gleichzeitig zu erfassen. Dadurch sind Transformer stark parallelisierbar und skalierbar.