LoRA Fine-Tuning
Definition
LoRA Fine-Tuning ist der Prozess des Anpassens eines vortrainierten LLM an eine spezifische Aufgabe mit Low-Rank Adaptation. Statt alle Gewichte zu aktualisieren, werden nur zusaetzliche niedrigdimensionale Matrizen trainiert. Dies reduziert Speicherbedarf und Kosten um bis zu 100x.
Beispiel
Ein LoRA-fine-getuntes Llama-3-8B auf medizinischen Daten benoetigt nur 50 MB zusaetzlich.
Mehr aus “AI/ML”
Inference Engine
Eine Inference Engine ist die Software-Komponente, die ein trainiertes KI-Modell ausfuehrt. Sie optimiert die Modellausfuehrung fuer die jeweilige Hardware (CPU, GPU, NPU). Bekannte Engines sind ONNX Runtime, TensorRT, OpenVINO und Core ML.
AI-PC
Ein AI-PC ist ein Computer mit integrierter NPU, der KI-Aufgaben lokal und energieeffizient ausfuehrt. Microsoft definiert AI-PCs mit mindestens 40 TOPS und Copilot+ Funktion. Sie ermoeglichen Features wie Live-Untertitel, Bildgenerierung und lokale LLMs ohne Cloud.
Token
Ein Token ist die Grundeinheit, die ein LLM verarbeitet. Ein Token entspricht durchschnittlich etwa 0,75 Woertern oder 4 Zeichen. Die Token-Anzahl bestimmt Verarbeitungsdauer und Kosten einer API-Anfrage.
RAG (Retrieval-Augmented Generation)
RAG kombiniert ein LLM mit einer externen Wissensdatenbank, um aktuellere und praesisere Antworten zu liefern. Das System sucht zuerst relevante Dokumente und uebergibt sie als Kontext an das LLM. RAG reduziert Halluzinationen und ermueglicht das Abfragen privater Daten.