INT4 (4-bit Integer)
Definition
INT4 ist ein Quantisierungsformat, das Gewichte mit nur 4 Bits speichert. Es reduziert den Speicherbedarf eines Modells um den Faktor 4 gegenueber FP16. Moderne NPUs und GPUs (wie RTX 50 mit FP4) unterstuetzen INT4/FP4 nativ fuer maximale Effizienz.
Beispiel
Llama 3 70B in INT4 benoetigt nur 35 GB VRAM statt 140 GB in FP16.
Verwandte Begriffe
Mehr aus “AI/ML”
RAG Pipeline
Eine RAG Pipeline ist die Verkettung von Komponenten fuer Retrieval-Augmented Generation: Dokumenten-Ingestion, Chunking, Embedding, Vector-DB-Speicherung, Retrieval und LLM-Generierung. Jeder Schritt kann optimiert werden. Moderne RAG-Pipelines nutzen Re-Ranking und Hybrid Search.
FP16 (Half Precision)
FP16 (16-bit Floating Point) ist das Standardformat fuer KI-Training und Inferenz. Es bietet ausreichend Praezision fuer die meisten Modelle bei halbem Speicherbedarf gegenueber FP32. Tensor Cores sind fuer FP16 optimiert.
Diffusion Model
Diffusion Models generieren Daten (Bilder, Audio, Video), indem sie schrittweise Rauschen entfernen. Sie wurden von Nicht-Gleichgewichts-Thermodynamik inspiriert. Stable Diffusion, DALL-E und Midjourney basieren alle auf Diffusionsarchitektur.
Attention Mechanism
Attention ist ein Konzept in Neural Networks, das dem Modell ermoeglicht, sich auf relevante Teile der Eingabe zu konzentrieren. Self-Attention berechnet fuer jedes Token, wie stark es alle anderen Tokens beeinflusst. Multi-Head Attention ist ein Kernbaustein der Transformer-Architektur.