Lokale AI-Modelle laufen lassen — Hardware-Bedarf
Lokale AI-Modelle sind 2026 eine echte Alternative zur Cloud: Keine Abo-Kosten, keine Latenz, keine Datenschutzbedenken. Aber welche Hardware brauchen Sie?
Warum lokale AI?
| Aspekt | Cloud (ChatGPT etc.) | Lokal (Ollama etc.) |
|--------|---------------------|---------------------|
| Kosten | 20-200 $/Monat | Einmalig Hardware |
| Datenschutz | Daten gehen an Server | 100 % lokal |
| Latenz | 1-5 Sekunden | 0,1-2 Sekunden |
| Verfügbarkeit | Internet nötig | Offline-fähig |
| Modell-Auswahl | Vorgegeben | Frei wählbar |
| Anpassbarkeit | Eingeschränkt | Vollständig (Fine-tuning) |
LLM-Hardware-Bedarf
Der VRAM-Bedarf hängt von der Modellgröße ab. Faustregel: 1 Milliarde Parameter ≈ 2 GB VRAM (bei 4-bit-Quantisierung).
| Modellgröße | VRAM (4-bit Q) | VRAM (8-bit Q) | VRAM (16-bit FP) | Beispiele |
|-------------|----------------|----------------|------------------|-----------|
| 1-3B | 2-4 GB | 4-6 GB | 6-12 GB | Llama 3.2 3B, Qwen 3 1.5B |
| 7-8B | 5-6 GB | 8-10 GB | 16 GB | Llama 3.1 8B, Mistral 7B |
| 14B | 9-11 GB | 16 GB | 28 GB | Qwen 3 14B, Phi-4 |
| 30-35B | 18-22 GB | 35 GB | 60 GB | Command R, Mixtral |
| 70B | 40-45 GB | 75 GB | 140 GB | Llama 3.1 70B, Qwen 3 72B |
| 120B+ | 70+ GB | 130+ GB | 240+ GB | Llama 4 Maverick |
Empfohlene GPUs für LLMs
Einsteiger (7-8B Modelle)
| GPU | VRAM | Preis | Modelle |
|-----|------|-------|---------|
| RTX 4060 | 8 GB | 299 € | 7B (4-bit, knapp) |
| RTX 5060 Ti 16GB | 16 GB | 429 € | 7-14B komfortabel |
| Radeon RX 7600 XT | 16 GB | 329 € | 7-14B (ROCm) |
Mittelklasse (14-30B Modelle)
| GPU | VRAM | Preis | Modelle |
|-----|------|-------|---------|
| RTX 5070 | 12 GB | 629 € | 14B (4-bit) |
| RTX 4070 Ti Super | 16 GB | 799 € | 14B komfortabel |
| Radeon RX 8800 XT | 16 GB | 579 € | 14B (ROCm) |
High-End (70B+ Modelle)
| GPU | VRAM | Preis | Modelle |
|-----|------|-------|---------|
| RTX 5080 | 16 GB | 1.099 € | 14-30B komfortabel |
| RTX 5090 | 32 GB | 1.999 € | 70B (4-bit) |
| 2× RTX 5090 | 64 GB | 3.998 € | 70B komfortabel |
Apple Silicon (Unified Memory)
| Chip | RAM (empfohlen) | Modelle | Vorteil |
|------|-----------------|---------|---------|
| M4 (Base) | 24 GB | 7-14B | Effizient |
| M5 Pro | 48 GB | 30B | Gutes P/L |
| M5 Max | 128 GB | 70B+ | Beste Option |
| M5 Ultra | 256 GB | 120B+ | Workstation |
Apple Vorteil: Unified Memory. Ein M5 Max mit 128 GB kann ein 70B-Modell laden, das auf einer NVIDIA-GPU 140 GB VRAM brauchen würde. Dafür ist die Geschwindigkeit niedriger.
Bildgenerierung (Stable Diffusion)
| Modell | VRAM-Minimum | VRAM-Empfohlen | Geschwindigkeit |
|--------|--------------|----------------|-----------------|
| SD 1.5 | 6 GB | 8 GB | Sehr schnell (1-2 s) |
| SDXL | 8 GB | 12 GB | Schnell (3-5 s) |
| SD 3.5 Large | 10 GB | 16 GB | Mittel (8-12 s) |
| SD 4 | 12 GB | 16-24 GB | Mittel (10-15 s) |
| Flux.1 | 16 GB | 24 GB | Langsam (20-30 s) |
Audio (Speech-to-Text, TTS)
| Modell | VRAM | Anwendung |
|--------|------|-----------|
| Whisper Small | 2 GB | Transkription (mehrere Sprachen) |
| Whisper Large-v3 | 10 GB | Beste Transkriptionsqualität |
| XTTS v2 | 4 GB | Voice-Cloning (Text-zu-Sprache) |
| Parler TTS | 6 GB | Text-zu-Sprache mit Stil-Kontrolle |
CPU-Only: Geht das?
Ja, aber langsam. Mit llama.cpp oder Ollama können Sie LLMs auf der CPU ausführen:
| CPU | 7B-Modell (Token/s) | 14B-Modell (Token/s) |
|-----|---------------------|----------------------|
| Ryzen 5 8600 | 12-15 | 5-7 |
| Ryzen 9 9900X | 18-22 | 8-10 |
| Intel Core Ultra 9 285K | 20-25 | 9-11 |
| Apple M5 (Base) | 25-30 | 12-15 |
Lesegeschwindigkeit: 6-8 Token/s sind für die meisten Nutzer "schnell genug". Ab 12 Token/s fühlt es sich flüssig an.
RAM-Anforderungen (CPU-Inferenz)
| Modellgröße | RAM (4-bit Q) | RAM (8-bit Q) |
|-------------|---------------|---------------|
| 7B | 6 GB | 10 GB |
| 14B | 10 GB | 16 GB |
| 30B | 20 GB | 35 GB |
| 70B | 42 GB | 75 GB |
FAQ
Was ist Ollama?
Ollama ist ein Tool, das lokale LLMs einfach macht — wie Docker für AI-Modelle.
ollama run llama3.1 lädt und startet das Modell. Funktioniert auf macOS, Linux und Windows.Brauche ich eine NVIDIA GPU?
Für beste Performance und Kompatibilität: ja. Mit AMD (ROCm) und Apple (Metal) geht es auch, aber mit Einschränkungen bei Frameworks und Geschwindigkeit.
Wie viel kostet ein kompletter AI-PC?
Ein PC, der 70B-Modelle lokal ausführen kann:
Alternative: Mac Studio M5 Ultra mit 256 GB Unified Memory (~5.500 €) für größte Modelle.
Lohnt sich lokales AI vs Cloud?
Wenn Sie täglich AI nutzen: ein lokales 14B-Modell ist kostenlos nach der Hardware-Investition. Wenn Sie gelegentlich AI nutzen: Cloud ist günstiger.
Fazit
Für den Einstieg: RTX 5060 Ti 16GB oder Apple M5 Mac mit 32 GB — läuft 7-14B Modelle schnell und lokal.
Für ernsthafte Nutzung: RTX 5090 (32 GB VRAM) — lädt 70B-Modelle mit 4-bit-Quantisierung.
Für Profis: Apple Mac Studio M5 Ultra mit 256 GB — die einzige erschwingliche Lösung für 120B+ Modelle.
Der Sweet Spot 2026: Eine RTX 5070 (12 GB) für ~629 € oder ein Mac mit M5 Pro und 48 GB für 14-30B Modelle.