Anleitungen aus der Praxis
Getestete Schritt-für-Schritt-Anleitungen aus realen Kundenumgebungen — sicher, dokumentiert, nachvollziehbar.

OpenSign mit Docker installieren: E-Signaturen selbst hosten
OpenSign selbst hosten: Docker-Compose-Stack mit Caddy und MongoDB, eigene Secrets, keine offenen Datenbankports, HTTPS, SMTP, Signaturzertifikat, Backup und Updates, dazu die Grenzen einfacher E-Signaturen.

Owncast 0.3 mit Docker installieren: Selbstgehostete Live-Streaming-Plattform mit integriertem Chat
Owncast ist die quelloffene Twitch-Alternative als Docker-Container: RTMP-Ingest, HLS-Transcodierung, Webplayer und Chat ohne externe Datenbank. Diese Anleitung zeigt, wie Sie Owncast 0.3 in 15 Minuten auf einem Linux-Host produktionsbereit aufsetzen und eine bestehende 0.2-Installation umstellen.

Solidtime mit Docker installieren: Modernes Open-Source-Zeiterfassungstool für Agenturen und Freelancer
Solidtime ist ein Open-Source-Zeiterfassungstool mit Projekten, Kunden, abrechenbaren Stunden und Import aus Toggl und Clockify. Die Anleitung zeigt die Installation per Docker Compose mit festem Image-Tag, Key-Generierung und erstem Admin.

DeepSeek lokal betreiben: R1-Modelle mit Ollama, Modellwahl und VRAM-Bedarf
DeepSeek lokal nutzen: welche R1-Variante zu welcher GPU passt, warum DeepSeek V4 nur in der Cloud läuft und wie Sie Ollama 0.35 per Docker mit Kontext, Denkausgabe und Modelfile einrichten.

Qwen3 lokal betreiben: 4B bis 32B per Ollama und vLLM mit Thinking-Mode
Qwen3 lokal per Ollama oder vLLM betreiben: Modellwahl nach VRAM, Thinking-Mode per /set nothink, think-Parameter oder enable_thinking steuern, vLLM-API mit Reasoning-Parser und YaRN für langen Kontext.

Microsoft Phi-4 lokal betreiben: 14B Reasoning-Modell auf Consumer-GPU
Phi-4 von Microsoft liegt auf Mathe- und Reasoning-Benchmarks vor GPT-4o und läuft per Ollama, Microsoft Foundry Local oder llama.cpp auf einer RTX 3080. Die Anleitung zeigt alle drei Wege, die Quantisierungswahl für 8 bis 12 GB VRAM und typische Fehler.

QLoRA Fine-Tuning mit Unsloth: Eigenes LLM auf einer Consumer-GPU spezialisieren
Wer ein lokales Llama- oder Qwen-Modell per Ollama betreibt, spezialisiert es mit QLoRA und Unsloth auf eigene Firmendaten: auf einer RTX 3060 oder RTX 4060 mit 8 GB VRAM, vollständig lokal und ohne Cloud.

LM Studio als lokale KI-Workstation einrichten: Modelle verwalten, testen und per API bereitstellen
LM Studio unter Windows einrichten: GGUF-Modelle aus Hugging Face laden, die passende Quantisierung wählen und einen lokalen OpenAI-kompatiblen API-Server starten, auch ohne Oberfläche per lms und llmster.

Continue.dev: GitHub Copilot selbst hosten in VS Code und JetBrains mit Ollama
Continue.dev ist eine quelloffene Alternative zu GitHub Copilot für VS Code und JetBrains. Mit Ollama laufen Autocomplete und Chat auf eigener Hardware, der Code verlässt Ihr Netzwerk nicht.

Embedding-Server lokal betreiben: sentence-transformers und FastEmbed mit Qdrant
Qdrant läuft, aber was erzeugt die Vektoren? Diese Anleitung zeigt FastEmbed (direkt im qdrant-client, ONNX, keine GPU-Pflicht) und den Infinity Embedding Server (Docker, OpenAI-API) – DSGVO-konform auf eigener Hardware.