Continue.dev: GitHub Copilot selbst hosten in VS Code und JetBrains mit Ollama
Continue.dev ersetzt das kostenpflichtige GitHub-Copilot-Abo durch eine datenschutzkonforme, lokale Alternative. Mit Ollama als Inferenz-Engine läuft alles auf deiner eigenen Hardware – kein Code verlässt dein Netzwerk, keine Cloud-Abhängigkeit, null laufende Lizenzkosten.

GitHub Copilot ist praktisch – aber mit $10 bis $19 pro Nutzer und Monat sowie der Tatsache, dass jede Codezeile an Microsoft-Server übertragen wird, passt es nicht zu jedem Team. Continue.dev löst genau dieses Problem: Die quelloffene Erweiterung (Apache 2.0) für VS Code und JetBrains verbindet sich mit einem lokalen Ollama-Server und liefert Tab-Autocomplete, Chat und Code-Edit vollständig auf deiner eigenen Hardware – ohne Cloud, ohne Abo, ohne DSGVO-Bauchschmerzen. Diese Anleitung zeigt dir den vollständigen Aufbau, erklärt die sinnvolle Modellwahl für KMU-Hardware und vergleicht die echten Kosten mit GitHub Copilot.
Voraussetzungen
- PC oder Server mit mindestens 8 GB RAM (empfohlen: 16 GB+)
- Optionale dedizierte GPU mit mindestens 8 GB VRAM für flüssige 7B-Modelle (z. B. NVIDIA RTX 3060/4060 oder höher); ohne GPU laufen kleinere Modelle auf der CPU, aber langsamer
- Betriebssystem: Windows 10/11, macOS oder Linux
- VS Code oder eine JetBrains-IDE (IntelliJ IDEA, PyCharm, WebStorm, GoLand u. a.)
- Internetverbindung für die Erstinstallation und den Modell-Download (danach optional)
- Freier Festplattenplatz:
qwen2.5-coder:1.5bca. 1 GB,qwen2.5-coder:7bca. 4,7 GB
Schritt 1: Ollama installieren und starten
Ollama ist die lokale Inferenz-Engine, die Continue.dev als Backend nutzt. Sie stellt eine OpenAI-kompatible REST-API auf http://localhost:11434 bereit – Continue.dev sendet seine Anfragen genau dorthin.
# Windows: Installer herunterladen von https://ollama.com/download/windows
# Nach der Installation läuft Ollama automatisch als Hintergrundprozess.
# Linux (einzeiliger Installer):
curl -fsSL https://ollama.com/install.sh | sh
# macOS: .dmg-Datei von https://ollama.com/download/mac
# Linux/macOS: Dienst manuell starten (falls nicht automatisch aktiv)
ollama serveUnter Linux empfiehlt sich außerdem die Einrichtung als systemd-Dienst, damit Ollama nach einem Reboot automatisch läuft. Weitere Details dazu findest du in der Anleitung Ollama-Modelle 2026 richtig auswählen: VRAM, Quantisierung und Modellvergleich für KMU.
Verifizieren: Öffne im Browser http://localhost:11434 – du solltest die Antwort Ollama is running sehen.
Schritt 2: Passende Modelle herunterladen
Die Modellwahl entscheidet maßgeblich darüber, wie flüssig sich Continue.dev anfühlt. Für Tab-Autocomplete ist Reaktionszeit wichtiger als Qualität: Alles über ~500 ms fühlt sich störend an. Für den Chat-Modus zählt dagegen Codequalität.
# Autocomplete-Modell: leichtgewichtig, schnell, läuft auch rein auf CPU/RAM
ollama pull qwen2.5-coder:1.5b
# Chat- und Edit-Modell: hohe Codequalität, benötigt ~8 GB VRAM (oder mehr RAM für CPU-Betrieb)
ollama pull qwen2.5-coder:7b
# Optional: Reasoning-Modell für High-End-Hardware (32 GB VRAM)
# ollama pull deepseek-r1:32b
# Heruntergeladene Modelle prüfen
ollama listVerifizieren: ollama list zeigt beide Modelle mit Größe und Modifikationsdatum. Beispielausgabe:
NAME ID SIZE MODIFIED
qwen2.5-coder:7b 2b0496514337 4.7 GB 2 minutes ago
qwen2.5-coder:1.5b 0b5f6afdc31f 986 MB 3 minutes agoDie folgende Tabelle gibt dir einen Überblick über empfohlene Modelle und ihre Hardwareanforderungen:
| Modell | Ollama-Tag | Rolle | VRAM/RAM | HumanEval Pass@1 | Kontext |
|---|---|---|---|---|---|
| qwen2.5-coder:1.5b | qwen2.5-coder:1.5b | Autocomplete | ~4 GB | – | 32k |
| qwen2.5-coder:7b | qwen2.5-coder:7b | Chat/Edit | ~8 GB | 88,4 % | 128k |
| llama3.1:8b | llama3.1:8b | Chat | ~8 GB | – | 128k |
| starcoder2:3b | starcoder2:3b | Autocomplete | ~4 GB | – | 16k |
| deepseek-r1:32b | deepseek-r1:32b | Chat/Reasoning | ~32 GB | – | 128k |
Wichtig beim Modell-Tag: Gib den Tag immer explizit an (z. B. qwen2.5-coder:7b). Ein ollama pull qwen2.5-coder ohne Tag lädt möglicherweise eine andere Variante als gewünscht.
Schritt 3: Continue.dev installieren
VS Code
# Über das Extensions-Panel: Strg+Shift+X → "Continue" suchen → Installieren
# Oder direkt über die Kommandozeile (falls VS Code CLI verfügbar):
code --install-extension Continue.continueJetBrains IDEs
# Settings → Plugins → Marketplace → "Continue" suchen (Plugin-ID: 22707)
# Nach der Installation muss die IDE neu gestartet werden.Hinweis für JetBrains-Nutzer: Das Plugin wird seit 2025/2026 als „Community-Maintained" eingestuft. Das offizielle Continue-Team entwickelt primär die VS-Code-Erweiterung und die Continue CLI weiter. Plane das bei der Entscheidung für dein Team ein.
Verifizieren: In VS Code erscheint in der linken Seitenleiste das Continue-Icon (ein Dreieck mit Pfeil). Ein Klick öffnet das Chat-Panel.
Schritt 4: config.yaml einrichten
Die gesamte Konfiguration von Continue.dev liegt in einer einzigen Datei:
- Windows:
%USERPROFILE%\.continue\config.yaml - Linux/macOS:
~/.continue/config.yaml
Du erreichst sie in VS Code über das Zahnrad-Icon in der Continue-Seitenleiste → „Open config.yaml".
Das folgende Beispiel zeigt ein vollständiges KMU-Setup mit Chat/Edit auf qwen2.5-coder:7b und Tab-Autocomplete auf qwen2.5-coder:1.5b. Beide Modelle laufen ausschließlich lokal – kein einziges Token verlässt dein Netzwerk:
# ~/.continue/config.yaml
# DSGVO-konformes KMU-Setup – nur lokale Ollama-Modelle, kein Cloud-Zugriff
models:
# Chat- und Edit-Modell: hohe Codequalität
- name: Qwen2.5-Coder 7B (lokal)
provider: ollama
model: qwen2.5-coder:7b
apiBase: http://localhost:11434
roles:
- chat
- edit
defaultCompletionOptions:
contextLength: 8192
maxTokens: 2048
keepAlive: 1800 # Modell 30 Minuten im Speicher halten (reduziert Kaltstart)
# Tab-Autocomplete-Modell: leichtgewichtig, Antwortzeit unter 500 ms
- name: Qwen2.5-Coder 1.5B Autocomplete
provider: ollama
model: qwen2.5-coder:1.5b
apiBase: http://localhost:11434
roles:
- autocomplete
autocompleteOptions:
disable: false
debounceDelay: 250 # Wartezeit in ms vor dem Senden der Anfrage
maxPromptTokens: 1024 # Kontextgröße für Autocomplete begrenzen
modelTimeout: 150 # Timeout in Sekunden
onlyMyCode: true # Nur Code aus dem eigenen Projekt als Kontext
multilineCompletions: "always"
maxSuffixPercentage: 0.2
prefixPercentage: 0.3
# Optional: Alternativ-Modell für Leistungsstarke Hardware (32 GB VRAM)
# - name: DeepSeek R1 32B
# provider: ollama
# model: deepseek-r1:32b
# apiBase: http://localhost:11434
# roles:
# - chat
# - editSpeichere die Datei. Continue.dev lädt die Konfiguration automatisch neu – kein IDE-Neustart notwendig.
Verifizieren: Öffne in VS Code das Continue-Chat-Panel und stelle eine Frage wie „Schreib eine Python-Funktion, die eine Liste sortiert." Das Modell sollte innerhalb weniger Sekunden antworten. Beim ersten Aufruf kann der Kaltstart 10–30 Sekunden dauern, weil das Modell in den Speicher geladen wird – das ist normal.
Schritt 5: Tab-Autocomplete aktivieren und testen
Tab-Autocomplete ist in Continue.dev standardmäßig aktiviert, sobald in der config.yaml ein Modell mit der Rolle autocomplete definiert ist. Öffne eine Code-Datei in VS Code, tippe den Beginn einer Funktion und warte kurz – Continue.dev zeigt einen grauen Vervollständigungsvorschlag an, den du mit Tab übernimmst.
Einige Stellschrauben für flüssiges Autocomplete:
- debounceDelay: 250 ms ist ein guter Startwert. Erhöhe ihn auf 400–500 ms, wenn Vorschläge zu aggressiv erscheinen.
- modelTimeout: Bei 150 Sekunden Timeout bricht Continue.dev langsame Anfragen ab. Auf reiner CPU-Hardware kann es sinnvoll sein, diesen Wert zu erhöhen.
- onlyMyCode: Mit
trueverwendet Continue.dev nur Code aus dem aktuell geöffneten Projekt als Kontext – das verhindert irrelevante Vorschläge aus dem Indexierungscache.
Kostenvergleich: Continue.dev + Ollama vs. GitHub Copilot
Seit dem 1. Juni 2026 stellt GitHub Copilot auf verbrauchsbasierte Abrechnung per AI Credits um. Die folgende Tabelle zeigt den direkten Vergleich:
| Merkmal | Continue.dev + Ollama | Copilot Pro | Copilot Business |
|---|---|---|---|
| Monatliche Kosten | $0 (nach Hardware) | $10/Monat/User | $19/Monat/User |
| Jährliche Kosten (5 User) | $0 | $600 | $1.140 |
| Datenschutz/DSGVO | Vollständig lokal | Daten an GitHub/MS | Daten an GitHub/MS |
| Code verlässt Netz | Nein | Ja | Ja |
| Modellauswahl | Beliebig (Ollama) | Fest vorgegeben | Fest vorgegeben |
| Open Source | Ja (Apache 2.0) | Nein | Nein |
| Offline-Betrieb | Vollständig offline | Nicht möglich | Nicht möglich |
Zur Einordnung der Qualität: qwen2.5-coder:7b erreicht auf dem HumanEval-Benchmark 88,4 % Pass@1 – und übertrifft damit GPT-4 (87,1 %) bei Standard-Coding-Aufgaben. Bei komplexen Multi-File-Refactorings oder sehr seltenen Frameworks kann ein Cloud-Modell noch Vorteile haben. Wer einen hybriden Ansatz bevorzugt, kann in der config.yaml zusätzlich einen Cloud-Provider als zweites Chat-Modell konfigurieren – Continue.dev unterstützt neben Ollama auch OpenAI-kompatible APIs, HuggingFace TGI und vLLM.
Wer sich für das Thema DSGVO-konformer KI-Einsatz interessiert, findet in der Anleitung Lokale KI datenschutzkonform betreiben: DSGVO-Checkliste für On-Premise-LLM-Deployments eine umfassende Checkliste für KMU.
Troubleshooting / Typische Fehler
Continue.dev zeigt „Could not connect to Ollama"
Ollama läuft nicht oder ist nicht erreichbar. Prüfe mit curl http://localhost:11434 – du solltest Ollama is running erhalten. Unter Windows startet Ollama nach einem Neustart nicht automatisch, sofern kein Autostart eingerichtet wurde. Starte Ollama manuell über das Startmenü oder die Taskleiste.
Falscher apiBase-Wert bei Remote-Ollama
Wenn Ollama auf einem separaten Server läuft (z. B. einer GPU-Workstation im Büronetzwerk), muss in der config.yaml apiBase auf die korrekte IP zeigen: http://192.168.1.100:11434. Auf dem Server muss außerdem die Umgebungsvariable gesetzt sein:
OLLAMA_HOST=0.0.0.0 ollama serveTab-Autocomplete fühlt sich träge an
Das gewählte Autocomplete-Modell ist zu groß. Modelle über ~3B Parameter sind für Tab-Autocomplete ungeeignet – Antwortzeiten über 500 ms stören den Schreibfluss spürbar. Wechsle zu qwen2.5-coder:1.5b oder starcoder2:3b.
YAML-Syntaxfehler in config.yaml
YAML ist einrückungsempfindlich. Tabs sind grundsätzlich verboten – verwende ausschließlich Leerzeichen. Ein einziger Einrückungsfehler verhindert den Start von Continue. Validiere die Datei mit einem Online-YAML-Linter oder mit:
python3 -c "import yaml; yaml.safe_load(open('~/.continue/config.yaml'))"Erster Request dauert sehr lange (Kaltstart)
Beim ersten Aufruf nach dem IDE-Start muss das Modell in den Speicher geladen werden. Das dauert je nach Hardware 10–30 Sekunden. Der keepAlive: 1800-Parameter in der config.yaml hält das Modell danach 30 Minuten im Speicher und verhindert weitere Kaltstarts.
VRAM-Unterschätzung bei quantisierten Modellen
Quantisierte Modelle (z. B. Q4_K_M) belegen ca. 50–60 % des VRAM gegenüber voller Präzision und laufen notfalls auch auf CPU+RAM – allerdings deutlich langsamer. Ohne dedizierte GPU mit mindestens 8 GB VRAM sind Modelle bis ~7B der sinnvolle Rahmen.
Hoher contextLength-Wert erhöht RAM-Bedarf
Ein contextLength von 32k erhöht den RAM/VRAM-Bedarf erheblich. Für 7B-Modelle mit 32k Kontext sind mindestens 16 GB RAM empfohlen. Starte mit 8192 Tokens und erhöhe den Wert bei Bedarf schrittweise.
Häufige Fragen
Läuft Continue.dev komplett offline?
Ja, im reinen Ollama-Setup verlässt kein Datenbyte das lokale Netzwerk. Continue.dev kommuniziert ausschließlich mit der lokalen Ollama-API auf http://localhost:11434. Eine Internetverbindung ist nur für die Erstinstallation der Erweiterung und den Modell-Download erforderlich.
Welches Modell ist der beste Einstieg für ein KMU mit normaler Hardware (16 GB RAM, keine GPU)?
Empfohlen wird qwen2.5-coder:1.5b für Autocomplete – dieses Modell läuft auch rein auf CPU und RAM mit akzeptabler Geschwindigkeit. Für Chat und Edit ist qwen2.5-coder:7b die erste Wahl, läuft aber ohne GPU spürbar langsamer. Als praktikable Alternative ohne GPU eignet sich auch starcoder2:3b für Autocomplete.
Kann ich mehrere Modelle gleichzeitig in config.yaml definieren?
Ja, du kannst beliebig viele Modelle definieren. Über das roles-Array steuerst du, welches Modell für Chat, Edit oder Autocomplete verwendet wird. Continue.dev wechselt automatisch zum konfigurierten Autocomplete-Modell – im Chat-Panel kannst du außerdem manuell zwischen Chat-Modellen wechseln.
Ist Continue.dev DSGVO-konform für den Einsatz in KMU?
Im lokalen Ollama-Setup ja: Da weder Code noch Nutzerdaten an externe Server übertragen werden, entfallen Anforderungen wie Auftragsverarbeitungsverträge mit Cloud-Anbietern. Prüfe intern, ob Unternehmensrichtlinien weitere Maßnahmen erfordern – eine vollständige Checkliste liefert die Anleitung zur datenschutzkonformen KI auf eigener Hardware.
Wie unterscheidet sich Continue.dev von GitHub Copilot qualitativ?
Für Standard-Coding-Aufgaben und einzelne Funktionen ist qwen2.5-coder:7b mit 88,4 % HumanEval Pass@1 auf Augenhöhe mit GPT-4-basierten Lösungen. Bei komplexen Multi-File-Refactorings oder sehr seltenen Frameworks kann ein Cloud-Modell noch Vorteile bieten. Entscheidend ist auch, dass du mit Ollama jederzeit auf bessere Modelle wechseln kannst, sobald diese verfügbar sind.
Muss Ollama immer laufen, wenn ich Continue.dev nutze?
Ja, Ollama muss als Dienst aktiv sein. Unter Windows läuft es nach der Installation als Hintergrundprozess im Tray. Unter Linux empfiehlt sich die Einrichtung als systemd-Dienst (ollama serve), damit es nach einem Reboot automatisch startet.
Fazit
Continue.dev mit Ollama ist kein Kompromiss, sondern eine echte Alternative zu GitHub Copilot – besonders für Teams, die Datenschutz ernst nehmen. Die Einrichtung dauert unter 30 Minuten, die laufenden Kosten liegen bei null, und die Qualität moderner Coder-Modelle wie qwen2.5-coder:7b ist nachweislich auf Augenhöhe mit proprietären Lösungen. Der einzige echte Nachteil ist das Fehlen einer automatischen Cloud-Absicherung bei Hardware-Problemen – wer das absichern will, definiert in der config.yaml ein Cloud-Modell als manuellen Fallback.
Für KMU mit mehreren Entwicklern ist der ROI eindeutig: Die Hardware amortisiert sich bereits nach wenigen Monaten gegenüber dem Copilot-Business-Abo. Und anders als bei proprietären Lösungen bist du nicht an ein bestimmtes Modell gebunden – sobald ein besseres Open-Source-Modell erscheint, ist der Wechsel eine Frage von einem einzigen ollama pull-Befehl.
Weiterführende Anleitungen und Quellen
- Ollama-Modelle 2026 richtig auswählen: VRAM, Quantisierung und Modellvergleich für KMU
- DeepSeek R1 lokal betreiben: Modellwahl, Quantisierung und VRAM-Bedarf
- Lokale KI datenschutzkonform betreiben: DSGVO-Checkliste für On-Premise-LLM-Deployments
- Ollama und Open WebUI mit Docker: eigenes lokales KI-Sprachmodell ohne Cloud betreiben
- Continue.dev Dokumentation: Ollama Guide (englisch)
- GitHub: continuedev/continue (Quellcode, Apache 2.0)
- Ollama – offizielle Website