While local models work well for Chat, Edits, and Agent Mode, GitHub Copilot’s real-time inline ghost-text autocompletion relies on custom, specialized models trained for ultra-fast response times. Local LLMs configured via (BYOK/BYOM) are generally limited to the Chat/Agent APIs rather than replacing the real-time completion engine.
VSCode extension for Continue¶
If you want 100% offline inline completions + chat using local models, popular dedicated open-source extensions like Continue are often preferred.
🛠️ How to set it up...
Install Continue VSCode extension.
Add the following lines to Continue’s main YAML config file:
models:
- name: Qwen3.5
provider: openai
model: qwen3.5:4b-q4_K_M
apiBase: http://localhost:12434/engines/v1
roles:
- chat
- edit
- apply
- autocomplete