AI-Provider einrichten¶
Drei Provider zur Wahl. Pro Instanz ist genau einer als Chat-Provider aktiv; das Embedding-Modell lässt sich unabhängig davon konfigurieren.
Ollama (lokal, empfohlen für Self-Hosting)¶
Vorteile¶
- Daten bleiben im Stack
- Keine API-Kosten
- Kein Internetzugang nötig
Voraussetzungen¶
- Mehrere GB RAM für ein brauchbares Modell — kleine 3B-Modelle laufen mit wenigen GB, größere Modelle brauchen deutlich mehr. Plane Ollama nicht auf einer knapp bemessenen Instanz ein.
- GPU empfohlen, aber optional (NVIDIA mit
nvidia-container-toolkit) - Disk-Platz für die heruntergeladenen Modelle
Aktivieren¶
Ollama ist ein optionales Compose-Profil und standardmäßig aus. Aktivieren:
GPU-Beschleunigung¶
Im Compose-File ist der GPU-Passthrough für den ollama-Service standardmäßig auskommentiert:
ollama:
image: ollama/ollama:latest
profiles: [ai]
# Für GPU-Beschleunigung einkommentieren (nvidia-container-toolkit nötig):
# deploy:
# resources:
# reservations:
# devices:
# - capabilities: [gpu]
Ohne GPU läuft Ollama auf der CPU — für kleinere Modelle brauchbar, für große spürbar langsamer.
Modell installieren¶
Admin → KI:
- Provider: Ollama
- Modellname eintragen (Default bei Erstinstallation:
qwen2.5:3b— ein kompaktes Modell, das auch ohne GPU praktikabel läuft) - Installieren — Fortschritt streamt live
- Embedding-Modell separat eintragen und installieren (z. B.
nomic-embed-text)
Größere Modelle liefern in der Regel bessere Antworten, brauchen aber entsprechend mehr RAM/VRAM. Wer mehr Qualität will als das Default-Modell bietet, kann jedes über Ollama verfügbare Modell eintragen — die Faustregel bleibt: größeres Modell = mehr RAM nötig.
Modelle verwalten¶
Admin → KI → Modelle:
- installierte Modelle auflisten
- Modelle löschen
- Modelle nachinstallieren
Anthropic (Cloud)¶
Voraussetzungen¶
- Anthropic-Account + API-Key
- Outbound-Zugriff auf die Anthropic-API
Konfiguration¶
Admin → KI:
- Provider: Anthropic
- API-Key einsetzen
- Modellname eintragen (Vesana nutzt intern standardmäßig ein aktuelles Haiku-Modell als Fallback, wenn kein Modell gesetzt ist — ein anderes Anthropic-Modell lässt sich frei eintragen)
- Embedding-Modell separat konfigurieren (läuft immer über Ollama, siehe oben — Anthropic bietet keine Embedding-API)
Kosten¶
Pay-as-you-go pro Token, abhängig vom gewählten Modell und der Nutzung. Kosten in der Anthropic-Console im Blick behalten, besonders bei vielen Tenants/Usern.
Externer OpenAI-kompatibler Anbieter¶
Für vLLM, LM Studio, text-generation-inference oder andere Endpoints mit OpenAI-kompatibler Chat-Completion-API:
Admin → KI:
- Provider: Extern
- API-URL eintragen (z. B.
http://gpu-server:8080/v1) - API-Key (falls vom Endpoint verlangt)
- Modellname
Verbindung testen¶
Nach Konfiguration: Verbindung testen schickt eine kleine Testanfrage an den gewählten Provider und zeigt, ob er erreichbar ist (bei Ollama zusätzlich die Liste installierter Modelle).
Konfigurierbare Parameter¶
| Parameter | Bedeutung |
|---|---|
provider |
ollama / anthropic / external |
model |
Chat-Modell |
embed_model |
Embedding-Modell (läuft bei Anthropic immer über Ollama) |
temperature |
Default 0,3 — niedrig = sachlich, hoch = kreativ |
api_url / api_key |
für Anthropic und Extern (Key verschlüsselt gespeichert) |
Weitere Sampling-Parameter (Output-Länge, Nucleus-Sampling) sind aktuell nicht separat in der Admin-Oberfläche einstellbar.
Verhalten bei Provider-Ausfall¶
Ist der konfigurierte Provider nicht erreichbar (Anthropic-Outage, Ollama-Container gestoppt, externer Endpoint down), schlägt die Anfrage mit einer Fehlermeldung fehl — es gibt bewusst keinen automatischen Wechsel auf einen anderen Provider, um keine überraschenden Cloud-Kosten oder unerwarteten Datenabfluss zu einem anderen Anbieter auszulösen. Gecachte Service-Analysen bleiben unabhängig davon abrufbar.
Permission¶
admin.system für die gesamte Provider-Konfiguration (Provider, Modell, API-Key, Modell-Installation/-Löschung, Verbindungstest). Andere User sehen nur, ob AI aktiv ist, ohne Zugriff auf Provider-Details.
Anschluss¶
- AI-Chat & Analyse — wofür der Provider gebraucht wird
- Wiki — Embeddings sind nur sinnvoll, wenn Wiki-Artikel gepflegt sind