Zum Inhalt

AI-Provider einrichten

Drei Provider zur Wahl. Pro Instanz ist genau einer als Chat-Provider aktiv; das Embedding-Modell lässt sich unabhängig davon konfigurieren.

Ollama (lokal, empfohlen für Self-Hosting)

Vorteile

  • Daten bleiben im Stack
  • Keine API-Kosten
  • Kein Internetzugang nötig

Voraussetzungen

  • Mehrere GB RAM für ein brauchbares Modell — kleine 3B-Modelle laufen mit wenigen GB, größere Modelle brauchen deutlich mehr. Plane Ollama nicht auf einer knapp bemessenen Instanz ein.
  • GPU empfohlen, aber optional (NVIDIA mit nvidia-container-toolkit)
  • Disk-Platz für die heruntergeladenen Modelle

Aktivieren

Ollama ist ein optionales Compose-Profil und standardmäßig aus. Aktivieren:

# .env
COMPOSE_PROFILES=ai
AI_ENABLED=true
docker compose --profile ai up -d ollama

GPU-Beschleunigung

Im Compose-File ist der GPU-Passthrough für den ollama-Service standardmäßig auskommentiert:

ollama:
  image: ollama/ollama:latest
  profiles: [ai]
  # Für GPU-Beschleunigung einkommentieren (nvidia-container-toolkit nötig):
  # deploy:
  #   resources:
  #     reservations:
  #       devices:
  #         - capabilities: [gpu]

Ohne GPU läuft Ollama auf der CPU — für kleinere Modelle brauchbar, für große spürbar langsamer.

Modell installieren

Admin → KI:

  1. Provider: Ollama
  2. Modellname eintragen (Default bei Erstinstallation: qwen2.5:3b — ein kompaktes Modell, das auch ohne GPU praktikabel läuft)
  3. Installieren — Fortschritt streamt live
  4. Embedding-Modell separat eintragen und installieren (z. B. nomic-embed-text)

Größere Modelle liefern in der Regel bessere Antworten, brauchen aber entsprechend mehr RAM/VRAM. Wer mehr Qualität will als das Default-Modell bietet, kann jedes über Ollama verfügbare Modell eintragen — die Faustregel bleibt: größeres Modell = mehr RAM nötig.

Modelle verwalten

Admin → KI → Modelle:

  • installierte Modelle auflisten
  • Modelle löschen
  • Modelle nachinstallieren

Anthropic (Cloud)

Voraussetzungen

  • Anthropic-Account + API-Key
  • Outbound-Zugriff auf die Anthropic-API

Konfiguration

Admin → KI:

  1. Provider: Anthropic
  2. API-Key einsetzen
  3. Modellname eintragen (Vesana nutzt intern standardmäßig ein aktuelles Haiku-Modell als Fallback, wenn kein Modell gesetzt ist — ein anderes Anthropic-Modell lässt sich frei eintragen)
  4. Embedding-Modell separat konfigurieren (läuft immer über Ollama, siehe oben — Anthropic bietet keine Embedding-API)

Kosten

Pay-as-you-go pro Token, abhängig vom gewählten Modell und der Nutzung. Kosten in der Anthropic-Console im Blick behalten, besonders bei vielen Tenants/Usern.

Externer OpenAI-kompatibler Anbieter

Für vLLM, LM Studio, text-generation-inference oder andere Endpoints mit OpenAI-kompatibler Chat-Completion-API:

Admin → KI:

  1. Provider: Extern
  2. API-URL eintragen (z. B. http://gpu-server:8080/v1)
  3. API-Key (falls vom Endpoint verlangt)
  4. Modellname

Verbindung testen

Nach Konfiguration: Verbindung testen schickt eine kleine Testanfrage an den gewählten Provider und zeigt, ob er erreichbar ist (bei Ollama zusätzlich die Liste installierter Modelle).

Konfigurierbare Parameter

Parameter Bedeutung
provider ollama / anthropic / external
model Chat-Modell
embed_model Embedding-Modell (läuft bei Anthropic immer über Ollama)
temperature Default 0,3 — niedrig = sachlich, hoch = kreativ
api_url / api_key für Anthropic und Extern (Key verschlüsselt gespeichert)

Weitere Sampling-Parameter (Output-Länge, Nucleus-Sampling) sind aktuell nicht separat in der Admin-Oberfläche einstellbar.

Verhalten bei Provider-Ausfall

Ist der konfigurierte Provider nicht erreichbar (Anthropic-Outage, Ollama-Container gestoppt, externer Endpoint down), schlägt die Anfrage mit einer Fehlermeldung fehl — es gibt bewusst keinen automatischen Wechsel auf einen anderen Provider, um keine überraschenden Cloud-Kosten oder unerwarteten Datenabfluss zu einem anderen Anbieter auszulösen. Gecachte Service-Analysen bleiben unabhängig davon abrufbar.

Permission

admin.system für die gesamte Provider-Konfiguration (Provider, Modell, API-Key, Modell-Installation/-Löschung, Verbindungstest). Andere User sehen nur, ob AI aktiv ist, ohne Zugriff auf Provider-Details.

Anschluss

  • AI-Chat & Analyse — wofür der Provider gebraucht wird
  • Wiki — Embeddings sind nur sinnvoll, wenn Wiki-Artikel gepflegt sind