Post

Lokale AI API Keys mit GPUstack

Lokale AI API Keys mit GPUstack

Wir experimentieren gerade mit GPUstack als Proof-of-Concept für lokale LLMs. Der Open-Source-GPU-Cluster-Manager scheint auf den ersten Blick alles mitzubringen, was wir brauchen: vLLM plus SSO und OpenAI-kompatible APIs. Kein Cloud-Zwang, volle Kontrolle über unsere Daten, und das alles mit einer relativ unkomplizierten Einrichtung.

GPUstack ist kein Chat-Interface wie ChatGPT, sondern für die Verwendung mit APIs gedacht. Um das Chat-Interface kümmern wir uns an anderer Stelle.

Disclaimer: Dieser Artikel ist keine offizielle Anleitung der Informatikdienste. Vorausgesetzt werden grundlegende Kenntnisse im Bereich KI und idealerweise auch KI-Agenten. Ich empfehle, KI-Tools nur für Aufgaben einzusetzen, die man sich auch selbst zutrauen würde.

Only let the AI do what you would feel comfortable doing yourself!

OpenAI-kompatible APIs

Was ist eine API?

Eine API (Application Programming Interface) ist eine Schnittstelle, über die Software-Anwendungen miteinander kommunizieren können. Sie definiert, wie Anfragen gestellt und Antworten erhalten werden, ohne dass die internen Funktionsweisen sichtbar sind.

APIs sind wie ein Menü in einem Restaurant - du kennst nicht den Weg, wie das Gericht zubereitet wird, aber du weißt, wie du es bestellen und erhalten kannst.

Weitere Informationen findest du hier: APIs für Einsteiger - MDN Web Docs

GPUstack bietet OpenAI-kompatible APIs, die sich als Standard für API Interaktionen mit LLMs durchgesetzt haben. Diese Kompatibilität ermöglicht eine reibungslose Integration in bestehende Workflows und Tools und erleichtert den Wechsel von Cloud-basierten Modellen zu lokalen Lösungen. In der Regel ist es möglich bestehende Anwendungen ohne große Änderungen weiterzuverwenden.

Die API unterstützt alle grundlegenden Funktionen wie:

  • Textgenerierung (completions)
  • Chat-Interaktionen (chat/completions)
  • Prompt-Management
  • Modell-Informationen abrufen

Details findest du in der vollständigen Liste der verfügbaren API Endpunkte.

GPUstack API Key erstellen

Als Erstes brauchen wir einen API-Key für GPUstack.

  1. Auf gpustack.unibe.ch mit SSO einloggen. GPUstack SSO Login

  2. User → API Keys → Key erstellen und kopieren.

    GPUstack API Key erstellen

Den Key gut aufbewahren – er kommt gleich wieder zum Einsatz.

GPUstack APIs verwenden

cURL Request

Du kannst GPUstack-APIs direkt mit cURL aufrufen:

1
2
3
4
5
6
7
8
9
10
11
12
13
curl -X POST https://gpustack.unibe.ch/v1/chat/completions \
  -H "Authorization: Bearer YOUR_API_TOKEN" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3-vl-8b-instruct",
    "messages": [
      {
        "role": "user",
        "content": "Erkläre in einfachen Worten, was GPUstack ist."
      }
    ],
    "temperature": 0.7
  }'

Kleines Python-Skript

Hier ist ein einfaches Python-Skript zur Integration:

1
2
3
4
5
6
7
8
9
10
11
12
13
14
15
16
17
18
import openai

# Konfiguration für GPUstack
client = openai.OpenAI(
    api_key="YOUR_API_TOKEN",
    base_url="https://gpustack.unibe.ch/v1"
)

# API-Aufruf
response = client.chat.completions.create(
    model="qwen3-vl-8b-instruct",
    messages=[
        {"role": "user", "content": "Was sind die Vorteile von GPUstack für lokale KI-Entwicklung?"}
    ],
    temperature=0.7
)

print(response.choices[0].message.content)

Verwendung mit Opencode

Mit Opencode kannst du den Key in deinen Agent-Konfigurationen verwenden, um lokale KI-Agenten zu betreiben, die auf GPUstack basieren. Dies ermöglicht eine vollständig lokale Entwicklungsumgebung ohne Abhängigkeit von Cloud-Diensten - ganz ähnlich zu Claude Code, Codex oder Copilot.

Weitere Details findest du im Blog-Post über lokale KI mit Opencode

This post is licensed under CC BY 4.0 by the author.