Hysen Labs
KI & MASCHINELLES LERNEN · ARCHITEKTURLEITFADEN

Ollama erklärt: So funktioniert lokales Model-Serving

Ein Praxisleitfaden zu Architektur, Modellpaketen, APIs, Kompromissen und Produktionseinsatz.

Hysen Labs Redaktion · 12 Min. Lesezeit · geprüft im Juli 2026
01

In einer Minute

Ollama bündelt Modellgewichte, Konfiguration und Prompt-Vorlagen zu einem reproduzierbaren lokalen Artefakt. Ein Hintergrunddienst lädt es und stellt eine kleine HTTP-API bereit; der CLI-Client übernimmt Abruf, Ausführung und Verwaltung.

02

So arbeitet die Architektur

Entwickler nutzen CLI oder REST-API. Ollama löst das Modellmanifest auf, lädt fehlende Schichten, bereitet die Laufzeit vor und streamt erzeugte Token zurück. Modelldateien werden nach Möglichkeit zwischen Manifesten geteilt.

Drei hilfreiche Denkmodelle

  1. Registry und Paketformat: Benannte Modellmanifeste verweisen auf wiederverwendbare Schichten.
  2. Lokaler Modellserver: Ein dauerhafter Prozess verwaltet Laden und Inferenzanfragen.
  3. Entwicklerschnittstelle: CLI und HTTP-Endpunkte halten übliche Abläufe kompakt.

Produktionscheckliste und Fehlerquellen

Kapazität und Kaltstarts

Messen Sie Ladezeit und Spitzenverbrauch für jede Kombination aus Modellgröße und Quantisierung. Begrenzen Sie Parallelität, bevor Speicherdruck Modelle verdrängt oder Swapping auslöst.

Sicherheitsgrenze

Stellen Sie die lokale API keinem nicht vertrauenswürdigen Netz direkt bereit. Schalten Sie Authentifizierung, Limits für Rate und Anfragegröße sowie Audit-Protokolle davor.

Betriebscheckliste

  • Modellnamen und Digests für reproduzierbare Bereitstellungen festschreiben.
  • Zeit bis zum ersten Token, Token pro Sekunde und Fehlerraten messen.
  • Modellspeicher von kurzlebigen Anwendungscontainern trennen.
  • Geordneten Rückfall ohne GPU-Beschleunigung testen.
03

Häufige Fragen

Funktioniert Ollama komplett ohne Internet?

Ja — nach dem ersten Pull läuft alles lokal. Deine Prompts verlassen nie deinen Rechner. Nur: Wenn du Drittanbieter-Tools obendrauf einsetzt, check kurz deren Netzwerkverhalten.

Moment — ist Ollama ein Trainingswerkzeug?

Nein! Ollama dreht sich darum, Modelle auszuführen, nicht zu trainieren. Stell es dir wie einen Motor vor — er fährt das Auto, baut es aber nicht. Für Fine-Tuning und Training brauchst du PyTorch, LoRA oder Axolotl.

Wann sollte ich von Ollama wegwechseln?

Ollama glänzt bei lokaler Entwicklung und kleinen Teams. Du wächst raus, wenn du Multi-User-Queuing, feine GPU-Steuerung, Produktionsmetriken oder horizontale Skalierung brauchst. Dann sind vLLM, TGI oder Triton die richtige Adresse.

06

Primärquellen