Ollama
AktivFuehre KI-Modelle lokal aus — die Open-Source-Inferenz-Engine mit 176K GitHub Stars
The default choice for local LLM inference — and for good reason. 176K GitHub stars, 9M+ users, MIT license, one-command setup. Runs on any hardware from Raspberry Pi 5 to dual H100s, with a model catalog spanning 4,500+ open-weight options. The OpenAI-compatible API with streaming, tool calling, structured outputs, and embeddings means no vendor lock-in — swap from Ollama to OpenAI (or vice versa) by changing one URL. Ollama Cloud (Pro $20/mo, Max $100/mo) extends the same surface to managed inference. The recent $65M raise confirms sustained investment. For any developer who wants to run AI locally — whether for privacy, cost control, or offline use — Ollama is where you start.
Each inference request is a stateless REST API call — no carried AI context between requests
Ist es das Richtige für dich?
Gut für
- Local-First-KI-Entwicklung – über 4.500 Modelle auf eigener Hardware mit null API-Kosten betreiben
- Datenschutzsensible Workloads – alle Inferenz bleibt auf deiner Infrastruktur, verlässt nie die Maschine
- Kostenkontrollierte KI – feste Hardwarekosten ersetzen Token-Abrechnung; Break-Even bei ~$200/Monat API-Ausgaben
- Offline-/abgeschottete Umgebungen – kein Internet nötig nach Modell-Download
- Entwickler-Toolchain-Integration – OpenAI-kompatible API funktioniert mit LangChain, LlamaIndex, Hermes Agent, Continue.dev
Nicht geeignet für
- Frontier-Modell-Zugriff – kann nur Open-Weight-Modelle ausführen; kein GPT-5.6, Claude oder Gemini über Ollama
- Teams ohne GPU-Hardware – 70B+-Modelle auf CPU sind nicht praktikabel (unter 1 tok/s)
- Zero-Ops Managed Serving – Cloud-Pläne existieren, aber das lokale Produkt erfordert Hardware-Management
Unsere Erfahrung
Preise
Open Source- Jedes kompatible Open-Weight-Modell auf eigener Hardware ausführen
- Keine Nutzungslimits, keine API-Keys, keine Daten verlassen deine Maschine
- Tägliches Kontingent zum Experimentieren
- Gleiche API-Oberfläche wie lokale Laufzeitumgebung
- Vollständiger Open-Weight-Katalog
- Höhere Ratenlimits pro Minute
- 10 Cloud-Modelle gleichzeitig ausführen
- 5-mal mehr Nutzung als Pro
Noch keine Urteilsänderungen
Die Uhr läuft ab dem ersten Tag — Änderungen erscheinen hier, sobald sich unser Urteil weiterentwickelt.
Quellen
- Ollama — official websiteJuli 2026
- Ollama — GitHub repositoryJuli 2026
- TechCrunch — Ollama raises $65M Series B, grows to nearly 9M usersJuli 2026
- Pooya Golchian — Ollama Cloud Pricing 2026Juli 2026
- Thunder Compute — What is Ollama: Run AI Models Locally (July 2026)Juli 2026
- Kunal Ganglani — Best Local LLMs in 2026: Models, Hardware & Setup GuideJuli 2026
- DanubeData — Run Ollama on a VPS: Self-Host Local LLMs in Europe (2026)Juli 2026
Prüfprotokoll
- Profil— Keine Änderungen
Beim Start importiert
- Preise— Keine Änderungen
Beim Start importiert