# Ollama Release Notes

> 28 Updates, 1 aktive Quellen, zuletzt aktualisiert am 29. September 2026.

Quelle: [Seite](https://updatefeed.de/updates/ollama) · Feed: [RSS](https://updatefeed.de/feed/ollama/feed.rss)

## September 2026

### Ollama 0.35.1: Clef-Modelle, mehr Websuchen und CAPABILITY in Modelfiles

29. September 2026 · Version 0.35.1

Ollama unterstützt die multimodalen Decision-Modelle Clef und Clef Flash über /v1/systemone, erlaubt bis zu zehn Websuchen pro Antwort, bietet CAPABILITY-Deklarationen in Modelfiles und meldet für Decision-Modelle nur noch „decision“ als Fähigkeit.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.35.1)

### Ollama 0.35.0: Unterstützung für Decision-Modelle über /v1/systemone

28. September 2026 · Version 0.35.0

Ollama unterstützt jetzt Decision-Modelle wie Nimble und Tev1 über /v1/systemone, die statt Text Entscheidungen, Wahrscheinlichkeiten und Scores zurückgeben.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.35.0)

### Ollama 0.40.0: MLX auf Apple Silicon jetzt Standard

25. September 2026 · Version 0.40.0

Auf Apple Silicon laufen Modellarchitekturen, die die MLX-Runtime unterstützt, jetzt standardmäßig auf MLX, darunter gemma4, qwen3.6, qwen3.5, mehrere Decision-Modelle sowie das Embedding-Modell embeddinggemma-2.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.40.0)

### Ollama 0.34.4: Strukturierte Ausgaben in einem Durchgang, Fehlerbehebungen

23. September 2026 · Version 0.34.4

Strukturierte Ausgaben bei Thinking-Modellen laufen in einem Durchgang, außerdem gibt es Fehlerbehebungen (Model-not-found, hängende macOS-App), schnellere Qwen-3.8-Verarbeitung und bessere Bildauflösung bei Gemma 4 auf Apple Silicon.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.34.4)

### Ollama 0.34.3: Thinking-Steuerung in show, Nemotron-H-Vision mit MLX

19. September 2026 · Version 0.34.3

GET /api/show und `ollama show` zeigen nun die Thinking-Steuerung und den Standardwert jedes Modells an, Nemotron-H-Vision-Modelle laufen auf Apple Silicon mit MLX, und Modell-Pulls von HuggingFace sowie das Fensterverhalten der macOS-App wurden korrigiert.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.34.3)

### Version 0.34.2: Setup beim ersten Start, ollama://apps, MLX-Speicherfix

15. September 2026 · Version 0.34.2

Beim ersten Start von `ollama` gibt es ein Setup mit Anmelde- oder lokaler Option, `ollama://apps` öffnet die Apps-Seite der Desktop-App, und übermäßiges Speicherwachstum bei MLX Speculative Decoding wurde behoben.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.34.2)

### Version 0.34.1: MLX-Safetensors-Create stabil, schnellere /api/tags

14. September 2026 · Version 0.34.1

`ollama create` mit MLX-Safetensors ist nicht mehr experimentell, /api/tags ist bei großen Modellbibliotheken deutlich schneller, die Erkennung wiederholter Tokens ist weniger fehleranfällig und `typical_p` ist veraltet.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.34.1)

### Version 0.34.0: Ollama-Modelle in ChatGPT Desktop, schnellere strukturierte Ausgaben

5. September 2026 · Version 0.34.0

Ollama-Modelle lassen sich jetzt direkt in ChatGPT Desktop nutzen, zudem wurden strukturierte Ausgaben auf Apple Silicon beschleunigt und Tool-Suche sowie Response Compaction für OpenAI-kompatible Clients ergänzt.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.34.0)

### Version 0.33.3: gemma4 mit Bild und Audio auf MLX, gecachte Tokens

2. September 2026 · Version 0.33.3

gemma4 unterstützt auf der MLX-Engine nun Bilder und Audio, gecachte Prompt-Tokens werden gemeldet und im GGUF-Modell definierte Standardparameter werden berücksichtigt.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.33.3)

## August 2026

### Version 0.33.2: Systemdesign mit Dark Mode, macOS-Übergabe an laufende Instanz

27. August 2026 · Version 0.33.2

Die Ollama-App folgt wieder dem Systemdesign inklusive Dark Mode, die macOS-App übergibt an eine bereits laufende Instanz, und der Claude-Desktop-Proxy unterbricht laufende Anfragen bei Katalog-Updates nicht mehr.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.33.2)

### Version 0.33.1: Qwen3.8 Flash Next unter MLX, strukturierte Ausgaben

26. August 2026 · Version 0.33.1

Unter MLX wird Qwen3.8 Flash Next unterstützt, der mlxrunner bietet strukturierte Ausgaben und vermeidet Metal-GPU-Timeouts beim Laden von langsamem Speicher.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.33.1)

### Version 0.33.0: Claude Desktop mit Ollama-Gateway, besseres Prefill-Caching

21. August 2026 · Version 0.33.0

Claude Desktop lässt sich nun mit Ollama als Drittanbieter-Gateway konfigurieren, das Prefill-Caching wurde verbessert (u. a. Hänger bei abgebrochenem Prefill behoben) und der DeepSeek-Harness-Launcher weicht bei Fehlern auf `npx` aus.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.33.0)

### Version 0.32.15: Onboarding, schnellerer erster Token, Parser-Hänger behoben

19. August 2026 · Version 0.32.15

Ollama bietet einen neuen Onboarding-Ablauf beim ersten Start der Desktop-App, halbiert durch Metadaten-Caching die Zeit bis zum ersten Token (ca. 995 ms auf 524 ms) und behebt ein Hängen von chat und generate nach Parser-Fehlern.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.15)

### Version 0.32.14: WebP-Transkodierung für llama-server, Qwen-Renderer

15. August 2026 · Version 0.32.14

WebP-Bilder werden für llama-server transkodiert, und der Qwen-Renderer toleriert nun System-Nachrichten, die nicht am Anfang stehen.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.14)

### Version 0.32.13: qwen3.8 mit Developer-Instruktionen

14. August 2026 · Version 0.32.13

qwen3.8 unterstützt jetzt Developer-Instruktionen.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.13)

### Version 0.32.12: Unterstützung für Qwen 3.8 27B, MLX-Variante

14. August 2026 · Version 0.32.12

Ollama unterstützt jetzt Qwen 3.8 27B, das für Coding und Agenten-Aufgaben ausgelegt ist, auf Apple Silicon zusätzlich mit optimierter MLX-Variante (qwen3.8:27b-mlx).

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.12)

### Version 0.32.11: DeepSeek Harness und Muse Code in ollama launch, Websuche

14. August 2026 · Version 0.32.11

`ollama launch` unterstützt nun DeepSeek Harness (dsh) und Muse Code (muse), und die OpenAI-kompatible Responses API unterstützt Websuche.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.11)

### Version 0.32.10: repeat_penalty-Standard 1.0, schnelleres NVFP4-Prefill

12. August 2026 · Version 0.32.10

Modelle ohne gesetzten `repeat_penalty` nutzen nun standardmäßig 1.0 statt 1.1, NVFP4-MLX-Modelle haben ein um etwa 7–8 % schnelleres Prefill, und die Blob-Verifizierung bei gleichem Digest in OCI-Manifests wurde korrigiert.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.10)

### Version 0.32.9: NVIDIA Nemotron 3.5 Lightning, Muse-Glimmer-Parserfix

11. August 2026 · Version 0.32.9

Ollama unterstützt jetzt NVIDIA Nemotron 3.5 Lightning samt Nemotron-3-Architektur und korrigiert einen Grenzfall im Function-Calling-Parser von Muse Glimmer.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.9)

### Version 0.32.8: Muse Glimmer auf allen Plattformen verfügbar

10. August 2026 · Version 0.32.8

Muse Glimmer ist jetzt auf allen Plattformen verfügbar, einschließlich NVIDIA, AMD und weiteren, und lässt sich per `ollama launch` mit Claude Code, Pi, OpenClaw und Hermes nutzen.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.8)

Weitere Einträge: [Seite 2](https://updatefeed.de/updates/ollama.md?seite=2)
