# Ollama Release Notes (Seite 2)

> 28 Updates, 1 aktive Quellen, zuletzt aktualisiert am 29. September 2026.

Quelle: [Seite](https://updatefeed.de/updates/ollama) · Feed: [RSS](https://updatefeed.de/feed/ollama/feed.rss)

## August 2026

### Version 0.32.7: Muse Glimmer 30B von Meta auf Apple Silicon mit MLX

10. August 2026 · Version 0.32.7

Ollama unterstützt ab Version 0.32.7 das multimodale 30B-Modell Muse Glimmer von Meta zunächst über die MLX-Engine auf Apple Silicon, inklusive DFlash und Bildeingabe, und es lässt sich per `ollama run muse-glimmer:30b-mlx` sowie mit `ollama launch` für Agenten wie Claude Code, Pi, OpenClaw und Hermes nutzen.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.7)

### Version 0.32.6: Schnelleres Qwen3.5 auf Apple-GPUs, OpenAI-Streaming angepasst

4. August 2026 · Version 0.32.6

Ollama 0.32.6 beschleunigt Qwen3.5 auf Apple-GPUs durch automatische Nutzung des MTP-Heads für Speculative Decoding, gleicht das Streaming von `/v1/chat/completions` an das OpenAI-Format an, meldet abgeschnittene Antworten mit `finish_reason: "length"`, behebt mehrere TUI-Fehler und entfernt die experimentelle Bildgenerierung vorübergehend (dafür weiter 0.32.5 nutzen).

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.6)

## Juli 2026

### Version 0.32.5: MLX-Metal-Fehler bei NVFP4-Modellen behoben

27. Juli 2026 · Version 0.32.5

Ollama 0.32.5 behebt einen MLX-Metal-Fehler, der die Ausgabequalität von NVFP4-Modellen, insbesondere Laguna, verschlechtern konnte.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.5)

### Version 0.32.4: Laguna auf Apple-GPUs, Qwen3-MoE-Decoding-Fix

25. Juli 2026 · Version 0.32.4

Ollama 0.32.4 unterstützt Laguna auf Apple-GPUs über die MLX-Engine, quantisiert die Ausgabeköpfe von Draft-Modellen beim Erstellen von Speculative-Decoding-Drafts im gewünschten Typ und behebt das Decoding von Qwen3 MoE bei unterschiedlich quantisierten Experten, mit schnellerer gepackter Gate/Up-Projektion (ca. 4–9 % auf M5 Max).

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.4)

### Version 0.32.3: Download- und GLM-Fixes, bessere GPU-Unterstützung, Laguna 2.1

23. Juli 2026 · Version 0.32.3

Ollama 0.32.3 behebt hängende Modell-Downloads und GLM-Tool-Calls, die am Ende der Generierung verworfen wurden, verbessert Integrationen (Claude Code Channels, Anthropic-Thinking-Streams, Hermes Desktop mit `--force-build`), erweitert die GPU-Unterstützung (CUDA auf Windows ARM64, B200 über CUDA 12, geringerer Speicherbedarf bei Linux-CUDA/ROCm-iGPUs) und ergänzt Chat, Thinking und Tool Calling für Laguna 2.1.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.3)

### Ollama 0.32.1: Besseres Tool Calling bei Gemma 4 und MLX-Fixes

16. Juli 2026 · Version 0.32.1

Ollama 0.32.1 verbessert Tool Calling und Multi-Turn-Reasoning bei Gemma 4, behebt ein Cache-Leck bei rekurrenten MLX-Modellen, lässt MLX-Textmodelle `OLLAMA_LOAD_TIMEOUT` beachten, weist bei Websuche und Fetch des Agenten auf `ollama signin` hin, übergibt dem interaktiven Agenten das aktuelle Arbeitsverzeichnis und behebt die Modellauswahl bei `ollama launch` mit veralteten Modellen.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.1)

### Ollama 0.32.0: Neuer interaktiver Agent und ChatGPT-Integration

11. Juli 2026 · Version 0.32.0

Ollama 0.32.0 startet mit `ollama` einen neuen interaktiven Agenten für Coding und delegierte Aufgaben, benennt die Codex-App-Integration in ChatGPT um (`ollama launch chatgpt`), zeigt im `ollama launch`-Menü nur noch die beliebtesten Integrationen und warnt vor dem Start älterer Agent-Modelle.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.32.0)

### Ollama 0.31.2: Flash Attention auf älteren NVIDIA-GPUs und Fixes

6. Juli 2026 · Version 0.31.2

Ollama 0.31.2 aktiviert Flash Attention auf älteren NVIDIA-GPUs (Compute Capability 6.x), erlaubt iGPUs das Auslagern von Vision-Modellen mit Padding, behebt Structured Output bei Thinking-Modellen ohne Thinking sowie das Laden von Modellen auf Pfaden mit Nicht-UTF-8-Zeichen, härtet die GGUF-Modellerstellung ab und deaktiviert Telemetrie bei `ollama launch` für Claude Code standardmäßig.

[Originalquelle](https://github.com/ollama/ollama/releases/tag/v0.31.2)
