# AI Voice and Speech: Release Notes

> Spracherkennung, Sprachausgabe und Stimmen per KI. 9 Hersteller, 158 Updates. Quelle: [AI Voice and Speech](https://updatefeed.de/updates/kategorien/ai-voice-and-speech)

## Hersteller

- [Cartesia](https://updatefeed.de/updates/cartesia.md): 9 Updates
- [Eleven Labs](https://updatefeed.de/updates/eleven-labs.md): 99 Updates
- [Fish Audio](https://updatefeed.de/updates/fish-audio.md): 15 Updates
- [Hume](https://updatefeed.de/updates/hume.md): 1 Update
- [Inworld](https://updatefeed.de/updates/inworld.md): 3 Updates
- [Letterly](https://updatefeed.de/updates/letterly.md): 16 Updates
- [Murf](https://updatefeed.de/updates/murf.md): 2 Updates
- [Plaud](https://updatefeed.de/updates/plaud.md): 1 Update
- [Wispr Flow](https://updatefeed.de/updates/wispr-flow.md): 12 Updates

## Oktober 2026

### Procedures werden automatisch kompiliert, Merge Proposals in Alpha

5. Oktober 2026 · Eleven Labs

Strukturierte Procedures werden beim Speichern und Veröffentlichen von Agenten automatisch kompiliert und validiert, der Compile-Endpunkt gilt als Legacy, und Merge Proposals sind in Alpha verfügbar.

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/10/5)

### Drama 3 Preview

5. Oktober 2026 · Fish Audio

Fish Audio bietet mit Drama 3 Preview (Modell-ID `drama-3-preview`) ein Text-to-Speech-Vorschaumodell, das sich per natürlicher Sprache nach Tonfall, Tempo und Charakter steuern lässt, wobei sich Verhalten und Verfügbarkeit während der Preview ändern können.

[Originalquelle](https://docs.fish.audio/developer-guide/getting-started/changelog#drama-3-preview)

### Transcribe 1 Pro

5. Oktober 2026 · Fish Audio

Fish Audio führt das Speech-to-Text-Modell Transcribe 1 Pro (`transcribe-1-pro` auf `POST /v1/asr`) für kurze Clips und lange Aufnahmen ein, dessen Transkripte Sprechermarker, Sprecherwechsel sowie Emotions- und Vokalereignis-Hinweise enthalten können.

[Originalquelle](https://docs.fish.audio/developer-guide/getting-started/changelog#transcribe-1-pro)

### Fish Audio S2.1 Pro

5. Oktober 2026 · Fish Audio

Fish Audio S2.1 Pro (`s2.1-pro`) ist ein Produktions-Text-to-Speech-Modell, das gegenüber S2-Pro bei Qualität, Latenz und Durchsatz verbessert ist und 83 Sprachen unterstützt, während `s2.1-pro-free` bis zum 30. November 2026 unter Fair-Use-Grenzen und ohne TTFA- und DPA-Garantien kostenlos nutzbar ist.

[Originalquelle](https://docs.fish.audio/developer-guide/getting-started/changelog#fish-audio-s2-1-pro)

### Murf: Gen2 für Streaming API abgeschaltet, Wechsel zu Falcon 2

5. Oktober 2026 · Murf

Das Gen2-Modell wurde für die Streaming API abgeschaltet, sodass Nutzer dort auf das neueste Falcon 2-Modell wechseln müssen, während Gen2 für nicht-streamingbasiertes Text-to-Speech über den Synthesize Speech-Endpunkt weiter verfügbar bleibt.

[Originalquelle](https://murf.ai/api/docs/changelog/2026/10/5)

### Hume stellt TTS- und EVI-APIs am 13. November 2026 ein

2. Oktober 2026 · Hume

Hume stellt die TTS- und EVI-APIs ein: Der Zugriff endet am 13. November 2026 um 12:01 Uhr EST, bis dahin bleiben beide APIs voll unterstützt, und alle Kontodaten werden danach dauerhaft gelöscht.

[Originalquelle](https://dev.hume.ai/changelog)

### Letterly Keyboard 2.7.6: Voice Rewrite per Sprachbefehl

2. Oktober 2026 · Version 2.7.6 · Letterly

Letterly Keyboard (Version 2.7.6) auf dem iPhone bietet unter Keyboard → Rewrites nun Voice Rewrite, mit dem sich diktierter Text per Sprachbefehl kürzen, im Ton ändern, übersetzen oder korrigieren lässt, inklusive Undo.

[Originalquelle](https://letterly.app/updates)

## September 2026

### Eleven v4 und Eleven v4 Turbo sowie Transkriptbearbeitung per Anweisung

28. September 2026 · Eleven Labs

Eleven v4 und Eleven v4 Turbo sind verfügbar, dazu kommen Transkriptbearbeitung per Anweisung in Speech to Text sowie neue Agent-Modelle und Testkosten-Angaben in ElevenAgents.

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/9/28)

### Sora 2, Sora 2 Pro und Seedance 1.5 Pro werden eingestellt

23. September 2026 · Eleven Labs

Sora 2 und Sora 2 Pro werden zum 24. September 2026 eingestellt und Seedance 1.5 Pro wird am 11. November 2026 abgeschaltet, Nutzer müssen betroffene Flows auf andere Videomodelle umstellen.

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/9/23)

### ElevenAgents: Parallele Tool-Aufrufe, gpt-6-astra und Slack-Alerting

21. September 2026 · Eleven Labs

ElevenAgents unterstützt parallele Tool-Aufrufe, das Modell `gpt-6-astra` und Slack-Alerting, außerdem kommen die GPT-Image-2.5-Modelle, ein `cascade_timeout_seconds`-Parameter für Speech Engine und präzisere Turn-Marker bei Text to Speech hinzu.

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/9/21)

### Letterly für Windows 1.1.7: Start mit dem Computer

21. September 2026 · Version 1.1.7 · Letterly

Letterly für Windows (Version 1.1.7) startet nun standardmäßig mit dem Computer und wartet im System Tray, was sich unter Preferences → Launch at startup abschalten lässt.

[Originalquelle](https://letterly.app/updates)

### Canto: das erste eigene Sprachmodell von Wispr Flow

17. September 2026 · Wispr Flow

Wispr Flow läuft jetzt für alle Nutzer auf Canto, dem ersten selbst entwickelten Sprachmodell, das laut Anbieter bei realen englischen Flow-Aufnahmen die niedrigste Wortfehlerrate der getesteten Modelle erreicht.

[Originalquelle](https://wisprflow.ai/whats-new)

### Letterly für Android 2.4.4: MCP-Anbindung und Abmelden

16. September 2026 · Version 2.4.4 · Letterly

Letterly für Android (Version 2.4.4) verbindet sich nun per MCP mit Claude, ChatGPT, Cursor und anderen KI-Tools und ermöglicht zudem das Abmelden vom Konto, wobei vorher synchronisiert und dann lokale Notizen und Aufnahmen entfernt werden.

[Originalquelle](https://letterly.app/updates)

### Wispr Flow Notetaker jetzt unter Windows verfügbar

15. September 2026 · Wispr Flow

Wispr Flow Notetaker ist jetzt auch unter Windows verfügbar und bietet Rückblicke während Anrufen, meetingübergreifende Fragen mit Quellenangaben, Entwürfe aus Notizen sowie die Ein-Klick-Anbindung an Gemini neben Claude, ChatGPT und anderen MCP-kompatiblen KI-Tools.

[Originalquelle](https://wisprflow.ai/whats-new)

### ElevenAgents: Call Queueing, gemini-3.8-flash und music_v2_5

14. September 2026 · Eleven Labs

ElevenAgents erhält Call Queueing mit Warteschleifen-Audio, Versionsmetadaten für Testergebnisse und das Modell `gemini-3.8-flash`, und die Music-Endpunkte akzeptieren `music_v2_5`.

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/9/14)

### Scribe v2 Medical für klinische Audioinhalte allgemein verfügbar

11. September 2026 · Eleven Labs

Scribe v2 Medical, ein Batch-Spracherkennungsmodell für medizinische und klinische Audioinhalte, ist allgemein verfügbar und wird zum selben Preis wie Scribe v2 abgerechnet (`model_id` `scribe_v2_medical`).

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/9/11)

### OpenAI-kompatibler Speech-Endpunkt für Realtime TTS

11. September 2026 · Inworld: Tts

Realtime TTS stellt jetzt den Endpunkt `POST /v1/audio/speech` im OpenAI-Format bereit, sodass Apps mit OpenAI-Text-to-Speech durch Umstellen des SDK auf Inworld mit einem Inworld-Modell und einer Inworld-Stimme laufen, inklusive Streaming, der Formate mp3, opus, flac, wav und pcm sowie SSE.

[Originalquelle](https://docs.inworld.ai/release-notes/tts.md)

### Letterly für Android 2.4.3: Notiz-Audio in der App abspielen

9. September 2026 · Version 2.4.3 · Letterly

Letterly für Android (Version 2.4.3) enthält einen Audio-Player, mit dem sich die Aufnahme einer Notiz samt zusätzlicher Record-More-Aufnahmen direkt in der App abspielen lässt.

[Originalquelle](https://letterly.app/updates)

### ElevenAgents: Ticket-API, Variablenfilter und Twilio-Anrufbeantworter-Erkennung

7. September 2026 · Eleven Labs

ElevenAgents bietet eine API zum Auflisten von Workspace-Tickets, Filter für dynamische Variablen bei Konversationen, optionale Twilio-Anrufbeantworter-Erkennung (`twilio_machine_detection`) sowie `allowed_values` für Data-Collection-Eigenschaften und erweiterte Agent-Metadaten.

[Originalquelle](https://elevenlabs.io/docs/changelog/2026/9/7)

### Otter-Transkripte in den Notetaker importieren (Version v1.6.721)

4. September 2026 · Version v1.6.721 · Wispr Flow

Otter.ai-Transkripte lassen sich nun mit erhaltenen Sprechernamen in den Notetaker importieren, zudem können Admins neue Mitglieder beim Einladen Teams zuweisen, Wörterbucheinträge organisations- oder abteilungsweit teilen, und Updates warten, bis man nicht mehr aktiv arbeitet.

[Originalquelle](https://wisprflow.ai/whats-new)

Weitere Einträge: [Seite 2](https://updatefeed.de/updates/kategorien/ai-voice-and-speech.md?seite=2)
