Zum Inhalt springen

Fish Audio Release Notes

15 Einträge aus 1 Quelle. Zuletzt aktualisiert:

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Drama 3 Preview

Fish Audio bietet mit Drama 3 Preview (Modell-ID drama-3-preview) ein Text-to-Speech-Vorschaumodell, das sich per natürlicher Sprache nach Tonfall, Tempo und Charakter steuern lässt, wobei sich Verhalten und Verfügbarkeit während der Preview ändern können.

Drama 3 Preview

Preview text-to-speech model you direct in plain language. Describe tone, pacing, and character without a fixed set of audio tags.

Use model ID drama-3-preview in the API. Behavior and availability may change while it is in preview.

Text to Speech API

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Transcribe 1 Pro

Fish Audio führt das Speech-to-Text-Modell Transcribe 1 Pro (transcribe-1-pro auf POST /v1/asr) für kurze Clips und lange Aufnahmen ein, dessen Transkripte Sprechermarker, Sprecherwechsel sowie Emotions- und Vokalereignis-Hinweise enthalten können.

Transcribe 1 Pro

Speech-to-text model for short clips and long recordings, including multi-speaker conversations. Transcripts can include inline speaker markers, speaker turns, and emotion and vocal-event cues.

Use model ID transcribe-1-pro on POST /v1/asr

Speech to Text | Models overview

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Fish Audio S2.1 Pro

Fish Audio S2.1 Pro (s2.1-pro) ist ein Produktions-Text-to-Speech-Modell, das gegenüber S2-Pro bei Qualität, Latenz und Durchsatz verbessert ist und 83 Sprachen unterstützt, während s2.1-pro-free bis zum 30. November 2026 unter Fair-Use-Grenzen und ohne TTFA- und DPA-Garantien kostenlos nutzbar ist.

Fish Audio S2.1 Pro

Production text-to-speech model that improves on S2-Pro in quality, latency, and throughput. Supports 83 languages on one model, with the same [bracket] natural-language control and multi-speaker dialogue as S2.

Use model ID s2.1-pro for production workloads that need TTFA and DPA guarantees. s2.1-pro-free is the same model at no cost through November 30, 2026 for testing, prototyping, development, and smaller businesses, under fair-use limits and without those guarantees.

Read more about S2.1 Pro | Models overview

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Fish Audio S2 mit Emotions-Tags und Multi-Speaker-Dialogen

Fish Audio S2 ist ein Text-to-Speech-Modell mit Emotions- und paralinguistischen Hinweisen per [Klammer]-Syntax, Multi-Speaker-Dialogen und über 80 Sprachen, das in der API mit der Modell-ID s2-pro genutzt wird, während S1 weiter unterstützt wird.

Fish Audio S2

Next-generation text-to-speech model with inline emotion cues, multi-speaker dialogue support, and 80+ languages.

S2 introduces [bracket] syntax for natural language control over emotion and paralinguistic cues (e.g., [whisper], [laugh], [emphasis]). Tags are treated as standard text rather than dedicated control tokens, so you are not limited to a fixed set of expressions. Built on the Qwen3-4B backbone and fully open-source.

Use model ID s2-pro in the API. S1 remains supported for existing integrations.

GitHub | HuggingFace

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Fish Audio S1 und Umbenennung von Fish Speech

Fish Speech heißt nun Fish Audio und das Modell S1 (4B Parameter) steht im Playground bereit, S1-mini (0,5B) ist Open Source auf Hugging Face, beide bieten 64+ emotionale Ausdrücke und mehrsprachige Unterstützung.

Fish Audio S1

Historic rebrand from Fish Speech to Fish Audio. #1 ranking on TTS-Arena2 with industry-leading performance.

S1 (4B params): 0.008 WER, 0.004 CER - Available on Fish Audio Playground S1-mini (0.5B params): 0.011 WER, 0.005 CER - Open source on Hugging Face

64+ emotional expressions with RLHF integration and multilingual support for English, Chinese, Japanese, and more.

Read More about S1

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.5.1

Version 1.5.1 behebt kritische PyTorch-Sicherheitseinstellungen, beschleunigt die Inferenz deutlich, ergänzt ONNX-Export und verbesserte Textverarbeitung für Arabisch und Hebräisch und behebt Fehler bei Apple Silicon (MPS).

v1.5.1

Fixed critical PyTorch security settings and improved inference speed significantly. Added ONNX export support for better deployment options and enhanced text processing for Arabic and Hebrew languages. Includes bug fixes for Apple Silicon (MPS) compatibility and reorganized library structure for cleaner codebase.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.5.0

Version 1.5.0 führt die v1.5-Modellarchitektur, besseres Dataset-Handling und Bearer-Token-Authentifizierung für APIs ein und ergänzt Caching von Referenzaudio per Hash, bessere Apple-Silicon-Unterstützung sowie Base64-Referenzdaten im JSON-Format.

v1.5.0

Introduced v1.5 model architecture with improved dataset handling and bearer token authentication for APIs.

Added reference audio caching by hash for faster performance and better Apple Silicon support. Includes OpenAPI documentation refactoring and base64 reference data support in JSON format.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.4.3

Version 1.4.3 führt Fish Agent für Konversations-KI mit Streaming und Echtzeit-Interaktion ein, ergänzt koreanische Dokumentation, behebt Probleme mit nicht-englischer Sprache und verbessert WebUI-Streaming sowie PyTorch-Kompatibilität.

v1.4.3

Introduced Fish Agent for conversational AI with streaming capabilities and real-time interactions.

Added comprehensive Korean language documentation and fixed critical non-English speech issues. Improved WebUI streaming functionality and PyTorch version compatibility.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.4.2

Version 1.4.2 aktualisiert vor allem die Dokumentation (v1.4, macOS, Übersetzungen), verbessert Docker-Unterstützung und JSON-Handling der API, ergänzt Audioauswahl in der WebUI und behebt Stabilitätsprobleme wie Cache-Handling und Backend-Leistung.

v1.4.2

Documentation-focused release with comprehensive updates for v1.4, macOS support, and multiple language translations.

Improved Docker support and API enhancements for JSON format handling. Added audio selection to WebUI and fixed various stability issues including cache handling and backend performance.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.4.1

Version 1.4.1 optimiert Docker und Multi-Plattform-Builds, aktualisiert PyTorch, ersetzt das Audio-Backend sox für bessere Leistung, erweitert die CI/CD-Pipeline um buildx und behebt Docker-Probleme.

v1.4.1

Infrastructure improvements focused on Docker optimization and multi-platform builds.

Updated PyTorch version and replaced audio backend from sox for better performance. Enhanced CI/CD pipeline with buildx support and fixed various Docker-related issues.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.4.0

Version 1.4.0 bringt eine neue VQGAN-Architektur für bessere Audioqualität und schnellere Inferenz, eine überarbeitete WebUI mit besserem Sprachwechsel, japanische Dokumentation und eine Korrektur beim Inferenz-Warmup.

v1.4.0

Major release with new VQGAN architecture for improved audio quality and faster inference.

Updated WebUI with enhanced interface and better language switching. Added Japanese documentation translation and fixed inference warmup issues for better performance.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.2.1

Version 1.2.1 ersetzt Whisper durch SenseVoice für bessere ASR, bringt native Apple-Silicon-Unterstützung, brasilianisch-portugiesische Lokalisierung, Audio-Streaming und CPU-Inferenz-Verbesserungen, fixiert PyTorch auf 2.3.1 gegen Geschwindigkeitsprobleme und gleicht die API mit der offiziellen Closed-Source-Version an.

v1.2.1

Replaced Whisper with SenseVoice for better ASR and added native Apple Silicon support.

Includes Portuguese (Brazil) localization, streaming audio functionality, and CPU-only inference improvements. Pinned PyTorch to 2.3.1 to fix inference speed issues and aligned API with official closed-source version.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.2

Version 1.2 führt ein Auto-Reranking-System, zweisprachige Unterstützung und Modellquantisierung ein, ersetzt Whisper durch Faster Whisper für mehr Geschwindigkeit, ergänzt japanische Dokumentation und verbessert Stabilität und Inferenzleistung.

v1.2

Introduced auto-reranking system for better results along with bilingual support and model quantization.

Replaced standard Whisper with Faster Whisper for improved speed and added Japanese documentation. Enhanced model stability and inference performance with optimized v1.2 architecture.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.1.2

Version 1.1.2 ergänzt chinesische Textnormalisierung und einen Download-Button für Streaming-Audio in der WebUI, behebt Probleme beim LoRA-Merging und verbessert die Firefly-Leistung.

v1.1.2

Minor release adding Chinese text normalization support and a streaming audio download button in the WebUI.

Fixed LoRA merging issues and improved Firefly performance.

Originalquelle(öffnet in neuem Tab)Problem melden

Angaben zum Datum

Datum aus der Quelle.

Erstmals gesehen am .

Fish Audio

Version 1.1.1 mit Breaking Changes und Lizenzwechsel

Version 1.1.1 ersetzt zibai durch uvicorn als API-Server, führt einen neuen Text-Splitter mit bytebasierter Längenberechnung ein und wechselt die Lizenz zu CC-BY-NC-SA 4.0, außerdem gibt es Apple-Silicon-(MPS)-Unterstützung, Windows-Ein-Klick-Installation, automatischen Modell-Download mit Fortsetzung und eine verbesserte WebUI.

v1.1.1

Breaking changes: Replaced zibai with uvicorn for API server, new text-splitter with byte-based length calculation, and license change to CC-BY-NC-SA 4.0.

Added Apple Silicon (MPS) support, Windows one-click installation, and automatic model downloading with resume capability. Improved WebUI with better file selection and download progress indicators.

Originalquelle(öffnet in neuem Tab)Problem melden