# Together AI Release Notes

> 139 Updates, 1 aktive Quellen, zuletzt aktualisiert am 6. Oktober 2026.

Quelle: [Seite](https://updatefeed.de/updates/together-ai) · Feed: [RSS](https://updatefeed.de/feed/together-ai/feed.rss)

## Oktober 2026

### Batch-API-Dateien werden jetzt 7 Tage aufbewahrt

6. Oktober 2026

Eingabe-, Ausgabe- und Fehlerdateien von Batch-Jobs werden jetzt 7 Tage aufbewahrt, danach sind sie nicht mehr abrufbar und eine hochgeladene Eingabedatei lässt sich nur in diesem Zeitraum für weitere Jobs wiederverwenden.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Together Link beta für macOS und Linux

1. Oktober 2026

Together Link startet als Beta auf macOS und Linux und führt sechs Coding-Agents (Claude Code, Codex, OpenCode, Pi Code, Claude Desktop, ChatGPT Desktop) auf bei Together AI gehosteten Modellen aus, ohne die normale Agent-Konfiguration zu verändern.

[Originalquelle](https://docs.together.ai/docs/changelog)

## September 2026

### Höheres LoRA-Rank-Limit für Fine-Tuning

29. September 2026

Für die meisten Modelle lassen sich LoRA-Adapter jetzt mit einem Rank von bis zu 128 statt 64 trainieren, der Standard-Rank bleibt 64, und die Model-Limits-Antwort enthält das neue Feld lora_training.default_rank.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Fine-getunte Modelle per Registry-Namen deployen

24. September 2026

Seit Together CLI 2.24.0 akzeptiert `tg beta endpoints deploy` anstelle der model_object_id auch den qualifizierten Registry-Namen (model_object_name) eines abgeschlossenen Fine-Tuning-Jobs.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Neues Serverless-Modell Tev1-4B-experimental

23. September 2026

together/Tev1-4B-experimental ist jetzt serverless verfügbar, mit 32.768 Kontextlänge und einem Preis von 0,042 $ Input bei kostenlosem Output pro 1M Tokens.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Neues serverloses Modell: Tev1-4B-experimental

22. September 2026

Das Modell `together/Tev1-4B-experimental` mit 32.768 Kontextlänge ist jetzt serverless verfügbar, zu 0,042 $ Input und kostenlosem Output pro 1M Tokens.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Preissenkung für Qwen3.7-Max und Qwen3.8-Flash

22. September 2026

Die Preise für Qwen/Qwen3.7-Max (1,50 $ Input / 4,50 $ Output) und Qwen/Qwen3.8-Flash (0,09 $ / 0,282 $) pro 1M Tokens sind ab dem 22. September 2026 gesenkt.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Automatische Leerlauf-Abschaltung für Dedicated Deployments

16. September 2026

Deployments lassen sich mit `--inactive-timeout` so einstellen, dass sie ohne Inferenz-Anfragen nach der festgelegten Zeit auf null Replikate skalieren und die Abrechnung stoppen.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Rollouts für Dedicated Model Inference und CLI v2.34.0

15. September 2026

Mit Rollouts wird Live-Traffic per Canary-, Blue-Green- oder Rolling-Strategie ohne URL-Änderung von einem Deployment auf ein anderes verlagert, und Together CLI/SDK 2.34.0 ergänzt außerdem HIPAA-Placement und strengere Parquet-Prüfung in `tg files check`.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Neues Serverless-Modell MiniMax-H3

14. September 2026

MiniMaxAI/MiniMax-H3 ist jetzt serverless verfügbar, mit einem Preis von 0,1391 $/Sek. bei 2k.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Neues Serverless-Modell DeepSeek-V4.1-Flash

11. September 2026

deepseek-ai/DeepSeek-V4.1-Flash ist serverless verfügbar, mit 1.000.000 Kontextlänge, FP8-Quantisierung, Function Calling und Structured Outputs.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Preemptible Compute für GPU-Cluster und CLI v2.33.2

10. September 2026

Preemptible Compute ist als Public Preview für Kubernetes-GPU-Cluster verfügbar, mit einem Preemptible-GPU-Ziel, einem fünfminütigen Drain-Fenster und minutengenauer Abrechnung, zudem verbessert Together CLI 2.33.2 Fehlermeldungen und Upload-Anzeigen.

[Originalquelle](https://docs.together.ai/docs/changelog)

### GLM-5.3 jetzt für Fine-Tuning verfügbar

8. September 2026

Das Modell zai-org/GLM-5.3 kann jetzt fine-getunt werden.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Günstigere H100-Endpoints und neue Modell-Deprecations

1. September 2026

H100-80GB-Hardware für Dedicated Endpoints kostet jetzt 3,99 $ statt 5,49 $ pro Stunde, und vier Modelle (u. a. openai/gpt-oss-20b) werden am 14. September 2026 aus Serverless entfernt.

[Originalquelle](https://docs.together.ai/docs/changelog)

## August 2026

### Neues Serverless-Modell Qwen3.8-Flash

31. August 2026

Qwen/Qwen3.8-Flash ist serverless verfügbar, mit 1.000.000 Kontextlänge und Preisen von 0,15 $ Input und 0,47 $ Output pro 1M Tokens.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Autoscaling-Metrik active_sessions für TTS

29. August 2026

Das Autoscaling für Dedicated Endpoints akzeptiert jetzt `active_sessions`, das gleichzeitige offene WebSocket-Sessions pro Replikat einer TTS-Deployment als Ziel verwendet.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Neues Serverless-Modell GLM-5.3

28. August 2026

zai-org/GLM-5.3 ist serverless verfügbar, mit 1.000.000 Kontextlänge, FP4-Quantisierung, Function Calling und Structured Outputs.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Billing-Usage-API (Beta) und weitere Neuerungen

27. August 2026

Die neue Beta-API `GET /billing/usage` liefert organisationsweite Nutzungs- und Kostenpositionen, außerdem gibt es Upload-Fortschrittsanzeigen in CLI und Python SDK, Kubeconfig-Download für Slurm-Cluster, Regenerierung von Legacy-API-Keys und Modell-Deprecations.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Batch-Jobs in der CLI und GLM-5.3-Flash

26. August 2026

Die Together CLI erhält die Befehlsgruppe `tg batches` für Batch-Inferenz, und zai-org/GLM-5.3-Flash ist neu serverless verfügbar.

[Originalquelle](https://docs.together.ai/docs/changelog)

### Deprecations, Qwen3.8-27B-Fine-Tuning und längerer GLM-5.2-Kontext

25. August 2026

Zwei Modelle werden aus Serverless entfernt, Qwen/Qwen3.8-27B ist für Fine-Tuning verfügbar, und zai-org/GLM-5.2 akzeptiert serverless nun 1.000.000 statt 512.000 Token Kontext bei gleichem Preis.

[Originalquelle](https://docs.together.ai/docs/changelog)

Weitere Einträge: [Seite 2](https://updatefeed.de/updates/together-ai.md?seite=2)
