Zum Inhalt springen

Fireworks AI Release Notes

79 Einträge aus 1 Quelle. Zuletzt aktualisiert:

Folge Fireworks AI, um die Release Notes in deinen Feed zu holen.

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Deployment Tags und Änderungen an der Annotation-API

firectl 1.8.3 bringt die Befehle deployment tag set, unset und list, und die REST-API verlangt für kundenverwaltete Annotation-Keys nun das Präfix custom/, sonst folgt HTTP 403, während Lesezugriffe für normale Nutzer nur custom/*-Einträge zurückgeben.

Deployment tags are customer-managed entries stored in a deployment's annotations map. firectl presents logical keys such as environment; the REST API represents the same key as custom/environment.

  • firectl: Version 1.8.3 adds deployment tag set, unset, and list, including atomic batch operations.
  • REST writes: Customer-managed annotation keys must begin with custom/. Bare keys now return HTTP 403 (PERMISSION_DENIED).
  • REST reads: For regular account users, GetDeployment and ListDeployments return only custom/* annotation entries. Keys outside that namespace are omitted without an error.

Existing stored annotations were not rewritten. Clients using a bare key such as environment should set custom/environment and update reads to use that canonical key.

See Deployment Tags for commands, REST examples, validation rules, and migration guidance. </Update>

<Update label="2026-09-07"> <Badge color="purple">Training</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Neues Trainingsmodell: GLM 5.3

GLM 5.3 steht für LoRA-Training auf der Dedicated Training API mit bis zu 204K Kontext zur Verfügung und ist für komplexes Coding und langfristige Agenten gedacht.

GLM 5.3 is now available for LoRA training on the Dedicated Training API, with up to 204K context. It's built for complex coding and long-horizon agents.

See the training model catalog for current availability. </Update>

<Update label="2026-09-01"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Serverless-Ratenlimits skalieren nach Modellgröße

Die adaptiven Ratenlimit-Obergrenzen bei Serverless richten sich nun nach der Modellgrößenstufe: kleine Modelle erhalten höhere, mittlere mittlere und große Modelle niedrigere Obergrenzen.

Serverless adaptive rate limit ceilings now vary by model size tier. Smaller models get higher ceilings, medium models get intermediate ceilings, and large models use lower ceilings. See Serverless rate limits for current tier thresholds and ceiling values. </Update>

<Update label="2026-08-30"> <Badge color="purple">Training</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Neue Serverless-Training-Modelle: DeepSeek V4 Flash 0731, Qwen 3.8 27B, Muse Glimmer 30B

DeepSeek V4 Flash 0731 (bis 262K Kontext), Qwen 3.8 27B und Muse Glimmer 30B (je bis 128K Kontext) sind jetzt für LoRA-Workloads im gemeinsamen Serverless-Training-Pool verfügbar.

The following models are now available for LoRA workloads on the shared Serverless Training pool:

See the Serverless Training guide for setup and the training model catalog for current availability. </Update>

<Update label="2026-08-27"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Serverless-Abkündigung mehrerer Modelle zum 27. August 2026

MiniMax M2.7, GPT OSS 20B, Kimi K2.6 Turbo/Fast, Kimi K2.7 Code Fast und DeepSeek V4 Pro werden ab dem 27. August 2026 auf Serverless abgekündigt, wobei Migrationsempfehlungen wie MiniMax M3, GPT OSS 120B oder DeepSeek V4 Pro (0813) genannt werden.

The following models are deprecated from serverless effective August 27, 2026.

Recommended migrations

<Update label="2026-08-26"> <Badge color="purple">Training</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Serverless Training: Qwen 3.5 9B und Qwen 3.6 27B abgekündigt

Qwen 3.5 9B und Qwen 3.6 27B werden ab dem 26. August 2026 im Serverless Training abgekündigt, Workloads sollen auf Qwen 3.8 27B migriert werden.

Qwen 3.5 9B and Qwen 3.6 27B are deprecated from Serverless Training effective August 26, 2026.

Migrate new and existing Serverless Training workloads to Qwen 3.8 27B.

This change applies to the shared Serverless Training pool. Check the training model catalog for availability on other training surfaces. </Update>

<Update label="2026-08-25"> <Badge color="gray">Platform</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Serverless-Abkündigung: DeepSeek V4 Flash

DeepSeek V4 Flash wird auf Serverless abgekündigt, die empfohlene Migration führt zu DeepSeek V4 Flash (0731).

DeepSeek V4 Flash is deprecated from serverless. Migrate to DeepSeek V4 Flash (0731). </Update>

<Update label="2026-07-16"> <Badge color="purple">Training</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Serverless-Abkündigung: Kimi K2.5 und Qwen 3.6 Plus

Kimi K2.5 und Qwen 3.6 Plus werden auf Serverless abgekündigt, empfohlen wird der Wechsel zu Kimi K2.6 bzw. Qwen 3.7 Plus.

Kimi K2.5 and Qwen 3.6 Plus are deprecated from serverless.

Recommended migrations

<Update label="2026-06-17"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Serverless-Abkündigung: MiniMax M2.5

MiniMax M2.5 wird auf Serverless abgekündigt, empfohlen wird die Migration zu MiniMax M2.7.

MiniMax M2.5 is deprecated from serverless. Migrate to MiniMax M2.7. </Update>

<Update label="2026-06-15"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Neues Modell: GLM 5.2

GLM 5.2 ist ab sofort in der Model Library verfügbar.

GLM 5.2 is now available in the Model Library. </Update>

<Update label="2026-06-12"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Neue Modelle: Kimi K2.7 Code, MiniMax M3, Qwen 3.7 Plus

Kimi K2.7 Code, MiniMax M3 und Qwen 3.7 Plus sind jetzt in der Model Library verfügbar.

The following models are now available in the Model Library:

<Update label="2026-06-10"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Audio-Inferenz und Bildgenerierung abgekündigt

Audio-Inferenz und Bildgenerierung werden abgekündigt.

Audio inference and image generation are deprecated. </Update>

<Update label="2026-05-14"> <Badge color="blue">Inference</Badge>

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Video- und Audio-Modelle, AWS-S3-Training und JIT-Provisioning für SSO

Multimodale Modelle wie Qwen3 Omni und Molmo2 verarbeiten nun Video- und Audio-Eingaben über die Chat Completions API, Trainingsdatasets können in eigenen AWS-S3-Buckets liegen, und Enterprise-SSO unterstützt Just-In-Time-Nutzerprovisionierung.

Video & Audio Input Models

You can now query multimodal models with video and audio inputs for video captioning, scene analysis, and multimodal question answering. Deploy models like Qwen3 Omni and Molmo2 to process video and audio content directly using the Chat Completions API.

See the Video & Audio Inputs guide for deployment instructions and code examples.

AWS S3 Integration for Training Datasets

Training datasets can now be stored in your own AWS S3 buckets using GCP-to-AWS OIDC federation. This Bring Your Own Bucket (BYOB) approach keeps your data private while enabling secure access during Supervised Fine-Tuning and Reinforcement Fine-Tuning jobs—no long-lived credentials required.

See the Secure Training (BYOB) documentation for IAM role setup and usage examples.

Just-In-Time (JIT) User Provisioning for SSO (Enterprise)

JIT user provisioning automatically creates user accounts when users sign in through SSO for the first time. Enable this when configuring your identity provider to eliminate manual user creation.

See the SSO documentation for setup instructions.

📚 Documentation Updates

  • Video & Audio Inputs: New guide for processing video and audio with Qwen3 Omni and Molmo2 models (Video & Audio Inputs) …

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Warm-Start-Training für RFT und Azure-Federated-Identity für Modell-Uploads

Reinforcement-Fine-Tuning-Jobs lassen sich per --warm-start-from aus SFT-Checkpoints starten, und Modell-Uploads aus Azure Blob Storage unterstützen alternativ zu SAS-Tokens die Azure-AD-Federated-Identity-Authentifizierung.

Warm-Start Training for Reinforcement Fine-Tuning

You can now warm-start Reinforcement Fine-Tuning jobs from previously supervised fine-tuned checkpoints using the --warm-start-from flag. This enables a streamlined SFT-to-RFT workflow where you first train a model with supervised fine-tuning, then continue training with reinforcement learning.

See the Warm-Start Training guide for details.

Azure Federated Identity for Model Uploads

Model uploads from Azure Blob Storage now support Azure AD federated identity authentication as an alternative to SAS tokens. This eliminates the need for credential rotation and enables secure, credential-less authentication.

See the Uploading Custom Models documentation for setup instructions.

📚 Documentation Updates

  • Warm-Start Training: New guide for SFT-to-RFT workflows (Warm-Start Training)
  • Azure Federated Identity: Setup instructions for Azure AD authentication (Uploading Custom Models)
  • Preserved Thinking: Multi-turn reasoning with preserved thinking context (Reasoning)
  • GLM 4.7: Added to models supporting reasoning_effort parameter

<Accordion title="Bug Fixes & Minor Improvements"> …

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Playground-Kategorien, neue Nutzerrollen und Fine-Tuning-Verbesserungen

Der Playground erhält Kategorie-Tabs (LLM, Image, TTS, STT), es gibt die neuen Rollen Contributor und Inference, und Fine-Tuning-Jobs lassen sich stoppen, fortsetzen und klonen, außerdem können Output-Datasets und Rollout-Logs von RFT-Jobs heruntergeladen werden.

Playground Categories

The Playground now features category tabs (LLM, Image, TTS, STT) in the header for easier switching between model types. The playground automatically detects the appropriate category based on the selected model and provides smart defaults for each category.

User Roles: Contributor and Inference

New user roles provide more granular access control for team collaboration:

  • Contributor: Read and write access to resources without administrative privileges
  • Inference: Read-only access with the ability to run inference on deployments

Assign these roles when inviting team members to provide appropriate access levels.

Fine-Tuning Improvements

Fine-tuning workflows have been enhanced with several new capabilities:

  • Stop and Resume Jobs: Stop running fine-tuning jobs and resume them later from where they left off. Available for Supervised Fine-Tuning and Reinforcement Fine-Tuning jobs.
  • Clone Jobs: Quickly create new fine-tuning jobs based on existing job configurations using the Clone action.
  • Download Output Datasets: Download output datasets from Reinforcement Fine-Tuning jobs, including individual files or bulk download as a ZIP archive.
  • Download Rollout Logs: Download rollout logs from Reinforcement Fine-Tuning jobs for offline analysis.

✨ New Models …

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Reasoning-Guide, Prompt-Caching-Updates und neue Modelle

Es gibt einen neuen Reasoning-Guide, gecachte Prompt-Tokens kosten auf Serverless 50 % weniger, Session-Affinity-Routing ist per user-Feld oder x-session-affinity-Header möglich, und Devstral Small 2 24B Instruct 2512 sowie NVIDIA Nemotron Nano 3 30B A3B sind in der Model Library verfügbar.

Reasoning Guide

A new Reasoning guide is now available in the documentation. This comprehensive guide covers:

  • Accessing reasoning_content from thinking/reasoning models
  • Controlling reasoning effort with the reasoning_effort parameter
  • Streaming with reasoning content
  • Interleaved thinking for multi-step tool-calling workflows

The guide provides code examples using the Fireworks Python SDK and explains how to work with models that support extended reasoning capabilities.

Prompt Caching Updates

Prompt caching documentation has been updated with expanded guidance:

  • Cached prompt tokens on serverless now cost 50% less than uncached tokens
  • Session affinity routing via the user field or x-session-affinity header for improved cache hit rates
  • Prompt optimization techniques for maximizing cache efficiency

See the Prompt Caching guide for details.

✨ New Models

📚 Documentation Updates …

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

DeepSeek V3.2 serverless, Cached-Token-Preise und neue Modelle

DeepSeek V3.2 ist serverless verfügbar, Model Library und Modellseiten zeigen Preise für gecachte und nicht gecachte Input-Tokens, das Evaluations-Dashboard erhält Statusspalte und Schnellfilter, und DeepSeek V3.2 sowie drei Ministral-3-Modelle (14B, 8B, 3B Instruct 2512) sind in der Model Library verfügbar.

☁️ Serverless

Cached Token Pricing Display

The Model Library and model detail pages now display cached and uncached input token pricing for serverless models that support prompt caching. This gives you better visibility into potential cost savings when using prompt caching with supported models.

Evaluations Dashboard Improvements

The Evaluations dashboard has been enhanced with new filtering and status tracking capabilities:

  • Status column showing evaluator build state (Active, Building, Failed)
  • Quick filters to filter evaluators and evaluation jobs by status
  • Improved table layout with actions integrated into the status column

✨ New Models

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Audit Logs, Dataset-Download und gewichtetes Training für Reinforcement Fine-Tuning

Die Web-App bietet nun eine Audit-Logs-Seite mit Suche und Filter sowie den Download von Datasets, Reinforcement Fine-Tuning unterstützt Gewichtung pro Beispiel, KAT Coder ist neu in der Model Library und die Konsolen-Seitenleiste wurde neu gegliedert.

Audit Logs in Web App

You can now view and search audit logs directly from the Fireworks web app. The new Audit Logs page provides:

  • Search and filter logs by status and timeframe
  • Detailed view panel for individual log entries
  • Easy navigation from the console sidebar under Account settings

See the Audit Logs documentation for more information.

Dataset Download

You can now download datasets directly from the Fireworks web app. The new download functionality allows you to:

  • Download individual files from a dataset
  • Download all files at once with "Download All"
  • Access downloads from the Datasets table in the dashboard

Weighted Training for Reinforcement Fine-Tuning

Reinforcement Fine-Tuning now supports per-example weighting, giving you more control over which samples have greater influence during training. This feature mirrors the weighted training functionality already available in Supervised Fine-Tuning.

See the Weighted Training documentation for details on the weight field format.

✨ New Models

  • KAT Coder is now available in the Model Library
<Accordion title="Bug Fixes & Minor Improvements"> - **Console Navigation:** Redesigned sidebar with organized groups (CREATE, EXPLORE, MANAGE) for easier navigation (Web App) …

Originalquelle(öffnet in neuem Tab)Problem melden

Datum unbekanntAngaben zum Datum

Kein Datum in der Quelle. Der Eintrag stammt aus dem ersten Abruf der Quelle, der Tag der Aufnahme sagt nichts über das Erscheinen.

Erstmals gesehen am .

Fireworks AI

Evaluator-Verbesserungen, Kimi K2 Thinking serverless und neue API-Endpunkte

Evaluatoren lassen sich über GitHub-Vorlagen erstellen und in einer sortierbaren Tabelle anzeigen, Kimi K2 Thinking ist serverless verfügbar, KAT Dev 32B und 72B Exp sind neue Modelle, es gibt Dokumentation zu W&B und MLflow, und neue REST-API-Endpunkte verwalten Reinforcement Fine-Tuning Steps und Deployments.

Improved Evaluator Creation Experience

The evaluator creation workflow has been significantly enhanced with GitHub template integration. You can now:

  • Fork evaluator templates directly from GitHub repositories
  • Browse and preview templates before using them
  • Create evaluators with a streamlined save dialog
  • View evaluators in a new sortable and paginated table

MLOps & Observability Integrations

New documentation for integrating Fireworks with MLOps and observability tools:

  • Weights & Biases (W&B) integration for experiment tracking during fine-tuning
  • MLflow integration for model management and experiment logging

✨ New Models

☁️ Serverless

📚 New REST API Endpoints

New REST API endpoints are now available for managing Reinforcement Fine-Tuning Steps and deployments:

  • Create Reinforcement Fine-Tuning Step …

Originalquelle(öffnet in neuem Tab)Problem melden