Step 5 Preview API

Demnächst
stepfun/step-5-preview
von StepFun•Veröffentlichungsdatum: 1/1/2026

Das multimodale MoE-Flaggschiffmodell von StepFun aus dem Jahr 2026 für agentisches Arbeiten, Coding, Reasoning mit langem Kontext, Dokumentenanalyse und Videoverständnis.

Demnächst
This model is coming soon and is not available for API calls yet.

Step 5 Preview API Hintergrund

Überblick

Step 5 Preview ist das Flaggschiffmodell 2026 von StepFun für agentisches Arbeiten, das als Step 5 Preview API unter der Modell-ID step-5-preview bereitgestellt wird. Es wurde für anspruchsvolle Software-Entwicklung, Reasoning mit langem Kontext, multimodale Analysen und professionelle Wissensaufgaben entwickelt, mit bemerkenswerten Stärken bei finanzorientierten Workflows. Das Modell akzeptiert Text-, Bild- und Video-Eingaben und liefert Text-Ausgaben, wodurch es sich hervorragend für API-gestützte Assistenten eignet, die große Dokumentensätze lesen, visuelles Material prüfen, Tools aufrufen und den Fortschritt bei komplexen mehrstufigen Aufgaben aufrechterhalten müssen.

Entwicklungsgeschichte

Step 5 Preview wurde 2026 veröffentlicht und stellt das Flaggschiff-Preview-Modell von StepFun für fortschrittliche agentische Anwendungen und produktionsorientierte Wissensarbeit dar. Die Step 5 Preview API wurde auf Spitzenleistungen in der Software-Entwicklung und im professionellen Reasoning ausgerichtet, insbesondere dort, wo langer Kontext und Tool-Nutzung entscheidend sind. Die Markteinführung hob die Kombination aus sparser Mixture-of-Experts-Skalierung, einem Kontextfenster von 1.048.576 Tokens, multimodaler Eingabe-Unterstützung sowie strukturierten API-Funktionen wie Streaming, JSON-Ausgaben, JSON Schema, Prompt-Caching und konfigurierbarem Reasoning-Aufwand für komplexe Workflows hervor.

Wichtige Innovationen

  • Sparse Mixture-of-Experts-Architektur mit insgesamt 600 Milliarden Parametern, wovon nur 27 Milliarden pro Token aktiviert werden, was die Skaleneffizienz für fortgeschrittene Reasoning- und Coding-Aufgaben verbessert
  • Native multimodale Verarbeitung von Text, Bildern und Videos innerhalb der Step 5 Preview API, die eine einheitliche Handhabung von Dokumenten, Screenshots, Diagrammen und kurzen Videoinhalten ermöglicht
  • Ein Kontextfenster von 1 Million Tokens kombiniert mit Tool Calling, strukturierter Ausgabe und Kontrollen für den Reasoning-Aufwand für langlaufende Agent-Workflows und umfangreiche Wissenssynthese

Step 5 Preview API Technische Spezifikationen

Architektur

Das Modell nutzt eine sparse Mixture-of-Experts-Architektur, die für groß angelegte agentische Workloads optimiert ist. Step 5 Preview verfügt über insgesamt 600 Milliarden Parameter, wobei 27 Milliarden Parameter pro Token aktiviert werden. Dies gleicht hochkapazitives Reasoning mit einer effizienteren Berechnung pro Token im Vergleich zu einem dichten Modell ähnlicher Gesamtzahl an Parametern aus. Die Step 5 Preview API unterstützt nativ Text-, Bild- und Video-Eingaben und erzeugt Text-Ausgaben, während sie gleichzeitig Streaming, Tool Calling, JSON Mode, JSON Schema-Ausgabe, Prompt-Caching sowie auswählbare Reasoning-Aufwandsstufen von low, medium und high bereitstellt.

Parameter

Step 5 Preview arbeitet auf einer sehr großen Skala mit insgesamt 600 Milliarden Parametern und 27 Milliarden aktiven Parametern pro Token. Es unterstützt ein Kontextfenster von 1.048.576 Tokens, was groß genug für Multidokumenten-Analysen, große Codebasen, umfangreiche Tool-Traces und eine kontinuierliche Agenten-Ausführung ist. Für multimodale Anfragen unterstützt die Step 5 Preview API bis zu 60 Bilder pro Anfrage in den Formaten JPG, JPEG, PNG, WebP und statischem GIF sowie Video-Eingaben in MP4, QuickTime und Matroska, wobei einzelne MP4-Dateien unter 128 MB und unter 5 Minuten empfohlen werden.

Funktionen

  • Verständnis und Reasoning über lange Kontexte hinweg bei sehr großen Dokumenten, mehreren Quellen, Tool-Ausgaben und fortlaufendem Aufgabenstatus
  • Unterstützung bei Programmierung und Software-Entwicklung in mehreren Sprachen, einschließlich Fehlerlokalisierung, Code-Änderung und Testempfehlung
  • Mehrstufige Agent-Aufgaben unter Verwendung von Tools zur Informationsbeschaffung, Dokumentenverarbeitung und Erstellung strukturierter Ausgaben über die Step 5 Preview API
  • Multimodales Verständnis für Screenshots, Diagramme, bildbasierte Beantwortung von Fragen sowie Zusammenfassung oder Interpretation kurzer Videos

Einschränkungen

  • Die Ausgabe beschränkt sich auf Text, sodass die Step 5 Preview API zwar Bilder und Videos analysieren, aber keine Bild-, Audio- oder Video-Antworten generieren kann
  • Die Videoverarbeitung eignet sich am besten für relativ kurze Dateien; empfohlen werden MP4-Dateien unter 128 MB und unter 5 Minuten, was Workflows mit langformatigen Videos einschränkt

Step 5 Preview API Leistung

Stärken

  • Spitzenleistung in der Software-Entwicklung und bei professioneller Wissensarbeit, insbesondere bei Aufgaben mit langem Kontext und Tool-Unterstützung
  • Besonders starke Ergebnisse beim finanzbezogenen Reasoning und bei entsprechenden Analysen, wodurch sich die Step 5 Preview API hervorragend für dokumentenintensive Fachbereiche eignet
  • Starkes multimodales Verständnis, das textuelles Reasoning mit dem Lesen von Diagrammen, der Interpretation von Screenshots und dem Verständnis kurzer Videos kombiniert
  • Zuverlässige Unterstützung für strukturierte und agentische Workloads durch Streaming, JSON-Ausgaben, Reasoning-Steuerung und Prompt-Caching

Praxiseffektivität

In der praktischen Anwendung ist Step 5 Preview am effektivsten, wenn eine Anwendung die Aufnahme großer Kontexte, mehrstufiges Reasoning und API-native Workflow-Steuerung kombinieren muss. Die Step 5 Preview API passt hervorragend zu Assistenten, die lange Berichte lesen, Code-Repositories durchsuchen, Screenshots prüfen, kurze Videos zusammenfassen und Tools aufrufen müssen, ohne die Kontinuität der Aufgabe zu verlieren. Ihr großes Kontextfenster reduziert die Fragmentierung über Anfragen hinweg, während strukturierte Ausgaben und Steuerungen für den Reasoning-Aufwand die Integration in Unternehmenssysteme verbessern, die vorhersagbare Formatierung, Orchestrierung und überprüfbare Ausgaben erfordern.

Step 5 Preview API Wann verwenden

Szenarien

  • Sie haben ein Software-Entwicklungsteam, das Unterstützung beim Navigieren in einem großen Repository, beim Identifizieren von Regressionen, beim Vorschlagen von Code-Änderungen und beim Empfehlen gezielter Tests benötigt. Die Step 5 Preview API ist ideal, da sie starke Coding-Leistung mit einem Kontextfenster von 1 Million Tokens kombiniert und so über umfangreichen Code, Problembeschreibungen und Tool-Ausgaben in einem einzigen Workflow nachdenken kann. Dies kann die manuelle Sichtungszeit reduzieren, die Entwicklerproduktivität steigern und eine konsistentere Fehlersuche sowie Behebung über dateiübergreifende Änderungen hinweg unterstützen.
  • Sie haben einen Workflow in der Forschung, Rechtsberatung oder im Finanzbereich, der das Lesen vieler langer Dokumente, das Vergleichen von Quellen, das Extrahieren von Schlussfolgerungen und das Bereitstellen strukturierter Ergebnisse erfordert. Die Step 5 Preview API passt zu diesem Szenario, da sie für Reasoning mit langem Kontext und professionelle Wissensarbeit optimiert ist – mit besonderer Stärke im Finanzsektor. Sie kann große Materialmengen in weniger Übergabeschritten verarbeiten, dokumentenübergreifende Zusammenhänge bewahren und JSON-formatierte Ausgaben liefern, die sich leichter validieren, automatisieren und in nachgelagerte Geschäftssysteme integrieren lassen.
  • Sie haben eine multimodale Support- oder Analyseaufgabe, die Screenshots, Diagramme, Produktbilder und kurze Videos zusammen mit schriftlichen Anweisungen oder Fragen umfasst. Die Step 5 Preview API ist eine hervorragende Wahl, da sie nativ Text-, Bild- und Video-Eingaben in einem einzigen Modell verarbeitet, sodass ein einziger Workflow visuelle Belege interpretieren und Ergebnisse in Textform erklären kann. Dies erhöht die operative Effizienz für Anwendungsfälle wie Dashboard-Überprüfungen, Diagrammanalysen, Fehlerbehebung anhand von Screenshots und prägnante Videozusammenfassungen, ohne dass separate modalitätsspezifische Pipelines aufgebaut werden müssen.

Best Practices

  • Verwenden Sie die Step 5 Preview API mit strukturierten Ausgabemodi wie JSON Mode oder JSON Schema bei der Integration in Geschäftsworkflows, Analyse-Pipelines oder tool-basierte Agenten, die vorhersagbare maschinenlesbare Antworten erfordern
  • Wählen Sie die Stufen für den Reasoning-Aufwand basierend auf der Komplexität der Aufgabe und kombinieren Sie Prompt-Caching, Tool Calling und Eingaben mit langem Kontext, um Konsistenz und Effizienz in wiederkehrenden oder mehrstufigen Workflows zu verbessern
  • Stellen Sie klare Aufgabenrahmen, relevante Dokumente und modalitätsspezifische Eingaben zusammen bereit, damit die Step 5 Preview API über Code, Text, Bilder und kurze Videos hinweg in einem einzigen kohärenten Kontext nachdenken kann

Technische Spezifikationen

Kontextlänge1,048,576
Maximale Dateigröße128MB
Veröffentlichungsdatum1/1/2026
Eingabeformate
textimagevideo
Ausgabeformate
text

Funktionen & Features

Fähigkeiten
text generationmultimodal understandingimage understandingvideo understandinglong context reasoningtool callingstructured outputjson modejson schema outputstreamingprompt cachingsoftware engineeringcode generationdocument analysisresearch and analysisagentic workflows
Unterstützte Dateitypen
.jpg.jpeg.png.webp.gif.mp4.mov.mkv
Step 5 Preview API - Günstige API - StepFun - Defapi