Step 5 Preview API
即将推出StepFun 2026年推出的旗舰多模态 MoE 模型,适用于智能体任务、代码编写、长上下文推理、文档分析和视频理解。
Step 5 Preview API 背景介绍
概述
Step 5 Preview 是 StepFun 2026 年面向智能体工作流推出的旗舰模型,在 API 中以模型 ID step-5-preview 的 Step 5 Preview API 形式开放。它专为高要求的软件工程、长上下文推理、多模态分析和专业知识任务而设计,在面向金融的工作流中表现尤为突出。该模型接受文本、图像和视频输入,并输出文本,非常适合需要读取大型文档集、检查视觉材料、调用工具并在复杂多步骤任务中保持进度的 API 驱动型助手。
发展历史
Step 5 Preview 于 2026 年发布,代表了 StepFun 用于高级智能体应用和面向生产的知识工作的旗舰预览模型。Step 5 Preview API 的定位是在软件工程和专业推理方面具备前沿级性能,尤其是在长上下文和工具使用至关重要的场景下。其发布强调了稀疏混合专家(Mixture-of-Experts)扩展、1,048,576 token 的上下文窗口、多模态输入支持以及结构化 API 功能的结合,例如流式传输(streaming)、JSON 输出、JSON Schema、prompt 缓存(prompt caching)以及针对复杂工作流的可配置推理工作量(reasoning effort)。
关键创新
- 采用稀疏混合专家(Mixture-of-Experts)架构,总参数量达 6000 亿,每个 token 仅激活 270 亿参数,提高了高级推理和代码编写任务的扩展效率
- Step 5 Preview API 支持文本、图像和视频的原生多模态摄入,能够统一处理文档、屏幕截图、图表和短视频内容
- 100 万 token 上下文窗口与工具调用、结构化输出和推理工作量控制相结合,适用于长期运行的智能体工作流和大规模知识综合
Step 5 Preview API 技术规格
架构
该模型采用专为大规模智能体工作负载优化的稀疏混合专家(Mixture-of-Experts)架构。Step 5 Preview 拥有 6000 亿总参数,每个 token 激活 270 亿参数,与同等总规模的密集模型相比,平衡了高容量推理与更高效的单 token 计算。Step 5 Preview API 原生支持文本、图像和视频输入,并生成文本输出,同时暴露了流式传输、工具调用、JSON Mode、JSON Schema 输出、prompt 缓存,以及可选的 low、medium 和 high 推理工作量等级。
参数
Step 5 Preview 以超大规模运行,总参数量为 6000 亿,每个 token 的激活参数量为 270 亿。它支持 1,048,576 个 token 的上下文窗口,足以满足多文档分析、大型代码库、广泛的工具执行轨迹和持续的智能体执行需求。对于多模态请求,Step 5 Preview API 每次请求最多支持 60 张 JPG、JPEG、PNG、WebP 和静态 GIF 格式的图像,以及 MP4、QuickTime 和 Matroska 格式的视频输入,建议单个 MP4 文件在 128 MB 以下且时长在 5 分钟以内。
功能
- 跨超大文档、多数据源、工具输出和持续任务状态的长上下文理解与推理
- 跨多种语言的编程和软件工程辅助,包括 Bug 定位、代码修改和测试用例推荐
- 通过 Step 5 Preview API 使用工具检索信息、处理文档并生成结构化输出的多步骤智能体任务
- 针对屏幕截图、图表、基于图像的问答以及短视频摘要或解读的多模态理解
局限性
- 仅支持文本输出,因此 Step 5 Preview API 虽然可以分析图像和视频,但不能生成图像、音频或视频响应
- 视频处理最适合相对较短的文件,建议 MP4 文件小于 128 MB 且时长小于 5 分钟,这限制了长视频工作流的应用
Step 5 Preview API 性能
优势
- 在软件工程和专业知识工作方面具备前沿级性能,尤其是在长上下文和工具增强型任务中
- 在金融相关推理和分析中表现尤为突出,使 Step 5 Preview API 非常适合文档密集型专业领域
- 强大的多模态理解能力,将文本推理与图表读取、截图解读和短视频理解结合在一起
- 通过流式传输、JSON 输出、推理控制和 prompt 缓存,为结构化和智能体工作负载提供可靠支持
实际效果
在实际应用中,当应用程序需要结合大上下文摄入、多步骤推理和 API 原生工作流控制时,Step 5 Preview 最为有效。Step 5 Preview API 非常适合那些必须阅读长篇报告、检索代码库、检查屏幕截图、总结短视频并调用工具而又不丢失任务连续性的助手。它的长上下文窗口减少了请求之间的碎片化,而结构化输出和推理工作量控制则改善了向需要可预测格式、编排和可审计输出的企业系统中的集成。
Step 5 Preview API 适用场景
应用场景
- 您拥有一个软件工程团队,需要帮助浏览大型代码库、识别回归问题、提出代码修改建议并推荐有针对性的测试。Step 5 Preview API 是理想选择,因为它结合了强大的编码性能与 100 万 token 的上下文窗口,可以在单个工作流中对海量代码、问题描述和工具输出进行推理。这可以减少手动排查时间,提高开发者效率,并支持在多文件修改中实现更一致的调试和修复。
- 您拥有研究、法律或金融运营工作流,需要阅读大量长文档、比较来源、提取结论并返回结构化结果。Step 5 Preview API 非常契合此场景,因为它专为长上下文推理和专业知识工作而优化,在金融领域优势尤为突出。它可以用更少的交互步骤处理大量材料,保留跨文档关联,并提供更易于校验、自动化和集成到下游业务系统中的 JSON 格式输出。
- 您有包含屏幕截图、图表、产品图像和短视频以及书面指令或问题的多模态支持或分析任务。Step 5 Preview API 是有力选择,因为它在单个模型中原生接受文本、图像和视频输入,允许单一工作流解读视觉证据并用文本解释分析结果。这提高了仪表板审查、图表分析、截图排错和简短视频摘要等用例的运营效率,无需构建单独的特定模态管线。
最佳实践
- 在与需要可预测的机器可读响应的业务工作流、分析管线或基于工具的智能体集成时,结合 JSON Mode 或 JSON Schema 等结构化输出模式使用 Step 5 Preview API
- 根据任务复杂度选择推理工作量等级(reasoning effort),并结合 prompt 缓存、工具调用和长上下文输入,以提高重复或多步骤工作流中的一致性和效率
- 同时提供清晰的任务框架、相关文档和特定模态的输入,以便 Step 5 Preview API 能够在单个连贯的上下文中对代码、文本、图像和短视频进行跨模态推理