Ling 3.1 Flash API

即将推出
inclusionai/ling-3.1-flash
由 inclusionAI, the AI lab of Ant Group•发布日期: 9/29/2026

Ling 3.1 Flash 是 inclusionAI 推出的一款快速 MoE 推理大语言模型(LLM),拥有 256K token 窗口,适用于代码编写、Agent 和长上下文文本工作流。

即将推出
该模型即将推出,暂不可调用。

Ling 3.1 Flash API 背景介绍

概述

Ling 3.1 Flash 是来自蚂蚁集团 AI 实验室 inclusionAI 的大规模文本到文本模型,定位为快速、长上下文且面向 Agent 的 API 应用。作为 Ling-3.0-flash 的继承者,它结合了混合专家(Mixture-of-Experts)设计与混合推理及显式思考模式,使 Ling 3.1 Flash API 特别适合代码编写、多步分析、长文档工作流和使用工具的助手。它发布时具备 256K 上下文窗口并支持最高 32,768 个 token 的输出,旨在服务需要强推理质量、高吞吐量以及可靠处理复杂文本任务的开发者和企业。

发展历史

Ling 3.1 Flash 于 2026 年 9 月 29 日发布,作为 inclusionAI 旗下的 Ling flash 系列的下一代产品。它延续自 Ling-3.0-flash,代表了规模上的重大提升,从总参数 1240 亿(每 token 激活 51 亿参数)扩展至总参数 5600 亿(每 token 激活约 250 亿参数)。在发布时,该模型通过名为 inclusionai/ling-3.1-flash 的 API 提供访问,并计划在初始试用期后开源权重。这一演进反映出 Ling 3.1 Flash API 对更快 Agent 性能、更强推理能力以及更强大长上下文处理能力的明确专注。

关键创新

  • 混合专家(Mixture-of-Experts)架构扩展至 5600 亿总参数,同时每 token 仅激活约 250 亿参数,实现高效的高能力推理
  • 具备显式思考模式的混合推理设计,支持多步分析、代码编写工作流以及更可靠的 Agent 行为
  • 长上下文 API 特性,发布时支持 262,144 token 窗口、32,768 token 最大输出,并规划了走向 100 万 token 上下文的目标

Ling 3.1 Flash API 技术规格

架构

Ling 3.1 Flash 采用了针对文本输入和文本输出优化的混合专家(Mixture-of-Experts)架构,并带有包含显式思考模式的混合推理系统。该设计旨在通过为每个 token 仅激活一部分专家,从而在较高的模型容量与实际推理效率之间取得平衡。Ling 3.1 Flash API 专为 Agent 执行模式构建,包括多步工具使用、搜索辅助任务、办公软件工作流和长文档理解。在发布时,它支持 262,144 token 的上下文窗口,并以未来实现全窗口启用的 100 万 token 为目标,最大输出可达 32,768 token。

参数

该模型拥有 5600 亿总参数,在推理期间每个 token 大约激活 250 亿参数。相比 Ling-3.0-flash(总参数 1240 亿,每 token 激活约 51 亿参数)有了大幅提升。更大的 MoE 规模为 Ling 3.1 Flash API 在复杂代码编写、推理和长上下文任务中赋予了显著更高的表达能力,同时保留了稀疏专家激活带来的效率优势。

功能

  • 强大的代码编写支持,适用于代码生成、调试辅助以及需要多步推理的软件工程任务
  • 跨超大文本上下文的长文档分析与总结,包括对冗长报告或知识库的结构化综合
  • 面向自动化应用的 Agent 任务执行,包含工具使用、搜索工作流及办公软件交互
  • 专业文本应用,如专业分析、特定领域辅助以及复杂任务编排

局限性

  • 该模型仅支持文本,因此无法原生处理图像、音频或视频输入
  • 在发布时,完整的 100 万 token 上下文是一个规划目标而非默认启用状态,初始可用上下文为 256K
  • 模型的输出明显偏冗长,在生产 API 集成中可能需要更严格的提示词或输出约束

Ling 3.1 Flash API 性能

优势

  • 同类模型中具备较高的综合能力,包括 Artificial Analysis Intelligence Index 得分为 41,远高于同类开放权重模型报告的中位数 19
  • 快速的推理特性,输出速度约为每秒 210.7 个 token,首 token 时间约为 1.79 秒,使得 Ling 3.1 Flash API 对于响应式应用极具吸引力
  • 强劲的 Agent 和应用基准测试结果,包括 Agent 综合得分为 81.0,Terminal-Bench 4 为 40.4%,SWE-Atlas 为 55.9%,HealthBench Professional 为 65.3%

实际效果

在实际 API 部署中,当用户需要兼顾速度、长上下文处理和推理深度时,Ling 3.1 Flash 显得尤为有效。基准表现表明,它非常适合软件工程助手、使用工具的 Agent、专业分析工作流和企业知识处理。其快速的输出和较低的首 token 时间支持交互式应用,而大上下文窗口有助于减少文档分块开销。主要的操作考量在于其偏冗长的输出:使用 Ling 3.1 Flash API 的团队可能需要显式的响应长度控制、结构化输出模板和简明提示词,以使输出与生产需求保持一致。

Ling 3.1 Flash API 适用场景

应用场景

  • 您拥有涉及大型代码库、多文件调试和 Agent 驱动代码编写支持的软件工程工作流。Ling 3.1 Flash API 非常适合,因为它将高代码能力与在 SWE-Atlas 和 Terminal-Bench 4 等软件任务上的出色基准表现相结合。这有助于开发团队加速 Bug 排查、起草实现方案并自动化日常工程分析,同时保持适合开发者工具和内部编程助手的响应速度。
  • 您有长篇报告、合同、研究集合或政策文件需要审阅和总结,且不能丢失跨文档的上下文。Ling 3.1 Flash API 是理想之选,因为其发布时提供的 256K 上下文窗口支持广泛的文本覆盖,并减少了激进分块的需求。这可以提高总结连贯性、保留跨章节依赖关系,并为处理大文本语料库的法务、金融、合规和运营团队简化知识提取。
  • 您拥有依赖于搜索、工具使用以及跨办公工作流进行结构化多步推理的企业自动化用例。Ling 3.1 Flash API 非常适合,因为它专为 Agent 任务和专业应用构建,并具备强大的 Agent 综合基准测试表现。这使团队能够构建收集信息、跨步骤推理、起草输出并以更快执行速度和更可扩展的文本任务处理来支持分析师或运营人员的助手。

最佳实践

  • 在生产工作流中使用清晰的系统指令、响应 Schema 和长度限制,以控制模型自然偏冗长的输出
  • 充分利用 Ling 3.1 Flash API 处理受益于大上下文和多步推理的任务,例如代码库分析、长文档综合和 Agent 编排
  • 围绕显式任务拆解设计提示词(尤其是对使用工具的 Agent),以提高可靠性并使模型的推理与行动流程更易验证

技术规格

上下文长度262,144
发布日期9/29/2026
输入格式
text
输出格式
text

功能特性

功能
text generationcodingmulti step analysishybrid reasoningexplicit thinking modetool using agentssearchoffice software workflowslong document analysissummarizationspecialist applicationsagentic taskslong context text processing