Ling 3.1 Flash API

近日公開
inclusionai/ling-3.1-flash
by inclusionAI, the AI lab of Ant Group•リリース日: 9/29/2026

inclusionAIによるLing 3.1 Flashは、256Kトークンのコンテキストウィンドウを備え、コーディング、エージェント、および長文コンテキストのテキストワークフロー向けの高速MoE推論LLMです。

近日公開
This model is coming soon and is not available for API calls yet.

Ling 3.1 Flash API 背景

概要

Ling 3.1 Flashは、Ant GroupのAIラボであるinclusionAIによる大規模なText-to-Textモデルであり、高速で長文コンテキストに対応した、エージェント向けのAPI利用に位置付けられています。Ling-3.0-flashの後継として、Mixture-of-Expertsデザインとハイブリッド推論、明確な思考モードを組み合わせており、Ling 3.1 Flash APIは特にコーディング、複数ステップの分析、長文ドキュメントのワークフロー、ツールを利用するアシスタントに適しています。256Kトークンのコンテキストウィンドウと最大32,768トークンの出力サポートを備えてローンチされ、強力な推論品質、高スループット、複雑なテキストタスクの信頼性の高い処理を必要とする開発者や企業に対応することを目指しています。

開発履歴

Ling 3.1 Flashは、inclusionAIのLing flashラインの次世代モデルとして2026年9月29日にリリースされました。Ling-3.0-flashに続くモデルであり、総パラメータ数が1,240億(1トークンあたりのアクティブパラメータ数51億)から、総パラメータ数5,600億(1トークンあたりのアクティブパラメータ数約250億)へと大幅なスケールアップを実現しています。ローンチ時、モデルはinclusionai/ling-3.1-flashという名前でAPIアクセスを通じて提供され、初期試用期間の後にオープンウェイトの公開が計画されていました。この進化は、Ling 3.1 Flash APIにおける、より高速なエージェント性能、より強力な推論、およびより優れた長文コンテキスト処理への明確な焦点を反映しています。

主要な革新

  • 効率的な高能力推論のために、1トークンあたり約250億パラメータをアクティブ化しつつ、総パラメータ数を5,600億にスケールしたMixture-of-Expertsアーキテクチャ
  • 複数ステップの分析、コーディングワークフロー、より信頼性の高いエージェント動作をサポートする、明確な思考モードを備えたハイブリッド推論設計
  • ローンチ時に262,144トークンのウィンドウ、最大32,768トークンの出力、および100万トークンのコンテキスト目標に向けた計画を掲げる長文コンテキストAPIプロファイル

Ling 3.1 Flash API 技術仕様

アーキテクチャ

Ling 3.1 Flashは、テキスト入力およびテキスト出力に最適化されたMixture-of-Expertsアーキテクチャを採用し、明確な思考モードを含むハイブリッド推論システムを備えています。この設計は、各トークンに対してエキスパートのサブセットのみをアクティブ化することで、高いモデル容量と実用的な推論効率のバランスを取ることを目的としています。Ling 3.1 Flash APIは、複数ステップのツール利用、検索支援タスク、オフィスソフトウェアのワークフロー、長文ドキュメント理解などのエージェント実行パターン向けに構築されています。ローンチ時には262,144トークンのコンテキストウィンドウをサポートしており、将来のフルウィンドウ有効化に向けて100万トークンの目標が掲げられており、最大32,768トークンの出力を許可します。

パラメータ

このモデルは総パラメータ数5,600億を持ち、推論中には1トークンあたりおよそ250億のパラメータがアクティブ化されます。これは、総パラメータ数1,240億、1トークンあたりのアクティブパラメータ数約51億であったLing-3.0-flashからの大幅な増加です。拡大されたMoEスケールにより、Ling 3.1 Flash APIはスパースなエキスパートアクティベーションに関連する効率面でのメリットを維持しながら、複雑なコーディング、推論、長文コンテキストタスクに対して大幅に優れた表現能力を発揮します。

機能

  • コード生成、デバッグ支援、複数ステップの推論を必要とするソフトウェアエンジニアリングタスクに対する強力なコーディングサポート
  • 長大なレポートやナレッジベースの構造化された統合を含む、非常に大規模なテキストコンテキスト全体にわたる長文ドキュメント分析と要約
  • 自動化指向のアプリケーションに向けた、ツール利用、検索ワークフロー、オフィスソフトウェアとのインタラクションによるエージェント的タスク実行
  • 専門的な分析、特定領域に焦点を当てた支援、複雑なタスクのオーケストレーションなどの専門的テキストアプリケーション

制限事項

  • モデルはテキスト専用であるため、画像、音声、動画の入力をネイティブに処理することはできません
  • ローンチ時には、完全な100万トークンのコンテキストは有効化されたデフォルトではなく目標であり、初期段階で利用可能なコンテキストは256Kです
  • かなり冗長になる傾向があり、本番環境のAPI連携において、より厳密なプロンプト指定や出力制限が必要になる場合があります

Ling 3.1 Flash API 性能

強み

  • 同クラスで高い総合能力を持ち、Artificial Analysis Intelligence Indexのスコアは41と、比較可能なオープンウェイトモデルの報告されている中央値19を大きく上回っています
  • 出力速度が毎秒約210.7トークン、最初のトークンまでの時間が約1.79秒という高速な推論特性により、Ling 3.1 Flash APIはレスポンス性が求められるアプリケーションにとって魅力的です
  • 総合エージェントスコア81.0、Terminal-Bench 4で40.4%、SWE-Atlasで55.9%、HealthBench Professionalで65.3%を含む、優れたエージェントおよび応用ベンチマーク結果

実世界での有効性

実際のAPI運用において、Ling 3.1 Flashはスピード、長文コンテキスト処理、推論の深さの組み合わせが必要な場合に特に有効であると考えられます。ベンチマークプロファイルは、ソフトウェアエンジニアリングアシスタント、ツールを利用するエージェント、専門的な分析ワークフロー、企業知識処理に非常に適していることを示唆しています。高速な出力と比較的短い最初のトークンまでの時間は対話型アプリケーションをサポートし、広大なコンテキストウィンドウはドキュメントの分割オーバーヘッドの削減に役立ちます。運用上の主な考慮事項は長文傾向です。Ling 3.1 Flash APIを使用するチームは、出力を本番要件に適合させるために、明確なレスポンス長制限、構造化出力テンプレート、簡潔なプロンプトを活用することが推奨されます。

Ling 3.1 Flash API 使用場面

シナリオ

  • 大規模リポジトリ、複数ファイルのデバッグ、エージェント駆動のコーディングサポートを含むソフトウェアエンジニアリングのワークフローがある場合。SWE-AtlasやTerminal-Bench 4などのベンチマークされたソフトウェアタスクのパフォーマンスと高いコーディング能力を組み合わせているため、Ling 3.1 Flash APIは強力な適合性を発揮します。これにより、開発チームはバグ調査の迅速化、実装計画のドラフト作成、定常的なエンジニアリング分析の自動化を実現しながら、開発者ツールや社内コーディングアシスタントに適したレスポンス性を維持できます。
  • ドキュメント間のコンテキストを失うことなく確認・要約する必要がある長文のレポート、契約書、研究資料、ポリシー文書がある場合。Ling 3.1 Flash APIは、ローンチ時の256Kコンテキストウィンドウにより広範なテキストをカバーし、過度なチャンキングの必要性を減らすため理想的です。これにより、要約の一貫性が向上し、セクション間の依存関係が保持され、大量のテキストデータを扱う法務、財務、コンプライアンス、運用チームの知識抽出が効率化されます。
  • オフィスワークフロー全体で検索、ツール利用、構造化された複数ステップの推論に依存する企業向け自動化ユースケースがある場合。Ling 3.1 Flash APIは、優れた総合エージェントベンチマーク性能を備え、エージェントタスクや専門アプリケーション向けに構築されているため適しています。これにより、チームは情報を収集し、ステップ間で推論を行い、出力をドラフト作成して、アナリストや運用スタッフをより高速な実行とスケーラブルなテキストベースのタスク処理でサポートするアシスタントを作成できます。

ベストプラクティス

  • 本番ワークフローでモデルの生来の冗長な出力を制御するために、明確なシステム指示、レスポンススキーマ、長さ制限を使用する
  • リポジトリ分析、長文ドキュメントの統合、エージェントのオーケストレーションなど、大容量コンテキストと複数ステップの推論が役立つタスクでLing 3.1 Flash APIを活用する
  • 特にツールを使用するエージェントにおいて、信頼性を向上させ、モデルの推論とアクションのフローの検証を容易にするために、明確なタスク分解を中心にプロンプトを設計する

技術仕様

コンテキスト長262,144
リリース日9/29/2026
入力形式
text
出力形式
text

機能と特徴

機能
text generationcodingmulti step analysishybrid reasoningexplicit thinking modetool using agentssearchoffice software workflowslong document analysissummarizationspecialist applicationsagentic taskslong context text processing