Ling 3.1 Flash API

출시 예정
inclusionai/ling-3.1-flash
제작: inclusionAI, the AI lab of Ant Group•출시일: 9/29/2026

inclusionAI의 Ling 3.1 Flash는 코딩, 에이전트, 256K 토큰 윈도우 기반의 긴 컨텍스트 텍스트 워크플로를 위해 설계된 빠른 MoE 추론 LLM입니다.

출시 예정
This model is coming soon and is not available for API calls yet.

Ling 3.1 Flash API 배경

개요

Ling 3.1 Flash는 Ant Group의 AI 연구소인 inclusionAI에서 개발한 대규모 텍스트 대 텍스트 모델로, 고속, 긴 컨텍스트, 에이전트 지향 API 활용에 맞추어 포지셔닝되었습니다. Ling-3.0-flash의 후속 모델로서 Mixture-of-Experts 구조와 하이브리드 추론 및 명시적 사고 모드(explicit thinking mode)를 결합하여, Ling 3.1 Flash API는 코딩, 다단계 분석, 긴 문서 워크플로 및 도구를 사용하는 어시스턴트에 특히 적합합니다. 256K 컨텍스트 윈도우와 최대 32,768 토큰 출력을 지원하며 출시되어, 강력한 추론 품질, 높은 처리량, 복잡한 텍스트 작업의 안정적인 처리가 필요한 개발자와 기업을 지원하는 것을 목표로 합니다.

개발 과정

Ling 3.1 Flash는 inclusionAI의 Ling flash 라인업의 차세대 모델로서 2026년 9월 29일에 출시되었습니다. Ling-3.0-flash의 후속으로, 토큰당 활성 파라미터 51억 개를 갖춘 총 파라미터 1,240억 개에서 토큰당 약 250억 개가 활성화되는 총 파라미터 5,600억 개로 대폭적인 규모 확장을 이루었습니다. 출시 시점에 이 모델은 inclusionai/ling-3.1-flash라는 이름으로 API 액세스를 통해 제공되었으며, 오픈 웨이트는 초기 시범 운영 기간 이후 공개될 예정이었습니다. 이러한 진전은 Ling 3.1 Flash API에서 더 빠른 에이전틱(agentic) 성능, 더 강력한 추론, 그리고 향상된 긴 컨텍스트 처리 기능에 대한 명확한 집중을 반영합니다.

주요 혁신

  • 효율적인 고성능 추론을 위해 토큰당 약 250억 개의 파라미터를 활성화하면서 총 파라미터 5,600억 개로 확장된 Mixture-of-Experts 아키텍처
  • 다단계 분석, 코딩 워크플로 및 더 신뢰할 수 있는 에이전트 동작을 지원하는 명시적 사고 모드(explicit thinking mode)를 갖춘 하이브리드 추론 설계
  • 출시 시 262,144 토큰 윈도우, 최대 32,768 토큰 출력, 100만 토큰 컨텍스트 목표 달성을 포함하는 긴 컨텍스트 API 프로필

Ling 3.1 Flash API 기술 사양

구조

Ling 3.1 Flash는 텍스트 입력 및 텍스트 출력에 최적화된 Mixture-of-Experts 아키텍처를 사용하며, 명시적 사고 모드를 포함하는 하이브리드 추론 시스템을 갖추고 있습니다. 이 설계는 각 토큰에 대해 전문가(expert)의 일부만 활성화함으로써 높은 모델 용량과 실용적인 추론 효율성의 균형을 맞추는 것을 목표로 합니다. Ling 3.1 Flash API는 다단계 도구 사용, 검색 보조 작업, 오피스 소프트웨어 워크플로 및 긴 문서 이해를 포함한 에이전틱 실행 패턴을 위해 구축되었습니다. 출시 시점에 262,144 토큰 컨텍스트 윈도우를 지원하며, 향후 전체 윈도우 활성화를 위한 100만 토큰 목표가 언급되었고 최대 32,768 토큰 출력을 허용합니다.

파라미터

이 모델은 총 파라미터 5,600억 개를 보유하며, 추론 중 토큰당 약 250억 개의 파라미터가 활성화됩니다. 이는 총 파라미터 1,240억 개와 토큰당 약 51억 개의 활성 파라미터를 사용했던 Ling-3.0-flash에 비해 상당한 증가입니다. 더욱 커진 MoE 스케일은 희소 전문가 활성화(sparse expert activation)와 관련된 효율성 이점을 유지하면서 복잡한 코딩, 추론 및 긴 컨텍스트 작업을 위한 훨씬 뛰어난 표현 용량을 Ling 3.1 Flash API에 제공합니다.

기능

  • 코드 생성, 디버깅 지원, 다단계 추론이 필요한 소프트웨어 엔지니어링 작업을 위한 강력한 코딩 지원
  • 긴 보고서나 지식 베이스의 구조화된 종합을 포함하여 매우 광범위한 텍스트 컨텍스트에 대한 긴 문서 분석 및 요약
  • 자동화 지향 애플리케이션을 위한 도구 사용, 검색 워크플로, 오피스 소프트웨어 상호작용을 통한 에이전틱 작업 실행
  • 전문적 분석, 도메인 특화 어시스턴스, 복잡한 작업 오케스트레이션과 같은 전문 텍스트 애플리케이션

한계

  • 텍스트 전용 모델이므로 이미지, 오디오 또는 비디오 입력을 기본적으로 처리하지 못함
  • 출시 시점에서 전체 100만 토큰 컨텍스트는 활성화된 기본값이 아니라 목표 단계였으며, 초기에는 256K 컨텍스트가 제공됨
  • 출력이 다소 장황(verbose)하므로 상용 API 연동 시 더 엄격한 프롬프팅 또는 출력 제한 조치가 필요할 수 있음

Ling 3.1 Flash API 성능

장점

  • 동급 대비 높은 종합 성능을 보유하고 있으며, Artificial Analysis Intelligence Index 점수는 41점으로 유사한 오픈 웨이트 모델의 보고된 중간값인 19점을 크게 상회함
  • 초당 약 210.7 토큰의 출력 속도와 약 1.79초의 첫 토큰 생성 시간(TTFT)을 포함한 빠른 추론 특성으로, Ling 3.1 Flash API는 응답성이 중요한 애플리케이션에 유용함
  • 종합 에이전틱 점수 81.0, Terminal-Bench 4 40.4%, SWE-Atlas 55.9%, HealthBench Professional 65.3% 등 강력한 에이전틱 및 응용 벤치마크 결과

실제 효과

실제 API 배포 환경에서 Ling 3.1 Flash는 속도, 긴 컨텍스트 처리 및 깊이 있는 추론의 조합이 필요한 경우 특히 효과적인 것으로 나타납니다. 벤치마크 프로필에 따르면 소프트웨어 엔지니어링 어시스턴트, 도구 활용 에이전트, 전문 분석 워크플로 및 기업 지식 처리에 적합합니다. 빠른 출력과 상대적으로 짧은 첫 토큰 생성 시간은 대화형 애플리케이션을 지원하며, 대용량 컨텍스트 윈도우는 문서 분할(chunking) 오버헤드를 줄이는 데 도움이 됩니다. 주요 운용 고려 사항은 장황함(verbosity)입니다. Ling 3.1 Flash API를 사용하는 팀은 출력을 상용 환경 요건에 맞추기 위해 명시적인 응답 길이 제어, 구조화된 출력 템플릿 및 간결한 프롬프팅을 적용하는 것이 좋습니다.

Ling 3.1 Flash API 언제 사용하나요

시나리오

  • 대규모 리포지토리, 다중 파일 디버깅 및 에이전트 기반 코딩 지원을 포함하는 소프트웨어 엔지니어링 워크플로가 있는 경우. Ling 3.1 Flash API는 뛰어난 코딩 능력과 SWE-Atlas 및 Terminal-Bench 4와 같은 벤치마크 검증을 거친 소프트웨어 작업 성능을 결합하여 매우 적합합니다. 이를 통해 개발 팀은 개발자 도구 및 내부 코딩 어시스턴트에 적합한 응답성을 유지하면서 버그 조사 가속화, 구현 계획 작성 및 일상적인 엔지니어링 분석 자동화를 수행할 수 있습니다.
  • 문서 간 컨텍스트를 손실하지 않고 검토 및 요약해야 하는 긴 보고서, 계약서, 연구 자료집 또는 정책 문서가 있는 경우. Ling 3.1 Flash API는 256K 출시 컨텍스트 윈도우를 통해 광범위한 텍스트 범위를 지원하고 과도한 문서 분할의 필요성을 줄여주므로 이상적입니다. 이는 대규모 텍스트 코퍼스를 다루는 법률, 재무, 컴플라이언스 및 운영 팀의 요약 일관성을 향상시키고, 섹션 간 의존성을 보존하며, 지식 추출 과정을 효율화할 수 있습니다.
  • 오피스 워크플로 전반에 걸친 검색, 도구 사용 및 구조화된 다단계 추론에 의존하는 기업 자동화 사용 사례가 있는 경우. Ling 3.1 Flash API는 에이전틱 작업 및 전문 애플리케이션을 위해 구축되었으며, 강력한 종합 에이전트 벤치마크 성능을 보여주어 잘 들어맞습니다. 이를 통해 팀은 정보를 수집하고 단계별로 추론하며 초안을 작성하고 분석가나 운영 직원을 지원하는 어시스턴트를 생성하여 더 빠른 실행과 확장 가능한 텍스트 기반 작업 처리를 실현할 수 있습니다.

모범 사례

  • 상용 워크플로에서 모델 특유의 장황한 출력을 제어하기 위해 명확한 시스템 지시사항, 응답 스키마 및 길이 제한을 사용하세요.
  • 리포지토리 분석, 긴 문서 종합, 에이전트 오케스트레이션과 같이 대용량 컨텍스트와 다단계 추론의 이점을 활용할 수 있는 작업에 Ling 3.1 Flash API를 적극 활용하세요.
  • 특히 도구를 사용하는 에이전트의 경우, 신뢰성을 높이고 모델의 추론 및 행동 흐름을 더 쉽게 검증할 수 있도록 명시적인 작업 분해를 중심으로 프롬프트를 설계하세요.

기술 사양

컨텍스트 길이262,144
출시일9/29/2026
입력 형식
text
출력 형식
text

기능 및 특징

기능
text generationcodingmulti step analysishybrid reasoningexplicit thinking modetool using agentssearchoffice software workflowslong document analysissummarizationspecialist applicationsagentic taskslong context text processing