Laya 0.3.20 API

활성
defapi/laya-0.3.20
제작: Convai Innovations•출시일: 9/28/2026

Laya 0.3.20은 텍스트 또는 JSON을 기반으로 단 한 번의 빠른 패스(pass)를 통해 타입 지정 분류, 점수 산정 및 라우팅을 수행하는 다국어 System 1 의사결정 엔진입니다.

$0.042100만 토큰당

Laya 0.3.20 API 배경

개요

Laya 0.3.20은 Convai Innovations에서 개발한 다국어 비자율회귀(non-autoregressive) System 1 의사결정 엔진으로, 텍스트 생성보다는 타입 지정(typed) 의사결정에 특화되어 있습니다. Laya 0.3.20 API는 단일 포워드 패스(forward pass)를 통해 텍스트 또는 JSON 형태의 상태에 대해 선택(choice), 점수(score), noul 질문을 평가하여 빠른 분류, 트리아지(triage), 모더레이션, 라우팅 및 스키마 기반 의사결정을 가능하게 합니다. 영어, 다국어 및 typed-decisions 체크포인트 중에서 선택하는 라우터를 통해 100개 이상의 언어를 지원하며, T4 GPU에서 단일 질문 지연 시간은 약 33ms로 측정되었고 배치(batched) 처리량은 질문 수가 증가함에 따라 대폭 향상됩니다.

개발 과정

Laya는 구조화된 출력, 보정된 확률(calibrated probabilities), 다국어 라우팅에 초점을 맞춘 자체 호스팅 가능한 의사결정 모델 패밀리로 발전했습니다. 버전 0.3.20은 3개의 프로덕션 체크포인트, Router 기반 자동 체크포인트 선택, 배치 추론, 다국어 인코더에서 최대 8,192 토큰의 긴 문서 처리 기능, 서버, MCP, LangChain, LlamaIndex 및 CrewAI용 연동을 포함하는 성숙한 릴리스를 나타냅니다. 연구 배경에 따르면 이 플랫폼은 제로샷(zero-shot) 타입 지정 의사결정에서 미세 조정된 도메인 특화로 확장되었으며, typed-decisions 체크포인트는 2,000개 의사결정 벤치마크에서 0.766의 정확도에 도달하여 베이스 체크포인트 대비 실질적인 성능 향상을 보였습니다.

주요 혁신

  • 텍스트 생성이나 파싱 없이 단 한 번의 포워드 패스로 여러 구조화된 질문에 답변하는 비자율회귀 타입 지정 의사결정 추론
  • 추론 전에 문자와 언어를 감지하여 정확도와 신뢰성을 높이기 위해 영어 또는 다국어 모델로 요청을 전송하는 Router 기반 체크포인트 선택
  • 엄격하게 적절한 스코어링 규칙(strictly proper scoring rules)에 대한 강화 학습을 중심으로 한 학습 및 신뢰도 설계로, 신뢰도 게이팅 및 기권(abstention) 정책에 더 유용한 확률 출력을 가능하게 함

Laya 0.3.20 API 기술 사양

구조

Laya 0.3.20은 구조화된 의사결정 작업에 최적화된 인코더 기반 아키텍처를 사용합니다. 영어 및 typed-decisions 체크포인트는 4억 2,100만(421M) 파라미터의 ModernBERT-large를 기반으로 하며, 다국어 체크포인트는 3억 2,200만(322M) 파라미터의 mmBERT-base를 사용하고 100개 이상의 언어를 지원합니다. Laya 0.3.20 API는 요청별로 적절한 체크포인트를 자동으로 선택하는 Router를 통해 이들을 제공합니다. 단일 호출 예측, 배치 추론, 스키마 기반 의사결정, 긴 문서 스캐닝을 지원하며, 다국어 컨텍스트는 기본적으로 최대 1,024 토큰, 긴 입력에 대해 설정된 경우 최대 8,192 토큰까지 지원합니다.

파라미터

모델 패밀리에는 각각 4억 2,100만 파라미터인 laya 및 laya-typed-decisions와 3억 2,200만 파라미터인 laya-multilingual의 3가지 체크포인트가 포함되어 있습니다. 컨텍스트 윈도우는 체크포인트에 따라 다릅니다. 영어 모델은 512 토큰, typed-decisions 체크포인트는 1,024 토큰을 사용하며, 다국어 인코더는 기본적으로 1,024 토큰을 지원하고 최대 8,192 토큰까지 확장 경로를 제공합니다. Laya 0.3.20 API에서는 고수량(high-cardinality) 의사결정 작업에 대해 문서 길이와 옵션 용량의 균형을 맞추기 위해 max_len 및 head_max_len을 사용하여 요청별 토큰 예산을 조정할 수 있습니다.

기능

  • 보정된 신뢰도 메타데이터와 함께 선택(choice), 순위 점수(ordinal score), noul 확률 출력 전반에 걸친 타입 지정 의사결정
  • 단일 포워드 패스 추론을 통해 비라틴 문자를 포함한 100개 이상의 언어에 대한 자동 다국어 라우팅
  • Laya 0.3.20 API를 통한 배치 예측, 스키마 기반 구조화된 출력, 긴 문서 스캐닝, 자체 호스팅 HTTP 또는 MCP 배포
  • 프로덕션 워크플로에서 마스킹(redaction), 캐싱, 로깅, 라우팅 재정의(routing overrides) 및 신뢰도 기반 에스컬레이션을 위한 예측 후크(prediction hooks)

한계

  • 제로샷 성능은 특화된 타입 지정 의사결정 워크플로에 대해 고르지 않을 수 있으며, 베이스 체크포인트에만 의존하기보다는 도메인 특화 데이터에 대한 미세 조정을 수행할 때 가장 뛰어난 결과를 얻을 수 있습니다.
  • 옵션 텍스트가 고정된 토큰 예산을 공유하므로 고수량 선택 작업은 성능이 급격히 저하될 수 있으며, head_max_len을 늘리거나 숏리스트(shortlist) 전략을 사용하지 않으면 50개 이상의 레이블 문제는 어려워집니다.
  • 다국어 체크포인트는 영어 체크포인트보다 영어 성능이 낮고, 영어 체크포인트는 영어 외 언어에서 심각하게 실패할 수 있으므로 라우팅은 선택이 아닌 필수입니다.
  • 다국어 점수 산정에서의 점수 편향, noul 레이블 민감도, 일부 부정 표현이 많은 선택 구문에 대한 약한 처리 등 기록된 일부 에지 케이스(edge cases)가 남아 있습니다.

Laya 0.3.20 API 성능

장점

  • 매우 빠른 구조화된 추론으로, T4 GPU에서 다국어 질문 1개에 대해 약 32.8ms, 배치 처리된 질문 10개에 대해 약 72.3ms의 지연 시간이 측정되었습니다.
  • 단일 체크포인트를 사용하는 것에 비해 우수한 다국어 라우팅 이득을 얻을 수 있으며, 라우팅된 설정은 영어 및 비영어 벤치마크 슬라이스에서 가장 우수한 모델과 동등한 성능을 발휘합니다.
  • 미세 조정된 typed-decisions 성능은 경쟁력이 뛰어나며, 2,000개 의사결정 벤치마크에서 0.766 정확도에 도달하여 해당 벤치마크에서 보고된 Jev의 0.727 결과를 능가합니다.
  • 긴 문서 지원은 운영 환경에서 실용적이며, 다국어 모델은 보고된 테스트에서 최대 8,192 토큰을 읽고 선행 토큰이 약 4,000개일 때 20개 요청 중 16~18개를 정확하게 답변했습니다.

실제 효과

실제 사용 시 Laya 0.3.20 API는 자율 형식의 텍스트 생성보다 지연 시간과 확정적(deterministic) 구조가 더 중요한 지원 트리아지, 모더레이션, 가드레일, 의도 라우팅, 스키마 추출과 같이 대용량의 명확하게 정의된 비즈니스 의사결정에 가장 효과적입니다. 보고된 결과에 따르면 배치 처리를 통한 의미 있는 처리량 향상, 51개 언어에 걸친 뛰어난 라우팅 동작, 도메인 미세 조정 후 상당한 품질 개선을 보여줍니다. 팀에 신뢰도 점수가 포함된 타입 지정 출력이 필요한 경우 특히 유용하지만, 대규모 옵션 집합에 대해 신중하게 설정하고, 로컬 데이터에서 보정하며, 완전 자동화 배포 전에 점수 또는 noul 에지 케이스에 대해 검증해야 합니다.

Laya 0.3.20 API 언제 사용하나요

시나리오

  • 모든 요청을 부서, 긴급도 수준, 환불 상태 또는 이탈 위험으로 분류해야 하는 대용량 고객 지원 또는 운영 워크플로가 있는 경우입니다. Laya 0.3.20 API는 단 한 번의 포워드 패스로 여러 타입 지정 질문에 답변하고, 다국어 입력을 지원하며, 생성 오버헤드 없이 신뢰도가 포함된 구조화된 출력을 반환하므로 적합합니다. 이를 통해 운영 팀은 티켓팅, 받은편지함 트리아지 및 서비스 데스크 워크플로에 대해 더 빠른 라우팅, 더 예측 가능한 자동화, 더 낮은 연동 복잡성을 확보할 수 있습니다.
  • 다양한 문자 및 언어로 사용자 메시지, 불만 사항 또는 모더레이션 이벤트를 수신하는 다국어 제품이 있는 경우입니다. Laya 0.3.20 API는 추론 전에 라우터가 영어 또는 다국어 체크포인트 중 어떤 것이 각 요청을 처리해야 하는지 감지하여, 영어 전용 모델이 비영어 텍스트를 처리할 때 발생할 수 있는 심각한 신뢰도 실패를 방지하므로 이상적입니다. 이는 글로벌 트래픽 전반에서 일관성을 향상시키고 혼합 언어 프로덕션 시스템에서 자동 트리아지, 안전 스크리닝 및 의도 감지를 더 신뢰할 수 있게 만듭니다.
  • 이메일이나 JSON 문서를 스키마 필드로 매핑하거나, 정책 플래그를 평가하거나, 워크플로에 사람의 검토가 필요한지 여부를 결정하는 등 생성된 문장보다는 구조화된 의사결정이 필요한 비즈니스 프로세스가 있는 경우입니다. Laya 0.3.20 API는 스키마 기반 의사결정, 배치 추론 및 자체 호스팅 서비스 배포를 지원하므로 매우 잘 맞습니다. 팀은 비구조화된 입력을 타입 지정 출력으로 빠르게 변환하고, 파싱 오류를 줄이며, 안정적인 응답 형식을 중심으로 확정적 하류(downstream) 자동화를 구축할 수 있습니다.

모범 사례

  • 기본적으로 Router 기반 추론을 사용하고, 홀드아웃(held-out) 데이터에서 신뢰도를 보정하며, 제공되는 원시 확률을 그대로 믿기보다 기권(abstention) 또는 에스컬레이션 임계값을 적용하세요.
  • 대규모 레이블 공간이나 긴 문서의 경우 max_len 및 head_max_len을 주의 깊게 조정하고, 20개 이상의 옵션에 대해서는 숏리스트(shortlist) 전략을 고려하며, 프로덕션 릴리스 전에 자체 워크로드에서 품질을 검증하세요.
  • 정확도가 중요한 경우 항상 도메인 특화 의사결정에 맞춰 미세 조정을 수행하세요. Laya 0.3.20 API에서 보고된 가장 큰 성능 향상은 제로샷 사용보다 특화에서 비롯되기 때문입니다.

기술 사양

컨텍스트 길이8,192
출시일9/28/2026
입력 형식
textjson
출력 형식
json

기능 및 특징

기능
typed decision inferenceclassificationmultilingual routingchoice predictionordinal scoringbinary probability estimationschema driven structured decisionsbatch inferencelong document decisioningconfidence scoringconfidence gatingsupport triageguardrailsmoderation
Laya 0.3.20 API - 저렴한 API - Convai Innovations - Defapi