Laya 0.3.20 API

Activo
defapi/laya-0.3.20
por Convai Innovations•fecha de lanzamiento: 9/28/2026

Laya 0.3.20 es un motor de decisiones de Sistema 1 multilingüe para clasificación tipada, puntuación y enrutamiento sobre texto o JSON en una sola pasada rápida.

$0.042por 1M tokens

Laya 0.3.20 API Antecedentes

Resumen

Laya 0.3.20 es un motor de decisiones de Sistema 1 multilingüe y no autorregresivo de Convai Innovations diseñado para decisiones tipadas en lugar de generación de texto. La API de Laya 0.3.20 evalúa preguntas de tipo choice, score y noul sobre texto o un estado similar a JSON en una sola pasada hacia adelante (forward pass), lo que permite una clasificación, triaje, moderación, enrutamiento y decisiones basadas en esquemas rápidos. Admite más de 100 idiomas a través de un router que selecciona entre checkpoints en inglés, multilingües y de decisiones tipadas, con una latencia medida por pregunta individual de alrededor de 33 ms en una GPU T4 y un rendimiento en lote (batched throughput) que mejora significativamente a medida que aumenta el número de preguntas.

Historia de Desarrollo

Laya evolucionó como una familia de modelos de decisión autoalbergables (self-hostable) centrada en salidas estructuradas, probabilidades calibradas y enrutamiento multilingüe. La versión 0.3.20 representa un lanzamiento maduro con tres checkpoints de producción, selección automática de checkpoints basada en Router, inferencia por lotes, manejo de documentos largos de hasta 8,192 tokens en el codificador multilingüe e integraciones para servidor, MCP, LangChain, LlamaIndex y CrewAI. El contexto de investigación muestra la expansión de la plataforma desde decisiones tipadas zero-shot hacia la especialización de dominio afinada (fine-tuned), donde el checkpoint de typed-decisions alcanzó una precisión de 0.766 en un benchmark de 2,000 decisiones, mejorando sustancialmente con respecto a los checkpoints base.

Innovaciones Clave

  • Inferencia de decisiones tipadas no autorregresiva que responde a múltiples preguntas estructuradas en una sola pasada hacia adelante sin generación ni procesamiento (parsing) de texto
  • Selección de checkpoints basada en Router que detecta la escritura y el idioma antes de la inferencia, enviando las solicitudes a modelos en inglés o multilingües para obtener una mayor precisión y confiabilidad
  • Diseño de entrenamiento y confianza centrado en el aprendizaje por refuerzo frente a reglas de puntuación estrictamente adecuadas (strictly proper scoring rules), lo que permite salidas de probabilidad más útiles para políticas de abstención y filtrado por confianza (confidence gating)

Laya 0.3.20 API Especificaciones Técnicas

Arquitectura

Laya 0.3.20 utiliza arquitecturas basadas en codificadores optimizadas para tareas de decisión estructuradas. Los checkpoints en inglés y de typed-decisions se basan en ModernBERT-large con 421M de parámetros, mientras que el checkpoint multilingüe utiliza mmBERT-base con 322M de parámetros y admite más de 100 idiomas. La API de Laya 0.3.20 expone estos mediante un Router que elige automáticamente el checkpoint adecuado por solicitud. Admite predicción en una sola llamada, inferencia por lotes, decisiones basadas en esquemas y escaneo de documentos largos, con un contexto multilingüe de hasta 1,024 tokens por defecto y de hasta 8,192 tokens cuando se configura para entradas largas.

Parámetros

La familia de modelos incluye tres checkpoints: laya y laya-typed-decisions de 421 millones de parámetros cada uno, y laya-multilingual de 322 millones de parámetros. Las ventanas de contexto difieren según el checkpoint: el modelo en inglés utiliza 512 tokens, el checkpoint de typed-decisions utiliza 1,024 tokens y el codificador multilingüe admite 1,024 tokens por defecto con una ruta extendida de hasta 8,192 tokens. En la API de Laya 0.3.20, los presupuestos de tokens por solicitud se pueden ajustar mediante max_len y head_max_len para equilibrar la longitud del documento frente a la capacidad de opciones para tareas de decisión de alta cardinalidad.

Capacidades

  • Decisiones tipadas a través de salidas de probabilidad de choice, score ordinal y noul con metadatos de confianza calibrados
  • Enrutamiento multilingüe automático en más de 100 idiomas, incluidos alfabetos no latinos, con inferencia en una sola pasada hacia adelante
  • Predicción por lotes, salidas estructuradas basadas en esquemas, escaneo de documentos largos y despliegue HTTP o MCP autoalbergado a través de la API de Laya 0.3.20
  • Hooks de predicción para redacción, almacenamiento en caché, registro de logs, invalidación de enrutamiento y escalado basado en confianza en flujos de trabajo de producción

Limitaciones

  • El rendimiento zero-shot es irregular para flujos de trabajo especializados de decisiones tipadas; los resultados más sólidos provienen del ajuste fino (fine-tuning) en datos específicos del dominio en lugar de depender únicamente de los checkpoints base
  • Las tareas de opción con alta cardinalidad pueden degradarse bruscamente porque los textos de las opciones comparten un presupuesto de tokens fijo, lo que dificulta los problemas de más de 50 etiquetas sin aumentar head_max_len o utilizar estrategias de lista corta (shortlist)
  • El checkpoint multilingüe es más débil en inglés que el checkpoint en inglés, mientras que el checkpoint en inglés puede fallar gravemente fuera del inglés, por lo que el enrutamiento es esencial y no opcional
  • Aún se mantienen algunos casos límite documentados, incluido el sesgo de puntuación en scoring multilingüe, la sensibilidad de etiquetas noul y el manejo débil de ciertas formulaciones de opciones cargadas de negaciones

Laya 0.3.20 API Rendimiento

Fortalezas

  • Inferencia estructurada muy rápida, con una latencia medida de alrededor de 32.8 ms para una pregunta multilingüe y 72.3 ms para 10 preguntas agrupadas en lote en una GPU T4
  • Grandes ganancias en el enrutamiento multilingüe en comparación con el uso de un solo checkpoint, equiparándose la configuración enrutada al mejor modelo en fragmentos de benchmarks en inglés y fuera del inglés
  • El rendimiento de typed-decisions afinado (fine-tuned) es altamente competitivo, alcanzando una precisión de 0.766 en un benchmark de 2,000 decisiones y superando el resultado de 0.727 reportado para Jev en ese benchmark
  • El soporte para documentos largos es práctico para uso operativo, leyendo el modelo multilingüe hasta 8,192 tokens y respondiendo correctamente de 16 a 18 de 20 solicitudes hasta unos 4,000 tokens precedentes en las pruebas reportadas

Efectividad en el Mundo Real

En la práctica, la API de Laya 0.3.20 es más efectiva para decisiones comerciales de alto volumen y bien delimitadas, como el triaje de soporte, la moderación, los guardrails, el enrutamiento de intenciones y la extracción de esquemas, donde la latencia y la estructura determinista importan más que la generación de forma libre. Los resultados reportados muestran ganancias significativas en el rendimiento gracias al procesamiento por lotes, un sólido comportamiento de enrutamiento en 51 idiomas y sustanciales mejoras de calidad tras el ajuste fino de dominio. Es especialmente útil donde los equipos necesitan salidas tipadas con puntuaciones de confianza, pero debe configurarse cuidadosamente para conjuntos de opciones grandes, calibrarse con datos locales y validarse para casos límite de score o noul antes de un despliegue completamente automatizado.

Laya 0.3.20 API Cuándo Usar

Escenarios

  • Tiene un flujo de trabajo de operaciones o atención al cliente de alto volumen donde cada solicitud debe clasificarse en departamentos, niveles de urgencia, estado de reembolso o riesgo de cancelación (churn). La API de Laya 0.3.20 se adapta porque responde múltiples preguntas tipadas en una sola pasada hacia adelante, admite entradas multilingües y devuelve salidas estructuradas ricas en confianza sin sobrecarga de generación. Esto otorga a los equipos de operaciones un enrutamiento más rápido, una automatización más predecible y una menor complejidad de integración para flujos de trabajo de ticketing, triaje de bandeja de entrada y mesa de ayuda.
  • Tiene un producto multilingüe que recibe mensajes de usuarios, quejas o eventos de moderación en múltiples escrituras e idiomas. La API de Laya 0.3.20 es ideal porque su router detecta si el checkpoint en inglés o el multilingüe debe procesar cada solicitud antes de la inferencia, evitando los fallos graves de confianza que pueden ocurrir cuando los modelos exclusivos en inglés procesan texto que no está en inglés. Esto mejora la consistencia en el tráfico global y hace que el triaje automatizado, el control de seguridad y la detección de intenciones sean más confiables en sistemas de producción con idiomas mixtos.
  • Tiene un proceso de negocio que requiere decisiones estructuradas en lugar de prosa generada, como mapear correos electrónicos o documentos JSON a campos de un esquema, evaluar indicadores (flags) de políticas o decidir si un flujo de trabajo requiere revisión humana. La API de Laya 0.3.20 se adecúa bien porque admite decisiones basadas en esquemas, inferencia por lotes y despliegue como un servicio autoalbergado. Los equipos pueden transformar rápidamente entradas no estructuradas en salidas tipadas, reducir errores de parsing y construir automatizaciones descendentes deterministas en torno a formatos de respuesta estables.

Mejores Prácticas

  • Utilice la inferencia basada en Router por defecto, calibre la confianza en datos retenidos (held-out data) y aplique umbrales de abstención o escalado en lugar de confiar de forma predeterminada en las probabilidades puras
  • Para espacios de etiquetas grandes o documentos largos, ajuste cuidadosamente max_len y head_max_len, considere estrategias de lista corta (shortlist) para más de 20 opciones y valide la calidad en su propia carga de trabajo antes del despliegue en producción
  • Realice un ajuste fino (fine-tune) en decisiones específicas del dominio siempre que la precisión sea importante, ya que las mayores ganancias reportadas para la API de Laya 0.3.20 provienen de la especialización más que del uso zero-shot

Especificaciones Técnicas

Longitud de Contexto8,192
Fecha de Lanzamiento9/28/2026
Formatos de Entrada
textjson
Formatos de Salida
json

Capacidades y Características

Capacidades
typed decision inferenceclassificationmultilingual routingchoice predictionordinal scoringbinary probability estimationschema driven structured decisionsbatch inferencelong document decisioningconfidence scoringconfidence gatingsupport triageguardrailsmoderation