Laya 0.3.20 API
Ativodefapi/laya-0.3.20
por Convai Innovations•data de lançamento: 9/28/2026
Laya 0.3.20 é um mecanismo de decisão System 1 multilíngue para classificação tipada, pontuação e roteamento sobre texto ou JSON em uma única passagem rápida.
$0.042por 1M tokens
Background
Overview
Laya 0.3.20 é um mecanismo de decisão System 1 multilíngue e não autorregressivo da Convai Innovations projetado para decisões tipadas em vez de geração de texto. A Laya 0.3.20 API avalia perguntas de escolha, pontuação e noul sobre texto ou estado tipo JSON em uma única passagem direta, permitindo classificação rápida, triagem, moderação, roteamento e decisões orientadas a esquema. Ele suporta mais de 100 idiomas por meio de um roteador que seleciona entre checkpoints em inglês, multilíngues e de decisões tipadas, com latência medida de pergunta única em torno de 33 ms em uma T4 GPU e taxa de transferência em lote que melhora significativamente à medida que a quantidade de perguntas aumenta.
Development History
O Laya evoluiu como uma família de modelos de decisão auto-hospedáveis focada em saídas estruturadas, probabilidades calibradas e roteamento multilíngue. A versão 0.3.20 representa um lançamento maduro com três checkpoints de produção, seleção automática de checkpoint baseada em Roteador, inferência em lote, manipulação de documentos longos de até 8.192 tokens no codificador multilíngue e integrações para servidor, MCP, LangChain, LlamaIndex e CrewAI. O contexto de pesquisa mostra a plataforma se expandindo de decisões tipadas zero-shot para especialização de domínio ajustada (fine-tuned), onde o checkpoint de decisões tipadas atingiu uma precisão de 0,766 em um benchmark de 2.000 decisões, melhorando materialmente em relação aos checkpoints base.
Key Innovations
- Inferência de decisão tipada não autorregressiva que responde a várias perguntas estruturadas em uma única passagem direta sem geração ou análise sintática de texto
- Seleção de checkpoint baseada em Roteador que detecta o script e o idioma antes da inferência, enviando solicitações para modelos em inglês ou multilíngues para melhor precisão e confiabilidade
- Design de treinamento e confiança centrado em aprendizado por reforço contra regras de pontuação estritamente adequadas (strictly proper scoring rules), permitindo saídas de probabilidade mais úteis para controle de confiança e políticas de abstenção
Technical Specs
Architecture
O Laya 0.3.20 usa arquiteturas baseadas em codificador otimizadas para tarefas de decisão estruturadas. Os checkpoints em inglês e de decisões tipadas são baseados no ModernBERT-large com 421M de parâmetros, enquanto o checkpoint multilíngue usa mmBERT-base com 322M de parâmetros e suporta mais de 100 idiomas. A Laya 0.3.20 API expõe esses recursos por meio de um Roteador que escolhe automaticamente o checkpoint apropriado por solicitação. Ele suporta predição de chamada única, inferência em lote, decisões orientadas a esquema e varredura de documentos longos, com contexto multilíngue de até 1.024 tokens por padrão e até 8.192 tokens quando configurado para entradas longas.
Parameters
A família de modelos inclui três checkpoints: laya e laya-typed-decisions com 421 milhões de parâmetros cada, e laya-multilingual com 322 milhões de parâmetros. As janelas de contexto diferem por checkpoint: o modelo em inglês usa 512 tokens, o checkpoint de decisões tipadas usa 1.024 tokens e o codificador multilíngue suporta 1.024 tokens por padrão com um caminho estendido de até 8.192 tokens. Na Laya 0.3.20 API, os orçamentos de tokens por solicitação podem ser ajustados usando max_len e head_max_len para equilibrar a extensão do documento contra a capacidade de opções para tarefas de decisão de alta cardinalidade.
Capabilities
- Decisões tipadas em saídas de escolha, pontuação ordinal e probabilidade noul com metadados de confiança calibrada
- Roteamento multilíngue automático em mais de 100 idiomas, incluindo scripts não latinos, com inferência em uma única passagem direta
- Predição em lote, saídas estruturadas orientadas a esquema, varredura de documentos longos e implantação HTTP ou MCP auto-hospedada por meio da Laya 0.3.20 API
- Hooks de predição para redação, alocação em cache, registro em log, substituições de roteamento e escalonamento baseado em confiança em fluxos de trabalho de produção
Limitations
- O desempenho zero-shot é irregular para fluxos de trabalho especializados de decisão tipada; os resultados mais fortes vêm do ajuste fino (fine-tuning) em dados específicos do domínio, em vez de confiar apenas nos checkpoints base
- Tarefas de escolha de alta cardinalidade podem degradar acentuadamente porque os textos das opções compartilham um orçamento fixo de tokens, tornando problemas de mais de 50 rótulos difíceis sem aumentar o head_max_len ou usar estratégias de lista restrita (shortlist)
- O checkpoint multilíngue é mais fraco em inglês do que o checkpoint em inglês, enquanto o checkpoint em inglês pode falhar gravemente fora do inglês, tornando o roteamento essencial e não opcional
- Alguns casos limites documentados permanecem, incluindo viés de pontuação na pontuação multilíngue, sensibilidade de rótulo noul e tratamento fraco de certas formulações de escolha ricas em negação
Performance
Strengths
- Inferência estruturada muito rápida, com latência medida em torno de 32,8 ms para uma pergunta multilíngue e 72,3 ms para 10 perguntas em lote em uma T4 GPU
- Fortes ganhos de roteamento multilíngue em comparação com o uso de um único checkpoint, com a configuração roteada igualando o melhor modelo em fatias de benchmark em inglês e não inglês
- O desempenho de decisões tipadas com ajuste fino (fine-tuning) é altamente competitivo, atingindo precisão de 0,766 em um benchmark de 2.000 decisões e superando o resultado relatado de 0,727 para o Jev nesse benchmark
- O suporte a documentos longos é prático para uso operacional, com o modelo multilíngue lendo até 8.192 tokens e respondendo corretamente a 16 até 18 de 20 solicitações até cerca de 4.000 tokens antecedentes nos testes relatados
Real-World Effectiveness
Na prática, a Laya 0.3.20 API é mais eficaz para decisões de negócios de alto volume e bem delimitadas, como triagem de suporte, moderação, proteções (guardrails), roteamento de intenção e extração de esquema, onde a latência e a estrutura determinística importam mais do que a geração de formato livre. Os resultados relatados mostram ganhos significativos de taxa de transferência com o loteamento, forte comportamento de roteamento em 51 idiomas e melhorias substanciais de qualidade após o ajuste fino de domínio. É especialmente útil onde as equipes precisam de saídas tipadas com pontuações de confiança, mas deve ser configurado com cuidado para grandes conjuntos de opções, calibrado em dados locais e validado para casos limites de pontuação ou noul antes da implantação totalmente automatizada.
When to Use
Scenarios
- Você tem um fluxo de trabalho operacional ou de suporte ao cliente de alto volume, onde cada solicitação deve ser classificada em departamentos, níveis de urgência, status de reembolso ou risco de cancelamento (churn). A Laya 0.3.20 API se adequa porque responde a várias perguntas tipadas em uma única passagem direta, suporta entrada multilíngue e retorna saídas estruturadas ricas em confiança sem sobrecarga de geração. Isso dá às equipes de operações um roteamento mais rápido, automação mais previsível e menor complexidade de integração para fluxos de trabalho de chamados, triagem de caixa de entrada e central de atendimento.
- Você tem um produto multilíngue que recebe mensagens de usuários, reclamações ou eventos de moderação em muitos scripts e idiomas. A Laya 0.3.20 API é ideal porque seu roteador detecta se o checkpoint em inglês ou multilíngue deve processar cada solicitação antes da inferência, evitando as severas falhas de confiança que podem ocorrer quando modelos apenas em inglês processam texto que não está em inglês. Isso melhora a consistência no tráfego global e torna a triagem automatizada, a triagem de segurança e a detecção de intenção mais confiáveis em sistemas de produção de idiomas mistos.
- Você tem um processo de negócios que precisa de decisões estruturadas em vez de prosa gerada, como mapear e-mails ou documentos JSON em campos de esquema, avaliar sinalizadores de política ou decidir se um fluxo de trabalho requer revisão humana. A Laya 0.3.20 API é muito adequada porque suporta decisões orientadas a esquema, inferência em lote e implantação como um serviço auto-hospedado. As equipes podem transformar entradas não estruturadas em saídas tipadas rapidamente, reduzir erros de análise sintática e construir automação downstream determinística em torno de formatos de resposta estáveis.
Best Practices
- Use a inferência baseada em Roteador por padrão, calibre a confiança em dados de validação retidos (held-out data) e aplique limiares de abstenção ou escalonamento em vez de confiar nas probabilidades brutas logo no início
- Para grandes espaços de rótulos ou documentos longos, ajuste max_len e head_max_len cuidadosamente, considere estratégias de lista restrita (shortlist) para 20+ opções e valide a qualidade em sua própria carga de trabalho antes da implantação em produção
- Faça o ajuste fino (fine-tuning) em decisões específicas do domínio sempre que a precisão for importante, porque os maiores ganhos relatados para a Laya 0.3.20 API vêm da especialização em vez do uso zero-shot
Nenhuma tabela de preços disponível para este modelo.
Especificações Técnicas
Comprimento do Contexto8,192
Data de Lançamento9/28/2026
Formatos de Entrada
textjson
Formatos de Saída
json
Capacidades e Recursos
Capacidades
typed decision inferenceclassificationmultilingual routingchoice predictionordinal scoringbinary probability estimationschema driven structured decisionsbatch inferencelong document decisioningconfidence scoringconfidence gatingsupport triageguardrailsmoderation