Laya 0.3.20 API
ActifLaya 0.3.20 est un moteur de décision Système 1 multilingue pour la classification typée, le scoring et le routage sur du texte ou du JSON en une seule passe rapide.
Laya 0.3.20 API Contexte
Aperçu
Laya 0.3.20 est un moteur de décision Système 1 multilingue et non autorégressif de Convai Innovations conçu pour des décisions typées plutôt que pour la génération de texte. L'API Laya 0.3.20 évalue des questions de type choice, score et noul sur du texte ou un état de type JSON en une seule passe avant, permettant une classification, un triage, une modération, un routage et des décisions basées sur des schémas rapides. Il prend en charge plus de 100 langues grâce à un routeur qui sélectionne parmi des checkpoints anglais, multilingues et de décisions typées, avec une latence mesurée pour une seule question d'environ 33 ms sur un GPU T4 et un débit par lots qui s'améliore considérablement à mesure que le nombre de questions augmente.
Historique de développement
Laya a évolué comme une famille de modèles de décision auto-hébergeable axée sur les sorties structurées, les probabilités calibrées et le routage multilingue. La version 0.3.20 représente une version mature avec trois checkpoints de production, une sélection automatique de checkpoint basée sur un routeur, l'inférence par lots, la prise en charge de documents longs jusqu'à 8 192 tokens sur l'encodeur multilingue, ainsi que des intégrations pour serveur, MCP, LangChain, LlamaIndex et CrewAI. Le contexte de recherche montre que la plateforme s'est élargie des décisions typées zero-shot vers la spécialisation de domaine affinée, où le checkpoint typed-decisions a atteint une exactitude de 0,766 sur un benchmark de 2 000 décisions, s'améliorant nettement par rapport aux checkpoints de base.
Innovations clés
- Inférence de décision typée non autorégressive qui répond à plusieurs questions structurées en une seule passe avant sans génération ni analyse de texte
- Sélection de checkpoint basée sur un routeur qui détecte le script et la langue avant l'inférence, envoyant les requêtes vers des modèles anglais ou multilingues pour une meilleure exactitude et fiabilité
- Conception de l'entraînement et de la confiance centrée sur l'apprentissage par renforcement contre des règles de score strictly proper scoring rules, permettant des sorties de probabilité plus utiles pour le filtrage par confiance et les politiques d'abstention
Laya 0.3.20 API Spécifications techniques
Architecture
Laya 0.3.20 utilise des architectures basées sur des encodeurs optimisées pour les tâches de décision structurées. Les checkpoints anglais et typed-decisions sont basés sur ModernBERT-large avec 421M de paramètres, tandis que le checkpoint multilingue utilise mmBERT-base avec 322M de paramètres et prend en charge plus de 100 langues. L'API Laya 0.3.20 les expose via un routeur qui choisit automatiquement le checkpoint approprié par requête. Elle prend en charge la prédiction à appel unique, l'inférence par lots, les décisions basées sur des schémas et l'analyse de documents longs, avec un contexte multilingue allant jusqu'à 1 024 tokens par défaut et jusqu'à 8 192 tokens lorsqu'il est configuré pour des entrées longues.
Paramètres
La famille de modèles comprend trois checkpoints : laya et laya-typed-decisions à 421 millions de paramètres chacun, et laya-multilingual à 322 millions de paramètres. Les fenêtres de contexte diffèrent selon le checkpoint : le modèle anglais utilise 512 tokens, le checkpoint typed-decisions utilise 1 024 tokens, et l'encodeur multilingue prend en charge 1 024 tokens par défaut avec un parcours étendu jusqu'à 8 192 tokens. Dans l'API Laya 0.3.20, les budgets de tokens par requête peuvent être ajustés à l'aide de max_len et head_max_len pour équilibrer la longueur du document et la capacité d'options pour les tâches de décision à forte cardinalité.
Capacités
- Décisions typées sur les sorties de probabilité choice, ordinal score et noul avec des métadonnées de confiance calibrées
- Routage multilingue automatique à travers plus de 100 langues, y compris les écritures non latines, avec inférence en une seule passe avant
- Prédiction par lots, sorties structurées basées sur des schémas, analyse de documents longs et déploiement HTTP auto-hébergé ou MCP via l'API Laya 0.3.20
- Hooks de prédiction pour le caviardage, la mise en cache, la journalisation, les surcharges de routage et l'escalade basée sur la confiance dans les flux de travail de production
Limitations
- Les performances zero-shot sont inégales pour les flux de travail de décisions typées spécialisées ; les résultats les plus solides proviennent d'un affinage sur des données spécifiques au domaine plutôt que de l'utilisation seule des checkpoints de base
- Les tâches de choix à forte cardinalité peuvent se dégrader fortement car les textes d'options partagent un budget de tokens fixe, rendant les problèmes à plus de 50 étiquettes difficiles sans augmenter head_max_len ou utiliser des stratégies de liste restreinte
- Le checkpoint multilingue est plus faible en anglais que le checkpoint anglais, tandis que le checkpoint anglais peut échouer lourdement en dehors de l'anglais, le routage est donc essentiel et non optionnel
- Certains cas limites documentés subsistent, notamment un biais de score dans le scoring multilingue, une sensibilité des étiquettes noul et une faible prise en charge de certaines formulations de choix comportant de nombreuses négations
Laya 0.3.20 API Performance
Points forts
- Inférence structurée très rapide, avec une latence mesurée d'environ 32,8 ms pour une question multilingue et 72,3 ms pour 10 questions regroupées en lot sur un GPU T4
- Gains importants du routage multilingue par rapport à l'utilisation d'un seul checkpoint, la configuration routée égalant le meilleur modèle sur les tranches de benchmark en anglais et non-anglais
- Les performances des décisions typées affinées sont très compétitives, atteignant une exactitude de 0,766 sur un benchmark de 2 000 décisions et surpassant le résultat rapporté de 0,727 pour Jev sur ce benchmark
- La prise en charge des documents longs est pratique pour un usage opérationnel, le modèle multilingue lisant jusqu'à 8 192 tokens et répondant correctement à 16 à 18 requêtes sur 20 jusqu'à environ 4 000 tokens précédents dans les tests rapportés
Efficacité en conditions réelles
En pratique, l'API Laya 0.3.20 est plus efficace pour les décisions d'entreprise à fort volume et bien délimitées, telles que le triage du support, la modération, les garde-fous, le routage d'intention et l'extraction de schémas, où la latence et la structure déterministe comptent plus que la génération libre. Les résultats rapportés montrent des gains de débit significatifs grâce au traitement par lots, un comportement de routage solide dans 51 langues et des améliorations substantielles de la qualité après un affinage par domaine. Elle est particulièrement utile lorsque les équipes ont besoin de sorties typées avec des scores de confiance, mais elle doit être configurée soigneusement pour les grands ensembles d'options, calibrée sur des données locales et validée pour les cas limites de score ou noul avant un déploiement entièrement automatisé.
Laya 0.3.20 API Quand l'utiliser
Scénarios
- Vous disposez d'un flux de travail d'opérations ou de support client à fort volume où chaque requête doit être classée par département, niveau d'urgence, statut de remboursement ou risque d'attrition. L'API Laya 0.3.20 convient car elle répond à plusieurs questions typées en une seule passe avant, prend en charge les entrées multilingues et renvoie des sorties structurées riches en confiance sans le surcoût lié à la génération. Cela offre aux équipes opérationnelles un routage plus rapide, une automatisation plus prévisible et une complexité d'intégration réduite pour le traitement des tickets, le triage de boîtes de réception et les flux de travail du centre de services.
- Vous avez un produit multilingue recevant des messages d'utilisateurs, des réclamations ou des événements de modération dans de nombreux alphabets et langues. L'API Laya 0.3.20 est idéale car son routeur détecte si le checkpoint anglais ou multilingue doit traiter chaque requête avant l'inférence, évitant ainsi les graves défaillances de confiance qui peuvent survenir lorsque des modèles exclusivement anglais traitent du texte non anglais. Cela améliore la cohérence sur l'ensemble du trafic mondial et rend le triage automatisé, le filtrage de sécurité et la détection d'intention plus fiables dans les systèmes de production à langues mixtes.
- Vous avez un processus métier qui nécessite des décisions structurées plutôt que de la prose générée, comme la mise en correspondance d'e-mails ou de documents JSON avec des champs de schéma, l'évaluation de règles de politique ou la décision de soumettre ou non un flux de travail à un examen humain. L'API Laya 0.3.20 est bien adaptée car elle prend en charge les décisions basées sur des schémas, l'inférence par lots et le déploiement en tant que service auto-hébergé. Les équipes peuvent rapidement transformer des entrées non structurées en sorties typées, réduire les erreurs d'analyse syntaxique et construire une automatisation en aval déterministe autour de formats de réponse stables.
Meilleures pratiques
- Utiliser l'inférence basée sur le routeur par défaut, calibrer la confiance sur des données réservées et appliquer des seuils d'abstention ou d'escalade plutôt que de faire confiance aux probabilités brutes prêtes à l'emploi
- Pour les grands espaces d'étiquettes ou les documents longs, ajuster soigneusement max_len et head_max_len, envisager des stratégies de liste restreinte pour plus de 20 options, et valider la qualité sur votre propre charge de travail avant le déploiement en production
- Affiner sur des décisions spécifiques au domaine dès que l'exactitude importe, car les plus grands gains rapportés pour l'API Laya 0.3.20 proviennent de la spécialisation plutôt que de l'utilisation zero-shot