Laya 0.3.20 API

活跃
defapi/laya-0.3.20
由 Convai Innovations•发布日期: 9/28/2026

Laya 0.3.20 是一款多语言系统 1(System 1)决策引擎,支持在单次快速前向传播中对文本或 JSON 进行类型化分类、打分与路由。

$0.042每百万token

Background

Overview


Laya 0.3.20 是由 Convai Innovations 开发的非自回归多语言系统 1 决策引擎,专为类型化决策而非文本生成而设计。Laya 0.3.20 API 可以在单次前向传播中对文本或类 JSON 状态上的 choice、score 和 noul 问题进行评估,从而实现快速分类、分流、审核、路由以及基于 Schema 的决策。它通过一个在英文、多语言和 typed-decisions 检查点之间进行选择的 Router 支持 100+ 种语言,在 T4 GPU 上测得的单问题延迟约为 33 ms,且批处理吞吐量会随着问题数量的增加而显著提升。

Development History


Laya 演化为一个可私有化部署的决策模型家族,专注于结构化输出、校准概率和多语言路由。0.3.20 版本是一个成熟的版本,包含三个生产级检查点、基于 Router 的自动检查点选择、批量推理、在多语言编码器上最高可达 8,192 个 token 的长文档处理能力,以及对服务器、MCP、LangChain、LlamaIndex 和 CrewAI 的集成。研究背景表明,该平台正在从 zero-shot 类型化决策扩展到微调领域专业化,其中 typed-decisions 检查点在包含 2,000 个决策的基准测试中达到了 0.766 的准确率,相比基础检查点有了显著提升。

Key Innovations


- 非自回归类型化决策推理:在单次前向传播中回答多个结构化问题,无需文本生成或解析
- 基于 Router 的检查点选择:在推理前检测文本脚本和语言,将请求发送至英文或多语言模型,以获得更高的准确性和可靠性
- 以针对严格适当评分规则(strictly proper scoring rules)强化学习为中心的训练与置信度设计:使得输出的概率在置信度门控和拒答(abstention)策略中更加实用

Technical Specifications

Architecture


Laya 0.3.20 采用了针对结构化决策任务进行优化的基于编码器的架构。英文和 typed-decisions 检查点基于拥有 421M 参数的 ModernBERT-large,而多语言检查点使用拥有 322M 参数的 mmBERT-base 并支持 100+ 种语言。Laya 0.3.20 API 通过 Router 向外暴露这些能力,Router 会自动为每个请求选择合适的检查点。它支持单次调用预测、批量推理、基于 Schema 的决策以及长文档扫描,多语言上下文默认最高支持 1,024 个 token,当配置长输入模式时最高可达 8,192 个 token。

Parameters


该模型家族包含三个检查点:laya 和 laya-typed-decisions 参数量均为 4.21 亿(421M),laya-multilingual 参数量为 3.22 亿(322M)。上下文窗口因检查点而异:英文模型使用 512 个 token,typed-decisions 检查点使用 1,024 个 token,多语言编码器默认支持 1,024 个 token,扩展路径最高可达 8,192 个 token。在 Laya 0.3.20 API 中,可以使用 max_len 和 head_max_len 调整每个请求的 token 预算,以便在高基数(high-cardinality)决策任务中平衡文档长度与选项容量。

Capabilities


- 涵盖 choice、ordinal score 和 noul 概率输出的类型化决策,并带有校准后的置信度元数据
- 在 100+ 种语言(包括非拉丁文字)间自动进行多语言路由,并具备单次前向传播推理能力
- 通过 Laya 0.3.20 API 实现批量预测、基于 Schema 的结构化输出、长文档扫描以及私有化 HTTP 或 MCP 部署
- 用于生产工作流中脱敏(redaction)、缓存、日志记录、路由覆盖和基于置信度的升级上报的预测钩子(prediction hooks)

Limitations


- Zero-shot 性能在专业类型化决策工作流中表现参差不齐;最强效果来自针对特定领域数据的微调,而非仅依赖基础检查点
- 高基数选择任务性能可能急剧下降,因为选项文本共享固定的 token 预算,使得 50 个以上标签的问题在不增加 head_max_len 或使用 shortlist 策略的情况下较难处理
- 多语言检查点在英文上的表现弱于英文检查点,而英文检查点在英文之外可能严重失效,因此路由功能是必需的而非可选的
- 仍存在一些已记录的边缘情况,包括多语言评分中的分数偏差、noul 标签敏感性以及对某些包含大量否定词的选择表述处理较弱

Performance

Strengths


- 极快的结构化推理速度,在 T4 GPU 上测得单个多语言问题的延迟约为 32.8 ms,10 个批量问题的延迟约为 72.3 ms
- 与使用单个检查点相比,多语言路由带来了显著收益,路由后的配置在英文和非英文基准切片上均达到了最佳模型的水平
- 微调后的 typed-decisions 性能极具竞争力,在包含 2,000 个决策的基准测试中准确率达到 0.766,超越了该基准测试中 Jev 报道的 0.727 结果
- 长文档支持非常适合实际业务使用,多语言模型可读取最高 8,192 个 token,在测试报道中,在前方多达约 4,000 个 token 的情况下,20 个请求中有 16 到 18 个能正确回答

Real-World Effectiveness


在实践中,Laya 0.3.20 API 最适用于高吞吐量、边界清晰的业务决策,例如客服分流、内容审核、安全护栏、意图路由和 Schema 提取,在这些场景中,延迟和确定性结构比自由形式的文本生成更为关键。报告的结果显示,批处理带来了显著的吞吐量提升,跨 51 种语言展现出强劲的路由表现,且在领域微调后质量得到了大幅改善。它在团队需要带有置信度分数的类型化输出时尤为有用,但在完全自动化部署之前,应针对大选项集进行谨慎配置,在本地数据上进行校准,并对 score 或 noul 边缘情况进行验证。

When to Use

Scenarios


- 您拥有高吞吐量的客户支持或运营工作流,其中每个请求都必须分类到部门、紧急程度、退款状态或流失风险。Laya 0.3.20 API 非常适合,因为它可以在一次前向传播中回答多个类型化问题,支持多语言输入,并在没有生成开销的情况下返回包含丰富置信度的结构化输出。这为工单处理、收件箱分流和服务台工作流中的运营团队带来了更快的路由速度、更可预测的自动化以及更低的集成复杂度。
- 您拥有一款多语言产品,接收来自多种文字和语言的用户消息、投诉或审核事件。Laya 0.3.20 API 是理想的选择,因为它的 Router 在推理前会检测应该由英文还是多语言检查点处理每个请求,从而避免纯英文模型处理非英文文本时可能发生的严重置信度失效。这提高了全球流量的一致性,并使混合语言生产系统中的自动分流、安全审查和意图检测更加可靠。
- 您的业务流程需要结构化决策而非生成的文本段落,例如将电子邮件或 JSON 文档映射到 Schema 字段、评估策略标记,或者决定工作流是否需要人工审核。Laya 0.3.20 API 非常适合,因为它支持基于 Schema 的决策、批量推理以及作为私有化服务部署。团队可以快速将非结构化输入转换为类型化输出,减少解析错误,并围绕稳定的响应格式构建确定性的下游自动化。

Best Practices


- 默认使用基于 Router 的推理,在留出(held-out)数据上校准置信度,并应用拒答或升级阈值,而不是直接信任原始概率
- 对于大标签空间或长文档,仔细调优 max_len 和 head_max_len,对 20 个以上的选项考虑使用 shortlist 策略,并在生产上线前在您自己的工作负载上验证质量
- 只要准确率至关重要,就针对特定领域的决策进行微调,因为 Laya 0.3.20 API 报道的最大收益来自专业化微调而非 zero-shot 使用

技术规格

上下文长度8,192
发布日期9/28/2026
输入格式
textjson
输出格式
json

功能特性

功能
typed decision inferenceclassificationmultilingual routingchoice predictionordinal scoringbinary probability estimationschema driven structured decisionsbatch inferencelong document decisioningconfidence scoringconfidence gatingsupport triageguardrailsmoderation