Ollaya:开源 Jev 式决策模型,毫秒级本地推理
Ollaya 是一款开源的决策模型运行环境,旨在通过单次前向传递(single forward pass)在毫秒内生成校准后的答案。与传统的自回归生成不同,Ollaya 不逐词生成文本,而是直接输出分类结果及其概率分布。

ollaya run laya --preset triage \
"I was charged twice this month and want a refund."
| 问题 | Answer | 可能性 |
|---|---|---|
| intent | refund | 1.00 |
| 是_紧急 | no | 0.87 |
| 这种丧 | 1.59 / 3 显然很生气 | 0.36 |
| 要求退款 | yes | 0.88 |
| 转换_风险 | no | 0.89 |
性能表现:毫秒级延迟
Ollaya 的核心优势在于极低的推理延迟。由于采用非自回归架构,模型在一次前向传递中即可得出所有问题的答案。在用户自有硬件上,针对 Laya 模型的五个问题请求,端到端 HTTP API 调用耗时约为 10 毫秒。
- 8–10ms:Ollaya Laya 模型(RTX 4090,五个问题,端到端)
- 236–276ms:托管 API 中位请求延迟(对比参考)
- Laya (多语言): 8.1 ms
- Laya (en): 9.6 ms
- Gliclass: 14.7 ms
- NLI: 20.4 ms
- Decoder 0.8b: 155 ms
- Decoder 2b: 190 ms
- TypeSafe Jev 托管 API: 236–276 ms
注:Ollaya 数据基于 NVIDIA RTX 4090 HTTP API 测试(Laya fp16,其他 fp32)。Jev 数据源自第三方基准测试(AbdelStark/jev-benchmarks, nibzard/decision-model-benchmark),包含网络开销。设置不同,仅供参考量级比较。
兼容性:支持 TypeSafe API
Ollaya 实现了 TypeSafe 的 /v1/systemone 和 /v1/models 接口规范。官方 TypeSafe Python SDK 0.7.1 可直接连接本地 Ollaya 服务器使用。
请求示例:
export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local
export TYPESAFE_DEFAULT_MODEL=laya
curl http://localhost:11435/v1/systemone -d '{
"model": "laya",
"state": "Can I get an invoice for last month?",
"questions": {
"intent": {
"type": "choice",
"instructions": "What does the customer want?",
"criteria": {
"invoice": "Needs an invoice or receipt",
"refund": "Wants money back",
"other": "Anything else"
}
}
}
}'
响应示例:
{
"model": "laya:en",
"answers": {
"intent": {
"type": "choice",
"choice": "invoice",
"confidence": 0.9547,
"probabilities": {
"invoice": 0.9698,
"refund": 0.0172,
"other": 0.013
}
}
},
"usage": {
"input_tokens": 43,
"output_tokens": 0
}
}
开放权重模型库
Ollaya 集成了一系列来自 Convai Innovations、Mapika、Moritz Laurer 等开发者的开放权重决策模型。这些模型均经过温度适配校准,其中 Laya 的校准误差 (ECE) 为 0.081,优于 Jev 的 0.246。
- Laya (Convai Innovations):支持英语及 100 多种语言的决策模型。参数规模 322m · 421m。通过单次前向传递输出选项、分数及校准的是/否答案。
- Mapika Decoder:基于 Qwen3.5 构建,参数规模 0.75b · 1.9b。从选项字母逻辑中读取答案,是目前 Ollaya 搭载的最准确开放决策模型之一。
- Moritz Laurer Zero-shot Classifier:将每个选项视为独立假设进行评分。参数规模 396m · 435m。在内部测试中表现为最准确的编码器模型。
- Knowledgator Instruction Model:在一次前向传递中对所有选项评分,成本随选项数量增加几乎不变。
未来计划引入更多基于 llama.cpp 和 GGUF 格式的开放决策模型。
隐私与部署
Ollaya 默认在本地运行,确保敏感数据(如工单、电子邮件和用户信息)不出域。运行时采用 Apache-2.0 协议,无代币费用或 API 账单。
- 本地执行:使用 ONNX Runtime,支持 CPU 或 NVIDIA GPU。服务器默认监听
127.0.0.1。 - 权重来源:直接从作者的 Hugging Face 仓库获取,锁定至特定 commit 并通过 sha256 校验。Ollaya 不重新托管权重。
平台支持
Ollaya 提供 macOS、Windows 和 Linux 的桌面应用程序及命令行工具,以及用于服务器的 Docker 镜像。模型可在 CPU 上运行;若配备 NVIDIA GPU(Linux, WSL2 或 Docker),请求延迟可缩短至毫秒级。
| macOS | 桌面应用 (.dmg) | 命令行安装脚本 | CPU only |
|---|---|---|---|
| Windows 10/11 (x64) | 桌面应用 (.exe/.msi) | PowerShell 脚本 | CPU; NVIDIA via WSL2 |
| Linux (x86-64) | 桌面应用 (.deb, .rpm) | 安装脚本/Systemd服务 | CPU; NVIDIA (CUDA 13) |
| Linux (ARM64) | 不可用 | 安装脚本/Systemd服务 | CPU only |
| WSL 2 | 不可用 | 同 Linux | NVIDIA (CUDA 13) |
| Docker (amd64/arm64) | 不可用 | GHCR 镜像 | NVIDIA (CUDA 13, amd64) |
系统要求:NVIDIA GPU 需要 R580 或更新版本的驱动程序。安装程序仅在检测到兼容 GPU 时拉取 CUDA 库。Apple、AMD 和 Intel GPU 环境下模型将在 CPU 上运行。
快速启动:下载单一二进制文件,执行命令 ollaya run laya。





