Ollaya发布开源决策模型,实现毫秒级本地推理

Ollaya发布开源决策模型,支持毫秒级本地推理。该模型采用非自回归架构,单次前向传递即可输出结果,在RTX 4090上响应仅需8.9毫秒,兼容TypeSafe接口规范。

Ollaya:开源 Jev 式决策模型,毫秒级本地推理

Ollaya 是一款开源的决策模型运行环境,旨在通过单次前向传递(single forward pass)在毫秒内生成校准后的答案。与传统的自回归生成不同,Ollaya 不逐词生成文本,而是直接输出分类结果及其概率分布。

RTX 4090实测延迟8.9毫秒
ollaya run laya --preset triage \
"I was charged twice this month and want a refund."
问题Answer可能性
intentrefund1.00
是_紧急no0.87
这种丧1.59 / 3 显然很生气0.36
要求退款yes0.88
转换_风险no0.89
实际输出示例:路由到 laya:en 模型,在 RTX 4090 上实现 8.9 毫秒响应。

性能表现:毫秒级延迟

Ollaya 的核心优势在于极低的推理延迟。由于采用非自回归架构,模型在一次前向传递中即可得出所有问题的答案。在用户自有硬件上,针对 Laya 模型的五个问题请求,端到端 HTTP API 调用耗时约为 10 毫秒。

  • 8–10ms:Ollaya Laya 模型(RTX 4090,五个问题,端到端)
  • 236–276ms:托管 API 中位请求延迟(对比参考)
各模型中位延迟对比(越低越好)
  • Laya (多语言): 8.1 ms
  • Laya (en): 9.6 ms
  • Gliclass: 14.7 ms
  • NLI: 20.4 ms
  • Decoder 0.8b: 155 ms
  • Decoder 2b: 190 ms
  • TypeSafe Jev 托管 API: 236–276 ms

注:Ollaya 数据基于 NVIDIA RTX 4090 HTTP API 测试(Laya fp16,其他 fp32)。Jev 数据源自第三方基准测试(AbdelStark/jev-benchmarks, nibzard/decision-model-benchmark),包含网络开销。设置不同,仅供参考量级比较。

兼容性:支持 TypeSafe API

Ollaya 实现了 TypeSafe 的 /v1/systemone 和 /v1/models 接口规范。官方 TypeSafe Python SDK 0.7.1 可直接连接本地 Ollaya 服务器使用。

请求示例:

export TYPESAFE_BASE_URL=http://localhost:11435
export TYPESAFE_API_KEY=local        
export TYPESAFE_DEFAULT_MODEL=laya

curl http://localhost:11435/v1/systemone -d '{
    "model": "laya",
    "state": "Can I get an invoice for last month?",
    "questions": {
      "intent": {
        "type": "choice",
        "instructions": "What does the customer want?",
        "criteria": {
          "invoice": "Needs an invoice or receipt",
          "refund": "Wants money back",
          "other": "Anything else"
        }
      }
    }
  }'

响应示例:

{
  "model": "laya:en",
  "answers": {
    "intent": {
      "type": "choice",
      "choice": "invoice",
      "confidence": 0.9547,
      "probabilities": {
        "invoice": 0.9698,
        "refund": 0.0172,
        "other": 0.013
      }
    }
  },
  "usage": {
    "input_tokens": 43,
    "output_tokens": 0
  }
}

开放权重模型库

Ollaya 集成了一系列来自 Convai Innovations、Mapika、Moritz Laurer 等开发者的开放权重决策模型。这些模型均经过温度适配校准,其中 Laya 的校准误差 (ECE) 为 0.081,优于 Jev 的 0.246。

  • Laya (Convai Innovations):支持英语及 100 多种语言的决策模型。参数规模 322m · 421m。通过单次前向传递输出选项、分数及校准的是/否答案。
  • Mapika Decoder:基于 Qwen3.5 构建,参数规模 0.75b · 1.9b。从选项字母逻辑中读取答案,是目前 Ollaya 搭载的最准确开放决策模型之一。
  • Moritz Laurer Zero-shot Classifier:将每个选项视为独立假设进行评分。参数规模 396m · 435m。在内部测试中表现为最准确的编码器模型。
  • Knowledgator Instruction Model:在一次前向传递中对所有选项评分,成本随选项数量增加几乎不变。

未来计划引入更多基于 llama.cpp 和 GGUF 格式的开放决策模型。

隐私与部署

Ollaya 默认在本地运行,确保敏感数据(如工单、电子邮件和用户信息)不出域。运行时采用 Apache-2.0 协议,无代币费用或 API 账单。

  • 本地执行:使用 ONNX Runtime,支持 CPU 或 NVIDIA GPU。服务器默认监听 127.0.0.1。
  • 权重来源:直接从作者的 Hugging Face 仓库获取,锁定至特定 commit 并通过 sha256 校验。Ollaya 不重新托管权重。

平台支持

Ollaya 提供 macOS、Windows 和 Linux 的桌面应用程序及命令行工具,以及用于服务器的 Docker 镜像。模型可在 CPU 上运行;若配备 NVIDIA GPU(Linux, WSL2 或 Docker),请求延迟可缩短至毫秒级。

macOS 桌面应用 (.dmg) 命令行安装脚本 CPU only
Windows 10/11 (x64) 桌面应用 (.exe/.msi) PowerShell 脚本 CPU; NVIDIA via WSL2
Linux (x86-64) 桌面应用 (.deb, .rpm) 安装脚本/Systemd服务 CPU; NVIDIA (CUDA 13)
Linux (ARM64) 不可用 安装脚本/Systemd服务 CPU only
WSL 2 不可用 同 Linux NVIDIA (CUDA 13)
Docker (amd64/arm64) 不可用 GHCR 镜像 NVIDIA (CUDA 13, amd64)

系统要求:NVIDIA GPU 需要 R580 或更新版本的驱动程序。安装程序仅在检测到兼容 GPU 时拉取 CUDA 库。Apple、AMD 和 Intel GPU 环境下模型将在 CPU 上运行。

快速启动:下载单一二进制文件,执行命令 ollaya run laya。

评论 0

0/500

评论需审核后展示,请文明发言

💬
还没有评论,来说两句

相关阅读