社区 Runtime

用 Rust 运行 Laya:sys1 与 ollaya

两个社区 Rust 服务,在兼容 Jev 的接口后面运行 Laya:基于 candle 的 sys1,以及类似 Ollama 的 ollaya。

Rust 服务无需 Python兼容 Jev 接口CPU / CUDA / Metal
快速开始
cargo install sys1 --features cpu
Source
alvarobartt/sys1

社区项目,不属于官方包。部署前请到各自仓库确认许可证和支持的模型。

Usage
sys1 --model-id convaiinnovations/laya --dtype auto
# POST http://localhost:3000/v1/systemone

有两个社区项目可以用 Rust 运行 Laya,部署的机器上不需要 Python 环境。它们都在 Laya 前面提供兼容 Jev 的 POST /v1/systemone 接口,同一套客户端代码两边都能用。

sys1:基于 candle 的 Rust 服务

sys1 是用 tokio、axum 和 serde 写的 System One 接口服务,在 candle 上运行 Laya 的 ModernBERT 编码器和决策头。安装时选择后端:

cargo install sys1 --features cpu
cargo install sys1 --no-default-features --features metal   # Apple Silicon
cargo install sys1 --no-default-features --features cuda    # NVIDIA GPU

用 Laya 的 checkpoint 启动:

sys1 --model-id convaiinnovations/laya --dtype auto

它监听 3000 端口,提供 POST /v1/systemone 和 POST /v1/decide 两个接口。请求按 token 数量动态合并批处理,项目报告在 NVIDIA RTX Pro 6000 上每次查询约 14 毫秒。README 目前列出的是英文 Laya checkpoint,更多模型在计划中。

ollaya:像 Ollama 一样用决策模型

ollaya 的用法和 Ollama 类似:一个后台服务加一个命令行,按名字拉取和运行决策模型。它在 CPU 上用 ONNX Runtime,在 NVIDIA 显卡上用 CUDA,也原生支持 Apple Silicon。

curl -fsSL https://ollaya.dev/install.sh | sh
ollaya serve
ollaya run laya --preset triage "My payment failed twice"

laya 会在 laya:en(ModernBERT-large,4.21 亿参数)和 laya:multilingual(mmBERT-base,3.22 亿参数)之间自动选择。ollaya 还能运行 Decider、NLI 分类器等其他决策模型。它监听 11435 端口,设置 TYPESAFE_BASE_URL=http://localhost:11435 后,官方 TypeSafe SDK 不用改代码就能用。ollaya 只分发很小的 ONNX 计算图,权重从 Hugging Face 原仓库读取并用 sha256 校验,不会重新托管权重。

选哪个

sys1ollaya
安装方式cargo install安装脚本、Docker 或 Windows 安装程序
后端CPU、CUDA、MetalCPU(ONNX Runtime)、CUDA、Apple Silicon
默认端口300011435
支持的 Laya checkpoint英文英文和多语言,自动路由
更适合自己编译、嵌入到 Rust 服务里开箱即用的本地后台服务,带模型管理

两者都是社区项目,不属于 Laya 官方包。部署前请到各自仓库确认许可证和当前支持的模型。

相关阅读

最后对照两个仓库核验:2026 年 9 月 25 日。