Laya 能用 Ollama 运行吗?用 ollaya 在本地跑 Laya

Laya 能在 Ollama 里运行吗?不能直接运行。本文介绍如何用 Ollama 风格的 ollaya 在本地运行 Laya,并对比 pip、laya-serve、MLX 和 Rust 几种方式。

最后更新: 2026/9/26

Laya 能在 Ollama 里运行吗? Ollama 本身不行。Ollama 运行的是生成式语言模型,而 Laya 是另一类模型:带决策头的编码器,输出的是概率而不是文字。Ollama 的模型库里没有 Laya。

可以改用 ollaya。这是一个社区项目,用 Ollama 运行大模型的方式 来运行 Laya 这类决策模型:一个可执行文件,pull、run 命令,本地守护进程,外加 Modelfile。本文介绍如何用 ollaya 在本地运行 Laya,以及它和其他本地运行方式的对比。

用 ollaya 运行 Laya

ollaya(Apache 2.0 许可,撰写本文时为 v0.7.1)在 macOS(Apple Silicon)和 Linux 上一条命令即可安装:

curl -fsSL https://ollaya.dev/install.sh | sh
ollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund."

Windows 上在 PowerShell 里运行 irm https://ollaya.dev/install.ps1 | iex。它还提供桌面应用和 Docker 镜像(ghcr.io/ollaya-dev/ollaya,NVIDIA GPU 用 :cuda 标签)。

triage 预设会一次问好几个问题,逐条打印答案和概率,比如意图(refund)、消息是否紧急、客户有多不满。

和 Ollama 一样的命令

ollaya 命令作用
ollaya serve启动本地守护进程(需要时 CLI 会自动启动)
ollaya pull laya下载模型
ollaya run laya "…"针对一段文本提问
ollaya list、ps、show、rm、stop管理模型,用法和 Ollama 一样
ollaya create my-model -f Modelfile把自己的问题集打包成一个模型

Modelfile 的思路和 Ollama 相同:

FROM laya
QUESTIONS ./triage.json
PARAMETER precision fp32

ollaya 里的 Laya 模型

模型说明
laya路由:根据每条请求的语言,自动选择英文版或多语言版
laya:en英文版(ModernBERT-large,4.21 亿参数)
laya:multilingual支持 100 多种语言(mmBERT-base,3.22 亿参数)
laya:typed-decisions针对 typed-decisions 工作流微调的版本

ollaya 还支持 Kev、Von、Decider 等其他决策模型。它不重新托管权重:只发布很小的 ONNX 计算图,运行时从作者的 Hugging Face 仓库读取原始权重文件,并锁定到具体提交、校验哈希。它基于 ONNX Runtime,支持 CPU 和 CUDA;项目称其 fp32 导出版本在每个 checkpoint 的 2,383 道测试题上,决策结果与 PyTorch 参考实现 100% 一致。

当作本地的 Jev API 使用

ollaya 守护进程监听 11435 端口,提供与 TypeSafe Jev API 格式相同的 POST /v1/systemone。为 Jev 写的代码只需改一个环境变量:

export TYPESAFE_BASE_URL=http://localhost:11435

ollaya mcp 还能把这些模型提供给 Claude Code、Claude Desktop、Cursor 等 MCP 客户端使用。

本地运行 Laya 的其他方式

ollaya 最接近 Ollama 的使用体验,但并不是唯一的选择:

方式适合安装运行环境
ollaya想要 Ollama 风格的命令行、守护进程和桌面应用一行安装脚本CPU、NVIDIA CUDA
Python 包(pip install laya)Python 代码和 Notebook;官方参考实现pipCPU、CUDA、Apple MPS
laya-serve官方包自带的 Jev 兼容 HTTP APIpip install "laya[serve]"CPU、CUDA、MPS
laya-mlxApple Silicon 原生推理pipApple MLX
sys1基于 candle 的 Rust 服务,支持 token 批处理cargoCPU、CUDA、Metal

相关指南:安装 Laya、自托管 Laya、用 MLX 运行 Laya、用 Rust 运行 Laya(sys1 和 ollaya),以及全部运行时。

该选哪一个?

  • 习惯 Ollama、想要同样的工作流:选 ollaya。
  • 写 Python,或者想用最新的官方代码:选 pip install laya。
  • 手上已有 Jev 客户端代码:选 ollaya 或 laya-serve,两者都兼容 Jev API。
  • 用 Apple Silicon 的 Mac,想要原生速度:选 laya-mlx,或者 ollaya。
  • 只有 CPU:哪个都行,实测延迟见 Laya 在 CPU 上多快。

不安装也能先试

Laya Playground 在浏览器里就能运行模型,你可以先用自己的文本和问题试一试,再决定本地怎么部署。

常见问题

Ollama 上有 Laya 吗?

没有。Ollama 运行的是生成式模型,而 Laya 是基于编码器的决策模型,不生成文字。想要同样的使用方式,可以用 ollaya。

ollaya 是 Laya 团队做的吗?

不是。ollaya 是独立的社区项目(GitHub 上的 ollaya-dev)。Laya 本身来自 ConvAI Innovations。

ollaya 需要 GPU 吗?

不需要。它用 ONNX Runtime 在 CPU 上运行;如果有 NVIDIA GPU 并装好了驱动,会自动使用 CUDA。

本地的 Laya 能用 TypeSafe SDK 调用吗?

可以。把 TYPESAFE_BASE_URL 指向 ollaya(http://localhost:11435)或 laya-serve,其余的 Jev 代码不用改。

相关阅读

最后对照 ollaya 仓库核实:2026 年 9 月 26 日。