Laya 能用 Ollama 运行吗?用 ollaya 在本地跑 Laya
Laya 能在 Ollama 里运行吗?不能直接运行。本文介绍如何用 Ollama 风格的 ollaya 在本地运行 Laya,并对比 pip、laya-serve、MLX 和 Rust 几种方式。
Laya 能在 Ollama 里运行吗? Ollama 本身不行。Ollama 运行的是生成式语言模型,而 Laya 是另一类模型:带决策头的编码器,输出的是概率而不是文字。Ollama 的模型库里没有 Laya。
可以改用 ollaya。这是一个社区项目,用 Ollama 运行大模型的方式 来运行 Laya 这类决策模型:一个可执行文件,pull、run 命令,本地守护进程,外加 Modelfile。本文介绍如何用 ollaya 在本地运行 Laya,以及它和其他本地运行方式的对比。
用 ollaya 运行 Laya
ollaya(Apache 2.0 许可,撰写本文时为 v0.7.1)在 macOS(Apple Silicon)和 Linux 上一条命令即可安装:
curl -fsSL https://ollaya.dev/install.sh | sh
ollaya run laya --preset triage "I was charged twice for my subscription this month and want a refund."
Windows 上在 PowerShell 里运行 irm https://ollaya.dev/install.ps1 | iex。它还提供桌面应用和 Docker 镜像(ghcr.io/ollaya-dev/ollaya,NVIDIA GPU 用 :cuda 标签)。
triage 预设会一次问好几个问题,逐条打印答案和概率,比如意图(refund)、消息是否紧急、客户有多不满。
和 Ollama 一样的命令
| ollaya 命令 | 作用 |
|---|---|
ollaya serve | 启动本地守护进程(需要时 CLI 会自动启动) |
ollaya pull laya | 下载模型 |
ollaya run laya "…" | 针对一段文本提问 |
ollaya list、ps、show、rm、stop | 管理模型,用法和 Ollama 一样 |
ollaya create my-model -f Modelfile | 把自己的问题集打包成一个模型 |
Modelfile 的思路和 Ollama 相同:
FROM laya
QUESTIONS ./triage.json
PARAMETER precision fp32
ollaya 里的 Laya 模型
| 模型 | 说明 |
|---|---|
laya | 路由:根据每条请求的语言,自动选择英文版或多语言版 |
laya:en | 英文版(ModernBERT-large,4.21 亿参数) |
laya:multilingual | 支持 100 多种语言(mmBERT-base,3.22 亿参数) |
laya:typed-decisions | 针对 typed-decisions 工作流微调的版本 |
ollaya 还支持 Kev、Von、Decider 等其他决策模型。它不重新托管权重:只发布很小的 ONNX 计算图,运行时从作者的 Hugging Face 仓库读取原始权重文件,并锁定到具体提交、校验哈希。它基于 ONNX Runtime,支持 CPU 和 CUDA;项目称其 fp32 导出版本在每个 checkpoint 的 2,383 道测试题上,决策结果与 PyTorch 参考实现 100% 一致。
当作本地的 Jev API 使用
ollaya 守护进程监听 11435 端口,提供与 TypeSafe Jev API 格式相同的 POST /v1/systemone。为 Jev 写的代码只需改一个环境变量:
export TYPESAFE_BASE_URL=http://localhost:11435
ollaya mcp 还能把这些模型提供给 Claude Code、Claude Desktop、Cursor 等 MCP 客户端使用。
本地运行 Laya 的其他方式
ollaya 最接近 Ollama 的使用体验,但并不是唯一的选择:
| 方式 | 适合 | 安装 | 运行环境 |
|---|---|---|---|
| ollaya | 想要 Ollama 风格的命令行、守护进程和桌面应用 | 一行安装脚本 | CPU、NVIDIA CUDA |
Python 包(pip install laya) | Python 代码和 Notebook;官方参考实现 | pip | CPU、CUDA、Apple MPS |
| laya-serve | 官方包自带的 Jev 兼容 HTTP API | pip install "laya[serve]" | CPU、CUDA、MPS |
| laya-mlx | Apple Silicon 原生推理 | pip | Apple MLX |
| sys1 | 基于 candle 的 Rust 服务,支持 token 批处理 | cargo | CPU、CUDA、Metal |
相关指南:安装 Laya、自托管 Laya、用 MLX 运行 Laya、用 Rust 运行 Laya(sys1 和 ollaya),以及全部运行时。
该选哪一个?
- 习惯 Ollama、想要同样的工作流:选 ollaya。
- 写 Python,或者想用最新的官方代码:选
pip install laya。 - 手上已有 Jev 客户端代码:选 ollaya 或 laya-serve,两者都兼容 Jev API。
- 用 Apple Silicon 的 Mac,想要原生速度:选 laya-mlx,或者 ollaya。
- 只有 CPU:哪个都行,实测延迟见 Laya 在 CPU 上多快。
不安装也能先试
Laya Playground 在浏览器里就能运行模型,你可以先用自己的文本和问题试一试,再决定本地怎么部署。
常见问题
Ollama 上有 Laya 吗?
没有。Ollama 运行的是生成式模型,而 Laya 是基于编码器的决策模型,不生成文字。想要同样的使用方式,可以用 ollaya。
ollaya 是 Laya 团队做的吗?
不是。ollaya 是独立的社区项目(GitHub 上的 ollaya-dev)。Laya 本身来自 ConvAI Innovations。
ollaya 需要 GPU 吗?
不需要。它用 ONNX Runtime 在 CPU 上运行;如果有 NVIDIA GPU 并装好了驱动,会自动使用 CUDA。
本地的 Laya 能用 TypeSafe SDK 调用吗?
可以。把 TYPESAFE_BASE_URL 指向 ollaya(http://localhost:11435)或 laya-serve,其余的 Jev 代码不用改。
相关阅读
最后对照 ollaya 仓库核实:2026 年 9 月 26 日。