Laya 运行要求:内存、GPU、模型大小与支持的系统
运行 Laya 需要什么:Python 3.10+,CPU 上每个 checkpoint 约 3 GB 内存,GPU 可选,模型文件 647-808 MB,以及支持的系统和硬件。Apache 2.0 免费开源。
运行 Laya 需要什么?Python 3.10 或更高版本,每个 checkpoint 约 1 GB 硬盘空间,在 CPU 上跑一个 checkpoint 大约需要 3 GB 空闲内存。GPU 不是必需的:Laya 在普通 CPU 上就能运行;上游实测中,换成 GPU 后速度快了约 6 到 40 倍,具体取决于 checkpoint 和问题数量。Laya 免费开源,许可证是 Apache 2.0。
本页把运行要求集中整理在一起。数字来自 Laya README、上游 BENCHMARKS.md、Hugging Face 上的模型文件和 PyPI;凡是我们自己估算的,都会标明。
Laya 运行要求一览
| 最低 | 推荐 | |
|---|---|---|
| Python | 3.10 | 3.11 或 3.12 |
| 操作系统 | macOS、Linux 或 Windows | 三者均可 |
| 内存(CPU 推理) | 一个 checkpoint 约 3 GB 空闲内存 | 默认 Router 用 8 GB;三个 checkpoint 全部常驻的服务用 16 GB |
| GPU | 不需要 | 4 GB 以上的 NVIDIA、Apple Silicon 或 Intel GPU |
| 硬盘 | 约 2 GB(PyTorch + 一个 checkpoint;Linux 上更多,见下文) | 3 到 5 GB(三个 checkpoint,Linux 上还有 CUDA 库) |
| 网络 | 只有第一次下载时需要 | 之后可以离线运行 |
| 费用 | 免费(Apache 2.0) | 免费,只需承担自己的硬件成本 |
软件要求:Python、PyTorch 和操作系统
- Python 3.10 或更高版本。 这个下限是依赖决定的:
transformers5.x、huggingface_hub1.x 和torch2.14 都要求 3.10 以上。 - 依赖。
pip install laya会装上 PyTorch、Transformers、safetensors、huggingface_hub 和 NumPy。laya[serve](HTTP 服务)、laya[mcp](MCP Server)等扩展只额外安装对应功能需要的包。 - 操作系统。 上游文档给出了 macOS、Linux 和 Windows(PowerShell)的安装方法,具体命令见安装 Laya。
安装包里最大的是 PyTorch。以 Python 3.12 下的 torch 2.14 为例,PyPI 安装包在 Apple Silicon Mac 上约 127 MB,Windows 上约 124 MB,Linux x86_64 上约 555 MB。Linux 上默认的安装包还会连带下载 NVIDIA CUDA 库(光 cuDNN 就约 519 MB),没有显卡的机器也一样。在只有 CPU 的 Linux 服务器上,先装 CPU 版 PyTorch 就能省掉这部分:
pip install torch --index-url https://download.pytorch.org/whl/cpu
pip install laya
Laya 模型大小和硬盘空间
Laya 提供三个 checkpoint。第一次加载时从 Hugging Face 下载,之后缓存在本地(默认在 ~/.cache/huggingface 下)。
| Checkpoint | 编码器 | 参数量 | 下载大小 | 适用场景 |
|---|---|---|---|---|
laya | ModernBERT-large | 421M | 约 808 MB | 英文 |
laya-multilingual | mmBERT-base | 322M | 约 647 MB | 100 多种语言,速度快 2 到 3 倍 |
laya-typed-decisions | ModernBERT-large | 421M | 约 808 MB | typed-decisions 数据集里的业务流程 |
大小取自模型卡,三个加起来约 2.3 GB,大多数应用只需要其中一两个。各个模型的详细说明见 Laya 模型。
Laya 需要多少内存?
在 CPU 上,Laya 以 32 位浮点数运行,权重在内存中每个参数约占 4 字节。按这个估算:
laya-multilingual: 权重约占 1.3 GB 内存。laya或laya-typed-decisions: 每个约 1.7 GB。- Python 和 PyTorch 本身还要额外占用一部分。
实测数据:
- 上游所有 CPU 基准测试都跑在一台 4 核、16 GiB 内存的 AWS 服务器上。整个测试过程中最多同时加载了 5 个 checkpoint,峰值内存是 9.3 GiB。
- 社区项目 laya-pi 通过 ONNX Runtime 在 8 GB 内存的树莓派 4 上提供 Laya 服务。
Router 默认会在内存里保留两个 checkpoint(英文版和多语言版)。内存小的机器可以用 Router(max_loaded=1),或者直接只加载一个 checkpoint;代价是每次切换语言都要重新加载,耗时几秒。
我们的建议:试用一个 checkpoint,4 GB 内存就够;用默认的 Router,建议 8 GB;三个 checkpoint 全部预加载的服务,建议 16 GB。
跑 Laya 需要 GPU 吗?
不需要。Laya 可以只用 CPU 运行,很多批处理任务这样就够了。GPU 主要在两种情况下有用:要求几十毫秒内出结果,或者每次调用要问很多个问题。
CPU(上游实测,一个问题的 p50 耗时):
| 硬件 | laya(英文) | laya-multilingual |
|---|---|---|
| AMD EPYC 服务器,4 核 | 580 ms | 193 ms |
在另一组上游测试里,一台 8 线程的 Ryzen 9 笔记本回答一个问题用了 329 ms。
在 CPU 上,每多问一个问题,耗时和第一个差不多,所以问 10 个问题大约要 10 倍时间。线程设置影响很大:有一台笔记本把 PyTorch 的 inter-op 线程数设为 1 之后,快了 12 倍。调优步骤见 在 CPU 上跑 Laya。
GPU(上游实测,p50):
| 硬件 | 1 个问题 | 10 个问题 |
|---|---|---|
NVIDIA T4,laya-multilingual | 32.8 ms | 72.3 ms |
NVIDIA T4,laya | 39.5 ms | 158.6 ms |
Intel Arc B390(XPU),laya | 29.7 ms | 96.9 ms |
即使按 32 位存储,一个 checkpoint 的权重最多也只占约 1.7 GB 显存。按我们的估算,4 GB 以上的显卡就能放下一个 checkpoint;上面测试用的 T4 有 16 GB。
支持哪些硬件
| 硬件 | 怎么运行 Laya |
|---|---|
| 任意 x86 或 ARM CPU | 默认安装即可,见 在 CPU 上跑 Laya |
| NVIDIA GPU | 默认安装,使用 CUDA 版 PyTorch |
| Apple Silicon Mac | 通过 PyTorch MPS 自动使用 GPU,或者用原生的 MLX 运行时 |
| Intel GPU(Arc 独显、集成显卡) | 先装 XPU 版 PyTorch,Laya 会自动选用 XPU |
| 华为昇腾 NPU | 社区项目 laya-Ascend |
| 树莓派 4、RK3588 开发板 | 社区项目 laya-pi(CPU)和 laya-rk3588-turingpi-rk1(NPU、Mali GPU) |
也可以完全不用 Python。Laya 还能通过 ONNX Runtime 在 Node.js 里运行,也有原生 C++ 版和 Rust 版。想在 CPU 上跑得更快,可以试试社区的 laya-openvino 后端,它提供一个 405 MB 的 INT8 英文 checkpoint。更多选择见 Laya 运行时。
微调 Laya 的要求
运行 Laya 不需要 GPU,但微调基本离不开 GPU。官方 notebook 用的是 Kaggle 免费提供的两张 T4,项目给出的数据是:约 3 万个问题跑 4 个 epoch,大约需要 4 到 5 小时。详见微调 Laya。
Laya 免费吗?
免费。代码和三个 checkpoint 都采用 Apache 2.0 许可证。你可以使用、修改、自己部署 Laya,也可以用在商业产品里,没有按次计费。唯一的成本是运行它的硬件。相比之下,TypeSafe 托管的 Jev 按 token 收费,对比见 Laya vs Jev。
想先不装任何东西试一下,可以用 Playground。
常见问题
Laya 的最低运行要求是什么?
macOS、Linux 或 Windows 上装有 Python 3.10 或更高版本,约 2 GB 硬盘空间,一个 checkpoint 约 3 GB 空闲内存。不需要 GPU。
Laya 模型有多大?
英文版 laya 和 laya-typed-decisions 各有 4.21 亿参数,下载大小各约 808 MB。laya-multilingual 有 3.22 亿参数,约 647 MB。
Laya 能只用 CPU 运行吗?
能。在一台 4 核服务器上,英文 checkpoint 回答一个问题约 580 ms,多语言 checkpoint 约 193 ms。线程设置按 在 CPU 上跑 Laya里的方法调整。
Mac 能跑 Laya 吗?
能。在 Apple Silicon 上,Laya 会自动通过 PyTorch MPS 使用 GPU。社区的 laya-mlx 运行时可以不装 PyTorch,直接在 MLX 上运行。
Windows 能用 Laya 吗?
能。上游文档提供了 Windows PowerShell 的安装方法;在 Windows 上也可以通过 XPU 版 PyTorch 使用 Intel GPU。
Laya 能离线运行吗?
能。第一次下载后,checkpoint 会从本地的 Hugging Face 缓存加载。如果机器完全不能联网,可以先在另一台机器上下载模型文件夹,再拷贝过去。
Laya 可以商用吗?
可以。Apache 2.0 许可证允许商业使用。
相关页面
- 安装 Laya:各平台的安装命令
- 在 CPU 上跑 Laya:没有 GPU 时的速度和线程调优
- Laya 模型:三个 checkpoint 的对比
- 自托管 Laya:HTTP 服务、Docker 和 MCP
- Laya 运行时:MLX、Node.js、Rust 等
最后核对:Laya README、BENCHMARKS.md、Hugging Face 和 PyPI,2026 年 9 月 28 日。