BaseRT
BaseRT:Apple Silicon 平台上性能最卓越的本地 AI 推理运行时
BaseRT 是一款专为 Apple Silicon 芯片深度优化的 AI 推理运行时,其推理速度在 Prefill 阶段比 llama.cpp 快 6.4 倍,比 MLX 快 3.9 倍。BaseRT 支持 Qwen、Llama 3.2、Gemma 4 等多种主流模型,让用户可以在无需 API 密钥、数据不离开设备的前提下,在本地流畅运行高效的编程代理和 AI 模型。
2026-07-20
--K
BaseRT 产品信息
BaseRT:Apple Silicon 平台上性能最卓越的本地 AI 推理运行时
在当前人工智能技术飞速发展的背景下,如何在本地硬件上高效、安全地运行大语言模型(LLM)成为了开发者关注的焦点。BaseRT 应运而生,作为目前在 Apple Silicon 芯片上运行速度最快的推理运行时(Runtime),BaseRT 正在重新定义 Mac 设备上的 AI 推理性能标杆。无论是进行学术研究、企业级应用开发,还是构建个人辅助工具,BaseRT 都能提供无与伦比的性能支持。
什么是 BaseRT? (What's BaseRT)
BaseRT 是一款专为 Apple Silicon 生态系统打造的高性能 AI 推理框架。它的核心目标是极致利用 Apple M 系列芯片(如 M1、M2、M3、M4 以及最新的 M5 Pro)的硬件潜力。BaseRT 不仅是一个运行环境,更是开发者在本地部署先进开源模型的加速器。
通过 BaseRT,用户可以轻松调用本地 GPU 和统一内存资源,实现极低延迟的模型响应。与传统的推理后端相比,BaseRT 在保持高精度的同时,大幅提升了 Token 的生成速度,是目前本地推理领域的领跑者。
BaseRT 的核心特性 (Features)
BaseRT 之所以能够在激烈的竞争中脱颖而出,主要归功于其卓越的技术优化和对硬件的深度适配。以下是 BaseRT 的核心优势:
1. 极致的推理速度
BaseRT 的性能表现远超目前市面上流行的同类工具:
- Prefill(预填充)阶段:在处理长文本输入时,BaseRT 的速度最高可达 llama.cpp 的 6.4 倍,是 MLX 的 3.9 倍。
- Decode(解码)阶段:在文本生成过程中,BaseRT 相比其他框架也有显著提升,最高可提速 1.33 倍。
2. 强大的模型兼容性
BaseRT 广泛支持目前社区最热门的开源模型,涵盖了从轻量级到大规模参数的各种架构:
- Qwen 系列:支持 Qwen3、Qwen3.5、Qwen3.6。
- Llama 系列:支持最新的 Llama 3.1 和 Llama 3.2。
- Gemma 系列:深度适配 Gemma 3 和 Gemma 4。
- 其他模型:包括 Mistral、Phi-3 以及用于向量生成的 Nomic BERT。
3. 数据隐私与安全
使用 BaseRT,一切计算都在你的本地机器上完成。这意味着:
- 无需 API 密钥:告别昂贵的订阅费用。
- 数据不出本地:敏感信息和代码数据永远不会离开你的设备,确保了极高的安全性。
性能基准测试 (Benchmarks)
为了直观展示 BaseRT 的性能优势,我们在 Apple M5 Pro 芯片上进行了严谨的对比测试。以下是 BaseRT 与 MLX 和 llama.cpp 的数据对比(单位:Tokens / Sec):
解码性能 (DECODE · TG128)
| 模型 | BaseRT | MLX | llama.cpp | | :--- | :--- | :--- | :--- | | QWEN3 0.6B · Q4 | 531 | 398 (+33%) | 386 (+37%) | | LLAMA 3.2 1B · Q4 | 342 | 298 (+15%) | 267 (+28%) | | LLAMA 3.2 3B · Q4 | 137 | 131 (+5%) | 120 (+14%) |
预填充性能 (PREFILL)
| 模型 | BaseRT | MLX | llama.cpp | | :--- | :--- | :--- | :--- | | QWEN3 30B-A3B (PP128 · Q4) | 2,478 | 639 (+288%) | 1,280 (+94%) | | GEMMA 4 E2B (PP2048 · Q8) | 16,264 | 12,355 (+32%) | 2,547 (+539%) |
从数据可以看出,BaseRT 在处理复杂模型和长输入时具有压倒性的效率优势。
如何使用 BaseRT (How to Use)
BaseRT 的安装与启动过程非常简洁,仅需几行命令即可在你的 Mac 上部署强大的 AI 服务。
第一步:安装 BaseRT
打开终端,运行以下命令进行快速安装:
curl -LsSf https://basecompute.co/install.sh | sh
第二步:启动模型服务
安装完成后,你可以通过以下命令启动指定模型(以 Gemma 4 为例):
basert serve basecompute/gemma-4-E4B-it
第三步:集成编程代理(可选)
如果你想配合本地编程代理使用,可以安装相关插件:
pi install git:github.com/basecompute/pi-basert
pi
典型应用场景 (Use Case)
本地化 AI 编程代理 (Coding Agents)
对于开发者而言,隐私和速度至关重要。通过 BaseRT,你可以运行一个完全本地化的 Coding Agent:
- 无需依赖云端:即使在断网环境下也能高效编写代码。
- 极速响应:基于 BaseRT 的强大性能,AI 能够实时理解你的代码库并提供建议。
- 零配置:只需将你的代理指向 BaseRT 提供的本地服务端点,即可完成集成。
常见问题 (FAQ)
Q: BaseRT 是否支持非 Apple Silicon 芯片? A: 目前 BaseRT 专门针对 Apple Silicon 进行底层优化,以确保在 Mac 设备上达到极致性能。
Q: BaseRT 支持哪些量化格式? A: 根据测试数据,BaseRT 完美支持 Q4、Q8 等主流模型量化格式,能够平衡显存占用与推理速度。
Q: 如何加入 BaseRT 社区? A: 欢迎加入我们的 Discord 社区。这里聚集了大量致力于在设备端运行 AI 和开源模型的工程师。目前社区已有 37 名成员,活跃度极高。
BaseRT 正在为本地 AI 推理树立新的标准。无论你是追求极致性能的开发者,还是注重数据隐私的企业,BaseRT 都是你在 Apple Silicon 平台上运行大语言模型的最优选择。立即尝试 BaseRT,体验速度带来的变革。








