BaseRT
BaseRT — самая быстрая среда выполнения для Apple Silicon: локальный запуск LLM с максимальной скоростью
BaseRT — это революционная среда выполнения (runtime), оптимизированная специально для чипов Apple Silicon. Продукт обеспечивает беспрецедентную скорость работы нейросетей, превосходя MLX и llama.cpp в несколько раз. В этой статье мы подробно рассмотрим преимущества BaseRT, бенчмарки на чипах M5 Pro, поддерживаемые модели, такие как Llama 3.2 и Gemma 4, а также способы локального развертывания AI-агентов без использования облачных API.
2026-07-20
--K
BaseRT Информация о продукте
BaseRT — Самая быстрая среда выполнения для Apple Silicon
В мире современных технологий локальный запуск больших языковых моделей (LLM) становится критически важным для разработчиков и предприятий, стремящихся к конфиденциальности и производительности. BaseRT устанавливает новый стандарт в этой области, являясь самой быстрой средой выполнения (runtime) для архитектуры Apple Silicon. Благодаря глубокой оптимизации, BaseRT позволяет использовать всю мощь вашего устройства Apple для эффективной работы с AI-моделями без необходимости полагаться на дорогостоящие облачные сервисы.
Что такое BaseRT?
BaseRT — это высокопроизводительный движок (runtime), разработанный командой Basecompute для локального запуска и обслуживания нейросетей на устройствах Apple. Основная цель BaseRT заключается в том, чтобы предоставить разработчикам инструмент, который максимально эффективно использует унифицированную память и вычислительные ядра Apple Silicon.
В отличие от универсальных решений, BaseRT сфокусирован на достижении максимальной пропускной способности при генерации текста (decode) и обработке входных данных (prefill). Это делает BaseRT идеальным выбором для создания локальных инструментов разработки, чат-ботов и автономных AI-агентов.
Основные характеристики BaseRT
Среда выполнения BaseRT выделяется на фоне конкурентов благодаря ряду ключевых особенностей:
- Невероятная скорость: BaseRT значительно превосходит такие популярные решения, как MLX и llama.cpp.
- Локальная конфиденциальность: Все вычисления происходят на вашем устройстве. Ваши данные не покидают пределы машины, и вам не требуются API-ключи.
- Поддержка современных архитектур: Продукт поддерживает широкий спектр актуальных моделей от ведущих разработчиков (Meta, Google, Mistral, Alibaba).
- Оптимизация под Apple Silicon: Движок специально настроен для работы на чипах серии M, включая новейшие конфигурации вроде Apple M5 Pro.
- Простота интеграции: Наличие CLI-инструментов и поддержки плагинов позволяет внедрить BaseRT в рабочий процесс за считанные минуты.
Поддерживаемые модели
BaseRT обеспечивает совместимость с широким списком современных открытых моделей, включая:
- Qwen: версии 3, 3.5, 3.6.
- Llama: версии 3.1 и 3.2.
- Gemma: версии 3 и 4.
- Mistral.
- Phi-3.
- Nomic BERT.
Сравнение производительности (Бенчмарки)
Производительность BaseRT подтверждена тестами на оборудовании Apple M5 Pro. Сравнение проводилось с популярными библиотеками MLX и llama.cpp. Результаты показывают значительное превосходство BaseRT как в режиме обработки контекста (Prefill), так и в режиме генерации (Decode).
Режим Decode (Генерация токенов)
В режиме генерации (TG128, квантование Q4) BaseRT демонстрирует стабильное преимущество:
-
Qwen3 0.6B:
- BaseRT: 531 ток/сек (+33% быстрее MLX, +37% быстрее llama.cpp).
- MLX: 398 ток/сек.
- llama.cpp: 386 ток/сек.
-
Llama 3.2 1B:
- BaseRT: 342 ток/сек (+15% быстрее MLX, +28% быстрее llama.cpp).
- MLX: 298 ток/сек.
- llama.cpp: 267 ток/сек.
-
Llama 3.2 3B:
- BaseRT: 137 ток/сек (+5% быстрее MLX, +14% быстрее llama.cpp).
Режим Prefill (Обработка входного текста)
В задачах предварительной обработки (Prefill) разрыв становится колоссальным:
- Qwen3 30B-A3B (PP128): BaseRT выдает 2,478 ток/сек, что на 288% быстрее MLX и на 94% быстрее llama.cpp.
- Gemma 4 E2B (PP2048, Q8): BaseRT достигает невероятных 16,264 ток/сек. Это в 5.39 раз (539%) быстрее, чем показатели llama.cpp (2,547 ток/сек), и на 32% быстрее MLX.
Кейс использования: Локальные агенты для кодинга
Одним из наиболее эффективных способов применения BaseRT является запуск локального агента для написания кода (Coding Agent). Это позволяет программистам работать с мощным AI-помощником, сохраняя полную приватность исходного кода.
С помощью BaseRT вы можете:
- Запустить модель локально.
- Направить вашего агента на локальный сервер.
- Работать без задержек сети и оплаты за каждый запрос к API.
«Запустите модель с помощью BaseRT, направьте на нее своего агента и оставьте все данные на своей машине. Никаких API-ключей, никакой утечки данных». — команда Basecompute.
Как использовать BaseRT
Начать работу с BaseRT крайне просто благодаря автоматизированным скриптам установки и интуитивно понятному интерфейсу командной строки.
Шаг 1: Установка
Для установки среды выполнения выполните следующую команду в терминале:
$ curl -LsSf https://basecompute.co/install.sh | sh
Шаг 2: Запуск модели
Чтобы развернуть сервер с конкретной моделью (например, Gemma 4), используйте команду serve:
basert serve basecompute/gemma-4-E4B-it
Шаг 3: Интеграция с агентом
Для использования с локальным агентом кодинга можно установить соответствующий плагин:
pi install git:github.com/basecompute/pi-basert
После чего достаточно запустить команду pi, и ваша система готова к работе в полностью автономном режиме.
FAQ (Часто задаваемые вопросы)
В: Насколько BaseRT быстрее других решений? О: В зависимости от модели и режима работы, BaseRT показывает ускорение до 6.4x по сравнению с llama.cpp и до 3.9x по сравнению с MLX на операциях Prefill. В режиме Decode прирост составляет до 33%.
В: Какие устройства поддерживаются? О: Среда выполнения оптимизирована для устройств на базе Apple Silicon (процессоры серии M).
В: Нужно ли мне интернет-соединение для работы BaseRT? О: Интернет требуется только для первоначальной установки и загрузки моделей. Сами вычисления и работа моделей происходят полностью локально (On-Device AI).
В: Где я могу получить поддержку или обсудить проект? О: Вы можете присоединиться к сообществу разработчиков в Discord, где инженеры обсуждают вопросы локального AI и работу с open-source моделями.
BaseRT — это выбор профессионалов, которым нужна максимальная отдача от их оборудования Apple. Независимо от того, строите ли вы сложные системы автоматизации или просто хотите ускорить свой процесс разработки, BaseRT обеспечит необходимую скорость и надежность.








