BaseRT
BaseRT – Najszybsze środowisko wykonawcze (runtime) dla procesorów Apple Silicon i modeli AI
BaseRT to najszybszy runtime zoptymalizowany pod Apple Silicon, oferujący do 6.4x większą wydajność niż llama.cpp. Pozwala na lokalne uruchamianie modeli Llama, Gemma i Qwen bez kluczy API.
2026-07-20
--K
BaseRT Informacje o produkcie
BaseRT: Najszybszy Runtime dla Apple Silicon
W świecie sztucznej inteligencji i lokalnego przetwarzania danych, wydajność jest kluczem do sukcesu. BaseRT to nowoczesne i niezwykle wydajne środowisko wykonawcze (runtime), które zostało zaprojektowane specjalnie z myślą o architekturze Apple Silicon. Dzięki rygorystycznej optymalizacji, BaseRT pozwala programistom i badaczom AI na wyciśnięcie maksymalnej mocy z ich urządzeń Mac, oferując szybkość działania niedostępną dla innych rozwiązań.
Co to jest BaseRT?
BaseRT to najszybsze na rynku środowisko wykonawcze zoptymalizowane pod kątem układów Apple Silicon. Jest to rozwiązanie stworzone przez zespół RuntimeResearch, działający w Melbourne i Berlinie. Głównym celem BaseRT jest umożliwienie błyskawicznego uruchamiania zaawansowanych modeli językowych (LLM) bezpośrednio na urządzeniach użytkowników, przy zachowaniu pełnej prywatności i braku konieczności polegania na zewnętrznych interfejsach API.
Projekt BaseRT koncentruje się na dwóch kluczowych fazach pracy modelu: Prefill (wstępne przetwarzanie promptu) oraz Decode (generowanie odpowiedzi). W obu tych obszarach BaseRT wyznacza nowe standardy wydajności dla ekosystemu Apple.
Cechy BaseRT
Środowisko BaseRT wyróżnia się na tle konkurencji kilkoma kluczowymi cechami, które czynią je idealnym wyborem dla inżynierów budujących on-device AI:
- Niedościgniona prędkość: Jak pokazują testy, BaseRT jest znacząco szybsze niż popularne rozwiązania takie jak MLX czy llama.cpp.
- Optymalizacja pod Apple Silicon: Architektura została zbudowana od podstaw, aby w pełni wykorzystać potencjał procesorów Apple, w tym najnowszych jednostek takich jak Apple M5 Pro.
- Prywatność i bezpieczeństwo: Korzystając z BaseRT, wszystkie dane pozostają na Twoim urządzeniu. Nie ma potrzeby przesyłania wrażliwych informacji do chmury ani generowania kluczy API.
- Wsparcie dla wielu architektur: BaseRT obsługuje szeroką gamę najpopularniejszych modeli open-source.
- Łatwa integracja: Prosty system instalacji i obsługi pozwala na szybkie wdrożenie modeli do lokalnych agentów kodujących.
Wydajność i Benchmarki
To, co naprawdę wyróżnia BaseRT, to jego liczby. Benchmarki przeprowadzone na układzie Apple M5 Pro pokazują miażdżącą przewagę nad innymi bibliotekami.
Faza Prefill (Szybkość przetwarzania)
W fazie Prefill, BaseRT osiąga wyniki, które redefiniują pracę z długimi kontekstami:
- Qwen3 30B-A3B (pp128, Q4): BaseRT osiąga 2,478 tokenów/sek, co stanowi wynik o 288% lepszy od MLX (639 t/s) i o 94% lepszy od llama.cpp (1,280 t/s).
- Gemma 4 E2B (pp2048, Q8): Tutaj BaseRT deklasuje konkurencję z wynikiem 16,264 tokenów/sek, będąc o 32% szybszym od MLX i aż o 539% szybszym od llama.cpp.
Faza Decode (Generowanie tekstu)
W fazie generowania (Decode tg128), BaseRT również utrzymuje prowadzenie:
- Qwen3 0.6B (Q4): 531 tokenów/sek (o 33% szybciej niż MLX i o 37% szybciej niż llama.cpp).
- Llama 3.2 1B (Q4): 342 tokenów/sek (o 15% szybciej niż MLX).
- Llama 3.2 3B (Q4): 137 tokenów/sek (o 14% szybciej niż llama.cpp).
Modele Obsługiwane przez BaseRT
Środowisko BaseRT jest kompatybilne z szerokim wachlarzem nowoczesnych modeli, co daje deweloperom ogromną elastyczność:
- Seria Qwen: Wsparcie dla Qwen3, Qwen3.5 oraz Qwen3.6.
- Seria Llama: Pełna obsługa Llama 3.1 oraz najnowszej wersji Llama 3.2.
- Seria Gemma: Obsługa modeli Gemma 3 oraz Gemma 4.
- Mistral: Popularny model Mistral działający z pełną prędkością na BaseRT.
- Phi-3: Lekki i wydajny model od Microsoftu.
- Nomic BERT: Wsparcie dla modeli typu BERT.
Przypadek Użycia: Lokalni Agenci Kodujący
Jednym z najbardziej ekscytujących zastosowań BaseRT jest tworzenie i uruchamianie lokalnych agentów kodujących. Dzięki BaseRT, możesz serwować model bezpośrednio na swojej maszynie i połączyć z nim swojego agenta.
Korzyść: Wszystkie Twoje pliki źródłowe i zapytania pozostają na Twoim dysku. Żadne dane nie opuszczają urządzenia, co jest kluczowe w pracy nad projektami komercyjnymi i zastrzeżonym kodem.
Dzięki wysokiej wydajności BaseRT, interakcja z agentem AI w czasie rzeczywistym staje się płynna, a odpowiedzi są generowane niemal natychmiastowo.
Jak używać BaseRT?
Rozpoczęcie pracy z BaseRT jest proste i sprowadza się do kilku komend w terminalu. Poniżej znajduje się instrukcja, jak przygotować środowisko i uruchomić model.
Instalacja
Aby zainstalować BaseRT na swoim systemie, użyj poniższego polecenia:
curl -LsSf https://basecompute.co/install.sh | sh
Uruchamianie modelu (Serve)
Aby udostępnić model (np. Gemma 4) lokalnie, użyj komendy serve:
basert serve basecompute/gemma-4-E4B-it
Integracja z Agentem Kodującym
Jeśli chcesz używać BaseRT z wtyczką coding-agent, wykonaj poniższe kroki:
- Zainstaluj plugin:
pi install git:github.com/basecompute/pi-basert - Uruchom narzędzie:
pi
Teraz wszystko jest skonfigurowane i gotowe do pracy w pełni lokalnym środowisku.
Często Zadawane Pytania (FAQ)
Czy BaseRT wymaga połączenia z internetem do działania? Nie, BaseRT jest zaprojektowane do pracy on-device. Internet jest potrzebny jedynie do pobrania instalatora i wag modeli. Po pobraniu, inferencja odbywa się całkowicie offline.
Dlaczego BaseRT jest szybsze niż MLX? BaseRT stosuje zaawansowane techniki optymalizacji specyficzne dla sprzętu Apple Silicon, co pozwala na osiągnięcie lepszych wyników w testach Prefill (nawet do 3.9x szybciej) i Decode w porównaniu do frameworka MLX.
Czy BaseRT obsługuje modele Llama 3.2? Tak, BaseRT w pełni wspiera modele Llama 3.2 w różnych wariantach (np. 1B, 3B) oraz z kwantyzacją Q4.
Gdzie mogę znaleźć pomoc techniczną? Możesz dołączyć do społeczności inżynierów na Discordzie, gdzie omawiane są tematy on-device AI i pracy z modelami open source. Dokumentacja jest również dostępna na GitHub oraz w oficjalnych raportach technicznych BaseRT docs.








