BaseRT
BaseRT – Die schnellste Runtime für Apple Silicon zur lokalen Ausführung von KI-Modellen
Entdecken Sie BaseRT, die weltweit schnellste Runtime für Apple Silicon. Mit überlegener Performance gegenüber MLX und llama.cpp ermöglicht BaseRT hocheffiziente On-Device-KI ohne Datenabfluss.
2026-07-20
--K
BaseRT Produktinformationen
BaseRT: Die schnellste Runtime für Apple Silicon
In der Welt der künstlichen Intelligenz und der lokalen Ausführung von Sprachmodellen (LLMs) ist Geschwindigkeit der entscheidende Faktor. BaseRT hat sich als die schnellste Runtime für Apple Silicon etabliert und setzt neue Maßstäbe in der Performance. Entwickelt für Ingenieure und Entwickler, die On-Device-KI vorantreiben möchten, bietet BaseRT eine beispiellose Effizienz für eine Vielzahl von Open-Source-Modellen.
Ob in Melbourne oder Berlin – das Team hinter BaseRT arbeitet an der Spitze der KI-Forschung, um eine Laufzeitumgebung zu schaffen, die herkömmliche Lösungen wie MLX und llama.cpp deutlich in den Schatten stellt. In diesem Artikel erfahren Sie alles über die Funktionen, Benchmarks und Einsatzmöglichkeiten dieser revolutionären Technologie.
Was ist BaseRT?
BaseRT ist eine hochoptimierte Runtime, die speziell für die Architektur von Apple Silicon entwickelt wurde. Das Hauptziel von BaseRT ist es, die Hardware-Ressourcen von Mac-Systemen (wie dem Apple M5 Pro) optimal auszureizen, um lokale KI-Berechnungen so schnell wie möglich durchzuführen.
Im Gegensatz zu Cloud-basierten Lösungen erlaubt BaseRT das Ausführen von Modellen direkt auf der eigenen Hardware. Dies bedeutet, dass keine API-Schlüssel erforderlich sind und keine sensiblen Daten das Gerät verlassen. BaseRT fungiert dabei als das Bindeglied zwischen komplexen KI-Modellen und der leistungsstarken Apple-Hardware, wobei der Fokus auf maximalem Durchsatz (Tokens pro Sekunde) liegt.
Features von BaseRT
BaseRT zeichnet sich durch eine Reihe von technischen Vorteilen aus, die es zur ersten Wahl für Entwickler machen:
- Extreme Geschwindigkeit: BaseRT ist nachweislich schneller als MLX und llama.cpp.
- Optimiertes Prefill & Decode: Besonders in der Prefill-Phase zeigt BaseRT eine überragende Überlegenheit.
- Lokale Privatsphäre: Alle Berechnungen erfolgen lokal. Es gibt keinen Datenexport in die Cloud.
- Einfache Integration: Mit simplen Befehlen lassen sich Modelle servieren und in Workflows integrieren.
- Breite Modellunterstützung: Kompatibilität mit den neuesten Modellarchitekturen wie Llama 3.2, Qwen3 und Gemma 4.
- Community-Getrieben: Eine aktive Discord-Community unterstützt Entwickler bei der Arbeit mit Open-Source-Modellen.
Benchmarks: BaseRT im Vergleich
Die Leistung von BaseRT wurde auf einem Apple M5 Pro intensiv getestet. Die Ergebnisse zeigen eine signifikante Überlegenheit gegenüber anderen gängigen Runtimes wie MLX und llama.cpp.
Prefill-Performance
Die Prefill-Phase ist entscheidend für die Reaktionszeit einer KI. BaseRT erreicht hier beeindruckende Werte:
- Bis zu 6,4-mal schneller als llama.cpp.
- Bis zu 3,9-mal schneller als MLX.
Ein konkretes Beispiel: Beim Modell Qwen3 30B-A3B (Q4) erreicht BaseRT im Prefill-Test (PP128) 2.478 Tokens/Sek., während llama.cpp nur auf 1.280 und MLX auf 639 kommt. Dies entspricht einer Steigerung von 288 % gegenüber MLX.
Bei Gemma 4 E2B (Q8) erzielt BaseRT im Prefill (PP2048) sogar 16.264 Tokens/Sek. – ein Vorsprung von 539 % gegenüber llama.cpp.
Decode-Performance
Auch in der Decode-Phase (TG128) bleibt BaseRT ungeschlagen:
- Qwen3 0.6B (Q4): 531 Tokens/Sek. (BaseRT) vs. 398 (MLX) und 386 (llama.cpp).
- Llama 3.2 1B (Q4): 342 Tokens/Sek. (BaseRT) vs. 298 (MLX) und 267 (llama.cpp).
- Llama 3.2 3B (Q4): 137 Tokens/Sek. (BaseRT) vs. 131 (MLX) und 120 (llama.cpp).
Diese Zahlen belegen, dass BaseRT die effizienteste Art ist, LLMs auf Apple Silicon zu betreiben.
Unterstützte Modelle
BaseRT bietet eine umfassende Unterstützung für moderne Open-Source-Modelle. Dazu gehören unter anderem:
- Qwen-Serie: Qwen3, Qwen3.5, Qwen3.6
- Llama-Serie: Llama 3.1, Llama 3.2
- Gemma-Serie: Gemma 3, Gemma 4
- Mistral
- Phi-3
- Nomic BERT
Diese Vielfalt ermöglicht es Entwicklern, für jede spezifische Aufgabe – von der Textgenerierung bis hin zu Embeddings – das passende Modell mit BaseRT-Geschwindigkeit zu nutzen.
Use Case: Lokale Coding Agents
Ein primäres Einsatzgebiet für BaseRT ist der Betrieb von lokalen Coding Agents. Anstatt auf externe APIs angewiesen zu sein, können Entwickler ihre Agenten direkt auf BaseRT aufsetzen.
"Serve a model with BaseRT, point your agent at it, and keep everything on your machine. No API keys, no data leaving your device."
Durch die lokale Ausführung entfallen Latenzzeiten durch Netzwerkübertragungen, und der Datenschutz wird maximiert. Mit dem pi-basert Plugin lässt sich BaseRT nahtlos in Coding-Workflows integrieren.
Wie man BaseRT verwendet
Die Einrichtung von BaseRT ist unkompliziert und erfolgt über das Terminal. Folgen Sie diesen Schritten, um BaseRT auf Ihrem Apple Silicon Gerät zu installieren und zu nutzen:
1. Installation
Installieren Sie BaseRT mit dem folgenden Curl-Befehl:
$ curl -LsSf https://basecompute.co/install.sh | sh
2. Ein Modell servieren
Starten Sie die Runtime und stellen Sie ein Modell (z. B. Gemma 4) bereit:
# Ein Modell mit BaseRT bereitstellen
basert serve basecompute/gemma-4-E4B-it
3. Coding-Agent Integration
Um BaseRT mit einem lokalen Coding-Agent zu nutzen, installieren Sie das entsprechende Plugin:
# Installieren des Coding-Agent Plugins
pi install git:github.com/basecompute/pi-basert
# Den Agenten starten
pi
Nun ist alles bereit, und Sie können lokal und in Höchstgeschwindigkeit arbeiten.
FAQ – Häufig gestellte Fragen
F: Auf welcher Hardware wurden die Benchmarks durchgeführt? A: Die Benchmarks wurden auf einem Apple M5 Pro Chip durchgeführt. Die Performance-Vorteile von BaseRT sind jedoch auf der gesamten Apple Silicon Architektur spürbar.
F: Ist BaseRT wirklich schneller als MLX? A: Ja, laut aktuellen technischen Berichten ist BaseRT im Prefill bis zu 3,9-mal schneller als MLX und im Decode bis zu 33 % schneller bei Modellen wie Qwen3 0.6B.
F: Benötige ich eine Internetverbindung, um BaseRT zu nutzen? A: Nur für den initialen Download der Software und der Modelle. Die eigentliche Inferenz findet komplett offline auf Ihrem Gerät statt.
F: Welche Modelle werden unterstützt? A: BaseRT unterstützt eine breite Palette, darunter die Llama 3.2-Serie, Gemma 4, Qwen3.6, Mistral und Phi-3 sowie Nomic BERT.
F: Wo finde ich Hilfe bei technischen Problemen? A: Die BaseRT-Community ist sehr aktiv auf Discord. Dort treffen sich Ingenieure, die an On-Device-KI arbeiten, um Erfahrungen auszutauschen.








