BaseRT – Die schnellste Runtime für Apple Silicon zur lokalen Ausführung von KI-Modellen

Einführung:

Entdecken Sie BaseRT, die weltweit schnellste Runtime für Apple Silicon. Mit überlegener Performance gegenüber MLX und llama.cpp ermöglicht BaseRT hocheffiziente On-Device-KI ohne Datenabfluss.

Hinzugefügt:

2026-07-20

Monatliche Besucher:

--K

BaseRT - AI Tool Screenshot and Interface Preview

BaseRT Produktinformationen

BaseRT: Die schnellste Runtime für Apple Silicon

In der Welt der künstlichen Intelligenz und der lokalen Ausführung von Sprachmodellen (LLMs) ist Geschwindigkeit der entscheidende Faktor. BaseRT hat sich als die schnellste Runtime für Apple Silicon etabliert und setzt neue Maßstäbe in der Performance. Entwickelt für Ingenieure und Entwickler, die On-Device-KI vorantreiben möchten, bietet BaseRT eine beispiellose Effizienz für eine Vielzahl von Open-Source-Modellen.

Ob in Melbourne oder Berlin – das Team hinter BaseRT arbeitet an der Spitze der KI-Forschung, um eine Laufzeitumgebung zu schaffen, die herkömmliche Lösungen wie MLX und llama.cpp deutlich in den Schatten stellt. In diesem Artikel erfahren Sie alles über die Funktionen, Benchmarks und Einsatzmöglichkeiten dieser revolutionären Technologie.

Was ist BaseRT?

BaseRT ist eine hochoptimierte Runtime, die speziell für die Architektur von Apple Silicon entwickelt wurde. Das Hauptziel von BaseRT ist es, die Hardware-Ressourcen von Mac-Systemen (wie dem Apple M5 Pro) optimal auszureizen, um lokale KI-Berechnungen so schnell wie möglich durchzuführen.

Im Gegensatz zu Cloud-basierten Lösungen erlaubt BaseRT das Ausführen von Modellen direkt auf der eigenen Hardware. Dies bedeutet, dass keine API-Schlüssel erforderlich sind und keine sensiblen Daten das Gerät verlassen. BaseRT fungiert dabei als das Bindeglied zwischen komplexen KI-Modellen und der leistungsstarken Apple-Hardware, wobei der Fokus auf maximalem Durchsatz (Tokens pro Sekunde) liegt.

Features von BaseRT

BaseRT zeichnet sich durch eine Reihe von technischen Vorteilen aus, die es zur ersten Wahl für Entwickler machen:

  • Extreme Geschwindigkeit: BaseRT ist nachweislich schneller als MLX und llama.cpp.
  • Optimiertes Prefill & Decode: Besonders in der Prefill-Phase zeigt BaseRT eine überragende Überlegenheit.
  • Lokale Privatsphäre: Alle Berechnungen erfolgen lokal. Es gibt keinen Datenexport in die Cloud.
  • Einfache Integration: Mit simplen Befehlen lassen sich Modelle servieren und in Workflows integrieren.
  • Breite Modellunterstützung: Kompatibilität mit den neuesten Modellarchitekturen wie Llama 3.2, Qwen3 und Gemma 4.
  • Community-Getrieben: Eine aktive Discord-Community unterstützt Entwickler bei der Arbeit mit Open-Source-Modellen.

Benchmarks: BaseRT im Vergleich

Die Leistung von BaseRT wurde auf einem Apple M5 Pro intensiv getestet. Die Ergebnisse zeigen eine signifikante Überlegenheit gegenüber anderen gängigen Runtimes wie MLX und llama.cpp.

Prefill-Performance

Die Prefill-Phase ist entscheidend für die Reaktionszeit einer KI. BaseRT erreicht hier beeindruckende Werte:

  • Bis zu 6,4-mal schneller als llama.cpp.
  • Bis zu 3,9-mal schneller als MLX.

Ein konkretes Beispiel: Beim Modell Qwen3 30B-A3B (Q4) erreicht BaseRT im Prefill-Test (PP128) 2.478 Tokens/Sek., während llama.cpp nur auf 1.280 und MLX auf 639 kommt. Dies entspricht einer Steigerung von 288 % gegenüber MLX.

Bei Gemma 4 E2B (Q8) erzielt BaseRT im Prefill (PP2048) sogar 16.264 Tokens/Sek. – ein Vorsprung von 539 % gegenüber llama.cpp.

Decode-Performance

Auch in der Decode-Phase (TG128) bleibt BaseRT ungeschlagen:

  • Qwen3 0.6B (Q4): 531 Tokens/Sek. (BaseRT) vs. 398 (MLX) und 386 (llama.cpp).
  • Llama 3.2 1B (Q4): 342 Tokens/Sek. (BaseRT) vs. 298 (MLX) und 267 (llama.cpp).
  • Llama 3.2 3B (Q4): 137 Tokens/Sek. (BaseRT) vs. 131 (MLX) und 120 (llama.cpp).

Diese Zahlen belegen, dass BaseRT die effizienteste Art ist, LLMs auf Apple Silicon zu betreiben.

Unterstützte Modelle

BaseRT bietet eine umfassende Unterstützung für moderne Open-Source-Modelle. Dazu gehören unter anderem:

  • Qwen-Serie: Qwen3, Qwen3.5, Qwen3.6
  • Llama-Serie: Llama 3.1, Llama 3.2
  • Gemma-Serie: Gemma 3, Gemma 4
  • Mistral
  • Phi-3
  • Nomic BERT

Diese Vielfalt ermöglicht es Entwicklern, für jede spezifische Aufgabe – von der Textgenerierung bis hin zu Embeddings – das passende Modell mit BaseRT-Geschwindigkeit zu nutzen.

Use Case: Lokale Coding Agents

Ein primäres Einsatzgebiet für BaseRT ist der Betrieb von lokalen Coding Agents. Anstatt auf externe APIs angewiesen zu sein, können Entwickler ihre Agenten direkt auf BaseRT aufsetzen.

"Serve a model with BaseRT, point your agent at it, and keep everything on your machine. No API keys, no data leaving your device."

Durch die lokale Ausführung entfallen Latenzzeiten durch Netzwerkübertragungen, und der Datenschutz wird maximiert. Mit dem pi-basert Plugin lässt sich BaseRT nahtlos in Coding-Workflows integrieren.

Wie man BaseRT verwendet

Die Einrichtung von BaseRT ist unkompliziert und erfolgt über das Terminal. Folgen Sie diesen Schritten, um BaseRT auf Ihrem Apple Silicon Gerät zu installieren und zu nutzen:

1. Installation

Installieren Sie BaseRT mit dem folgenden Curl-Befehl:

$ curl -LsSf https://basecompute.co/install.sh | sh

2. Ein Modell servieren

Starten Sie die Runtime und stellen Sie ein Modell (z. B. Gemma 4) bereit:

# Ein Modell mit BaseRT bereitstellen
basert serve basecompute/gemma-4-E4B-it

3. Coding-Agent Integration

Um BaseRT mit einem lokalen Coding-Agent zu nutzen, installieren Sie das entsprechende Plugin:

# Installieren des Coding-Agent Plugins
pi install git:github.com/basecompute/pi-basert

# Den Agenten starten
pi

Nun ist alles bereit, und Sie können lokal und in Höchstgeschwindigkeit arbeiten.

FAQ – Häufig gestellte Fragen

F: Auf welcher Hardware wurden die Benchmarks durchgeführt? A: Die Benchmarks wurden auf einem Apple M5 Pro Chip durchgeführt. Die Performance-Vorteile von BaseRT sind jedoch auf der gesamten Apple Silicon Architektur spürbar.

F: Ist BaseRT wirklich schneller als MLX? A: Ja, laut aktuellen technischen Berichten ist BaseRT im Prefill bis zu 3,9-mal schneller als MLX und im Decode bis zu 33 % schneller bei Modellen wie Qwen3 0.6B.

F: Benötige ich eine Internetverbindung, um BaseRT zu nutzen? A: Nur für den initialen Download der Software und der Modelle. Die eigentliche Inferenz findet komplett offline auf Ihrem Gerät statt.

F: Welche Modelle werden unterstützt? A: BaseRT unterstützt eine breite Palette, darunter die Llama 3.2-Serie, Gemma 4, Qwen3.6, Mistral und Phi-3 sowie Nomic BERT.

F: Wo finde ich Hilfe bei technischen Problemen? A: Die BaseRT-Community ist sehr aktiv auf Discord. Dort treffen sich Ingenieure, die an On-Device-KI arbeiten, um Erfahrungen auszutauschen.

Loading related products...