BaseRT
BaseRT: El runtime más rápido para Apple Silicon, optimizado para modelos Llama, Qwen y Gemma con máximo rendimiento.
BaseRT es el runtime de alto rendimiento definitivo para procesadores Apple Silicon, diseñado para superar a MLX y llama.cpp. Ofrece una velocidad de prefill hasta 6.4 veces superior, permitiendo la ejecución local de modelos avanzados como Llama 3.2, Qwen y Gemma 4 sin necesidad de API externas, garantizando privacidad total y eficiencia extrema para desarrolladores y agentes de código.
2026-07-20
--K
BaseRT Información del producto
BaseRT: El Runtime Más Rápido para Apple Silicon
En el ecosistema actual de la inteligencia artificial, la eficiencia y la velocidad de ejecución local son factores determinantes para los desarrolladores. BaseRT se presenta como la solución definitiva, consolidándose como el runtime más rápido disponible para Apple Silicon. Diseñado para maximizar el potencial del hardware de Apple, BaseRT permite a los ingenieros y entusiastas de la IA ejecutar modelos de código abierto con un rendimiento sin precedentes.
¿Qué es BaseRT?
BaseRT es un entorno de ejecución (runtime) de alto rendimiento optimizado específicamente para la arquitectura de chips de Apple. Su objetivo principal es facilitar la inferencia de modelos de lenguaje de gran tamaño (LLM) de manera local, eliminando la dependencia de servicios en la nube y garantizando que los datos nunca abandonen el dispositivo del usuario.
Al utilizar BaseRT, los usuarios obtienen una ventaja competitiva gracias a su arquitectura optimizada, que supera significativamente a otras herramientas populares en la industria. Este runtime no solo se enfoca en la velocidad bruta, sino también en la facilidad de integración para flujos de trabajo profesionales, como el desarrollo de software asistido por IA.
Características Principales de BaseRT
El éxito de BaseRT se basa en un conjunto de características técnicas que lo posicionan por encima de alternativas como MLX y llama.cpp. A continuación, se detallan sus ventajas más destacadas:
- Velocidad Superior: BaseRT ofrece un rendimiento excepcional, siendo notablemente más rápido que sus competidores directos.
- Optimización para Prefill y Decode: En tareas de Prefill, BaseRT alcanza velocidades de hasta 6.4x frente a llama.cpp y 3.9x frente a MLX. En tareas de Decode, la mejora es de hasta 1.33x.
- Privacidad Total: Al ejecutar los modelos localmente con BaseRT, no se requieren claves de API y no hay transferencia de datos a servidores externos.
- Soporte de Modelos de Vanguardia: Es compatible con las arquitecturas más modernas del mercado.
- Fácil Instalación: Se puede desplegar rápidamente mediante una simple línea de comandos en la terminal.
Modelos Compatibles
BaseRT ofrece un soporte robusto para una amplia gama de modelos de código abierto, asegurando versatilidad para diferentes tipos de tareas:
- Qwen: Versiones 3, 3.5 y 3.6.
- Llama: Soporte para Llama 3.1 y Llama 3.2.
- Gemma: Incluyendo Gemma 3 y la reciente Gemma 4.
- Mistral: Optimización para modelos de esta familia.
- Phi-3: Los modelos compactos y eficientes de Microsoft.
- Nomic BERT: Ideal para tareas de procesamiento de lenguaje natural y embeddings.
Comparativa de Rendimiento (Benchmarks)
El rendimiento de BaseRT ha sido probado exhaustivamente en entornos reales, específicamente utilizando hardware Apple M5 Pro. Los resultados demuestran una superioridad clara en métricas de tokens por segundo.
Rendimiento en Decode (TG128)
En la fase de generación de texto (Decode), BaseRT lidera la tabla:
- Qwen3 0.6B (Q4): BaseRT alcanza 531 tokens/seg, superando en un 33% a MLX (398) y en un 37% a llama.cpp (386).
- Llama 3.2 1B (Q4): BaseRT registra 342 tokens/seg, un 15% más rápido que MLX y un 28% más que llama.cpp.
- Llama 3.2 3B (Q4): Mantiene el liderazgo con 137 tokens/seg.
Rendimiento en Prefill
La ventaja de BaseRT es aún más drástica en el procesamiento inicial de tokens (Prefill):
- Qwen3 30B-A3B (PP128, Q4): BaseRT procesa 2,478 tokens/seg, lo que representa un incremento del 288% frente a MLX y un 94% frente a llama.cpp.
- Gemma 4 E2B (PP2048, Q8): Alcanza la impresionante cifra de 16,264 tokens/seg, superando por un 539% a llama.cpp.
Casos de Uso: Agentes de Código Locales
Uno de los usos más potentes de BaseRT es la implementación de agentes de programación locales. Al servir un modelo con BaseRT y conectarlo a un agente, los desarrolladores pueden disfrutar de una experiencia de codificación fluida y privada.
"Ejecuta un agente de código local con BaseRT, apunta tu agente hacia él y mantén todo en tu máquina. Sin llaves de API, sin que los datos salgan de tu dispositivo."
Este flujo de trabajo es ideal para empresas con políticas estrictas de seguridad de datos o para desarrolladores que trabajan en entornos sin conexión constante a internet.
Cómo Usar BaseRT
Configurar BaseRT en tu sistema Apple Silicon es un proceso directo y simplificado para desarrolladores.
Instalación
Para instalar BaseRT, simplemente ejecuta el siguiente comando en tu terminal:
$ curl -LsSf https://basecompute.co/install.sh | sh
Configuración de un Agente de Código
Una vez instalado BaseRT, puedes poner en marcha un modelo y un agente siguiendo estos pasos:
- Servir el modelo: Utiliza BaseRT para cargar el modelo deseado.
basert serve basecompute/gemma-4-E4B-it - Instalar el plugin del agente: Instala el complemento necesario para la interacción.
pi install git:github.com/basecompute/pi-basert - Ejecutar: Inicia la herramienta y todo estará listo para funcionar localmente.
pi
Preguntas Frecuentes (FAQ)
¿Es BaseRT compatible con procesadores Intel? No, BaseRT está optimizado específicamente para Apple Silicon para garantizar las velocidades de procesamiento más altas del mercado en este hardware.
¿Cómo se compara BaseRT con llama.cpp? BaseRT es significativamente más rápido, especialmente en tareas de Prefill, donde puede ser hasta 6.4 veces superior a llama.cpp.
¿Necesito una conexión a internet para usar BaseRT? Solo necesitas conexión para la descarga inicial del runtime y los modelos. Una vez instalados, BaseRT funciona de forma completamente local.
¿Dónde puedo encontrar soporte o comunidad? Existen comunidades activas en Discord para ingenieros que construyen IA en dispositivos locales y trabajan con modelos de código abierto. También puedes consultar los reportes técnicos y la documentación oficial de BaseRT en su sitio web.
¿Quién desarrolla BaseRT? BaseRT es desarrollado por equipos ubicados en Melbourne y Berlín, enfocados en la investigación y el desarrollo de runtime de alto rendimiento.








