BaseRT
BaseRT: Apple Silicon을 위한 세계에서 가장 빠른 런타임 및 LLM 가속화 가이드
BaseRT는 Apple Silicon에서 최적화된 가장 빠른 런타임으로, MLX 및 llama.cpp 대비 압도적인 속도를 제공합니다. 로컬 코딩 에이전트 구축 및 다양한 오픈 소스 모델 지원을 통해 데이터 보안과 고성능을 동시에 경험하세요.
2026-07-20
--K
BaseRT 제품정보
BaseRT: Apple Silicon을 위한 세계에서 가장 빠른 런타임
최신 AI 기술의 발전과 함께 로컬 환경에서 대규모 언어 모델(LLM)을 구동하려는 수요가 급증하고 있습니다. 이러한 흐름 속에서 BaseRT는 Apple Silicon 환경에서 압도적인 성능을 발휘하는 가장 빠른 런타임으로 주목받고 있습니다. 본 기사에서는 BaseRT의 핵심 기능, 벤치마크 성능, 그리고 실제 활용 사례에 대해 심층적으로 분석합니다.
What's BaseRT?
BaseRT는 Apple Silicon(애플 실리콘) 하드웨어에 최적화된 고성능 AI 런타임입니다. 개발자와 엔지니어들이 로컬 기기에서 오픈 소스 모델을 가장 효율적으로 실행할 수 있도록 설계되었습니다. BaseRT는 특히 속도와 효율성에 집중하여, 기존의 대중적인 프레임워크인 MLX나 llama.cpp를 능가하는 퍼포먼스를 보여줍니다.
BaseRT의 핵심 가치는 사용자의 데이터를 외부로 유출하지 않고 기기 내부에서 모든 처리를 완료하는 '온디바이스(On-device) AI' 환경을 완벽하게 지원하는 데 있습니다. 이를 통해 API 키 없이도 보안이 유지되는 개인화된 AI 환경을 구축할 수 있습니다.
BaseRT의 주요 특징 (Features)
BaseRT가 다른 런타임과 차별화되는 주요 특징은 다음과 같습니다.
1. Apple Silicon 최적화
BaseRT는 Apple의 M 시리즈 칩셋 아키텍처를 최대한 활용하도록 설계되었습니다. 이를 통해 하드웨어 가속을 극대화하며, 동일한 하드웨어에서도 타 런타임 대비 월등한 속도를 기록합니다.
2. 압도적인 Prefill 및 Decode 속도
BaseRT는 모델이 입력을 처리하는 Prefill 단계와 텍스트를 생성하는 Decode 단계 모두에서 혁신적인 속도 향상을 이루어냈습니다. 특히 Prefill 단계에서는 llama.cpp 대비 최대 6.4배, MLX 대비 최대 3.9배 빠른 속도를 자랑합니다.
3. 로컬 실행 및 개인정보 보호
데이터가 사용자의 기기를 떠나지 않습니다. 외부 API 호출이 필요 없으므로 민감한 코드나 개인 데이터를 안전하게 다룰 수 있습니다.
4. 폭넓은 모델 호환성
BaseRT는 Qwen, Llama, Gemma, Mistral 등 최신 오픈 소스 모델들을 폭넓게 지원하여 사용자가 원하는 최적의 모델을 선택할 수 있는 유연성을 제공합니다.
BaseRT 벤치마크: MLX 및 llama.cpp와의 비교
BaseRT의 진가는 실제 벤치마크 수치에서 드러납니다. Apple M5 Pro 환경에서 수행된 테스트 결과에 따르면, BaseRT는 모든 지표에서 경쟁사들을 압도합니다.
Decode 성능 (TG128 기준)
텍스트 생성 속도를 나타내는 Decode 단계에서 BaseRT는 다음과 같은 성능(Tokens/Sec)을 보여줍니다.
- Qwen3 0.6B · Q4: BaseRT (531), MLX (398, +33% 향상), llama.cpp (386, +37% 향상)
- Llama 3.2 1B · Q4: BaseRT (342), MLX (298, +15% 향상), llama.cpp (267, +28% 향상)
- Llama 3.2 3B · Q4: BaseRT (137), MLX (131, +5% 향상), llama.cpp (120, +14% 향상)
Prefill 성능
초기 컨텍스트 처리 속도를 측정하는 Prefill 단계에서는 더욱 극적인 차이가 발생합니다.
- Qwen3 30B-A3B · PP128 · Q4: BaseRT (2,478), MLX (639, +288% 향상), llama.cpp (1,280, +94% 향상)
- Gemma 4 E2B · PP2048 · Q8: BaseRT (16,264), MLX (12,355, +32% 향상), llama.cpp (2,547, +539% 향상)
이러한 수치는 BaseRT가 대규모 컨텍스트를 처리할 때 얼마나 강력한 효율성을 발휘하는지 증명합니다.
지원되는 모델 (Supported Models)
BaseRT는 지속적으로 업데이트되며 다양한 최신 모델을 지원하고 있습니다.
- Qwen 시리즈: Qwen3, Qwen3.5, Qwen3.6
- Llama 시리즈: Llama 3.1, Llama 3.2
- Gemma 시리즈: Gemma 3, Gemma 4
- 기타 주요 모델: Mistral, Phi-3, Nomic BERT
활용 사례: 로컬 코딩 에이전트 (Use Case)
BaseRT의 가장 대표적인 활용 사례는 로컬 코딩 에이전트를 구축하는 것입니다.
기존의 클라우드 기반 코딩 도구는 코드 유출의 위험과 API 비용 문제가 있었습니다. 하지만 BaseRT를 사용하면 다음과 같은 이점을 누릴 수 있습니다.
- 데이터 보안: 모든 코드가 로컬 머신 내에서 머무르며 외부로 전송되지 않습니다.
- 비용 절감: 별도의 API 키나 구독료 없이 오픈 소스 모델을 무제한으로 활용할 수 있습니다.
- 무중단 작업: 인터넷 연결 여부와 상관없이 오프라인 환경에서도 고성능 AI의 도움을 받을 수 있습니다.
BaseRT 사용 방법 (How to Use)
BaseRT를 설치하고 로컬 코딩 에이전트를 실행하는 방법은 매우 간단합니다.
1. 설치 단계
터미널에서 다음 명령어를 입력하여 BaseRT를 설치합니다.
$ curl -LsSf https://basecompute.co/install.sh | sh
2. 모델 서비스 시작
원하는 모델(예: Gemma 4)을 BaseRT를 통해 서빙합니다.
# 모델 서빙 실행
basert serve basecompute/gemma-4-E4B-it
3. 코딩 에이전트 플러그인 설치 및 실행
플러그인을 설치하고 에이전트를 구동하면 모든 설정이 완료됩니다.
# 플러그인 설치
pi install git:github.com/basecompute/pi-basert
# 에이전트 실행
pi
이제 사용자의 장치에서 모든 작업이 로컬로 수행됩니다.
FAQ (자주 묻는 질문)
Q: BaseRT는 어떤 하드웨어에서 가장 잘 작동하나요? A: BaseRT는 Apple Silicon(M1, M2, M3, M4, M5 등) 기기에 최적화되어 설계되었습니다.
Q: BaseRT를 사용하기 위해 외부 API 키가 필요한가요? A: 아니요, BaseRT는 로컬에서 모델을 직접 실행하므로 별도의 외부 API 키가 필요하지 않습니다.
Q: 지원되는 모델 목록은 어디서 확인할 수 있나요? A: 현재 Qwen3, Llama 3.2, Gemma 4, Mistral, Phi-3 등 주요 오픈 소스 모델들을 지원하고 있으며, 지속적으로 추가되고 있습니다.
Q: BaseRT 개발자 커뮤니티에 참여하려면 어떻게 해야 하나요? A: 공식 Discord 채널을 통해 온디바이스 AI를 구축하는 엔지니어들과 소통하고 정보를 공유할 수 있습니다.
BaseRT는 단순한 런타임을 넘어, Apple Silicon 사용자들에게 가장 강력하고 안전한 AI 경험을 선사하는 도구입니다. 지금 바로 BaseRT를 설치하고 로컬 AI의 진정한 속도를 경험해 보세요.








