Zurück zur Übersicht
vLLM v0.28.0 Release: Umfangreiche Performance-Optimierungen für Kimi-K3 und volle Unterstützung für DeepSeek V4
ProduktstartvLLMOpen SourceKünstliche Intelligenz

vLLM v0.28.0 Release: Umfangreiche Performance-Optimierungen für Kimi-K3 und volle Unterstützung für DeepSeek V4

Das neueste Update v0.28.0 des vLLM-Projekts markiert einen bedeutenden Fortschritt in der Effizienz von Large Language Models. Mit insgesamt 584 Commits von 270 Mitwirkenden konzentriert sich diese Version primär auf die Optimierung des Kimi-K3-Modells sowie die Integration von DeepSeek V4. Zu den Highlights gehören die Einführung von Decode Context Parallel (DCP), signifikante Kernel-Beschleunigungen durch fused FlashKDA und eine Reduzierung des Speicherverbrauchs um bis zu 17 GiB pro GPU durch Shared-Expert Sharding. Darüber hinaus bietet das Release eine verbesserte Unterstützung für AMD-Hardware über ROCm, insbesondere für die Architekturen gfx11 und gfx950. Diese Neuerungen versprechen eine drastisch verbesserte Time-to-First-Token (TTFT) und eine effizientere Nutzung moderner GPU-Ressourcen in Produktionsumgebungen.

Hacker News

Die wichtigsten Punkte

  • Massive Kimi-K3 Optimierung: Einführung von Decode Context Parallel (DCP) und fused FlashKDA-Kernels für signifikante Performance-Steigerungen.
  • DeepSeek V4 Integration: Volle End-to-End-Unterstützung für Sparse MLA, inklusive Optimierungen für spekulatives Decoding und AMD-Hardware.
  • Effizienzgewinne: Bis zu 17 GiB Speicherersparnis pro GPU durch Shared-Expert Sharding und eine um 60 % verbesserte Time-to-First-Token (TTFT).
  • Hardware-Erweiterung: Verbesserte Unterstützung für AMD ROCm, einschließlich der Architekturen gfx11 und gfx950 sowie des V2 Model Runners.
  • Community-getriebene Entwicklung: Das Release umfasst 584 Commits von 270 Mitwirkenden, darunter 76 neue Beitragende.

Analyse

Der Kimi-K3 Performance-Schub

Das Release v0.28.0 von vLLM legt einen starken Fokus auf die Optimierung des Kimi-K3-Modells über den gesamten Software-Stack hinweg. Ein zentrales Element dieser Bemühungen ist die Unterstützung von Decode Context Parallel (DCP), die eine effizientere parallele Verarbeitung während der Dekodierungsphase ermöglicht. Ergänzt wird dies durch die Einführung von fused FlashKDA-Kernels sowohl für die Dekodierung als auch für den Prefill-Prozess, was die Recheneffizienz direkt steigert.

Ein weiterer technischer Meilenstein für Kimi-K3 ist die Implementierung der SiTU-Aktivierung für MegaMoE sowie GEMM-RS für Sequenz-Parallelismus. Besonders hervorzuheben ist die Optimierung der All-Gather-Operationen, die eine Kernel-Beschleunigung um das 1,5- bis 3-fache erzielen. Für den praktischen Einsatz in Rechenzentren ist zudem das Shared-Expert Sharding von großer Bedeutung, da es eine Einsparung von etwa 17 GiB Speicher pro GPU ermöglicht. In Kombination mit einem adaptiven spekulativen Token-Budget führt dies zu einer Reduzierung der Time-to-First-Token (TTFT) um etwa 60 % bei der Nutzung von DSpark.

DeepSeek V4 und AMD-Integration

Die Unterstützung für DeepSeek V4 wurde in dieser Version massiv ausgebaut. Die Sparse MLA (Multi-Head Latent Attention) funktioniert nun End-to-End für einfaches Decoding, Multi-Token Prediction (MTP) und DSpark spekulatives Decoding. Um die Leistung auf AMD-Hardware zu maximieren, wurde die Unterstützung für AMD Quark NVFP4 integriert.

Zusätzlich wurden spezifische Kernel-Optimierungen für Sparse Top-k Metadaten vorgenommen, um die Effizienz bei Modellen mit Sparse-Strukturen zu erhöhen. vLLM v0.28.0 verbessert zudem die Handhabung von CUDA-Graphen durch verengte Eager-Regionen, was die Stabilität und Geschwindigkeit erhöht. Für Nutzer von AMD-GPUs ist die Freigabe von ROCm für die Architekturen gfx11 und gfx950 ein entscheidender Schritt, um vLLM auf einer breiteren Hardwarebasis zugänglich zu machen. Auch Kimi-K3 profitiert nun von der ROCm-Unterstützung durch den neuen V2 Model Runner.

Bedeutung für die KI-Branche

Die Veröffentlichung von vLLM v0.28.0 unterstreicht den Trend zur hochgradigen Spezialisierung von Inferenz-Engines auf spezifische Modellarchitekturen wie Kimi-K3 und DeepSeek V4. Durch die drastische Reduzierung des Speicherbedarfs (17 GiB Ersparnis) und die Beschleunigung kritischer Kernel-Operationen wird die Schwelle für den wirtschaftlichen Betrieb extrem großer Sprachmodelle gesenkt.

Besonders die Fortschritte im Bereich des spekulativen Decodings und der adaptiven Token-Budgets zeigen, dass die Branche verstärkt an der Reduzierung von Latenzzeiten arbeitet, um Echtzeitanwendungen zu ermöglichen. Die erweiterte Unterstützung für AMD ROCm signalisiert zudem eine zunehmende Diversifizierung der Hardware-Landschaft, weg von einer rein NVIDIA-zentrierten Infrastruktur, was den Wettbewerb und die Innovationskraft im Bereich der KI-Inferenz fördern dürfte.

Häufig gestellte Fragen

Welche konkreten Vorteile bietet das Update für Kimi-K3 Nutzer?

Nutzer von Kimi-K3 profitieren von einer massiv verbesserten Performance durch neue Kernel-Optimierungen (FlashKDA) und eine Reduzierung der Latenz (TTFT) um bis zu 60 %. Zudem sinkt der Hardware-Bedarf durch eine Speicherersparnis von 17 GiB pro GPU erheblich.

Was bedeutet die Unterstützung von Sparse MLA für DeepSeek V4?

Sparse MLA ermöglicht eine effizientere Aufmerksamkeitsberechnung im Modell. In vLLM v0.28.0 ist diese Funktion nun vollständig für verschiedene Decoding-Szenarien integriert, was die Inferenzgeschwindigkeit von DeepSeek V4 Modellen deutlich erhöht.

Welche AMD-Grafikkarten werden nun besser unterstützt?

Mit dem neuen Release wurde die ROCm-Unterstützung speziell für die Architekturen gfx11 und gfx950 erweitert. Zudem ermöglicht der V2 Model Runner nun auch die Ausführung von Kimi-K3 auf AMD-Hardware.

Ähnliche Nachrichten

Spanisches KI-Unternehmen Magnific veröffentlicht neues Bildmodell Magnific One für Marken auf allen bezahlten Plattformen
Produktstart

Spanisches KI-Unternehmen Magnific veröffentlicht neues Bildmodell Magnific One für Marken auf allen bezahlten Plattformen

Das spanische Unternehmen Magnific hat die Einführung seines neuen KI-Bildmodells mit dem Namen Magnific One bekannt gegeben, das sich speziell an Marken richtet. Der Dienst wird über verschiedene Schnittstellen und Endgeräte bereitgestellt: Nutzer können über das Web, Desktop-Anwendungen, mobile Endgeräte sowie über Magnific MCP auf das System zugreifen. Das Modell steht allen Kunden zur Verfügung, die ein kostenpflichtiges Abonnement bei Magnific abgeschlossen haben. Die Berichterstattung von Tech in Asia hebt hervor, dass die spanische KI-Schmiede damit ihr Angebot im Bereich der generativen Bildtechnologie erweitert und gezielt kommerzielle Marken adressiert. Mit der Veröffentlichung auf mehreren Plattformen stellt der Anbieter sicher, dass Abonnenten flexibel über verschiedene Arbeitsumgebungen hinweg auf die neuen generativen Funktionen zugreifen können.

Produktstart

Pollo AI setzt auf OpenAI: Erstellung von Bildern und kinoreifen Videokampagnen mit neuen GPT-Modellen

Laut einem Bericht des OpenAI Blogs setzt Pollo AI auf künstliche Intelligenz von OpenAI, um kreative Ideen in Kampagnen zu transformieren. Auf Basis der Modelle GPT-5.6, GPT-6 Astra sowie GPT-Image-2.5 unterstützt Pollo AI Kreative dabei, mutige Vorstellungen in detaillierte Bildwelten und kinoreife Videowerbung zu verwandeln. Die Plattform fungiert als kreatives Werkzeug, das den Schritt von der ersten Idee bis zur Realisierung von Medieninhalten abbildet. Durch den kombinierten Einsatz von Text- und Bildmodellen wird verdeutlicht, wie moderne KI-Systeme in der Werbeproduktion Anwendung finden. Die Meldung hebt hervor, dass die genannten OpenAI-Technologien spezifisch darauf ausgerichtet sind, visuelle Details und cineastische Videoformate für werbliche Zwecke zu ermöglichen.

ClawCall: Einblick in das neue Produkt auf Product Hunt von Panshul Jindal
Produktstart

ClawCall: Einblick in das neue Produkt auf Product Hunt von Panshul Jindal

ClawCall wurde am 8. Oktober 2026 von Panshul Jindal auf der Plattform Product Hunt veröffentlicht. Als neues Produkt zieht es die Aufmerksamkeit von Beobachtern und Interessierten im Bereich der Technologie- und Softwarelandschaft auf sich. Der folgende Artikel beleuchtet die spärlich vorhandenen offiziellen Details zu ClawCall, analysiert die verfügbaren Metadaten der Veröffentlichung und ordnet das Produkt im Rahmen der aktuellen Produktlaunches ein. Da keine weiteren inhaltlichen Beschreibungen vorliegen, konzentriert sich die Betrachtung strikt auf die bekannten Rahmendaten der Erstveröffentlichung.