Zurück zur Übersicht
vLLM v0.28.0 Release: Umfangreiche Performance-Optimierungen für Kimi-K3 und volle Unterstützung für DeepSeek V4
ProduktstartvLLMOpen SourceKünstliche Intelligenz

vLLM v0.28.0 Release: Umfangreiche Performance-Optimierungen für Kimi-K3 und volle Unterstützung für DeepSeek V4

Das neueste Update v0.28.0 des vLLM-Projekts markiert einen bedeutenden Fortschritt in der Effizienz von Large Language Models. Mit insgesamt 584 Commits von 270 Mitwirkenden konzentriert sich diese Version primär auf die Optimierung des Kimi-K3-Modells sowie die Integration von DeepSeek V4. Zu den Highlights gehören die Einführung von Decode Context Parallel (DCP), signifikante Kernel-Beschleunigungen durch fused FlashKDA und eine Reduzierung des Speicherverbrauchs um bis zu 17 GiB pro GPU durch Shared-Expert Sharding. Darüber hinaus bietet das Release eine verbesserte Unterstützung für AMD-Hardware über ROCm, insbesondere für die Architekturen gfx11 und gfx950. Diese Neuerungen versprechen eine drastisch verbesserte Time-to-First-Token (TTFT) und eine effizientere Nutzung moderner GPU-Ressourcen in Produktionsumgebungen.

Hacker News

Die wichtigsten Punkte

  • Massive Kimi-K3 Optimierung: Einführung von Decode Context Parallel (DCP) und fused FlashKDA-Kernels für signifikante Performance-Steigerungen.
  • DeepSeek V4 Integration: Volle End-to-End-Unterstützung für Sparse MLA, inklusive Optimierungen für spekulatives Decoding und AMD-Hardware.
  • Effizienzgewinne: Bis zu 17 GiB Speicherersparnis pro GPU durch Shared-Expert Sharding und eine um 60 % verbesserte Time-to-First-Token (TTFT).
  • Hardware-Erweiterung: Verbesserte Unterstützung für AMD ROCm, einschließlich der Architekturen gfx11 und gfx950 sowie des V2 Model Runners.
  • Community-getriebene Entwicklung: Das Release umfasst 584 Commits von 270 Mitwirkenden, darunter 76 neue Beitragende.

Analyse

Der Kimi-K3 Performance-Schub

Das Release v0.28.0 von vLLM legt einen starken Fokus auf die Optimierung des Kimi-K3-Modells über den gesamten Software-Stack hinweg. Ein zentrales Element dieser Bemühungen ist die Unterstützung von Decode Context Parallel (DCP), die eine effizientere parallele Verarbeitung während der Dekodierungsphase ermöglicht. Ergänzt wird dies durch die Einführung von fused FlashKDA-Kernels sowohl für die Dekodierung als auch für den Prefill-Prozess, was die Recheneffizienz direkt steigert.

Ein weiterer technischer Meilenstein für Kimi-K3 ist die Implementierung der SiTU-Aktivierung für MegaMoE sowie GEMM-RS für Sequenz-Parallelismus. Besonders hervorzuheben ist die Optimierung der All-Gather-Operationen, die eine Kernel-Beschleunigung um das 1,5- bis 3-fache erzielen. Für den praktischen Einsatz in Rechenzentren ist zudem das Shared-Expert Sharding von großer Bedeutung, da es eine Einsparung von etwa 17 GiB Speicher pro GPU ermöglicht. In Kombination mit einem adaptiven spekulativen Token-Budget führt dies zu einer Reduzierung der Time-to-First-Token (TTFT) um etwa 60 % bei der Nutzung von DSpark.

DeepSeek V4 und AMD-Integration

Die Unterstützung für DeepSeek V4 wurde in dieser Version massiv ausgebaut. Die Sparse MLA (Multi-Head Latent Attention) funktioniert nun End-to-End für einfaches Decoding, Multi-Token Prediction (MTP) und DSpark spekulatives Decoding. Um die Leistung auf AMD-Hardware zu maximieren, wurde die Unterstützung für AMD Quark NVFP4 integriert.

Zusätzlich wurden spezifische Kernel-Optimierungen für Sparse Top-k Metadaten vorgenommen, um die Effizienz bei Modellen mit Sparse-Strukturen zu erhöhen. vLLM v0.28.0 verbessert zudem die Handhabung von CUDA-Graphen durch verengte Eager-Regionen, was die Stabilität und Geschwindigkeit erhöht. Für Nutzer von AMD-GPUs ist die Freigabe von ROCm für die Architekturen gfx11 und gfx950 ein entscheidender Schritt, um vLLM auf einer breiteren Hardwarebasis zugänglich zu machen. Auch Kimi-K3 profitiert nun von der ROCm-Unterstützung durch den neuen V2 Model Runner.

Bedeutung für die KI-Branche

Die Veröffentlichung von vLLM v0.28.0 unterstreicht den Trend zur hochgradigen Spezialisierung von Inferenz-Engines auf spezifische Modellarchitekturen wie Kimi-K3 und DeepSeek V4. Durch die drastische Reduzierung des Speicherbedarfs (17 GiB Ersparnis) und die Beschleunigung kritischer Kernel-Operationen wird die Schwelle für den wirtschaftlichen Betrieb extrem großer Sprachmodelle gesenkt.

Besonders die Fortschritte im Bereich des spekulativen Decodings und der adaptiven Token-Budgets zeigen, dass die Branche verstärkt an der Reduzierung von Latenzzeiten arbeitet, um Echtzeitanwendungen zu ermöglichen. Die erweiterte Unterstützung für AMD ROCm signalisiert zudem eine zunehmende Diversifizierung der Hardware-Landschaft, weg von einer rein NVIDIA-zentrierten Infrastruktur, was den Wettbewerb und die Innovationskraft im Bereich der KI-Inferenz fördern dürfte.

Häufig gestellte Fragen

Welche konkreten Vorteile bietet das Update für Kimi-K3 Nutzer?

Nutzer von Kimi-K3 profitieren von einer massiv verbesserten Performance durch neue Kernel-Optimierungen (FlashKDA) und eine Reduzierung der Latenz (TTFT) um bis zu 60 %. Zudem sinkt der Hardware-Bedarf durch eine Speicherersparnis von 17 GiB pro GPU erheblich.

Was bedeutet die Unterstützung von Sparse MLA für DeepSeek V4?

Sparse MLA ermöglicht eine effizientere Aufmerksamkeitsberechnung im Modell. In vLLM v0.28.0 ist diese Funktion nun vollständig für verschiedene Decoding-Szenarien integriert, was die Inferenzgeschwindigkeit von DeepSeek V4 Modellen deutlich erhöht.

Welche AMD-Grafikkarten werden nun besser unterstützt?

Mit dem neuen Release wurde die ROCm-Unterstützung speziell für die Architekturen gfx11 und gfx950 erweitert. Zudem ermöglicht der V2 Model Runner nun auch die Ausführung von Kimi-K3 auf AMD-Hardware.

Ähnliche Nachrichten

Claude Code von anthropics: Neues Agent-Programmierwerkzeug für das Terminal unterstützt Entwickler bei alltäglichen Aufgaben
Produktstart

Claude Code von anthropics: Neues Agent-Programmierwerkzeug für das Terminal unterstützt Entwickler bei alltäglichen Aufgaben

Das Unternehmen anthropics hat mit Claude Code ein neues Agent-Programmierwerkzeug vorgestellt, das direkt und dauerhaft im Terminal arbeitet. Das Tool wurde entwickelt, um Softwareentwickler bei der täglichen Programmierarbeit zu unterstützen und Entwicklungsabläufe spürbar zu beschleunigen. Zu den zentralen Fähigkeiten von Claude Code gehört das tiefgreifende Verständnis der jeweiligen Codebasis. Auf Grundlage einfacher Befehle in natürlicher Sprache kann die Anwendung alltägliche Routineaufgaben selbstständig ausführen, hochkomplexe Programmteile verständlich erklären und gängige Git-Workflows steuern. Durch die nahtlose Integration in die gewohnte Terminalumgebung ermöglicht Claude Code Entwicklern, Programmierarbeiten schneller und fokussierter durchzuführen. Das von anthropics bereitgestellte Werkzeug verbindet die Verarbeitung natürlicher Sprache mit konkreten Entwicklungsaufgaben und erleichtert dadurch sowohl die Codeerklärung als auch das Management von Versionskontrollsystemen direkt an der Befehlszeile.

WhaleRead auf Product Hunt: Eine detaillierte redaktionelle Bestandsaufnahme des neuen Software-Eintrags von Autor New User
Produktstart

WhaleRead auf Product Hunt: Eine detaillierte redaktionelle Bestandsaufnahme des neuen Software-Eintrags von Autor New User

Am 18. September 2026 wurde auf der Plattform Product Hunt ein neuer Eintrag unter dem Titel WhaleRead veröffentlicht. Als einreichende Person oder Profil wird der Benutzer New User genannt. Die vorliegende Originalmeldung beschränkt sich ausschließlich auf diese Basisdaten sowie die zugehörige Webadresse und enthält im Inhaltsbereich den Vermerk, dass kein weiterführender Text vorliegt. Aus redaktioneller Sicht stellt dieser Beitrag eine strukturierte Erfassung der bekannten Metadaten dar, ohne spekulative Funktionsbeschreibungen oder nicht verifizierte Produktmerkmale hinzuzufügen. Der folgende Bericht analysiert die vorliegende Dokumentationslage, fasst die belegbaren Kernfakten der Meldung zusammen und beleuchtet die Bedeutung einer transparenten und quellengetreuen Datenverarbeitung bei neu gelisteten Technologieprojekten im aktuellen Branchenumfeld.

Produktstart

Polishory auf Product Hunt veröffentlicht: Analyse des neuen Produkteintrags von Entwickler HYEON GYE YONG

Am 18. September 2026 wurde auf der Technologieplattform Product Hunt ein neuer Produkteintrag unter der Bezeichnung Polishory veröffentlicht. Als verantwortlicher Urheber wird HYEON GYE YONG genannt. Die bereitgestellte Originalmeldung umfasst neben den grundlegenden Metadaten wie dem Veröffentlichungszeitpunkt, der Webadresse und der Autorenangabe keinen weiteren Textinhalt bezüglich konkreter Funktionen oder technischer Spezifikationen. Der vorliegende Beitrag analysiert die dokumentierten Rahmendaten dieser Neueinreichung sachlich und strukturiert für interessierte Leser. Da der Ausgangstext keine weitergehenden Ausführungen zu Leistungsumfang, Zielgruppe oder Systemarchitektur bereithält, bleibt diese redaktionelle Zusammenfassung strikt bei den eindeutig belegten Fakten der Originalquelle. Auf spekulative Ergänzungen zum Projektumfeld wird bewusst und konsequent verzichtet, um höchste journalistische Genauigkeit zu gewährleisten.