Der Booster fürs Flaggschiff: Gemma 4 31B mit MTP-Drafter
Executive Summary
Gemma 4 31B gehört zu den großen Modellen in unserer lokalen NOVA-Instanz. Ein passender MTP-Drafter kann die Textausgabe beschleunigen: Er schlägt mehrere nächste Textbausteine vor, die das Hauptmodell gemeinsam prüft. Die Verantwortung für die Antwort bleibt beim Hauptmodell.
Für Unternehmen ist das eine praktische Frage: Wie lässt sich eine anspruchsvolle lokale KI reaktionsfreudiger machen? Schnellere Textausgabe kann die Arbeit mit einem Wissensassistenten angenehmer machen und Wartezeiten in mehrstufigen Abläufen verkürzen.
In unserer aktuellen Ollama-Konfiguration ist ein Drafter hinterlegt. Wie viel er auf der Windows-Workstation mit einer RTX 5090 und 32 GB VRAM tatsächlich bringt, muss ein Vergleich zeigen. Einen festen Geschwindigkeitsgewinn versprechen wir deshalb noch nicht.
Wenn das stärkste Modell plötzlich Flügel bekommt
Mit Gemma 4 auf NOVA haben wir bereits gezeigt, warum uns lokal betreibbare Modelle beschäftigen. Zuletzt kam Gemma 4 12B als Familienzuwachs dazu. Jetzt schauen wir wieder auf das größere Modell: Gemma 4 31B, eines unserer Flaggschiffe für anspruchsvolle Aufgaben.
Eine gute Antwort ist viel wert. Aber kennen Sie diesen Moment, wenn eine KI schon mit dem Schreiben begonnen hat und Sie trotzdem auf den nächsten Absatz warten? Gerade bei längeren Antworten wird Geschwindigkeit plötzlich sehr konkret. Nicht als Zahl auf einem Datenblatt, sondern als kleine Unterbrechung im eigenen Arbeitsfluss.
Was wäre, wenn das große Modell Hilfe bekäme, ohne die Entscheidung über seine Antwort abzugeben? Genau darum geht es beim MTP-Drafter. Der »Booster« ist hier eine Form von Arbeitsteilung.
Ein Entwurf voraus, die Prüfung beim Hauptmodell
MTP steht für »Multi-Token Prediction«. Ein Token ist ein Textbaustein; das kann ein Wortteil, ein Zeichen oder auch ein ganzes Wort sein. Bei der üblichen Textgenerierung entsteht die Ausgabe Schritt für Schritt, jeweils abhängig vom bisher geschriebenen Text.
Beim sogenannten Speculative Decoding schlägt ein kleineres Draft-Modell mehrere mögliche nächste Token vor. Gemma 4 31B prüft diese Vorschläge gemeinsam. Passende Fortsetzungen können übernommen werden. Wo ein Vorschlag nicht passt, entscheidet das Hauptmodell über die Fortsetzung und das Drafting setzt dort wieder an.
Das erinnert ein wenig an eine Redaktion: Jemand bereitet einen Entwurf vor, die verantwortliche Person prüft ihn. Der Unterschied ist natürlich, dass hier keine Menschen zusammenarbeiten, sondern Rechenverfahren.
Das Verfahren ist darauf ausgelegt, die Qualität des Hauptmodells zu erhalten. Daraus folgt aber nicht, dass zwei zufällig erzeugte Antworten immer Wort für Wort identisch aussehen. Und der Drafter macht aus einer falschen Antwort keine richtige: Quellenbezug und fachliche Prüfung bleiben nötig.
Unsere Bühne: Windows und eine RTX 5090
Wir arbeiten mit einer lokalen Windows-Umgebung und einer NVIDIA GeForce RTX 5090 mit 32 GB VRAM. Apple Silicon ist ebenfalls eine interessante Plattform. Ein dort gemessener Geschwindigkeitsgewinn lässt sich aber nicht einfach auf unsere Grafikkarte übertragen.
Wie viel Drafting bringt, hängt unter anderem von der Laufzeitumgebung und davon ab, wie oft das Hauptmodell die Vorschläge akzeptiert. Bei vorhersehbaren Textfortsetzungen kann das günstiger ausfallen als bei Aufgaben, deren nächste Schritte schwerer vorwegzunehmen sind.
Auch der Speicher verdient Aufmerksamkeit. Modellgewichte, Gesprächskontext und Laufzeit benötigen Platz. Die Größe der heruntergeladenen Datei verrät deshalb noch nicht, wie viel VRAM ein längeres Gespräch oder mehrere gleichzeitige Anfragen belegen.
Für unseren Vergleich wollen wir dieselben Aufgaben mit und ohne Drafting ausführen. Uns interessieren die Zeit bis zur ersten Antwort, die Geschwindigkeit der weiteren Ausgabe und der Speicherbedarf bei festgelegter Kontextlänge. So wird aus dem Wort »schneller« eine Aussage, die zu unserem tatsächlichen Betrieb passt.
Den Drafter nutzen, ohne ein zweites Flaggschiff anzulegen
In der von uns geprüften Ollama-Ausgabe von gemma4:31b ist bereits ein passender Drafter hinterlegt. Im Modelfile stehen eine DRAFT-Referenz und draft_num_predict 3. Die Drei bezeichnet die eingestellte Obergrenze für vorgeschlagene Token je Schritt; sie bedeutet keine dreifache Geschwindigkeit.
Ein eigener Modellname wie gemma4-fast ist dafür nicht nötig. Eine Kopie des aktuellen Modells fügt keinen weiteren Beschleuniger hinzu. Wer Ollama bereits verwendet, kann zunächst das Modell aktualisieren und seine Konfiguration ansehen:
ollama pull gemma4:31b
ollama show --modelfile gemma4:31b
ollama run gemma4:31b
Ob die jeweilige Ausgabe und Laufzeit das Drafting tatsächlich nutzen, gehört zur Prüfung. Die Einstellung num_ctx 8192 legt dagegen die Kontextgröße fest. Sie ist kein Schalter zum Aktivieren eines Drafters.
Was bringt das unseren Kunden?
Für NOVA zählt am Ende, wie sich die Arbeit mit der KI anfühlt. Ein Wissensassistent soll Fragen zu eigenen Unterlagen verständlich beantworten. Wenn die Textausgabe schneller wird, kommen Rückfragen und der nächste Arbeitsschritt früher an die Reihe. Bei Abläufen mit mehreren Modellaufrufen kann sich der Nutzen summieren.
Der Drafter beschleunigt allerdings nicht automatisch das Auffinden von Dokumenten oder den Aufruf eines anderen Werkzeugs. Wir betrachten deshalb den gesamten Ablauf und wählen das Modell passend zur Aufgabe. Manchmal ist das große Flaggschiff richtig, manchmal reicht ein kompakteres Modell.
Sie möchten lokale KI mit Ihren eigenen Unterlagen einsetzen? Wir besprechen mit Ihnen, welche Aufgaben NOVA in Ihrem Unternehmen übernehmen soll und wie die vorhandene Hardware dazu passt.
Welche lokale KI passt zu Ihrem Unternehmen?
Autor
Prof. Dr. Alexander Lutz, Professor für Big Data und KI an der FOM München, Doktor der Humangenetik und Anthropologie, ehemaliger Onlinespiele-Designer und natürlich Gründer und Inhaber der Agentur Die NEOs. Neben den Themen der künstlichen Intelligenz und deren Einsatzmöglichkeiten in der Praxis konzentriert sich Alexander auf die Kundenkommunikation. Neue Problemfelder oder technische Innovationen bereitet er so auf, dass der Nutzen für unsere Kunden deutlich wird. Er schläft zeitverantwortlich und agiert schnell, sein Motto: »Tue es, oder tue es nicht. Es gibt kein Versuchen.«




