Der Boos­ter fürs Flagg­schiff: Gem­ma 4 31B mit MTP-Drafter

Exe­cu­ti­ve Summary

Gem­ma 4 31B gehört zu den gro­ßen Model­len in unse­rer loka­len NOVA-Instanz. Ein pas­sen­der MTP-Draf­ter kann die Text­aus­ga­be beschleu­ni­gen: Er schlägt meh­re­re nächs­te Text­bau­stei­ne vor, die das Haupt­mo­dell gemein­sam prüft. Die Ver­ant­wor­tung für die Ant­wort bleibt beim Hauptmodell.

Für Unter­neh­men ist das eine prak­ti­sche Fra­ge: Wie lässt sich eine anspruchs­vol­le loka­le KI reak­ti­ons­freu­di­ger machen? Schnel­le­re Text­aus­ga­be kann die Arbeit mit einem Wis­sen­sas­sis­ten­ten ange­neh­mer machen und War­te­zei­ten in mehr­stu­fi­gen Abläu­fen verkürzen.

In unse­rer aktu­el­len Oll­ama-Kon­fi­gu­ra­ti­on ist ein Draf­ter hin­ter­legt. Wie viel er auf der Win­dows-Work­sta­tion mit einer RTX 5090 und 32 GB VRAM tat­säch­lich bringt, muss ein Ver­gleich zei­gen. Einen fes­ten Geschwin­dig­keits­ge­winn ver­spre­chen wir des­halb noch nicht.

KI-generiert

KI-generierte Illustration: Ein großer Roboter prüft Textkarten, die ihm ein kleiner Drafter-Roboter an einem Bürotisch reicht.
Reddit Reddit

Wenn das stärks­te Modell plötz­lich Flü­gel bekommt

Mit Gem­ma 4 auf NOVA haben wir bereits gezeigt, war­um uns lokal betreib­ba­re Model­le beschäf­ti­gen. Zuletzt kam Gem­ma 4 12B als Fami­li­en­zu­wachs dazu. Jetzt schau­en wir wie­der auf das grö­ße­re Modell: Gem­ma 4 31B, eines unse­rer Flagg­schif­fe für anspruchs­vol­le Aufgaben.

Eine gute Ant­wort ist viel wert. Aber ken­nen Sie die­sen Moment, wenn eine KI schon mit dem Schrei­ben begon­nen hat und Sie trotz­dem auf den nächs­ten Absatz war­ten? Gera­de bei län­ge­ren Ant­wor­ten wird Geschwin­dig­keit plötz­lich sehr kon­kret. Nicht als Zahl auf einem Daten­blatt, son­dern als klei­ne Unter­bre­chung im eige­nen Arbeitsfluss.

Was wäre, wenn das gro­ße Modell Hil­fe bekä­me, ohne die Ent­schei­dung über sei­ne Ant­wort abzu­ge­ben? Genau dar­um geht es beim MTP-Draf­ter. Der »Boos­ter« ist hier eine Form von Arbeitsteilung.

Ein Ent­wurf vor­aus, die Prü­fung beim Hauptmodell

MTP steht für »Mul­ti-Token Pre­dic­tion«. Ein Token ist ein Text­bau­stein; das kann ein Wort­teil, ein Zei­chen oder auch ein gan­zes Wort sein. Bei der übli­chen Text­ge­ne­rie­rung ent­steht die Aus­ga­be Schritt für Schritt, jeweils abhän­gig vom bis­her geschrie­be­nen Text.

Beim soge­nann­ten Spe­cu­la­ti­ve Deco­ding schlägt ein klei­ne­res Draft-Modell meh­re­re mög­li­che nächs­te Token vor. Gem­ma 4 31B prüft die­se Vor­schlä­ge gemein­sam. Pas­sen­de Fort­set­zun­gen kön­nen über­nom­men wer­den. Wo ein Vor­schlag nicht passt, ent­schei­det das Haupt­mo­dell über die Fort­set­zung und das Draf­ting setzt dort wie­der an.

Das erin­nert ein wenig an eine Redak­ti­on: Jemand berei­tet einen Ent­wurf vor, die ver­ant­wort­li­che Per­son prüft ihn. Der Unter­schied ist natür­lich, dass hier kei­ne Men­schen zusam­men­ar­bei­ten, son­dern Rechenverfahren.

Das Ver­fah­ren ist dar­auf aus­ge­legt, die Qua­li­tät des Haupt­mo­dells zu erhal­ten. Dar­aus folgt aber nicht, dass zwei zufäl­lig erzeug­te Ant­wor­ten immer Wort für Wort iden­tisch aus­se­hen. Und der Draf­ter macht aus einer fal­schen Ant­wort kei­ne rich­ti­ge: Quel­len­be­zug und fach­li­che Prü­fung blei­ben nötig.

Unse­re Büh­ne: Win­dows und eine RTX 5090

Wir arbei­ten mit einer loka­len Win­dows-Umge­bung und einer NVIDIA GeForce RTX 5090 mit 32 GB VRAM. Apple Sili­con ist eben­falls eine inter­es­san­te Platt­form. Ein dort gemes­se­ner Geschwin­dig­keits­ge­winn lässt sich aber nicht ein­fach auf unse­re Gra­fik­kar­te übertragen.

Wie viel Draf­ting bringt, hängt unter ande­rem von der Lauf­zeit­um­ge­bung und davon ab, wie oft das Haupt­mo­dell die Vor­schlä­ge akzep­tiert. Bei vor­her­seh­ba­ren Text­fort­set­zun­gen kann das güns­ti­ger aus­fal­len als bei Auf­ga­ben, deren nächs­te Schrit­te schwe­rer vor­weg­zu­neh­men sind.

Auch der Spei­cher ver­dient Auf­merk­sam­keit. Modell­ge­wich­te, Gesprächs­kon­text und Lauf­zeit benö­ti­gen Platz. Die Grö­ße der her­un­ter­ge­la­de­nen Datei ver­rät des­halb noch nicht, wie viel VRAM ein län­ge­res Gespräch oder meh­re­re gleich­zei­ti­ge Anfra­gen belegen.

Für unse­ren Ver­gleich wol­len wir die­sel­ben Auf­ga­ben mit und ohne Draf­ting aus­füh­ren. Uns inter­es­sie­ren die Zeit bis zur ers­ten Ant­wort, die Geschwin­dig­keit der wei­te­ren Aus­ga­be und der Spei­cher­be­darf bei fest­ge­leg­ter Kon­text­län­ge. So wird aus dem Wort »schnel­ler« eine Aus­sa­ge, die zu unse­rem tat­säch­li­chen Betrieb passt.

Den Draf­ter nut­zen, ohne ein zwei­tes Flagg­schiff anzulegen

In der von uns geprüf­ten Oll­ama-Aus­ga­be von gemma4:31b ist bereits ein pas­sen­der Draf­ter hin­ter­legt. Im Model­fi­le ste­hen eine DRAFT-Refe­renz und draft_num_predict 3. Die Drei bezeich­net die ein­ge­stell­te Ober­gren­ze für vor­ge­schla­ge­ne Token je Schritt; sie bedeu­tet kei­ne drei­fa­che Geschwindigkeit.

Ein eige­ner Modell­na­me wie gemma4-fast ist dafür nicht nötig. Eine Kopie des aktu­el­len Modells fügt kei­nen wei­te­ren Beschleu­ni­ger hin­zu. Wer Oll­ama bereits ver­wen­det, kann zunächst das Modell aktua­li­sie­ren und sei­ne Kon­fi­gu­ra­ti­on ansehen:

ollama pull gemma4:31b
ollama show --modelfile gemma4:31b
ollama run gemma4:31b

Ob die jewei­li­ge Aus­ga­be und Lauf­zeit das Draf­ting tat­säch­lich nut­zen, gehört zur Prü­fung. Die Ein­stel­lung num_ctx 8192 legt dage­gen die Kon­text­grö­ße fest. Sie ist kein Schal­ter zum Akti­vie­ren eines Drafters.

Was bringt das unse­ren Kunden?

Für NOVA zählt am Ende, wie sich die Arbeit mit der KI anfühlt. Ein Wis­sen­sas­sis­tent soll Fra­gen zu eige­nen Unter­la­gen ver­ständ­lich beant­wor­ten. Wenn die Text­aus­ga­be schnel­ler wird, kom­men Rück­fra­gen und der nächs­te Arbeits­schritt frü­her an die Rei­he. Bei Abläu­fen mit meh­re­ren Modell­auf­ru­fen kann sich der Nut­zen summieren.

Der Draf­ter beschleu­nigt aller­dings nicht auto­ma­tisch das Auf­fin­den von Doku­men­ten oder den Auf­ruf eines ande­ren Werk­zeugs. Wir betrach­ten des­halb den gesam­ten Ablauf und wäh­len das Modell pas­send zur Auf­ga­be. Manch­mal ist das gro­ße Flagg­schiff rich­tig, manch­mal reicht ein kom­pak­te­res Modell.

Sie möch­ten loka­le KI mit Ihren eige­nen Unter­la­gen ein­set­zen? Wir bespre­chen mit Ihnen, wel­che Auf­ga­ben NOVA in Ihrem Unter­neh­men über­neh­men soll und wie die vor­han­de­ne Hard­ware dazu passt.

Wel­che loka­le KI passt zu Ihrem Unternehmen?

Die­ses Feld dient zur Vali­die­rung und soll­te nicht ver­än­dert werden.
Name(erfor­der­lich)
E‑Mail-Adres­se(erfor­der­lich)
Wofür möch­ten Sie das loka­le KI Öko­sys­tem ein­set­zen? Haben Sie bereits bestimm­te gro­ße Sprach­mo­del­le (LLMs) im Blick, wel­che Sie im Pro­jekt ver­wen­den möchten?
Die fol­gen­den Fel­der wer­den über den Kon­fi­gu­ra­tor auf der Sei­te Nova Kon­fi­gu­ra­tor befüllt. Bit­te besu­chen Sie den Kon­fi­gu­ra­tor und tref­fen dort Ihre Ent­schei­dung. Die­se Fel­der sind schreibgeschützt.
Stan­dard RAM oder erwei­ter­ter RAM?
Wie vie­le vCPUs sind gewünscht?
Wie viel RAM wird gewünscht?
Loka­ler Spei­cher­platz für Nova
Laden Sie ger­ne rele­van­te Doku­men­te mit hoch, Bil­der oder Datei­en (optio­nal)
Zie­he Datei­en hier her oder 
Max. Datei­grö­ße: 12 MB.

    Professor Doktor Alexander Lutz

    Autor

    Prof. Dr. Alex­an­der Lutz, Pro­fes­sor für Big Data und KI an der FOM Mün­chen, Dok­tor der Human­ge­ne­tik und Anthro­po­lo­gie, ehe­ma­li­ger Online­spie­le-Desi­gner und natür­lich Grün­der und Inha­ber der Agen­tur Die NEOs. Neben den The­men der künst­li­chen Intel­li­genz und deren Ein­satz­mög­lich­kei­ten in der Pra­xis kon­zen­triert sich Alex­an­der auf die Kun­den­kom­mu­ni­ka­ti­on. Neue Pro­blem­fel­der oder tech­ni­sche Inno­va­tio­nen berei­tet er so auf, dass der Nut­zen für unse­re Kun­den deut­lich wird. Er schläft zeit­ver­ant­wort­lich und agiert schnell, sein Mot­to: »Tue es, oder tue es nicht. Es gibt kein Ver­su­chen.«