NOVA und Nemo­tron 3.5 Light­ning: Ein Modell, das arbei­ten will

Exe­cu­ti­ve Summary

NVIDIA Nemo­tron 3.5 Light­ning setzt auf eine für loka­le Agen­ten rele­van­te Arbeits­tei­lung: Rund 30 Mil­li­ar­den Para­me­ter stel­len Modell­ka­pa­zi­tät bereit, etwa 3 Mil­li­ar­den davon sind pro Token aktiv. Der Her­stel­ler ver­bin­det Mix­tu­re of Experts mit Mamba‑2 und Atten­ti­on und rich­tet das Modell auf häu­fi­ge Tool-Auf­ru­fe und struk­tu­rier­te Arbeits­schrit­te aus.

Für NOVA sehen wir dar­in einen Kan­di­da­ten für die Aus­füh­rungs­schicht: Infor­ma­tio­nen zuord­nen, Rück­ga­ben prü­fen und den nächs­ten Schritt vor­be­rei­ten. Unse­re Win­dows-Umge­bung mit einer RTX 5090 und 32 GB VRAM ist der vor­ge­se­he­ne Prüf­stand. Ob eine kon­kre­te Quan­ti­sie­rung mit dem benö­tig­ten Kon­text voll­stän­dig im Gra­fik­spei­cher läuft, wird dort gemessen.

Der Nut­zen für Unter­neh­men ent­steht im gesam­ten Ablauf. Des­halb betrach­ten wir Light­ning zusam­men mit NOVA-Schnitt­stel­len und einer pas­sen­den Modell­aus­wahl. Her­stel­ler­an­ga­ben zur Geschwin­dig­keit sind dabei kei­ne Mess­ergeb­nis­se unse­rer Installation.

KI-generiert

NOVA verteilt Arbeitsaufträge an drei leuchtende Komponenten ihrer Wissensmaschine
Reddit Reddit

Nemo­tron will arbei­ten. Und zwar schnell.

Die Open-Weight-Welt macht gera­de kei­ne Pau­se. Kaum haben wir mit Gem­ma 4 gese­hen, wie viel Intel­li­genz inzwi­schen in lokal beherrsch­ba­re Modell­grö­ßen passt, legt NVIDIA mit einem Modell nach, das einen ande­ren Schwer­punkt setzt.

Nemo­tron 3.5 Light­ning will arbei­ten. Und zwar schnell.

Das ist für NOVA inter­es­sant. Denn bei pro­duk­ti­ver loka­ler KI zählt nicht nur, wie gut ein Modell grund­sätz­lich ant­wor­ten kann. Min­des­tens eben­so wich­tig ist die Fra­ge: Wie viel die­ser Leis­tung bekom­men wir pro Sekun­de, pro Watt und pro ver­füg­ba­rer GPU tat­säch­lich in einen Unternehmensprozess?

Ein Agent ver­bringt einen gro­ßen Teil sei­ner Zeit mit ziem­lich hand­fes­ten Auf­ga­ben. Er wählt ein Werk­zeug aus, ver­ar­bei­tet des­sen Rück­ga­be und berei­tet Infor­ma­tio­nen für das nächs­te Sys­tem vor. Gera­de wenn sol­che Schrit­te häu­fig auf­ein­an­der fol­gen, ent­schei­det ihre Dau­er dar­über, ob ein Ablauf sich ange­nehm bedie­nen lässt. Genau an die­ser Stel­le wol­len wir Light­ning prüfen.

War­um wenig akti­ve Para­me­ter nicht wenig Spei­cher bedeuten

Die tech­ni­sche Vor­stel­lung von NVIDIA beschreibt Light­ning als hybri­des Modell aus Mamba‑2, Mix­tu­re of Experts und Atten­ti­on. Die gerin­ge­re akti­ve Para­me­ter­zahl kann den Rechen­auf­wand pro Token begren­zen. Die übri­gen Exper­ten ver­schwin­den dadurch aber nicht aus dem Modell.

3 Mil­li­ar­den akti­ve Para­me­ter bedeu­ten nicht, dass nur ein 3B-Modell im Spei­cher liegt. Die gesam­te Exper­ten­struk­tur muss wei­ter ver­füg­bar sein. Die­se Tren­nung von Modell­ka­pa­zi­tät und akti­ver Rechen­last ist für unse­re Pla­nung wesent­lich: Wir rech­nen mit der tat­säch­li­chen Datei und dem Spei­cher­be­darf der Lauf­zeit, nicht mit einem ver­meint­li­chen 3B-Footprint.

Noch schnel­ler durch Mul­ti-Token Prediction?

Light­ning wur­de mit Mul­ti-Token Pre­dic­tion trai­niert. NVIDIA stellt außer­dem Ver­fah­ren für spe­ku­la­ti­ve Deco­die­rung vor. Dabei wer­den meh­re­re mög­li­che Fort­set­zun­gen vor­ge­schla­gen und vom Ziel­mo­dell geprüft. Das kann die Aus­ga­be beschleu­ni­gen, benö­tigt aber eine pas­sen­de Imple­men­tie­rung im Inferenz-Backend.

Ein Down­load oder ein neu­er Modell­na­me akti­viert die­ses Ver­fah­ren nicht auto­ma­tisch. Für unse­re Oll­ama-Umge­bung müs­sen Modell­ar­te­fakt und unter­stütz­ter Aus­füh­rungs­pfad zusam­men­pas­sen. Den Betrieb ohne Beschleu­ni­ger mes­sen wir getrennt von einer tat­säch­lich ein­ge­rich­te­ten spe­ku­la­ti­ven Variante.

Geschwin­dig­keit allein genügt nicht

Ein sehr schnel­les Modell, des­sen Aus­ga­ben anschlie­ßend stän­dig kor­ri­giert wer­den müs­sen, macht einen Agen­ten nicht pro­duk­ti­ver. Eine struk­tu­rier­te Ant­wort muss dem ver­ein­bar­ten Sche­ma ent­spre­chen. Ein Tool-Auf­ruf muss die rich­ti­ge Funk­ti­on mit gül­ti­gen Para­me­tern ansprechen.

Nicht jede Auf­ga­be braucht das größ­te ver­füg­ba­re Modell. Sie braucht das für die­se Auf­ga­be rich­ti­ge Modell. In NOVA kann dar­aus eine gezielt ein­ge­rich­te­te Arbeits­tei­lung ent­ste­hen: ein Modell berei­tet eine anspruchs­vol­le Ana­ly­se vor, ein ande­res über­nimmt wie­der­keh­ren­de Ver­ar­bei­tungs­schrit­te. Ob Light­ning die­se Rol­le erfüllt, prü­fen wir an kon­kre­ten Aufgaben.

NOVA am Aufgabenverteiler

Stel­len wir uns einen Ser­vice­vor­gang vor. Eine Fra­ge zu einem Pro­dukt kommt an. NOVA soll das pas­sen­de frei­ge­ge­be­ne Hand­buch fin­den, eine rele­van­te Pas­sa­ge zuord­nen und einen Ant­wort­vor­schlag für das Team vor­be­rei­ten. In unse­rer Bild­welt bedient sie dafür den Auf­ga­ben­ver­tei­ler ihrer Wis­sens­ma­schi­ne. Hin­ter jedem Anschluss steckt eine fest­ge­leg­te Aufgabe.

Light­ning wäre in die­sem Sze­na­rio ein Kan­di­dat für die kur­zen, häu­fi­gen Ver­ar­bei­tungs­schrit­te. Das Modell könn­te Such­ergeb­nis­se ein­ord­nen oder Infor­ma­tio­nen in eine defi­nier­te Struk­tur brin­gen. Die Suche nach Doku­men­ten über­nimmt dabei das Wis­sens­sys­tem; das Sprach­mo­dell ersetzt nicht des­sen Index. Wie Unter­la­gen vor­be­rei­tet und gefun­den wer­den, erläu­tern wir im Bereich Wis­sen und RAG.

Und wenn der Vor­schlag zurück in ein Ser­vice­por­tal soll? Dann braucht es eine ent­wi­ckel­te Anbin­dung. Die NOVA-Inte­gra­ti­on über Schnitt­stel­len legt fest, wel­che Infor­ma­tio­nen über­ge­ben wer­den, was die Anwen­dung mit dem Ergeb­nis macht und wie sie einen fehl­ge­schla­ge­nen Schritt erkennt.

Unse­re RTX 5090 als Prüfstand

Unse­re loka­le Win­dows-Umge­bung stellt eine NVIDIA GeForce RTX 5090 mit 32 GB VRAM bereit. NVIDIA nennt die­se Kar­te als Platt­form für loka­le Light­ning-Infe­renz. Unse­re Oll­ama-Modell­lis­te weist eine rund 25 GB gro­ße Light­ning-Datei aus; die­se Datei­grö­ße ist noch kei­ne Mes­sung des gesam­ten Grafikspeicherbedarfs.

Run­time, Kon­text­spei­cher und wei­te­re Kom­po­nen­ten kom­men hin­zu. Eine gro­ße nomi­nel­le Kon­text­län­ge ist daher kei­ne Zusa­ge, dass der­sel­be Kon­text auf einer ein­zel­nen 32-GB-Kar­te nutz­bar ist. Wir begin­nen mit einem über­schau­ba­ren Kon­text und stei­gern ihn anhand der tat­säch­li­chen Aufgabe.

Für einen pro­duk­ti­ven Wis­sen­sas­sis­ten­ten ist ohne­hin sel­ten das maxi­mal mög­li­che Kon­text­fens­ter das Ziel. NOVA soll die rele­van­ten Infor­ma­tio­nen bereit­stel­len. Eine gute Aus­wahl kann weni­ger Spei­cher ver­brau­chen und zugleich bes­ser über­prüf­ba­re Ant­wor­ten ermöglichen.

Was wir mes­sen wollen

Zuerst zählt die Zeit bis zur ers­ten nutz­ba­ren Ant­wort. Danach mes­sen wir den Aus­ga­be­durch­satz und den Spit­zen­be­darf im Gra­fik­spei­cher. Für Tool-Auf­ga­ben pro­to­kol­lie­ren wir zusätz­lich, ob das Ergeb­nis gül­tig war und wie vie­le Kor­rek­tur­ver­su­che nötig wurden.

Eige­ne Tokens-pro-Sekun­de-Wer­te ver­öf­fent­li­chen wir erst nach einem repro­du­zier­ba­ren Lauf. Quan­ti­sie­rung, Backend, Prompt­län­ge, Cache und Par­al­le­li­tät gehö­ren des­halb zu jedem Mess­pro­to­koll. Eine schnel­le Her­stel­ler­de­mo ist ein Anlass zum Tes­ten; sie ersetzt die­sen Test nicht.

Eine Kom­po­nen­te für die tat­säch­li­che Aufgabe

Für NOVA sehen wir Light­ning als mög­li­ches Arbeits­pferd. Es muss dabei nicht jede Denk­auf­ga­be allein lösen. Sein Platz könn­te dort sein, wo vie­le struk­tu­rier­te Schrit­te anfal­len und eine kur­ze Ant­wort­zeit einen spür­ba­ren Unter­schied macht.

Das Auf­ga­ben­ver­tei­ler-Motiv erzählt genau die­se Idee. Es zeigt kei­ne fer­ti­ge auto­ma­ti­sche Uni­ver­sal­ma­schi­ne und kei­nen Screen­shot unse­rer Instal­la­ti­on, son­dern eine Illus­tra­ti­on der geplan­ten Arbeitsteilung.

Du möch­test wis­sen, ob so ein Ablauf zu eurem Unter­neh­men passt? Die NOVA-Anwen­dungs­fäl­le geben kon­kre­te Aus­gangs­punk­te. Für die Umset­zung klä­ren wir zuerst, wel­che Infor­ma­ti­on benö­tigt wird, wel­che Akti­on fol­gen darf und wor­an ihr ein brauch­ba­res Ergeb­nis erkennt. Den pas­sen­den Ein­stieg fin­det ihr auf der NOVA-Haupt­sei­te mit Kon­takt­for­mu­lar.

Per­sön­li­ches Gespräch gefällig?

Die­ses Feld dient zur Vali­die­rung und soll­te nicht ver­än­dert werden.
Name(erfor­der­lich)
E‑Mail-Adres­se(erfor­der­lich)
Wofür möch­ten Sie das loka­le KI Öko­sys­tem ein­set­zen? Haben Sie bereits bestimm­te gro­ße Sprach­mo­del­le (LLMs) im Blick, wel­che Sie im Pro­jekt ver­wen­den möchten?
Die fol­gen­den Fel­der wer­den über den Kon­fi­gu­ra­tor auf der Sei­te Nova Kon­fi­gu­ra­tor befüllt. Bit­te besu­chen Sie den Kon­fi­gu­ra­tor und tref­fen dort Ihre Ent­schei­dung. Die­se Fel­der sind schreibgeschützt.
Stan­dard RAM oder erwei­ter­ter RAM?
Wie vie­le vCPUs sind gewünscht?
Wie viel RAM wird gewünscht?
Loka­ler Spei­cher­platz für Nova
Laden Sie ger­ne rele­van­te Doku­men­te mit hoch, Bil­der oder Datei­en (optio­nal)
Zie­he Datei­en hier her oder 
Max. Datei­grö­ße: 12 MB.

    Professor Doktor Alexander Lutz

    Autor

    Prof. Dr. Alex­an­der Lutz, Pro­fes­sor für Big Data und KI an der FOM Mün­chen, Dok­tor der Human­ge­ne­tik und Anthro­po­lo­gie, ehe­ma­li­ger Online­spie­le-Desi­gner und natür­lich Grün­der und Inha­ber der Agen­tur Die NEOs. Neben den The­men der künst­li­chen Intel­li­genz und deren Ein­satz­mög­lich­kei­ten in der Pra­xis kon­zen­triert sich Alex­an­der auf die Kun­den­kom­mu­ni­ka­ti­on. Neue Pro­blem­fel­der oder tech­ni­sche Inno­va­tio­nen berei­tet er so auf, dass der Nut­zen für unse­re Kun­den deut­lich wird. Er schläft zeit­ver­ant­wort­lich und agiert schnell, sein Mot­to: “Tue es, oder tue es nicht. Es gibt kein Ver­su­chen.”