NOVA und Muse Glim­mer 30B: Prä­zi­si­on für Code und Werkzeuge

Exe­cu­ti­ve Summary

Muse Glim­mer 30B von Meta rich­tet sich auf loka­le Agen­ten­auf­ga­ben. Das Modell kom­bi­niert einen dich­ten Sprach­de­co­der mit Bild­ver­ar­bei­tung und wur­de unter ande­rem für Tool-Nut­zung und Feh­ler­kor­rek­tur trai­niert. Für NOVA sehen wir dar­in einen Kan­di­da­ten für Ent­wick­lungs­auf­ga­ben und Abläu­fe mit defi­nier­ten Schnittstellen.

Die offi­zi­el­le Modell­kar­te nennt für eine quan­ti­sier­te Vari­an­te auf der RTX 5090 durch­schnitt­lich 233,4 Tokens pro Sekun­de mit DFlash, gegen­über 74,9 ohne spe­ku­la­ti­ve Deco­die­rung. Das sind Her­stel­ler­mes­sun­gen mit einer bestimm­ten Kon­fi­gu­ra­ti­on, kei­ne Ergeb­nis­se unse­rer Win­dows- und Ollama-Installation.

Wie ein sol­ches Modell mit euren Anwen­dun­gen zusam­men­ar­bei­tet, hängt von der NOVA-Anbin­dung und den fest­ge­leg­ten Frei­ga­ben ab. Ein prä­zi­ses Modell ist dabei eine Kom­po­nen­te des Sys­tems; es legt sei­ne Berech­ti­gun­gen nicht selbst fest.

KI-generiert

NOVA verbindet zwei Schnittstellen mit einem Präzisionswerkzeug in ihrer Werkstatt
Reddit Reddit

Brau­chen wir wirk­lich noch ein Modell?

Manch­mal erscheint ein neu­es Open-Weight-Modell und man fragt sich zunächst: Brau­chen wir davon wirk­lich noch eines?

Bei Muse Glim­mer 30B lohnt sich ein genaue­rer Blick. Ein pro­duk­ti­ves Unter­neh­mens-KI-Sys­tem soll schließ­lich nicht nur Fra­gen beant­wor­ten. Es soll Din­ge tun können.

Code ana­ly­sie­ren. Eine Funk­ti­on auf­ru­fen. Ein Ergeb­nis über­prü­fen. Einen Feh­ler erken­nen. Einen zwei­ten Ver­such vor­be­rei­ten. Und anschlie­ßend ent­schei­den, wel­cher Pro­zess­schritt als Nächs­tes sinn­voll ist.

Das trifft einen Bereich, der für NOVA zuneh­mend rele­vant wird. Nicht weil jedes Modell sofort jeden Ablauf über­neh­men soll, son­dern weil wir für sol­che Auf­ga­ben pas­sen­de Kom­po­nen­ten aus­wäh­len und ihre Zusam­men­ar­beit erpro­ben wollen.

»Fast rich­tig« ist an einer Schnitt­stel­le oft falsch

Ein Modell kann einen her­vor­ra­gen­den Absatz for­mu­lie­ren und trotz­dem ein schlech­ter Soft­ware-Agent sein. Sobald eine Ant­wort Teil einer Ent­wick­lungs- oder Auto­ma­ti­sie­rungs­ket­te wird, gel­ten ande­re Regeln. Ein Funk­ti­ons­na­me stimmt oder er stimmt nicht. Ein Para­me­ter gehört an eine bestimm­te Stel­le. Ein JSON-Objekt ent­spricht dem erwar­te­ten Sche­ma – oder der nächs­te Schritt schlägt fehl.

»Fast rich­tig« ist bei maschi­nen­les­ba­ren Schnitt­stel­len häu­fig schlicht falsch. Des­halb inter­es­siert uns bei Muse Glim­mer beson­ders die Kom­bi­na­ti­on aus Tool-Nut­zung und Feh­ler­kor­rek­tur. Die offi­zi­el­le Modell­kar­te von Meta beschreibt die­se Fähig­kei­ten als Trainingsziele.

Ein Feh­ler ist noch kein Anlass zum Aufgeben

Ein Werk­zeug kann einen uner­war­te­ten Rück­ga­be­wert lie­fern. Ein API-Auf­ruf kann schei­tern. Ein brauch­ba­rer Agent soll­te dann nach­voll­zie­hen kön­nen, was pas­siert ist, statt den Vor­gang kom­men­tar­los lie­gen zu lassen.

In NOVA wür­den wir das als begrenz­ten Ablauf gestal­ten: Rück­ga­be prü­fen, einen zuläs­si­gen nächs­ten Schritt vor­be­rei­ten und bei wie­der­hol­tem Feh­ler an das zustän­di­ge Team über­ge­ben. Die Fähig­keit eines Modells zum erneu­ten Ver­such ist kei­ne Erlaub­nis für unbe­grenz­te Wie­der­ho­lun­gen. Das ist ins­be­son­de­re dann wich­tig, wenn ein Auf­ruf Daten verändert.

Muse Glim­mer kann visu­el­le Infor­ma­tio­nen einbeziehen

Meta kom­bi­niert das dich­te Modell mit einem Per­cep­ti­on Enco­der. Damit las­sen sich Text und Bil­der gemein­sam ver­ar­bei­ten. Ein Screen­shot einer feh­ler­haf­ten Ober­flä­che kann so neben der zuge­hö­ri­gen Beschrei­bung ste­hen. Die Ana­ly­se muss sich nicht auf einen nach­träg­lich for­mu­lier­ten Text­be­richt beschränken.

Für unse­re Arbeit ist das eine nütz­li­che Per­spek­ti­ve: Ein Team könn­te den sicht­ba­ren Feh­ler zei­gen und eine Erklä­rung dazu geben. NOVA wür­de dar­aus einen Vor­schlag für die wei­te­re Unter­su­chung vor­be­rei­ten. Ob die­ser Vor­schlag stimmt, lässt sich anschlie­ßend am Code und am repro­du­zier­ba­ren Feh­ler­bild prüfen.

NOVA am Reparaturplatz

In unse­rer Illus­tra­ti­on steht NOVA mit einem Prä­zi­si­ons­werk­zeug an einer unter­bro­che­nen Ver­bin­dung. Der Blick rich­tet sich auf das pas­sen­de Gegen­stück. Die­se Sze­ne erzählt, was uns an Muse Glim­mer inter­es­siert: ver­ste­hen, war­um ein Schritt nicht funk­tio­niert hat, und die Ver­bin­dung kon­trol­liert wiederherstellen.

Ein denk­ba­rer Unter­neh­mens­fall beginnt mit einer impor­tier­ten Datei. Ein Feld ist unvoll­stän­dig oder das Ziel­for­mat weist den Daten­satz zurück. NOVA könn­te die Rück­mel­dung erklä­ren und eine Kor­rek­tur vor­schla­gen. Bevor erneut über­tra­gen wird, prüft die Anbin­dung, ob der ers­te Ver­such bereits etwas gespei­chert hat. So ver­mei­den wir, dass aus einem Wie­der­ho­lungs­ver­such eine dop­pel­te Buchung wird.

Wie NOVA Infor­ma­tio­nen an bestehen­de Anwen­dun­gen über­gibt, zei­gen wir auf der Sei­te zur API-Inte­gra­ti­on. Wer wel­che Daten sehen und wel­che Aktio­nen frei­ge­ben darf, gehört in die Pla­nung von Gover­nan­ce und Sicher­heit.

DFlash: Vor­schla­gen, prü­fen und übernehmen

Bei spe­ku­la­ti­ver Deco­die­rung schlägt ein klei­ne­res Draf­ter-Modell mög­li­che Text­fort­set­zun­gen vor. Das Ziel­mo­dell prüft sie. Ein pas­sen­der Vor­schlag kann über­nom­men wer­den, ohne dass jedes Token voll­stän­dig nach­ein­an­der erzeugt wer­den muss.

Meta ver­öf­fent­licht für sei­ne RTX-5090-Kon­fi­gu­ra­ti­on die genann­ten 74,9 bezie­hungs­wei­se 233,4 Tokens pro Sekun­de. Gemes­sen wur­de mit Batch­grö­ße 1, gree­dy Deco­ding und llama.cpp an einem gemisch­ten Prompt-Satz. Die­se Kon­fi­gu­ra­ti­on ist für uns ein Anhalts­punkt, aber kein pau­scha­les Ver­spre­chen für Ollama.

DFlash benö­tigt den pas­sen­den Draf­ter und einen unter­stütz­ten Aus­füh­rungs­pfad. Das Basis­mo­dell her­un­ter­zu­la­den oder ihm einen Namen mit »fast« zu geben, genügt nicht. Wir ver­glei­chen eine sau­ber doku­men­tier­te Basis mit der tat­säch­lich ein­ge­rich­te­ten beschleu­nig­ten Variante.

32 GB sind ein Bud­get, kei­ne pau­scha­le Zusage

Unse­re Win­dows-Umge­bung mit RTX 5090 und 32 GB VRAM ist der vor­ge­se­he­ne Prüf­stand. Die vor­lie­gen­de Oll­ama-Lis­te zeigt Muse Glim­mer als rund 18 GB gro­ße Datei. Für den Betrieb zäh­len außer­dem der Kon­text­spei­cher, die Bild­ver­ar­bei­tung und gege­be­nen­falls der Drafter.

Wir möch­ten des­halb unter­schied­li­che Kon­fi­gu­ra­tio­nen gegen­ein­an­der abwä­gen. Mehr Prä­zi­si­on bei den Gewich­ten kann nütz­lich sein. Mehr Spei­cher­re­ser­ve für eine län­ge­re Auf­ga­be eben­so. Quan­ti­sie­rung ist nicht nur eine Not­lö­sung zum Ein­spa­ren von VRAM; sie beein­flusst, wel­che Arbeits­last sinn­voll in die vor­han­de­ne Hard­ware passt.

Ob eine ein­zel­ne Ent­wick­lungs­auf­ga­be flott reagiert und ob meh­re­re par­al­le­le Anfra­gen gut lau­fen, sind unter­schied­li­che Prü­fun­gen. Die Modell­kar­te ersetzt kei­ne Last­mes­sung unse­res Systems.

Was wür­de Muse Glim­mer in NOVA übernehmen?

Als mög­li­cher Coding-Assis­tent könn­te das Modell ein bestehen­des Pro­jekt erklä­ren, einen Feh­ler unter­su­chen oder einen Ände­rungs­vor­schlag mit pas­sen­den Tests vor­be­rei­ten. Der Quell­code muss dafür nicht zwin­gend an einen exter­nen Dienst über­tra­gen wer­den; wel­che Daten­we­ge zuläs­sig sind, legen wir für die kon­kre­te Instal­la­ti­on fest.

Für die ers­te Erpro­bung wür­den wir eine über­schau­ba­re Auf­ga­be wäh­len. Ein bekann­tes Feh­ler­bild, ein begrenz­ter Code­be­reich und ein prüf­ba­res Ergeb­nis sind bes­ser als ein offe­ner Auf­trag, »das gan­ze Sys­tem zu ver­bes­sern«. Die­se Hal­tung prägt auch unse­re NOVA-Anwen­dungs­fäl­le.

Muse Glim­mer ergänzt damit die Idee des Auf­ga­ben­ver­tei­lers aus dem Nemo­tron-Arti­kel. Ein häu­fig auf­ge­ru­fe­nes Aus­füh­rungs­mo­dell und ein Modell für län­ge­re Unter­su­chun­gen kön­nen unter­schied­li­che Rol­len über­neh­men. Wel­che Rol­le tat­säch­lich passt, ent­schei­den wir anhand der Ergeb­nis­se. Die NOVA-Modell­aus­wahl beschreibt, wie Auf­ga­be und Aus­füh­rung zusammengehören.

Du möch­test einen Ent­wick­lungs- oder Daten­pro­zess auf die­se Wei­se erpro­ben? Auf der NOVA-Haupt­sei­te könnt ihr euren Ablauf beschrei­ben. Aus­gangs­punkt bleibt die kon­kre­te Arbeit, die am Ende bes­ser erle­digt sein soll.

Per­sön­li­ches Gespräch gefällig?

Die­ses Feld dient zur Vali­die­rung und soll­te nicht ver­än­dert werden.
Name(erfor­der­lich)
E‑Mail-Adres­se(erfor­der­lich)
Wofür möch­ten Sie das loka­le KI Öko­sys­tem ein­set­zen? Haben Sie bereits bestimm­te gro­ße Sprach­mo­del­le (LLMs) im Blick, wel­che Sie im Pro­jekt ver­wen­den möchten?
Die fol­gen­den Fel­der wer­den über den Kon­fi­gu­ra­tor auf der Sei­te Nova Kon­fi­gu­ra­tor befüllt. Bit­te besu­chen Sie den Kon­fi­gu­ra­tor und tref­fen dort Ihre Ent­schei­dung. Die­se Fel­der sind schreibgeschützt.
Stan­dard RAM oder erwei­ter­ter RAM?
Wie vie­le vCPUs sind gewünscht?
Wie viel RAM wird gewünscht?
Loka­ler Spei­cher­platz für Nova
Laden Sie ger­ne rele­van­te Doku­men­te mit hoch, Bil­der oder Datei­en (optio­nal)
Zie­he Datei­en hier her oder 
Max. Datei­grö­ße: 12 MB.

    Professor Doktor Alexander Lutz

    Autor

    Prof. Dr. Alex­an­der Lutz, Pro­fes­sor für Big Data und KI an der FOM Mün­chen, Dok­tor der Human­ge­ne­tik und Anthro­po­lo­gie, ehe­ma­li­ger Online­spie­le-Desi­gner und natür­lich Grün­der und Inha­ber der Agen­tur Die NEOs. Neben den The­men der künst­li­chen Intel­li­genz und deren Ein­satz­mög­lich­kei­ten in der Pra­xis kon­zen­triert sich Alex­an­der auf die Kun­den­kom­mu­ni­ka­ti­on. Neue Pro­blem­fel­der oder tech­ni­sche Inno­va­tio­nen berei­tet er so auf, dass der Nut­zen für unse­re Kun­den deut­lich wird. Er schläft zeit­ver­ant­wort­lich und agiert schnell, sein Mot­to: “Tue es, oder tue es nicht. Es gibt kein Ver­su­chen.”