NOVA am Modell­prüf­stand: Qwen3.6 35B gegen Qwen3.8 Distill

Exe­cu­ti­ve Summary

Wir wol­len zwei 35B-Model­le auf der­sel­ben loka­len Hard­ware ver­glei­chen: das ori­gi­na­le Qwen3.6–35B-A3B und die von Empe­ro ver­öf­fent­lich­te Qwen3.8–35B-A3B-Distill-Version. Der zwei­te Kan­di­dat ist eine Com­mu­ni­ty-Distil­la­ti­on mit Qwen3.6‑Basis, kei­ne offi­zi­el­le Qwen3.8‑Veröffentlichung des Qwen-Teams.

Unser Prüf­stand ist eine Win­dows-Umge­bung mit Oll­ama und NVIDIA GeForce RTX 5090 mit 32 GB VRAM. Der Ver­gleich soll zei­gen, wel­che Kon­fi­gu­ra­ti­on für aus­ge­wähl­te NOVA-Auf­ga­ben brauch­bar ist. Reak­ti­ons­zeit und Spei­cher­be­darf zäh­len eben­so wie die fach­li­che Qua­li­tät der Ergebnisse.

Eige­ne Mess­ergeb­nis­se lie­gen für die­sen Ver­gleich noch nicht vor. Die­ser Bei­trag beschreibt den vor­ge­se­he­nen Test­auf­bau. Einen Sie­ger nen­nen wir erst, wenn nach­voll­zieh­ba­re Mes­sun­gen und eine Aus­wer­tung der­sel­ben Auf­ga­ben vorliegen.

KI-generiert

NOVA vergleicht zwei Modellkomponenten an einem Prüfstand mit einer Grafikkarte
Reddit Reddit

Ein neu­er Name ist noch kein bes­se­res Arbeitsergebnis

Zwei Down­loads, die­sel­be Gra­fik­kar­te, eine ver­meint­lich ein­fa­che Fra­ge: Wel­ches Modell ist besser?

Bei nähe­rem Hin­se­hen wird dar­aus die Fra­ge, die uns an NOVA wirk­lich inter­es­siert: Wel­ches Modell erle­digt wel­che Auf­ga­be unter unse­ren Bedin­gun­gen bes­ser? Ein neue­rer Name ver­spricht noch kei­ne bes­se­re Ant­wort. Ein schnel­le­res Modell hilft wenig, wenn das Team danach jeden Daten­satz von Hand kor­ri­gie­ren muss.

Des­halb wol­len wir den Ver­gleich auf unse­rer tat­säch­li­chen Win­dows- und Oll­ama-Umge­bung durch­füh­ren. Apple-Sili­con-Mes­sun­gen kön­nen ande­re Ein­satz­fäl­le beleuch­ten. Für die­se Rei­he ist aber die vor­han­de­ne RTX 5090 der maß­geb­li­che Prüfstand.

In unse­rer Illus­tra­ti­on ste­hen zwei Kom­po­nen­ten auf der­sel­ben Werk­bank. NOVA hat noch kei­ne davon aus­ge­wählt. Die­se offe­ne Ent­schei­dung ent­spricht dem Stand des Vorhabens.

Was genau ver­glei­chen wir?

Das ori­gi­na­le Qwen3.6–35B-A3B stammt vom Qwen-Team. Die Bezeich­nung A3B beschreibt ein Mix­tu­re-of-Experts-Modell mit unge­fähr 3 Mil­li­ar­den akti­ven Para­me­tern pro Token bei einer grö­ße­ren Gesamtparameterzahl.

Die Empe­ro-Modell­kar­te beschreibt eine Distil­la­ti­on auf Basis die­ser Archi­tek­tur. Die Ver­öf­fent­li­chung über­nimmt laut Anbie­ter Trai­nings­si­gna­le aus Qwen3.8‑Lehrermodellen. Die­sen Her­kunfts­hin­weis hal­ten wir fest, statt den kür­ze­ren Namen als offi­zi­el­les Upgrade zu verwenden.

Für die loka­le Prü­fung benö­ti­gen wir außer­dem die genaue Quan­ti­sie­rung und den Stand des her­un­ter­ge­la­de­nen Arte­fakts. Ein Oll­ama-Tag kann sich ändern; Modell-Digest, Quel­le und Datum machen nach­voll­zieh­bar, wel­che Datei tat­säch­lich gemes­sen wurde.

Glei­che Bedin­gun­gen, doku­men­tier­te Unterschiede

Bei­de Kan­di­da­ten erhal­ten die­sel­ben Auf­ga­ben und die­sel­ben frei­ge­ge­be­nen Test­do­ku­men­te. Wir doku­men­tie­ren Oll­ama-Ver­si­on, Trei­ber und Kon­text­grö­ße. Wenn eine Quan­ti­sie­rung oder ein Chat-Tem­p­la­te abweicht, wird das im Pro­to­koll sichtbar.

Ein fai­rer Ver­gleich bedeu­tet nicht, jedem Modell blind das­sel­be unge­eig­ne­te Tem­p­la­te auf­zu­zwin­gen. Modell­ge­rech­te Vor­la­gen blei­ben erhal­ten; der Auf­trag und die Bewer­tung des Ergeb­nis­ses sind für bei­de iden­tisch. Gemein­sa­me Ein­stel­lun­gen bil­den die Ver­gleichs­ba­sis. Zusätz­li­che opti­mier­te Vari­an­ten wer­den getrennt ausgewertet.

NOVA schreibt Messwerte auf einen Block; ein zweiter Bleistift steckt hinter dem oberen Ohrrand, während GPU-Lüfter laufen und cyanfarbene Komponenten leuchten
KI-generiert
NOVA am Prüf­stand ihrer Wis­sens­ma­schi­ne. Illus­tra­ti­on des geplan­ten Modellvergleichs.

Der Test soll NOVA-Arbeit abbilden

Eine ers­te Auf­ga­be besteht aus einer Wis­sens­fra­ge mit einer ein­deu­tig beleg­ten Ant­wort. Bei­de Model­le erhal­ten den­sel­ben rele­van­ten Doku­men­ten­aus­schnitt. Wir prü­fen, ob sie den Zusam­men­hang rich­tig wie­der­ge­ben, die Fund­stel­le zuord­nen und bei feh­len­der Infor­ma­ti­on eine Rück­fra­ge stellen.

Die zwei­te Auf­ga­be ver­langt eine struk­tu­rier­te Aus­ga­be. Ein fest­ge­leg­tes JSON-Sche­ma ent­hält Pflicht­fel­der und einen defi­nier­ten Umgang mit feh­len­den Anga­ben. Auto­ma­ti­sche Vali­die­rung prüft die Struk­tur; das Team prüft die extra­hier­ten Werte.

Für einen Tool-Auf­ruf stel­len wir eine begrenz­te Test-Schnitt­stel­le bereit. Der Auf­trag ist gleich, die erlaub­ten Funk­tio­nen ste­hen fest. Ein kon­trol­liert erzeug­ter Feh­ler zeigt, ob das Modell einen zuläs­si­gen nächs­ten Schritt vor­be­rei­tet. Pro­duk­ti­ve Daten wer­den dadurch nicht verändert.

Eine klei­ne Coding-Auf­ga­be ergänzt den Ver­gleich. Ein bekann­tes Feh­ler­bild und vor­be­rei­te­te Tests machen das Ergeb­nis über­prüf­bar. Ein schö­ner Erklä­rungs­text zählt nicht als gelös­ter Feh­ler, wenn der Test danach wei­ter­hin fehlschlägt.

Was wir im Mess­pro­to­koll festhalten

Wir mes­sen die Zeit bis zum ers­ten Token und den anschlie­ßen­den Aus­ga­be­durch­satz getrennt. Dazu kom­men die Gesamt­dau­er bis zu einem brauch­ba­ren Ergeb­nis und der Spit­zen­be­darf im Gra­fik­spei­cher. Fehl­ver­su­che und nöti­ge Wie­der­ho­lun­gen blei­ben im Protokoll.

Für unter­schied­li­che Kon­text­län­gen wird der­sel­be Auf­ga­ben­typ wie­der­holt. Modell­la­den und Auf­wärm­lauf erfas­sen wir sepa­rat. Meh­re­re Mess­läu­fe zei­gen, ob ein ein­zel­ner schnel­ler Durch­lauf typisch war. Aus­ga­be­bud­gets und Thin­king-Ein­stel­lun­gen wer­den doku­men­tiert, damit lan­ge inter­ne Her­lei­tun­gen nicht als zusätz­li­che pro­duk­ti­ve Ant­wort­leis­tung gezählt werden.

Eine Basis­mes­sung ohne spe­ku­la­ti­ve Beschleu­ni­gung steht für sich. Falls ein zusätz­li­cher Draf­ter ein­ge­rich­tet wird, bekommt die­ser einen eige­nen Ver­gleich. So schrei­ben wir einen Unter­schied im Backend nicht ver­se­hent­lich dem Sprach­mo­dell allein zu.

32 GB bestim­men den sinn­vol­len Versuchsaufbau

Die gesam­te Modell­struk­tur muss im Betrieb ver­füg­bar sein, auch wenn pro Token nur eini­ge Exper­ten aktiv rech­nen. Hin­zu kom­men Kon­text­spei­cher und Lauf­zeit. Wir mes­sen daher, wel­che Kon­fi­gu­ra­ti­on tat­säch­lich voll­stän­dig auf der GPU arbei­tet und wann Daten in den Haupt­spei­cher ausweichen.

Ein zunächst mode­ra­ter Kon­text schafft eine nach­voll­zieh­ba­re Basis. Erst danach erhö­hen wir die Län­ge. Falls eine Kon­fi­gu­ra­ti­on nicht in den Gra­fik­spei­cher passt, hal­ten wir das als Gren­ze die­ser Kon­fi­gu­ra­ti­on fest. Es ist kei­ne all­ge­mei­ne Aus­sa­ge über die Modellfamilie.

NOVA wählt eine Kom­po­nen­te, kei­nen Pokalsieger

Der Ver­gleich soll unse­re Modell­aus­wahl für NOVA begrün­den. Ein Modell kann für kur­ze struk­tu­rier­te Schrit­te gut pas­sen, das ande­re für eine län­ge­re Ana­ly­se. Viel­leicht ist die Qua­li­tät so ähn­lich, dass Spei­cher­re­ser­ve oder Wart­bar­keit den Aus­schlag geben. Auch das wäre ein brauch­ba­res Ergebnis.

Für die Wis­sens­auf­ga­be gehört ein sau­ber vor­be­rei­te­tes NOVA-Wis­sens­sys­tem dazu. Für den Tool-Test brau­chen wir eine begrenz­te Anbin­dung an die Anwen­dung. Die­se Kom­po­nen­ten beein­flus­sen den Erfolg genau­so wie das Modell.

Sobald ech­te Mes­sun­gen vor­lie­gen, lässt sich die­ser Bei­trag um die doku­men­tier­te Kon­fi­gu­ra­ti­on und die Resul­ta­te ergän­zen. Bis dahin bleibt die Aus­wahl offen. Wer bereits einen eige­nen Ablauf hat, kann über die NOVA-Haupt­sei­te eine pas­sen­de Test­auf­ga­be mit uns besprechen.

Per­sön­li­ches Gespräch gefällig?

Die­ses Feld dient zur Vali­die­rung und soll­te nicht ver­än­dert werden.
Name(erfor­der­lich)
E‑Mail-Adres­se(erfor­der­lich)
Wofür möch­ten Sie das loka­le KI Öko­sys­tem ein­set­zen? Haben Sie bereits bestimm­te gro­ße Sprach­mo­del­le (LLMs) im Blick, wel­che Sie im Pro­jekt ver­wen­den möchten?
Die fol­gen­den Fel­der wer­den über den Kon­fi­gu­ra­tor auf der Sei­te Nova Kon­fi­gu­ra­tor befüllt. Bit­te besu­chen Sie den Kon­fi­gu­ra­tor und tref­fen dort Ihre Ent­schei­dung. Die­se Fel­der sind schreibgeschützt.
Stan­dard RAM oder erwei­ter­ter RAM?
Wie vie­le vCPUs sind gewünscht?
Wie viel RAM wird gewünscht?
Loka­ler Spei­cher­platz für Nova
Laden Sie ger­ne rele­van­te Doku­men­te mit hoch, Bil­der oder Datei­en (optio­nal)
Zie­he Datei­en hier her oder 
Max. Datei­grö­ße: 12 MB.

    Professor Doktor Alexander Lutz

    Autor

    Prof. Dr. Alex­an­der Lutz, Pro­fes­sor für Big Data und KI an der FOM Mün­chen, Dok­tor der Human­ge­ne­tik und Anthro­po­lo­gie, ehe­ma­li­ger Online­spie­le-Desi­gner und natür­lich Grün­der und Inha­ber der Agen­tur Die NEOs. Neben den The­men der künst­li­chen Intel­li­genz und deren Ein­satz­mög­lich­kei­ten in der Pra­xis kon­zen­triert sich Alex­an­der auf die Kun­den­kom­mu­ni­ka­ti­on. Neue Pro­blem­fel­der oder tech­ni­sche Inno­va­tio­nen berei­tet er so auf, dass der Nut­zen für unse­re Kun­den deut­lich wird. Er schläft zeit­ver­ant­wort­lich und agiert schnell, sein Mot­to: “Tue es, oder tue es nicht. Es gibt kein Ver­su­chen.”