NOVA und Qwen3.8 27B: Wenn Doku­men­te mehr als Text sind

Exe­cu­ti­ve Summary

Qwen3.8 27B ver­bin­det Text­ver­ar­bei­tung mit nati­ver Bild- und Video­ver­ar­bei­tung. Die offi­zi­el­le Modell­kar­te beschreibt ein dich­tes Modell mit 262.144 Tokens nati­vem Kon­text, steu­er­ba­rem Reaso­ning und Mul­ti-Token Pre­dic­tion. Für NOVA inter­es­siert uns beson­ders, wie sich tech­ni­sche Doku­men­te mit ihren Abbil­dun­gen gemein­sam betrach­ten lassen.

Unse­re Win­dows-Umge­bung mit RTX 5090 und 32 GB VRAM ist der vor­ge­se­he­ne loka­le Prüf­stand. Unse­re Modell­lis­te weist eine rund 17 GB gro­ße Qwen3.8–27B-Datei aus. Dar­aus folgt noch kei­ne Aus­sa­ge über den Spei­cher­be­darf mit Bild­ver­ar­bei­tung und lan­gen Kontexten.

Doku­men­ten­ver­ständ­nis ergänzt ein sau­ber ein­ge­rich­te­tes NOVA-Wis­sens­sys­tem mit RAG. Es ersetzt weder die Quel­len­zu­ord­nung noch die fach­li­che Prü­fung einer Ant­wort. Den Unter­schied zwi­schen dem offi­zi­el­len 27B-Modell und Com­mu­ni­ty-Distill-Ver­sio­nen hal­ten wir dabei aus­drück­lich fest.

KI-generiert

NOVA betrachtet eine technische Dokumentseite mit Diagramm durch einen beleuchteten Dokumentenbetrachter
Reddit Reddit

Was bekom­men wir auf unse­rer Hard­ware davon zum Laufen?

Bei Qwen haben wir uns inzwi­schen dar­an gewöhnt, dass neue Modell­ge­ne­ra­tio­nen nicht lan­ge auf sich war­ten las­sen. Inter­es­san­ter als die Ver­si­ons­num­mer ist für uns aber die Fra­ge, was sich im All­tag tat­säch­lich verändert.

Unse­re zen­tra­le Fra­ge bei neu­en Open Models lau­tet nicht: »Wie groß ist es?« Son­dern: »Was bekom­men wir auf unse­rer Hard­ware tat­säch­lich davon zum Laufen?«

Das klingt ähn­lich, ist aber ein deut­li­cher Unter­schied. Ein Modell kann gute Bench­marks erzie­len und trotz­dem eine Infra­struk­tur benö­ti­gen, die für eine loka­le Unter­neh­mens­in­stal­la­ti­on nicht sinn­voll ist. Die 27B-Klas­se liegt dage­gen in einer Grö­ßen­ord­nung, die wir auf unse­rem vor­han­de­nen Prüf­stand kon­kret unter­su­chen können.

Groß genug für anspruchs­vol­le Auf­ga­ben. Klein genug, um den Betrieb auf einem ein­zel­nen leis­tungs­fä­hi­gen Desk­top-Sys­tem zu erpro­ben. Ob die­se Kom­bi­na­ti­on für eure Auf­ga­be reicht, zeigt sich an deren Ergeb­nis – nicht an der Para­me­ter­zahl allein.

Ein Doku­ment besteht nicht aus­schließ­lich aus Wörtern

Ein klas­si­sches Text­mo­dell bekommt bei­spiels­wei­se den extra­hier­ten Text einer PDF. Ein mul­ti­mo­da­les Modell kann zusätz­lich die eigent­li­che Sei­te betrach­ten. Das macht für vie­le Wis­sens­auf­ga­ben einen Unterschied.

In einem Hand­buch kann eine Ver­bin­dung erst durch ihre Posi­ti­on in der Zeich­nung ver­ständ­lich wer­den. Ein Dia­gramm ord­net Mess­wer­te zu. Eine Tabel­le ent­hält Über­schrif­ten, deren Bezug beim blo­ßen Extra­hie­ren ver­lo­ren geht. Genau des­halb inter­es­siert uns die gemein­sa­me Ver­ar­bei­tung von Text und visu­el­len Informationen.

Die offi­zi­el­le Modell­kar­te von Qwen3.8 27B doku­men­tiert die Unter­stüt­zung für Bil­der und Vide­os. Dar­aus lei­ten wir mög­li­che Ein­satz­auf­ga­ben ab; ein feh­ler­frei­es Ver­ständ­nis jeder Zeich­nung ist damit nicht bewiesen.

NOVA liest und betrachtet

Stel­len wir uns eine tech­ni­sche Rück­fra­ge im Ser­vice vor. In der Beschrei­bung steht eine Gerä­te­num­mer, auf der bei­gefüg­ten Sei­te ist die Anschluss­zeich­nung zu sehen. NOVA könn­te die rele­van­te Text­stel­le mit der Abbil­dung zusam­men­füh­ren und einen Hin­weis für das Team vorbereiten.

In unse­rer Bild­welt betrach­tet sie dafür ein Dos­sier durch einen beleuch­te­ten Doku­men­ten­be­trach­ter. Es ist eine Illus­tra­ti­on des Ablaufs, kein Screen­shot und kei­ne Behaup­tung mensch­li­chen Sehens. Die rea­le Anwen­dung muss nach­voll­zieh­bar zei­gen, wel­ches Doku­ment und wel­che Fas­sung die Ant­wort stützen.

Für eine pro­duk­ti­ve Anwen­dung pla­nen wir auch den Fall, dass eine Zeich­nung unscharf oder ein Bezug nicht ein­deu­tig ist. Dann ist eine Rück­fra­ge oft hilf­rei­cher als eine über­zeu­gend for­mu­lier­te Ver­mu­tung. Die Gren­zen der Auf­ga­be gehö­ren zur Einrichtung.

Ein gro­ßer Kon­text ersetzt kein gutes Retrieval

262.144 Tokens nati­ver Kon­text geben dem Modell grund­sätz­lich Platz für umfang­rei­che Zusam­men­hän­ge. Die tat­säch­lich nutz­ba­re Län­ge hängt aber von der loka­len Kon­fi­gu­ra­ti­on und dem ver­füg­ba­ren Spei­cher ab. Wir geben dem Modell des­halb nicht pau­schal den gesam­ten Dokumentenbestand.

Für NOVA wer­den Unter­la­gen vor­be­rei­tet und die für eine Fra­ge rele­van­ten Infor­ma­tio­nen aus­ge­wählt. Die Sei­te Wis­sen und RAG erklärt die­se Ver­ar­bei­tung. Ein lan­ges Kon­text­fens­ter kann dann Reser­ve für eine grö­ße­re Auf­ga­be bie­ten, wäh­rend die Quel­len wei­ter­hin gezielt zuge­ord­net bleiben.

Wie viel Modell passt sinn­voll auf die RTX 5090?

Qwen3.8 27B ist ein dich­tes Modell. Anders als bei einem MoE-Modell mit weni­gen akti­ven Exper­ten arbei­tet der Sprach­pfad mit sei­ner gesam­ten Para­me­ter­struk­tur. Das allein ent­schei­det noch nicht über die Reak­ti­ons­zeit, ist aber ein wesent­li­cher Unter­schied für den Vergleich.

Unse­re 32-GB-Kar­te ist der Prüf­stand für quan­ti­sier­te Vari­an­ten. Die rund 17 GB in unse­rer Modell­lis­te bezeich­nen die gespei­cher­te Datei. Für Lauf­zeit, Kon­text und visu­el­le Kom­po­nen­ten braucht es zusätz­li­chen Platz. Ob ein kon­kre­ter Ablauf voll­stän­dig im Gra­fik­spei­cher bleibt, prü­fen wir wäh­rend der Ausführung.

Q4 oder Q5? Die Auf­ga­be entscheidet

Wir wür­den nicht auto­ma­tisch die stärks­te Kom­pres­si­on wäh­len. Wenn ein etwas genau­er quan­ti­sier­tes Modell wich­ti­ge Bezü­ge zuver­läs­si­ger erkennt und genü­gend Spei­cher­re­ser­ve bleibt, kann die­se Vari­an­te sinn­voll sein. Wenn die Auf­ga­be län­ge­re Doku­men­te oder meh­re­re Bild­sei­ten benö­tigt, ist zusätz­li­cher Platz viel­leicht wertvoller.

Die­se Abwä­gung braucht Mes­sun­gen mit dem­sel­ben Mate­ri­al. Eine Datei­grö­ße erlaubt eine ers­te Pla­nung. Sie beant­wor­tet noch nicht, wel­che Kon­fi­gu­ra­ti­on im kon­kre­ten Arbeits­ab­lauf die brauch­ba­re­ren Ant­wor­ten liefert.

Reaso­ning und Beschleu­ni­gung sind Konfiguration

Qwen beschreibt steu­er­ba­re Reaso­ning-Stu­fen und ein Trai­ning mit Mul­ti-Token Pre­dic­tion. Wir möch­ten die ver­füg­ba­re Rechen­zeit pas­send zur Auf­ga­be ein­set­zen: Eine ein­fa­che Zuord­nung braucht nicht zwangs­läu­fig den­sel­ben Auf­wand wie eine tech­ni­sche Ursachenanalyse.

Wel­che Steue­rung und wel­che Beschleu­ni­gung tat­säch­lich ver­füg­bar sind, hängt vom ver­wen­de­ten Backend und des­sen Ver­si­on ab. Die Modell­kar­te beschreibt Mög­lich­kei­ten; für Oll­ama prü­fen wir den kon­kre­ten Aus­füh­rungs­pfad. Ein instal­lier­tes Modell ist noch kei­ne akti­vier­te MTP-Konfiguration.

Und die ange­kün­dig­te zwei­te Qwen-Spitze?

Der ursprüng­li­che Arti­kel­ent­wurf war­te­te noch auf eine offi­zi­el­le Qwen3.8–35B-A3B-Veröffentlichung. Für unse­re jet­zi­ge Rei­he hal­ten wir die Model­le genau­er aus­ein­an­der. Qwen3.8 27B stammt vom Qwen-Team. Die von Empe­ro ver­öf­fent­lich­te Qwen3.8–35B-A3B-Distill-Version ist eine Com­mu­ni­ty-Distil­la­ti­on auf Basis der Qwen3.6–35B-A3B-Architektur.

Wir behan­deln sie des­halb nicht als gleich­wer­ti­ge offi­zi­el­le Vari­an­te der­sel­ben Ver­öf­fent­li­chung. Im geplan­ten Ver­gleich tre­ten das ori­gi­na­le Qwen3.6–35B-A3B und die Com­mu­ni­ty-Distill-Ver­si­on gegen­ein­an­der an. Ein höher klin­gen­der Name ersetzt kei­ne nach­voll­zieh­ba­re Her­kunft und kei­ne eige­ne Prüfung.

Wel­che Rol­le bekommt Qwen in NOVA?

Für NOVA sehen wir Qwen3.8 27B als Kan­di­da­ten für Auf­ga­ben, bei denen Doku­ment­text und visu­el­le Hin­wei­se zusam­men­ge­hö­ren. Ein tech­ni­sches Hand­buch, ein Dia­gramm oder eine doku­men­tier­te Ober­flä­che sind gute Aus­gangs­punk­te für eine begrenz­te Erprobung.

Wel­ches Modell die Auf­ga­be über­nimmt, wol­len wir anhand des benö­tig­ten Ergeb­nis­ses ent­schei­den. Die NOVA-Sei­te zu Model­len und Infe­renz erklärt die­se Aus­wahl. Aus einem Modell­park wird erst dann eine brauch­ba­re Wis­sens­ma­schi­ne, wenn die pas­sen­den Quel­len, Berech­ti­gun­gen und Aus­füh­rungs­schrit­te dazu kommen.

Du hast einen Doku­men­ten­be­stand, in dem wich­ti­ge Infor­ma­tio­nen zwi­schen Text und Zeich­nung ver­steckt sind? Die NOVA-Anwen­dungs­fäl­le zei­gen mög­li­che Ein­stie­ge. Für eine gemein­sa­me Prü­fung genügt zunächst eine typi­sche Fra­ge mit dem zuge­hö­ri­gen frei­ge­ge­be­nen Mate­ri­al; über die NOVA-Haupt­sei­te lässt sich die­ser ers­te Schritt besprechen.

Per­sön­li­ches Gespräch gefällig?

Die­ses Feld dient zur Vali­die­rung und soll­te nicht ver­än­dert werden.
Name(erfor­der­lich)
E‑Mail-Adres­se(erfor­der­lich)
Wofür möch­ten Sie das loka­le KI Öko­sys­tem ein­set­zen? Haben Sie bereits bestimm­te gro­ße Sprach­mo­del­le (LLMs) im Blick, wel­che Sie im Pro­jekt ver­wen­den möchten?
Die fol­gen­den Fel­der wer­den über den Kon­fi­gu­ra­tor auf der Sei­te Nova Kon­fi­gu­ra­tor befüllt. Bit­te besu­chen Sie den Kon­fi­gu­ra­tor und tref­fen dort Ihre Ent­schei­dung. Die­se Fel­der sind schreibgeschützt.
Stan­dard RAM oder erwei­ter­ter RAM?
Wie vie­le vCPUs sind gewünscht?
Wie viel RAM wird gewünscht?
Loka­ler Spei­cher­platz für Nova
Laden Sie ger­ne rele­van­te Doku­men­te mit hoch, Bil­der oder Datei­en (optio­nal)
Zie­he Datei­en hier her oder 
Max. Datei­grö­ße: 12 MB.

    Professor Doktor Alexander Lutz

    Autor

    Prof. Dr. Alex­an­der Lutz, Pro­fes­sor für Big Data und KI an der FOM Mün­chen, Dok­tor der Human­ge­ne­tik und Anthro­po­lo­gie, ehe­ma­li­ger Online­spie­le-Desi­gner und natür­lich Grün­der und Inha­ber der Agen­tur Die NEOs. Neben den The­men der künst­li­chen Intel­li­genz und deren Ein­satz­mög­lich­kei­ten in der Pra­xis kon­zen­triert sich Alex­an­der auf die Kun­den­kom­mu­ni­ka­ti­on. Neue Pro­blem­fel­der oder tech­ni­sche Inno­va­tio­nen berei­tet er so auf, dass der Nut­zen für unse­re Kun­den deut­lich wird. Er schläft zeit­ver­ant­wort­lich und agiert schnell, sein Mot­to: “Tue es, oder tue es nicht. Es gibt kein Ver­su­chen.”