RT @sudoingX: Vor einem Jahr war dies auf einer einzelnen Consumer-GPU noch nicht möglich. Heute ist es einfach möglich,...

RT @sudoingX: Vor einem Jahr war dies auf einer einzelnen Consumer-GPU noch nicht möglich. Heute ist es einfach möglich, und ich bin immer noch etwas überwältigt davon. Google hat vor zwei Tagen Gemma 4 12B veröffentlicht, und ich habe es auf einer einzigen 3090er GPU geladen. Nativ multimodal – Text, Bild, Video, Audio alles in einem einzigen Netzwerk, ohne separate Encoder, die nachträglich angehängt wurden. 256k Kontextfenster, Apache 2.0 Lizenz, Gewichte, die ich tatsächlich besitze und die ich für immer offline betreiben kann. Und das Modell läuft tatsächlich – vollständiges Reasoning aktiviert, der gesamte 256k-Kontext passt in 16 GB VRAM, mit weiteren 8 GB als Puffer. Ich saß da und sah zu, wie es eine Frage Token für Token in seiner eigenen Reasoning-Trace durchdachte, auf einer Grafikkarte, die weniger kostet als ein Monat einiger API-Rechnungen, in meinem eigenen Terminal, ohne Internetverbindung. Der generierte Text ist wirklich scharf, klar strukturiert und wirklich kohären...

Read Original

Related