RT @sudoingX: Vor einem Jahr war dies auf einer einzelnen Consumer-GPU noch nicht möglich. Heute ist es einfach möglich,...

RT @sudoingX: Vor einem Jahr war dies auf einer einzelnen Consumer-GPU noch nicht möglich. Heute ist es einfach möglich, und ich bin immer noch ein wenig überwältigt davon. Google hat vor zwei Tagen Gemma 4 12b veröffentlicht, und ich habe es auf einer einzelnen 3090 geladen. Nativ multimodal: Text, Bild, Video, Audio – alles in einem einzigen Modell, ohne separate Encoder, die nachträglich angehängt wurden. 256k Kontextfenster, Apache 2.0-Lizenz, Gewichte, die ich tatsächlich besitze und die ich für immer offline betreiben kann. Und das Ding läuft tatsächlich: Vollständiges Reasoning aktiviert, der gesamte 256k-Kontext passt in 16 GB VRAM, mit weiteren 8 GB Reserve. Ich saß da und sah zu, wie es eine Frage Token für Token in seiner eigenen Reasoning-Trace durchdachte, auf einer Grafikkarte, die weniger kostet als eine Monatsrechnung einiger API-Dienste, in meinem eigenen Terminal, ohne Internetverbindung. Die daraus resultierenden Texte sind wirklich scharf, mit klarer Struktur und ec...

Read Original

Related