#flash
Follow to get notified about new posts with this tagCross Attention + Ring Attention und Flash Attention... Ja genau, ersteres mit einem En- und Decoder. Also schon bisle was. Aber das ist Geilo Zeugs! Ich sage es euch!
Mit der Cross Attention, kann man dann zum Beispiel bessere Analysen machen lassen, weil ich dann die Token mit en und decodierungsmechanismen ausarbeiten kann an deren Gewichte fuereinander. Das macht
Da sind von Llama.cpp und XAIGPUARC fertig geschriebene Kernel auf meinen Rechnern... die ich mir mit dem Arsch nicht anschaue...
Nichtmal zum Lernen... Ich lerne nur von einem, des kann man sich denken, wer das ist als Person auf der Welt. Der, und sonst garnix und bei dem, geht ich auch nur so Vorbeischauen, gugg auf seinen Zettel,
SYCL KI Flash Attention Gebastel. Man muss bedenken das ich damit am wenigsten Zeit verbracht habe bisher! Aber es mausert sich so langsam heran.
Die Flash Attention habe ich ja auch nur nebenbei das bauen angefangen, da wusste ich noch nichtmal, das ich XAIGPUARC von Llama.cpp wegforken will, und auch nicht, das ich da inzwischen komplett drauf
ggml_sycl_flash_attention.cpp Miniversion XMX ARC Intel iGPU + dGPU Rechen KI Kernel F16 GGUF/GGML Modells useable with dual GPU Mode and more
Meine Arbeiten an der neuen Flash Attention Version jetzt nur noch 460 Zeilen klein gehen gut vorran. Ich habe viele grobe Fehler ausgebessert und die Sache sieht so langsam irgendwie... Rund aus. :-)
