Sudo su (@sudoingX)Qwen 3.5-0.8B의 24개 레이어를 하나의 fused CUDA 커널로 처리해 CPU 왕복 없이 단일 커널 런치만으로 고성능을 달성했다는 내용이다. RTX 3090이 411 t...

Sudo su (@sudoingX)Qwen 3.5-0.8B의 24개 레이어를 하나의 fused CUDA 커널로 처리해 CPU 왕복 없이 단일 커널 런치만으로 고성능을 달성했다는 내용이다. RTX 3090이 411 tok/s로 Apple M5 Max의 229 tok/s를 앞질렀다고 소개하며, CUDA 최적화와 추론 성능 개선의 인상을 준다.https://x.com/sudoingX/status/2042093043533410339#cuda #qwen #llm #gpu #optimization

Read Original

Related