mrciffa (@davideciffa)Luce PFlash가 prefix caching, cold-start 튜닝, CUDA VMM 수정과 block sparse attention autotune 개선으로 크게 빨...

mrciffa (@davideciffa)Luce PFlash가 prefix caching, cold-start 튜닝, CUDA VMM 수정과 block sparse attention autotune 개선으로 크게 빨라졌습니다. warm 상태는 약 10배, cold 상태는 약 2.5배 향상됐으며 Qwen3.6 27B에서 사용 가능하다고 밝혔습니다.https://x.com/davideciffa/status/2050906786232689033#caching #cuda #sparseattention #qwen #llm

Read Original

Related