zR (@zRdianjiao)TileRT가 추론 실행 구조를 처음부터 재설계한 내용을 소개합니다. 핵심은 전체 그래프를 AOT로 컴파일해 GPU 상주 엔진 커널로 한 번만 띄우는 persistent kernel과, ...

zR (@zRdianjiao)TileRT가 추론 실행 구조를 처음부터 재설계한 내용을 소개합니다. 핵심은 전체 그래프를 AOT로 컴파일해 GPU 상주 엔진 커널로 한 번만 띄우는 persistent kernel과, compute/async I/O/통신을 타일 단위 작업으로 처리해 중간 결과를 레지스터·shared memory 중심으로 흐르게 하는 tile pipeline입니다. LLM 추론 최적화와 GPU 인퍼런스 런타임에 직접적인 의미가 있습니다.https://x.com/zRdianjiao/status/2057662553703272778#llm #inference #gpu #optimization #runtime

Read Original

Related

Mastodon discussion 18m ago

美中科技戰夾縫求存,台灣下一個兆元產業就在「智慧研發平台」徐作聖 (Joseph Z. Shyu) 2026-07-27 07:56:00 CST全球科技競爭正轉向智慧研發平台(IRDP)。台灣應整合產業優勢,建構跨域協作平台,從代工製造轉...

美中科技戰夾縫求存,台灣下一個兆元產業就在「智慧研發平台」徐作聖 (Joseph Z. Shyu) 2026-07-27 07:56:00 CST全球科技競爭正轉向智慧研發平台(IRDP)。台灣應整合產業優勢,建構跨域協作平台,從代工製造轉型為智慧研發服務商,掌握知識生產主導權,此為奠定下一階段高價值產業定位的關鍵戰略。https://www.thenews...